MinivLLM

最近更新: 6天前

nano-vllm
Python
forked from 中国好男人/nano-vllm
Python

该项目是用 Python 实现的轻量级 vLLM(大语言模型推理引擎)项目,核心代码仅 1000 多行。它结构清晰、易于阅读,推理速度媲美 vLLM 原版,并集成了前缀缓存(Prefix Caching)、张量并行(Tensor Parallelism)和 Torch 编译等推理优化技术。

最近更新: 19天前

搜索帮助