2026年,大模型推理成本以每年10倍的速度下降。a16z发布的报告指出,这个下降速度比个人电脑革命时期的计算成本下降还快,甚至超过了互联网泡沫时期的带宽成本降幅。推理引擎就是这个降本奇迹背后的核心基础设施。DeepSeek在2025年开源周宣布,不会直接开源内部代码库,而是将核心优化成果贡献给vLLM和SGLang这两个开源项目。这个决定让推理引擎赛道瞬间升温。
目前主流的推理框架有五个:vLLM、SGLang、TensorRT-LLM、LMDeploy和llama.cpp。每一个都在用不同的技术路径解决同一个问题——如何让大模型跑得更快、更便宜。
vLLM:PagedAttention擑起的行业标杆
vLLM由UC Berkeley团队开发,GitHub上已获得数万星标,是工业界部署大模型的事实标准。它的核心创新是PagedAttention技术,把注意力缓存当作操作系统的页表来管理。传统推理引擎会为每个请求分配完整的上下文内存,短请求浪费大量显存。PagedAttention使用固定大小的内存页,短上下文用更少的页,同一块GPU能同时处理10到50个请求,吞吐量提升2到4倍。
2025年1月,vLLM发布了v1 alpha版本,引入了优化的执行循环和零开销的前缀缓存。在H100 GPU上,vLLM跑Llama 3.1 8B的吐吐量达到12,553 tokens/s,p50延迟在50到80毫秒之间。连续批处理(Continuous Batching)让新请求可以插入正在处理的批次,某个请求完成后立即释放资源,高并发场景下吐吐量再提升2到3倍。
vLLM的部署门槛很低,单文件即可启动,支持LLaMA、Qwen、Mistral等主流开源模型。对于提供在线聊天服务的初创公司和研究团队来说,vLLM是性价比最高的选择。
SGLang:RadixAttention让Agent场景提速12 7%
SGLang同样来自伯克利的LMSYS.org团队,就是Chatbot Arena平台的创建者。2024年1月发布后,到2025年逐渐获得字节跳动、xAI等头部公司的关注。
SGLang的核心武器是RadixAttention。它通过基数树结构复用已计算的注意力缓存,对于共享前缀的请求效果显著。在多轮对话场景中,SGLang的延迟只有95毫秒,而vLLM需要180毫秒,提速幅度达89%。在Agent工作流场景(10次调用),SGLang耗时185毫秒,vLLM需覀420毫秒,差距拉大到127%。
阿里云函数计算平台的测试数据显示,部署Qwen系列模型时,SGLang的首字延迟(TTFT)比vLLM快15%到50%,吐吐量高约10%,启动速度快30%。在H100上跑Llama 3.1 8B,SGLang吐吐量达到16,215 tokens/s,比vLLM高出29%。
SGLang还原生支持if/loop等控制流指令,适合多轮对话、工具调用和结构化输出。如果你的业务是构建AI Agent或RAG系统,SGLang是目前最优解。
TensorRT-LLM:NVIDIA的极致性能王牌
NVIDIA在2023年下半年推出TensorRT-LLM,专门为A100和H100做了深度定制。它由TensorRT深度学习编译器、优化内核和多GPU通信基原组成,在NVIDIA GPU上能实现突破性性能。
在H100基准测试中,TensorRT-LLM在所有并发级别都领先。单请求时比vLLM快8%,50并发时快13%,100并发时吐吐量达到2,780 tokens/s。配合FP8量化,在Hopper架构GPU上可获得30%以上的速度提升,且几乎无精度损失。
代价是部署复杂度高。TensorRT-LLM需要28分钟的引擎编译时间,模型一旦变更就要重新编译。Meta、Cohere等公司有专门的工程团队维护,适合模型稳定且追求极致性能的大规模部署场景。H100的租赁价格已经稳定在每小时3到4美元,让TensorRT-LLM的门槛有所降低。
量化技术:4-bit成主流,精度损失可控
推理优化离不开量化。FP8已成为Hopper GPU的新默认选项,速度提升30%以上,精度几乎无损。4-bit量化的表现同样亮眼:AWQ 4-bit在HumanEval代码生成任务上达到52%的准确率,仅比FP16基线低2个百分点。质量保留率方面,AWQ保留95%,GGUF保留92%,GPTQ保留90%。
LMDeploy的TurboMind引擎在4-bit推理上表现突出,性能是FP16的2.4倍,吐吐量比vLLM高出1.8倍。DistilBERT通过知识蒸馏将模型大小压缩40%,保留了97%的语言理解能力,速度提升60%。
成本优化实战:夜间调度省一半
推理成本优化有明确的操作路径。把非紧急任务(如批量摘要生成、模型微调)安排在夜间和周末执行,Spot实例价格下降30%到50%。以1亿token的摘要任务为例:峰值时段成本300美元,夜间只需150美元,每天节省150美元,一年省下54,750美元。
路由策略同样关键。简单查询路由到小模型,复杂查询路由到大模型,整体吐吐量提升40%到60%。vLLM推荐的GPU内存利用率配置:7B模型设0.95,13B设0.85,70B设0.90。
选型决策:没有银弹,只有匹配
五大框架各有定位。vLLM是通用生产环境的默认选择,部署简单,社区活跃。SGLang在Agent和RAG场景中优势明显,多轮对话和工具调用是它的主场。TensorRT-LLM追求极致性能,适合有工程能力的大型团队。LMDeploy在量化模型上表现抢眼,尤其适合国产模型部署。llama.cpp主打边缘设备和本地运行,CPU上也能流畅推理。
2026年的推理引擎赛道正在出现技术融合的趋势。vLLM可能增强复杂控制流支持,SGLang可能借鉴PagedAttention的内存管理。DeepSeek将优化成果同时贡献给两个项目,也在推动这种融合。对企业来说,选型时需要考虑三个维度:业务场景的并发特征、团队的工程能力、长期维护成本。跑一次基准测试,用真实业务数据做决策,比任何评测文章都靠谱。
发表回复