大模型推理框架对比分析报告

文档日期:2026-07-10
数据截止:2025年10月(部分框架更新至2026年中)
覆盖框架:vLLM、SGLang、TensorRT-LLM、LMDeploy、TGI(Text Generation Inference)
信息来源:各框架官方文档、官方博客、学术论文、权威社区评测(均已标注)


一、框架概览

框架 开发团队 首次发布 开源许可 核心定位 GitHub Stars(2025.10)
vLLM UC Berkeley Sky Computing Lab 2023.06 Apache 2.0 高性能通用LLM推理服务引擎 60,000+
SGLang UC Berkeley LMSYS.org 2024.01 Apache 2.0 结构化生成与复杂推理服务引擎 20,000+
TensorRT-LLM NVIDIA 2023.09 Apache 2.0 基于TensorRT的LLM推理加速库 12,000+
LMDeploy 上海AI Lab / OpenMMLab 2023 Apache 2.0 压缩-推理-服务一体化部署工具箱
TGI Hugging Face 2023 HFOILv1.0 HF生态原生的LLM推理服务框架

来源:阿里云开发者社区《vLLM、SGLang与TensorRT-LLM综合对比分析报告》[1];LMDeploy官方文档与博客 [2];HuggingFace TGI官方文档 [3]


二、各框架深度解析

2.1 vLLM

基本信息
  • 全称:Vectorized Large Language Model Serving System
  • 开发团队:UC Berkeley Sky Computing Lab → 2025年5月加入PyTorch基金会 [4]
  • 学术基础:SOSP 2023论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》[5]
  • 项目现状:200+贡献者机构、2000+贡献者,支持200+ HuggingFace模型架构 [4]
核心技术
技术点 说明 来源
PagedAttention 借鉴操作系统分页机制,将KV Cache划分为固定大小(如16个token)的逻辑页,非连续存储于显存中,显存利用率从传统~60%提升至95%+ vLLM官方博客 [6];CSDN技术解析 [7]
Continuous Batching 动态批处理机制,新请求可随时加入处理队列,无需等待完整批次凑齐,GPU持续保持工作状态 Anyscale博客 [8]
Prefix Caching 自动前缀缓存,相同前缀的请求共享KV Cache,减少重复计算 vLLM官方文档设计说明 [4]
Chunked Prefill 将长输入的prefill阶段分块处理,降低TTFT vLLM官方文档 [4]
Speculative Decoding 支持n-gram、suffix、EAGLE、DFlash等多种投机解码 vLLM官方文档 [4]
量化支持 FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, compressed-tensors等 vLLM官方文档 [4]
分布式并行 张量并行(TP)、流水线并行(PP)、数据并行(DP)、专家并行(EP)、上下文并行(CP) vLLM官方文档 [4]
硬件支持 NVIDIA GPU, AMD GPU, x86/ARM/PowerPC CPU, Google TPU, Intel Gaudi, 华为Ascend, Apple Silicon等 vLLM官方文档 [4]
优点
  1. 易用性极佳:pip安装即用,OpenAI API兼容,1-2天即可部署基础服务 [1]
  2. 社区生态最成熟:60,000+ Stars,500+贡献者,每周多次更新 [1]
  3. 显存效率高:PagedAttention将显存利用率提升至90%+ [6]
  4. 硬件支持最广:NVIDIA、AMD、CPU、TPU、Ascend等多平台 [4]
  5. 模型支持最全:200+ HuggingFace模型架构,覆盖Decoder-only LLM、MoE、Mamba、多模态、Embedding等 [4]
  6. 生产验证充分:被众多企业采用,稳定可靠 [1]
缺点
  1. ⚠️ 无原生RadixAttention:多轮对话场景前缀复用效率不如SGLang [1]
  2. ⚠️ 纯性能非极致:吞吐量和延迟不如TensorRT-LLM [1]
  3. ⚠️ 结构化输出:需借助xgrammar/guidance等外部工具,不如SGLang原生 [4]
  4. ⚠️ 安全漏洞:曾出现CVE-2025-66448代码执行漏洞(已在0.11.1+修复)[9]
适用场景
  • 通用LLM在线服务(ChatGPT类应用)
  • 高并发API服务
  • 多模型管理、A/B测试
  • 快速验证新模型
  • 需要跨硬件平台部署的场景

2.2 SGLang

基本信息
  • 全称:Structured Generation Language
  • 开发团队:UC Berkeley LMSYS.org团队 → 2025年3月加入PyTorch生态系统 [10]
  • 学术基础:arXiv 2023论文《SGLang: Efficient Execution of Structured Language Model Programs》[1]
  • 项目现状:已部署超过40万+GPU,日处理数万亿tokens [10]
核心技术
技术点 说明 来源
RadixAttention 通过基数树(Radix Tree)管理KV Cache,支持多轮对话中共享前缀的自动缓存复用,缓存命中率提升3-5倍 SGLang论文;CSDN对比文章 [11]
结构化输出 原生支持正则表达式约束解码、JSON Schema约束、有限状态机(FSM),直接生成符合格式的结构化数据 SGLang官方文档 [10]
编译器式设计 前端DSL(领域特定语言)简化复杂任务编程,后端运行时优化调度和资源分配 SGLang论文 [1]
投机解码 支持DSpark(置信度驱动的变长验证)、DFlash v2等前沿投机解码技术 SGLang官方博客 [10]
多模态支持 原生支持LLaVA、Qwen-VL等视觉语言模型;支持MOSS-TTS语音模型 SGLang官方文档 [10]
MoE负载均衡 Waterfill和LPLB算法优化DeepEP MoE负载均衡 SGLang官方博客 [10]
多硬件平台 NVIDIA、AMD、Intel Xeon、Google TPU、华为Ascend NPU SGLang官方文档 [10]
FlashInfer集成 使用FlashInfer作为高性能Attention内核库(MLSys 2025最佳论文) 腾讯云技术文章 [12]
优点
  1. 多轮对话性能极强:RadixAttention带来5×吞吐量提升、40%延迟降低、50%显存节省 [1]
  2. 原生结构化输出:正则表达式约束解码,直接生成JSON/XML [10]
  3. 编程灵活:DSL提供强大的控制流能力,适合Agent、工具调用等复杂任务 [11]
  4. 多模态原生支持:VLM(视觉语言模型)、TTS语音模型 [10]
  5. 大规模生产验证:40万+GPU,日处理数万亿tokens [10]
  6. 前沿技术快速跟进:投机解码、MoE优化等领域持续创新 [10]
缺点
  1. ⚠️ 社区相对较小:相比vLLM生态较新,20,000+ Stars [1]
  2. ⚠️ 学习曲线:DSL需要学习,不如vLLM直接 [1]
  3. ⚠️ 文档:相对不够完善,主要以英文为主 [1]
  4. ⚠️ 单请求速度:在禁用chunked prefill时,TTFT稍差于vLLM [13]
适用场景
  • 多轮对话系统(智能客服、AI助手)
  • 结构化生成(API代理、数据提取、JSON输出)
  • Agent应用(规划、执行、反思)
  • 工具调用(动态选择和调用外部工具)
  • 多模态应用(图文对话、视频理解)
  • 复杂推理任务

2.3 TensorRT-LLM

基本信息
  • 开发团队:NVIDIA Corporation
  • 首次发布:2023.09(公开预览),2025.09 v1.0正式版 [1]
  • 技术生态:深度集成NVIDIA TensorRT、CUDA、cuBLAS、cuDNN [1]
  • 项目现状:v1.0引入PyTorch-first架构和trtllm-serve(OpenAI兼容服务器)[1]
核心技术
技术点 说明 来源
深度图优化 算子自动融合(Layer Fusion)、计算图重写(DGO),将Conv+BN+ReLU等模式融合为单个内核 百度开发者文章 [14]
In-flight Batching NVIDIA的动态批处理技术,类似Continuous Batching但针对TensorRT引擎优化 阿里云对比报告 [1]
Paged KV Cache 分页式KV缓存管理 阿里云对比报告 [1]
量化支持最全 FP8、FP16、INT8、INT4、AWQ、GPTQ、SmoothQuant等多种方案 阿里云对比报告 [1]
TensorCore加速 深度适配NVIDIA Tensor Core,最大化算力释放 百度开发者文章 [14]
并行策略 张量并行(TP)、流水线并行(PP)、专家并行(EP)、序列并行(SP) 阿里云对比报告 [1]
trtllm-serve v1.0+提供OpenAI兼容的REST API服务器,支持PyTorch后端直接加载 阿里云对比报告 [1]
模型加密 可将模型编译为加密引擎格式,保护知识产权 阿里云对比报告 [1]
优点
  1. 性能极致:吞吐量和延迟均为最优,尤其在NVIDIA最新硬件上 [1]
  2. 量化支持最全面:唯一原生支持FP8(需H100/L40S),INT4性能优秀 [1]
  3. 并行效率最高:多GPU并行效率~85-90% [1]
  4. 官方支持:NVIDIA官方维护,质量保证 [1]
  5. 模型保护:可编译为加密引擎 [1]
  6. v1.0大幅降低门槛:trtllm-serve + PyTorch后端,使用体验接近vLLM [1]
缺点
  1. ⚠️ 硬件绑定:仅支持NVIDIA GPU,无法部署到AMD或国产硬件 [1]
  2. ⚠️ 模型转换:使用TensorRT引擎时需编译转换,首次编译耗时较长 [1]
  3. ⚠️ 灵活性受限:深度优化依赖编译,模型迭代不如vLLM灵活 [1]
  4. ⚠️ 社区较小:主要依赖NVIDIA官方维护 [1]
  5. ⚠️ 冷启动慢:TensorRT引擎首次编译耗时较长 [1]
适用场景
  • 极致性能需求(高频交易、实时翻译、游戏NPC)
  • 大规模生产部署(云服务商LLM API)
  • 量化部署(FP8/INT4降低成本)
  • 深度绑定NVIDIA生态的项目
  • 需要模型保护的商业场景
  • 边缘推理(NVIDIA Jetson)

2.4 LMDeploy

基本信息
  • 开发团队:上海人工智能实验室(Shanghai AI Lab)/ OpenMMLab团队 [2]
  • 开源许可:Apache License 2.0
  • 项目地址:https://github.com/InternLM/lmdeploy [2]
  • 最新版本:v0.13.0(支持Qwen3.5、GLM5、TurboQuant等)[15][16]
核心技术
技术点 说明 来源
双引擎架构 TurboMind(C++/CUDA,追求极致性能)+ PyTorch(纯Python,便于二次开发) LMDeploy官方文档 [2]
Persistent Batch 即Continuous Batching,动态批处理 LMDeploy官方文档 [2]
Blocked KV Cache 分块式KV缓存管理 LMDeploy官方文档 [2]
TurboQuant 新增KV Cache量化方案(quant_policy=42),支持AWQ、FP8、MXFP4等多种量化 v0.13.0发布说明 [15]
权重与KV Cache卸载 v0.10.0+支持将权重和KV缓存卸载到CPU内存,降低显存占用 v0.10.0发布说明 [17]
有状态推理 缓存多轮对话KV,避免重复处理历史会话 LMDeploy官方文档 [2]
全链路支持 覆盖模型压缩(量化)→ 推理优化 → 服务部署全流程 LMDeploy官方文档 [2]
优点
  1. 推理性能强:吞吐量可达vLLM的1.8倍,4bit量化推理效率是FP16的2.4倍 [2]
  2. 双引擎灵活:TurboMind追求性能 + PyTorch引擎便于调试和定制 [2]
  3. 国产模型支持好:原生支持InternLM、GLM5、Qwen3.5等国产模型 [16]
  4. 全链路工具:量化→推理→服务一站式 [2]
  5. 量化方案丰富:AWQ、KV Cache量化、FP8、MXFP4、TurboQuant [15]
  6. 多模态支持:支持Qwen2.5-VL、InternVL3.5等VLM [17]
  7. 国产硬件适配:支持华为Ascend NPU [15]
缺点
  1. ⚠️ 社区规模:相比vLLM较小,中文社区为主
  2. ⚠️ 国际生态:在国际社区的影响力不如vLLM/SGLang
  3. ⚠️ 模型覆盖:虽然支持主流模型,但不如vLLM的200+覆盖广
适用场景
  • 国产模型(InternLM、GLM、Qwen)的部署
  • 需要全链路工具(量化+推理+服务)的场景
  • 国产硬件(Ascend)部署
  • 多轮对话(有状态推理)
  • 需要灵活选择引擎(TurboMind/PyTorch)的场景

2.5 TGI(Text Generation Inference)

基本信息
  • 开发团队:Hugging Face
  • 开源许可:HFOILv1.0(允许商业使用,但需作为辅助工具而非主要产品)[3]
  • 技术栈:Rust + Python [18]
  • 最新版本:TGI v3.0 [19]
核心技术
技术点 说明 来源
连续批处理 动态批处理,服务器内部动态批处理请求 TGI官方文档 [18]
张量并行 多GPU分布式推理 TGI官方文档 [18]
量化支持 bitsandbytes-nf4、bitsandbytes-fp4等4bit量化 TGI官方文档 [3]
长文本优化 v3.0优化数据结构,长提示词处理速度比vLLM快13倍 TGI v3.0发布说明 [19]
安全功能 水印(watermark)、logit扭曲(bias控制)、停止序列 TGI官方文档 [18]
HF生态原生 直接使用HuggingFace模型ID,零配置部署 TGI v3.0发布说明 [19]
优点
  1. HuggingFace生态原生:直接使用HF模型ID,零配置 [19]
  2. 长文本处理极强:v3.0处理20万token仅需2秒(vLLM需27.5秒),快13倍 [19]
  3. 内存效率:单L4 GPU(24GB)可处理3万token,是vLLM的3倍 [19]
  4. 安全功能丰富:内置水印、bias控制、停止序列 [18]
  5. Rust+Python架构:Rust保证性能,Python保证灵活性 [18]
缺点
  1. ⚠️ 性能非全面领先:长文本场景领先,但通用吞吐量不如TensorRT-LLM
  2. ⚠️ 许可证限制:HFOILv1.0要求TGI作为辅助工具而非主要产品 [18]
  3. ⚠️ 社区竞争:被vLLM等框架分流,社区活跃度下降
  4. ⚠️ 硬件支持:主要面向NVIDIA GPU
适用场景
  • HuggingFace生态深度用户
  • 超长文本处理(>10万token)
  • 内存受限环境下的推理
  • 需要内置安全功能的场景
  • 需要快速从HF Hub部署模型的场景

三、横向对比总表

3.1 核心技术对比

维度 vLLM SGLang TensorRT-LLM LMDeploy TGI
内存管理 PagedAttention(分页式) RadixAttention(基数树) Paged KV Cache Blocked KV Cache 连续分配+优化
批处理策略 Continuous Batching Continuous Batching + 前缀缓存 In-flight Batching Persistent Batch Dynamic Batching
KV缓存共享 自动前缀缓存 自动前缀缓存(Radix树,最优) 部分支持(需手动配置) 有状态推理 不支持
结构化输出 基础支持(xgrammar/guidance) 原生支持(正则/FSM约束) 不支持 不支持 不支持
量化支持 FP8,INT8,INT4,AWQ,GPTQ,GGUF等 AWQ,GPTQ FP8,INT8,INT4,AWQ,GPTQ,SmoothQuant(最全) AWQ,KV量化,FP8,MXFP4,TurboQuant bitsandbytes-nf4/fp4
并行策略 TP,PP,DP,EP,CP TP,DP TP,PP,EP,SP TP TP
多模态 实验性(LLaVA等) 原生支持(LLaVA,Qwen-VL,TTS等) 有限支持 支持VLM 不支持
投机解码 n-gram,suffix,EAGLE,DFlash DSpark,DFlash v2 支持 支持 不支持
硬件支持广度 最广(NVIDIA/AMD/CPU/TPU/Ascend等) NVIDIA/AMD/Intel/TPU/Ascend 仅NVIDIA NVIDIA/Ascend NVIDIA
API兼容 OpenAI兼容 OpenAI兼容 + 自定义DSL OpenAI兼容(trtllm-serve) RESTful/gRPC/WebSocket OpenAI兼容
模型格式 HuggingFace原生 HuggingFace原生 需转换为TensorRT引擎(v1.0+支持PyTorch直接加载) HF/TurboMind格式 HuggingFace原生

来源:阿里云对比报告 [1];vLLM官方文档 [4];SGLang官方文档 [10];LMDeploy文档 [2]

3.2 性能对比(参考数据)

重要说明:以下数据基于公开基准测试和官方报告,实际性能因模型大小、序列长度、硬件配置等因素差异较大,强烈建议在自己的环境中实测。数据来源均标注于各部分。

吞吐量对比(LLaMA-2-7B,输入128 tokens,输出128 tokens,FP16)
硬件 vLLM SGLang TensorRT-LLM
A100 80GB 2,000-3,000 tok/s 3,500-4,500 tok/s 4,000-5,000 tok/s
H100 80GB 4,000-6,000 tok/s 6,000-8,000 tok/s 7,000-10,000 tok/s
A10G 24GB 800-1,200 tok/s 1,000-1,500 tok/s 1,200-1,800 tok/s

来源:vLLM官方基准测试、SGLang v0.4发布博客、TensorRT-LLM技术文档 [1]

TTFT对比(首Token延迟)
场景 vLLM SGLang TensorRT-LLM
短输入(128 tok) 40-60ms 30-50ms 25-40ms
长输入(2048 tok) 150-250ms 120-200ms 100-180ms
超长输入(8192 tok) 600-900ms 500-800ms 400-700ms

来源:各框架官方benchmark工具测试结果 [1]

多轮对话场景(前缀复用,SGLang核心优势)
框架 吞吐量提升 延迟降低 显存节省
vLLM 基准 基准 基准
SGLang 40% 50%
TensorRT-LLM 1.2× 15% 10%

来源:SGLang RadixAttention论文、vLLM prefix caching文档 [1]

LMDeploy性能
指标 数据 来源
吞吐量 vLLM的1.36~1.85倍 LMDeploy官方文档 [2]
4bit量化推理 FP16的2.4倍 LMDeploy官方文档 [2]
TGI v3.0长文本性能
指标 数据 来源
20万token提示词处理 2秒(vLLM需27.5秒,快13倍) TGI v3.0发布说明 [19]
单L4 GPU可处理token 30,000(vLLM的3倍) TGI v3.0发布说明 [19]

3.3 开发者体验对比

维度 vLLM SGLang TensorRT-LLM LMDeploy TGI
安装难度 ⭐ 简单(pip) ⭐ 简单(pip) ⭐⭐ 中等 ⭐ 简单(pip) ⭐ 简单(pip)
快速上手 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐(v1.0+) ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
学习曲线 1-2天 3-5天 2-3天(v1.0)/1-2周(深度) 1-2天 1-2天
文档质量 详细完善 良好但较新 详细(v1.0+改善) 中文友好 详细
社区活跃度 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐

来源:阿里云对比报告 [1]


四、选型决策矩阵

4.1 快速选型表

需求 推荐框架 理由
快速上手、通用服务 vLLM 易用性最佳,生态最成熟
多轮对话、Agent应用 SGLang RadixAttention带来5×性能提升
结构化输出(JSON/XML) SGLang 原生约束解码,无需后处理
极致性能、NVIDIA生态 TensorRT-LLM 吞吐量和延迟最优,FP8支持
国产模型/硬件 LMDeploy 原生支持InternLM/GLM/Qwen + Ascend
全链路工具(量化+推理+服务) LMDeploy 一站式覆盖
HuggingFace生态、超长文本 TGI v3.0长文本性能领先13×
跨硬件平台(AMD/CPU/TPU) vLLM 硬件支持最广
多模态应用 SGLang 原生VLM + TTS支持
成本敏感的大规模部署 TensorRT-LLM 性能最高,摊薄单卡成本

4.2 场景化选型

场景一:在线聊天服务(ChatGPT类)
推荐:vLLM(首选)/ SGLang(多轮对话多时)
理由:高并发、易部署、OpenAI API兼容
场景二:智能客服系统(多轮对话为主)
推荐:SGLang
理由:RadixAttention在多轮对话中吞吐量5×提升,延迟降低40%
场景三:企业级大规模API服务
推荐:TensorRT-LLM
理由:吞吐量最优,量化最全(FP8),并行效率最高
场景四:Agent应用(工具调用、复杂推理)
推荐:SGLang
理由:DSL支持复杂控制流,结构化输出原生支持
场景五:国产模型+国产硬件部署
推荐:LMDeploy
理由:原生支持InternLM/GLM/Qwen + Ascend NPU,全链路工具
场景六:超长文本处理(>10万token)
推荐:TGI v3.0
理由:长文本处理速度比vLLM快13倍,内存效率3倍
场景七:快速验证新模型
推荐:vLLM
理由:支持200+模型架构,pip安装即用

五、互补使用方案

在某些场景下,多个框架可以组合使用,各取所长:

方案一:vLLM + TensorRT-LLM 混合部署

用户请求 → 负载均衡器 → {
    简单任务 → vLLM(易维护、快速迭代)
    高性能任务 → TensorRT-LLM(极致性能)
}

来源:阿里云对比报告 [1]

方案二:SGLang前端 + vLLM/TensorRT-LLM后端

复杂控制流 → SGLang DSL(结构化输出、Agent逻辑)
                → vLLM / TensorRT-LLM(推理执行)

来源:阿里云对比报告 [1]

方案三:多模型分层服务

┌─────────────┐
│   API 网关   │
└──────┬──────┘
       │
   ┌───┴────────────┐
   │                │
┌──▼──────┐  ┌──────▼─────┐
│ vLLM    │  │ SGLang     │
│ (通用)  │  │ (对话)     │
└──┬──────┘  └──────┬─────┘
   │                │
   └───────┬────────┘
           │
    ┌──────▼────────┐
    │ TensorRT-LLM  │
    │ (高性能后端)   │
    └───────────────┘

来源:阿里云对比报告 [1]


六、前沿技术趋势

6.1 投机解码(Speculative Decoding)

框架 支持方案 来源
vLLM n-gram, suffix, EAGLE, DFlash vLLM官方文档 [4]
SGLang DSpark(置信度驱动变长验证), DFlash v2 SGLang官方博客 [10]
TensorRT-LLM 支持 阿里云对比报告 [1]

6.2 PD分离(Prefill-Decode Disaggregation)

  • vLLM:支持Disaggregated prefill, decode, and encode [4]
  • SGLang:在MoE负载均衡方面有Waterfill和LPLB算法优化 [10]

6.3 FlashInfer统一注意力内核

FlashInfer(MLSys 2025最佳论文)已被集成到vLLM和SGLang中,成为跨框架的高性能Attention内核库。

来源:腾讯云技术文章 [12]

6.4 MoE模型优化

随着DeepSeek-V3、Qwen-MoE等MoE模型普及,各框架都在加强MoE支持:

  • vLLM:Fused MoE模块化内核 [4]
  • SGLang:Waterfill和LPLB算法优化DeepEP MoE负载均衡 [10]
  • TensorRT-LLM:Expert并行 [1]

七、总结

一句话选型

如果你是… 选择
初学者/快速验证 vLLM
做多轮对话/Agent SGLang
追求极致性能/有NVIDIA资源 TensorRT-LLM
用国产模型/国产硬件 LMDeploy
HF生态用户/处理超长文本 TGI

核心结论

  1. 没有绝对最优的框架,只有最适配场景的选择 [20]
  2. vLLM是通用首选:易用性、生态、硬件支持广度全面领先,适合大多数通用场景
  3. SGLang是复杂任务首选:RadixAttention在多轮对话/Agent场景下优势显著,结构化输出原生支持
  4. TensorRT-LLM是性能首选:在NVIDIA硬件上吞吐量和延迟最优,适合大规模生产部署
  5. LMDeploy是国产首选:全链路工具+国产模型/硬件适配,InternLM/GLM/Qwen生态首选
  6. TGI是长文本首选:v3.0在超长文本场景下性能领先,HF生态无缝集成

框架迭代极快,建议每季度重新评估选型。所有性能数据请以实际环境测试为准。


参考来源索引

编号 来源 链接
[1] 阿里云《vLLM、SGLang与TensorRT-LLM综合对比分析报告》 https://developer.aliyun.com/article/1686693
[2] LMDeploy框架详解 https://blog.csdn.net/watson2017/article/details/157215447
[3] TGI高性能大语言模型推理框架 https://blog.csdn.net/u013172930/article/details/147190222
[4] vLLM官方文档 https://docs.vllm.ai/en/latest/
[5] vLLM论文(SOSP 2023) https://arxiv.org/abs/2309.06180
[6] vLLM官方博客(PagedAttention) https://blog.vllm.ai/2023/06/20/vllm.html
[7] vLLM原理深度解析 https://blog.csdn.net/bugyinyin/article/details/152045437
[8] Anyscale连续批处理博客 https://www.anyscale.com/blog/continuous-batching-llm-inference
[9] vLLM安全漏洞预警 http://net.jstu.edu.cn/2025/1212/c2331a206986/page.htm
[10] SGLang官方文档 https://docs.sglang.ai/
[11] SGLang vs vLLM全面对比 https://blog.csdn.net/shenhonglei1234/article/details/145950623
[12] FlashInfer MLSys 2025最佳论文 https://cloud.tencent.com/developer/article/2520358
[13] vLLM和SGLang比较(最新版本) https://post.smzdm.com/zz/p/a24r20rp/
[14] 大模型推理框架技术选型指南 https://developer.baidu.com/article/detail.html?id=4956470
[15] LMDeploy v0.13.0发布说明 https://cloud.tencent.com/developer/article/2671330
[16] LMDeploy v0.12.2发布说明 https://cloud.tencent.com/developer/article/2648626
[17] LMDeploy v0.10.0发布说明 https://cloud.tencent.com/developer/article/2603449
[18] TGI文本生成推理工具包 https://blog.csdn.net/hyang1974/article/details/138501231
[19] TGI v3.0发布 https://blog.csdn.net/2301_79342058/article/details/144412348
[20] TensorRT-LLM与vLLM对比 https://www.toutiao.com/article/7618839210207887915/

本文档基于公开资料整理,数据截至2025年10月(部分更新至2026年7月)。框架迭代极快,建议结合最新官方文档使用。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐