登录社区云,与社区用户共同成长
邀请您加入社区
研发团队通过 torch_xray 精度对齐工具,对 GLM-4.x 系列语言模型在昆仑芯平台上的推理过程进行逐层、逐算子的数值对齐,一旦发现精度异常,迅速结合代码判断,可以快速定位和解决精度异常的原因,从而确保 XPU 平台的模型输出与 GPU 平台保持一致;通过双推理框架的适配实践、插件化的高效迭代机制,以及覆盖推理流程全链路的系统级优化能力,GLM-4.x 系列语言模型在昆仑芯 XPU 平台
本文主要介绍一个在sglang启用本地大模型进行对话之后,远程清除对话缓存的一个指令。可以在闲时或者有紧急任务时,释放出一部分的显存出来作其他用途。
特性vLLMSGLangKV Cache 管理页表(Paged KV Cache)前缀树(RadixAttention)前缀复用机制基于哈希的 Prefix Caching基于前缀树的自动匹配调度粒度Block 级别Token 级别结构化生成集成 Outlines/LMFormatEnforcer原生 DSL + FSM 编译预填充/解码分离实验性支持原生支持API 兼容性完全兼容 OpenAI
设计目标对比:吞吐优先 vs 延迟与灵活性平衡内存管理范式差异扩展性与生态集成关键指标对比表格技术选型决策树。
大模型推理框架对比摘要 本报告对比分析了五大主流LLM推理框架(vLLM、SGLang、TensorRT-LLM、LMDeploy、TGI)的核心技术与适用场景。vLLM凭借PagedAttention和Continuous Batching技术,在显存利用率和易用性上表现突出;SGLang专长于结构化生成与复杂推理,RadixAttention技术显著提升多轮对话效率;TensorRT-LLM在
经过前七篇,文档 VLM 已经具备"看图答问、SFT 对齐、DPO 抗幻觉"的能力。模型究竟有多好(评测),以及如何让它服务真实流量(部署)。本篇覆盖评测与部署的完整链条。核心认知:VLM 评测远不如 NLP 稳定,部署也比纯 LLM 多几个坑(动态分辨率、视觉 token 显存)。一份零依赖 demo(评测稳定性)附带真实运行结果。✅ 识别 VLM 评测不稳定的三个根因,掌握"评分规则脆弱性"这
场景一:高吞吐量补全(纯文本续写,固定长度)。场景二:低延迟对话(多轮交互,短输出)。场景三:复杂结构化生成(JSON 输出、函数调用、多步推理)。场景四:长上下文处理(128K+ 上下文,检索增强生成)。从架构演进来看,效率与灵活性的平衡将成为下一代推理框架的核心命题。vLLM 正在探索更灵活的状态管理以支持轻量级工作流,而 SGLang 则持续优化其底层执行引擎以提升基础吞吐。
在当前以对话为主的 LLM 推理场景中,Beam Search 较少使用。如果以 Beam Search 为核心来组织推理流程,会显著增加代码复杂度,所以在当前的主流推理引擎中,都没有将 beam search 作为核心链路,SGLang 甚至相当长时间都不支持。在搜索推荐场景里,当大模型用作召回时,需要召回多条可能满足用户诉求的资源,这和 Beam Search 返回多结果的特性正好契合,因此部
2026年主流大模型推理框架横评 随着Llama 4、Qwen 3等开源模型性能逼近GPT-4o水平,企业私有化部署需求激增。本文对比三大主流推理框架: vLLM(UC Berkeley) 核心创新:PagedAttention显存管理技术 优势:连续批处理使吞吐量提升1-2个数量级,显存利用率达90%+ 适用场景:工业级高并发生产环境 SGLang(LMSYS分支) 特色功能:RadixAtte
本文将对当前大语言模型(LLM)推理领域两大高性能开源框架——vLLM 与 SGLang 进行全面的性能对比与深度解析。我们将从设计哲学、核心架构、吞吐量、延迟、内存效率、易用性、生态支持等多个维度展开评测,并结合实际应用场景(如 API 服务、批量推理、长上下文处理)给出选型建议,旨在帮助开发者和研究者根据自身需求做出最佳技术决策。
大模型推理引擎vLLM(30): 参考sglang代码,重构vllm021中MOE EP高吞吐代码,消除空泡问题:400us减小到25us
方式本机路径举例带宽延迟CPU参与NVLink~900 GB/s~1μs不参与~25 GB/s~2-5μs不参与GPU0→CPU→内核→CPU→GPU4~10-50μs全程参与。
推理框架的选择不是一劳永逸的决策。随着模型的更新和业务需求的变化,可能需要调整推理方案。重要的是建立一套灵活的推理基础设施,支持多框架共存和动态切换。同时,关注社区的最新进展——推理优化是一个快速演进的领域,今天的"最佳实践"可能在几个月后就被新的方案取代。
很多人做本地部署选型时,第一反应是“27B dense 一定比 35B MoE 更小、更轻、更好跑”。但我在单卡 `L20 48GB` 上把 `llama.cpp`、`SGLang`、`vLLM` 三条路线都跑了一遍后,结论恰好相反:`Qwen3.6-35B-A3B` 这颗 MoE 在长上下文服务场景里反而更好部署,`Qwen3.6-27B` dense 不仅没有更轻,某些路线甚至更难落地。
推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
文章对比了Java后端与大模型应用开发两大技术方向。Java后端市场需求稳定但内卷严重,成长空间有限;大模型应用开发作为新兴技术,薪资高、需求大,是未来5-10年的技术热点。文章详细介绍了大模型学习路径,包括transformer架构、LangChain等技术栈,并指出当前是进入AI领域的好时机,掌握相关技能可获得更高薪资和更多职业可能性。
本文介绍了 Rust 实现的高性能模型服务网关(SMG)的核心架构与关键技术。系统采用分层设计,包括负载均衡策略(7种算法)、gRPC路由管道化处理、4层可靠性机制(断路器/令牌桶/重试/健康检查)、PD分离路由、多模型网关等模块。特别优化了令牌桶的无锁实现、字符串Interning指标存储、全Rust Tokenizer等关键路径,支持Prometheus监控和OpenTelemetry链路追踪
本文系统梳理了主流大模型推理部署框架,包括vLLM、SGLang、TensorRT-LLM、Ollama、XInference等。从核心技术、系统架构、性能指标及适用场景等多维度进行深度剖析,帮助读者了解各框架特点。vLLM适合高并发场景,SGLang擅长多轮交互,TensorRT-LLM优化NVIDIA GPU性能,Ollama便于本地部署,XInference支持分布式扩展,国产框架则适配特定