美团正式发布并开源LongCat-2.0——总参数1.6万亿、平均激活480亿的MoE大模型。
2026年6月30日,美团正式发布并开源LongCat-2.0——总参数1.6万亿、平均激活480亿的MoE大模型。
这不是一个普通的开源模型发布。它有两个"第一":业界第一个在五万卡国产AI芯片集群上完成全流程预训练与推理的万亿参数模型,也是国内第一个在OpenRouter全球大模型调用量榜上杀入前三的开源模型。
在海外高端GPU持续受限的大背景下,这个"龙猫"(LongCat的中文名)跑出的不仅是技术参数,更是一条国产算力从"能用"到"好用"的完整路径。
背景
LongCat-2.0的研发故事要从2023年说起。
彼时,美团LongCat团队从千卡国产算力起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题。此前,它以"Owl Alpha"代号在OpenRouter平台灰度测试,预览版月调用量已跻身全球前三,成为最受全球Agent开发者欢迎的模型之一。
而在正式版发布前,美团内部也做了重要的组织调整——成立AI Transformation部门。这释放了一个清晰信号:美团对大模型的预期正在从"技术探索"转向"业务流的实质改造"。
五万卡国产算力:技术突围的三场硬仗
在超过5万张国产AI芯片集群上完成30万亿Token的预训练,意味着什么?
万卡集群的工程难度已经是业界共识。五万卡意味着通信拓扑更复杂、故障概率更高、显存压力更大。LongCat团队从三个维度打了一场硬仗:
稳定性。 通过卡间通信异常处理、弹性扩缩卡和自动故障恢复机制,将月均日故障率降低了70%以上。对规模化训练而言,这个数字意味着从"每天崩溃几次"到"几天崩一次"的质变。
正确性。 自研设计确定性算子,实施Bitwise一致性验证和参数检测。训练万亿参数模型,任何微小的精度偏差都会在反向传播中被指数级放大。团队还基于实践提升了关键模块的计算精度、优化了Reduce逻辑。
效率。 通过流水线调度、显存优化和算子级控核,训练MFU(模型浮点利用率)提升了1.5倍。最终实现稳态日吞吐超过1T tokens/day。
这三项成果合在一起,回答了一个核心问题:国产算力能不能撑得起万亿参数模型的规模化训练?答案是能。
而在推理侧,LongCat围绕模型、算子和框架进行协同优化:通过大规模专家并行聚合访存带宽,将零计算专家机制融入专家并行通信流程,并针对通信、Attention、GEMM等核心算子优化调度,结合提前下发与权重预取等框架机制,进一步降低推理链路中的等待开销。
据官方披露,得益于算力优化、技术突破等综合因素,LongCat-2.0的训练和推理成本消耗低于全球其他万亿参数级别的大模型。
架构创新:让万亿参数模型"聪明地干活"
万亿参数模型最容易出现的问题是"笨重"——参数多但大部分是冗余计算。LongCat-2.0在架构设计上做了一系列针对性创新。
LSA稀疏注意力:百万级上下文不掉链子。 传统模型在处理超过100K上下文后就开始"遗忘"前面内容。LongCat-2.0采用LongCat Sparse Attention(LSA)机制,在处理长文本时不再逐字逐句地看,而是智能筛选关键信息,将计算量从平方级降至线性级。这使得模型在原生1M超长上下文中仍能保持精准的信息定位与理解能力。
想象一下:用一个模型读完《三体》三部曲的全部内容,还能准确回答第二部某个角色的第一句台词——这就是LSA的功底。
零计算专家+ScMoE:算力用在刀刃上。 代码任务中不同Token的复杂度差异巨大——定义变量名和推导递归算法对算力的需求完全不同。LongCat-2.0通过零计算专家实现Token级动态激活(激活参数范围33B~56B),简单Token不消耗算力,复杂Token自动获得更多计算资源。平均480亿的激活参数意味着:你总是只付出完成任务所需的计算量,不多花一分。
MOPD多专家融合:一个模型三种专长。 这是LongCat-2.0最独特的架构创新。通过MOPD架构,模型融合了Agent、Reasoning、Interaction三组专家能力——Agent Experts专攻工具调用与自主纠错,Reasoning Experts深耕数学与STEM推理,Interaction Experts优化指令遵循与交互体验。推理时由门控网络根据任务类型动态调度最擅长的专家,而非简单合并参数。
这意味着一个模型同时擅长写代码、做推理、懂交互,任务不同,调用的"脑区"也不同。
评测表现与真实场景:不止是"纸面参数"
在基准评测上,LongCat-2.0交出了一份引人注目的成绩单:
- SWE-bench Pro(深层工程能力):59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)和Claude Opus 4.6(57.3)
- SWE-bench Multilingual(多语言编程):77.3,与Claude Opus 4.6(77.8)在同一水位
- Terminal-Bench 2.1(真实终端指令):70.8,体现真实运维和开发终端任务的稳定执行与纠错能力
- RWSearch(搜索智能体):78.8,FORCE(生产力场景):73.2,BrowseComp:79.9
但更值得关注的是它在真实场景中的表现。美团官方披露的几个案例让人印象深刻:
- 代码库迁移:给LongCat-2.0一个旧版插件代码库和一份新版SDK文档,它能自行分析整体架构、梳理核心逻辑,将整个插件重构为符合新API的实现——保留全部原有功能,修复潜在隐患,编译一次通过。
- 一句话生成完整3D交互:通过一句话描述,即可生成完整Three.js 3D演示,所有代码封装在一个HTML文件中,打开即用。
- AI小说工厂:基于LongCat-2.0构建的"AI小说工厂",将创意写作升级为自动化内容流水线。通过长上下文能力保障百万字级设定一致性,最终内容可自动适配多平台发布。
对行业意味着什么?
国产算力大规模商用验证完成。 这是LongCat-2.0最深远的意义。2023年许多人还在质疑国产AI芯片能否支撑大规模训练,而今天,美团用五万卡集群、30万亿Token的训练量给出了明确答案。据媒体透露,LongCat还将开源Infra框架、推理框架和模型权重,这意味着整个行业都可以复用这一套经过验证的国产算力训练方案。
推理对标海外成本的结构性压降。 训练成本本身很重要,但对企业级应用而言,推理成本才是决定大规模落地的关键。LongCat-2.0通过MoE动态激活、零计算专家等机制,显著压降了单次交互的显存占用和推理成本。对企业而言,这直接关系到AI能力能否嵌入到高频、低利润率的业务场景中。
从技术探索到业务流的实质改造。 美团成立AI Transformation部门绝非偶然。LongCat-2.0的能力与美团业务的结合路径已经清晰:对内,AI代码助手与SQL数据分析智能体可直接缩减后端开发与数据查询的人力消耗;对外,同城物流与本地生活业务涉及的高频商户与骑手交互,可以利用1M超长上下文结合工具调用能力,处理多维度的调度指令分发与自动化客诉流转。
总结与展望
LongCat-2.0的发布,是国产大模型史上的一个标志性事件。
它不是参数规模最大的——国内已有超过它的模型。它不是评测分数最高的——某些细分赛道有更专注的方案。但它是第一个在国产算力集群上完整跑通从预训练到推理全流程的万亿参数模型,而且跑得很好。
这件事的意义不仅关乎美团,更关乎整个中国AI产业。在算力脱钩的大背景下,一条不依赖海外高端GPU的大模型训练路径被验证是可行的。这是一次"国模国芯"从理念到实践的全栈证明。
龙猫的英文是LongCat,但它的中文含义更值得品味——"龙"象征国产算力的腾飞,"猫"则代表灵活和敏捷。万亿参数但不笨重,国产算力但不妥协——这或许才是LongCat-2.0最想传达的信息。
更多推荐



所有评论(0)