作为大模型开发者,过去这一年我们听了太多关于“长文本”和“Agent”的营销黑话。但说实话,每次看到那些一输长文本就卡死、写个复杂脚本就要人工反复调教的“半吊子 Agent”,热情难免被浇灭大半。
在这里插入图片描述

不过,MiniMax 最新发布的 MiniMax M3,确实让人眼前一亮。
在这里插入图片描述

它不搞虚的,一上来就甩出三个硬标签:原生多模态、1M(100万)超长上下文、开源权重
最绝的是官方公布的一个实战案例:在完全没有人工干预的情况下,M3 连续运行 24 小时,自主调用工具 1959 次、提交 147 次测试,硬生生把一个跑不通的 Triton 骨架代码,榨出了 71.3% 的 Hopper GPU 硬件峰值性能,算子性能飙升 9.4 倍。

大模型开始抢底层算子工程师的饭碗了?
别慌,我们先看看它底层的技术底牌。


架构掀桌子:1M 上下文,推理速度凭什么狂飙?

做过大模型部署和训练的同学都知道,1M Context 最大的痛点不是模型记不住,而是算不起。传统的 Full Attention(全注意力机制)计算复杂度随长度呈平方级( O ( N 2 ) O(N^2) O(N2))爆炸,显存分分钟 OOM,更别提恐怖的推理延迟了。

为了破这个局,MiniMax M3 直接放弃了老路,自己搞了一套 MSA(MiniMax Sparse Attention)稀疏注意力架构在这里插入图片描述

核心黑科技:“KV 外聚 Q”(KV outer gather Q)

简单来说,MSA 在计算过程中加入了一个预过滤阶段

  • 它把庞大的 Key-Value (KV) 缓存进行了分块。
  • 在 Query 聚合阶段,每个 KV 块只需要被读取一次。

这种对硬件极度友好的稀疏化改动,带来的性能红利堪称恐怖:
在 1M 极端长文本下,M3 的单 Token 计算开销直接缩减到了上一代模型的 1/20。官方实测,Prefill(前文填充)阶段加速 9 倍以上,Decoding(解码输出)阶段加速 15 倍以上
在这里插入图片描述

这意味着,以前你传一个包含成百上千个复杂层级映射的 JSON 数据集,或者几十个 DINOv2 训练日志进去,模型得“死机”半天;现在用 M3,基本上能做到秒级响应。


从“写代码”到“搞研发”:三个细思极恐的 Agent 实战

如果说 MSA 架构是内功,那 M3 展现出的长周期自主研发能力就是杀招。现在的 M3 已经不满足于单轮的 Ctrl+C / Ctrl+V 帮写个小脚本了,它能像个真正的初级工程师一样,自己拆任务、看日志、改 Bug、跑 Benchmark。

除了前面提到自主魔改 CUDA 算子,官方还公布了两个非常有意思的极限压测:

1. 12小时自主复现 ICLR 顶会论文

让 M3 独立去啃一篇 ICLR 2025 的优秀论文《Learning Dynamics of LLM Finetuning》。

  • 怎么做? 靠着 1M 的大肚子,把论文 PDF、配套代码和实验日志全塞进窗口。
  • 结果: 连续高强度运行 12 小时,利用多模态能力看懂了论文里复杂的公式和图表,硬生生完成了 18 次代码 Commit,产出了 23 张实验图表,把核心实验完美复现了出来。
    在这里插入图片描述

2. 完美的“套娃”:AI 自己训练 AI

在 PostTrainBench 测试中,给 M3 扔了 4 个刚从产线下来、什么都不会的 Base(预训练)模型,让它在 12 小时内客串“微调工程师”。
结果它自己搞定了“合成数据 → \rightarrow 跑训练 → \rightarrow 自动化评估 → \rightarrow 调参迭代”的全流程。最终在这个基准上拿到了 37.1 的高分,全球第三,仅次于 Opus 4.7 和 GPT-5.5。
在这里插入图片描述


刷榜与生态:这波羊毛怎么薅?

在打榜这块,M3 也没客气。软件工程领域的硬核指标 SWE-Bench Pro 直接冲到了 59.0%,把 GPT-5.5 和 Gemini 3.1 Pro 甩在身后。而在测试智能体工具调用能力的 MCP Atlas 上,也有 74.2% 的高分。
在这里插入图片描述

更重要的是,MiniMax 这次在商业化策略上玩了个“加量不加价”:

同样是 20 美元/月的 Plus 档,Token 额度直接翻倍,每月给到了足足 17 亿(1.7B)Tokens! 官方换算了一下,这相当于 11 万篇长文档。对于天天泡在服务器、改脚本、倒腾各种跨平台自动化流转的技术人来说,这个吞吐量终于能让人放开手脚去跟 AI 协同了。
在这里插入图片描述


最后的思考

从技术演进的角度来看,MiniMax M3 的发布释放了一个强烈的信号:单打独斗的 LLM 时代正在过去,原生多模态 + 高效长文本支撑下的“长周期智能体(Long-horizon Agent)”才是下一半场的标准配置。

特别是对于我们这种经常需要处理海量图像数据、调优深度学习模型架构、写多线程自动化脚本的技术人来说,一个能在本地 Linux 服务器和 macOS 之间无缝协同、甚至能帮你自动看文档去优化底层算子的工具,已经不仅仅是一个“聊天框”,而是一个真正能下地干活的“数字同事”了。

M3 的开源权重已经放出,API 也同步上线。你是打算用它来写一个自动清洗数据集的 Agent,还是打算给自己的项目卷一波算子优化?欢迎在评论区聊聊。
使用网站:https://agent.minimax.io/
在这里插入图片描述

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐