老实说,很震惊。不是因为模型有多好,而是偷偷摸摸的发了新模型,不知道的,还以为拿不出手呢。哈哈哈

1M上下文

之前 DeepSeek V4 发布的时候,我已经隐隐预感 1M 上下文的时代要来了。这不,MiniMax 跟进的挺快哈。

还是应了那句话“不是 1M 上下文实现起来很难,而是要做到兼顾成本、效率很难”。

简洁可扩展、易于实现且硬件友好的特点,使它的理论收益能真正落地:在 100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。在 prefilling 阶段,我们实现了超过 9 倍的加速倍率,在 decoding 阶段有超过 15 倍的加速优势。而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平。

多模态

多模态也是大势所趋~,这是MiniMax 首次支持。写代码又方便了,直接截图就可以调试(复刻)了。

--完整报告

MiniMax M3:前沿 Coding 能力,1M上下文,原生多模态,一个模型全给你 - MiniMax Research | MiniMax

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐