MiniMax 偷偷发了新模型-M3
·
老实说,很震惊。不是因为模型有多好,而是偷偷摸摸的发了新模型,不知道的,还以为拿不出手呢。哈哈哈
1M上下文
之前 DeepSeek V4 发布的时候,我已经隐隐预感 1M 上下文的时代要来了。这不,MiniMax 跟进的挺快哈。
还是应了那句话“不是 1M 上下文实现起来很难,而是要做到兼顾成本、效率很难”。
简洁可扩展、易于实现且硬件友好的特点,使它的理论收益能真正落地:在 100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。在 prefilling 阶段,我们实现了超过 9 倍的加速倍率,在 decoding 阶段有超过 15 倍的加速优势。而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平。
多模态
多模态也是大势所趋~,这是MiniMax 首次支持。写代码又方便了,直接截图就可以调试(复刻)了。

--完整报告
MiniMax M3:前沿 Coding 能力,1M上下文,原生多模态,一个模型全给你 - MiniMax Research | MiniMax
更多推荐




所有评论(0)