前OpenAI CTO Mira Murati创立的Thinking Machines Lab放出了第一款模型Inkling。消息一出,Hugging Face上直接挤爆。

9750亿总参数、混合专家MoE架构、单次推理只激活410亿参数。Apache 2.0协议开放推理权重,BF16和NVFP4量化版本都给了。官方说预训练数据量45万亿token,涵盖文本、图像、音频、视频,原生多模态。上下文窗口100万token。

但最让我在意的不是这些数字,是官方博客里的一句话——“Inkling并非当今最强的模型,开源闭源都不是”。一家AI公司主动说自己不是最强,这在今天的大模型赛道里几乎不可想象。

仔细看了他们的设计思路,才发现这家公司的打法跟别人完全不一样。他们不冲SOTA,不刷榜,追求的是“能力、推理成本、原生多模态、可微调性”四者的平衡。说白了就是:让你用得起、改得动、跑得稳。

真正吸引我的是他们配套的微调工具Tinker。官方说用普通笔记本就能完成工业级模型的微调,不需要搭超算集群。我当晚就拉了一个小数据集试了一下——一个垂直领域的客服对话语料,大概5000条。环境配置比想象中简单,一条命令拉起来,训练过程在消费级显卡上跑了大概四个小时。微调后的模型在测试集上的意图识别准确率从基线的67%提到了83%。虽然离生产级还有距离,但这个门槛确实低。

不过跑微调的过程中也暴露了一个问题。45万亿token的预训练数据量意味着模型本身的知识覆盖很广,但微调时的I/O吞吐成了瓶颈——数据集加载、checkpoint读写、多轮eval,全卡在磁盘IO上。我本地用的是NVMe SSD,但连续跑了几轮之后温度上来就开始降速,训练时间直接翻倍。如果换更高性能的存储层,整个流程能再压缩至少三分之一。

Inkling的出现让我重新想了一个问题:当模型不再是“最强”而是“最可用”的时候,开发者的工作方式会怎么变?以前我们选模型只看跑分,现在得看微调成本、推理效率、工具链完整度。TML这套“模型+微调平台”的组合拳,确实把大模型的二次开发门槛往下拉了一大截。

但门槛再低,算力环境跟不上也是白搭。微调过程中的数据读写、模型加载、checkpoint管理,每一个环节都在考验底层存储和计算资源的响应速度。一个稳定的、高吞吐的算力底座,才是把这些“可用”的模型真正用起来的隐形前提。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐