9B、35B同级别SOTA,397B比肩Opus4.8,Ornith-1.5开启端到端自提升
用海量的人类标注数据喂养模型,花费无数精力清洗数据、设计提示词的范式正在发生转变。
DeepReinforce 正式推出了 Ornith-1.5 并以 MIT 协议开源。这是一个向端到端自我提升迈进的基础模型新框架。

模型开始学会自己给自己出题,自己寻找答案,并在不断试错中完成进化。
9B 和 35B 参数规模的模型在同级别中达到了最优性能。


而 397B 的旗舰版本,其表现已经与 Claude Opus 4.8 并驾齐驱。

最小的 9B 版本经过量化后,甚至可以直接运行在普通的智能手机上。
Ornith-1.5 将模型自我支撑扩展为完整的自我提升循环。模型不再依赖人工设定的固定任务和固定评测框架,而是自行提出任务、生成评测脚手架、产出解题轨迹,三者用 GRPO 联合优化形成闭环。、
卓越性能表现
Ornith-1.5 覆盖了三个不同的模型规模,均展现出令人瞩目的性能,满足了从云端到边缘的多样化需求。全尺寸的性能跨越展示了该架构的强大扩展性。
旗舰级的 Ornith-1.5-397B 采用 MoE (混合专家) 架构。
它在 Terminal-Bench 2.1 评测中获得了 86.1 分,在 DeepSWE 评测中获得了 56.0 分。这一成绩与 Claude Opus 4.8 的 85.0 分和 59.0 分基本持平。

同时,它大幅领先于同规模的开源模型,例如 GLM-5.2 的 82.7 分和 46.2 分,以及 DeepSeek-V4-Flash-0731 的 82.7 分和 54.4 分。
中坚力量的 Ornith-1.5-35B 同样采用 MoE 架构,在处理每个 token 时仅激活 3B 参数。
它在所有编码和智能体基准测试中,显著超越了同级别的 Qwen 3.6-35B。模型即便参数激活量如此克制,它在智能体编码任务上依然大幅超越了传统的 Dense 模型。

在 Terminal-Bench 2.1 上,它取得了 68.5 分,远超 Gemma 4-31B 的 43.4 分和 Meta 的 Muse Glimmer-30B 的 51.7 分。
在 SWE-Bench Verified 上,它更是拿下了 79.0 分,对比前两者的 52.0 分和 76.0 分,优势十分明显。
边缘部署的 Ornith-1.5-9B 则是 Dense 架构。它的量化版本已经具备了在 iPhone 和 Android 设备上直接部署的能力。

尽管只有 9B 参数,它依然交出了 Terminal-Bench 2.1 的 47.0 分和 SWE-Bench Verified 的 70.6 分。在多个测评维度上已经超越了 Gemma 4-31B 和 Qwen 3.6-35B 等规模大得多的模型。
告别人工
DeepReinforce 是一家专注于AI与系统优化的研究型初创公司,由斯坦福博士李纪为于2024年创立。团队几乎所有产品都已开源,并在多项关键任务上超越了行业标杆。
团队开发的 CUDA-L1 & CUDA-L2(系统优化),真实 GPU 任务加速超越了英伟达的闭源方案;编程智能体 GrandCode,在 Codeforces 的多次正式直播赛中击败所有人类选手(包括传奇大师),成为首个达成此成就的 AI 系统。
如今的 Ornith-1.5 模型展示了 AI 可以自主生成训练数据和学习课程,实现自我进化。
初版的 Ornith-1.0 建立在 Qwen3.5 和 Gemma 4 的基础之上,经历了持续预训练 (CPT)、中期训练和后训练的打磨。模型通过吸收现有的高质量知识,建立起了初步的认知框架。
Ornith-1.5 则在此基础上完成了一次范式跃迁。它打破了静态分布的束缚。它将优化的重心从单纯的支撑和展开,扩展到了联合优化任务生成、支撑构建和解决方案展开。
模型不再被动接受知识,而是主动创造新的学习体验。

每一次训练循环,系统都在根据自身的表现动态调整课程表。它自适应地改变解决问题的策略,在推理、编码和智能体任务中不断挖掘更深层的能力。
这个自我提升循环的精妙之处,在于其紧密咬合的三个阶段。我们可以将其想象为一个高度自律的学者在攻克未知领域,每一步都经过深思熟虑。
第一阶段是任务提出。系统会审视当前的环境或代码库,结合高级任务指令和过往的解题历史,主动构思难度更高的新任务。这些新任务并非随机生成,而是专门用来暴露模型现有的能力盲区。
通过不断推高训练的前沿,模型被迫走出舒适区,直面自身的不足。
第二阶段是支撑构建。面对每一个新提出的任务,模型不会盲目尝试,而是会生成或优化一套专属的 Scaffold (脚手架)。这套支撑体系包含了具体的操作指令、需要调用的外部工具、复杂问题的分解策略,以及整体的执行编排方式。
第三阶段是方案展开。在明确的任务目标和完善的支撑框架引导下,模型策略会生成完整的 Solution Rollout (解决方案展开)。这是将理论转化为实际执行步骤的过程,模型在这里展示其综合运用各种工具和逻辑推理的能力。
整个机制的灵魂在于奖励信号的流动。展开阶段获得的奖励,会反向传播到前两个阶段。
模型不仅在学习如何给出更好的最终答案,还在学习如何提出更有价值的训练任务,以及如何构建更高效的支撑框架。
Ornith-1.5 赋予模型自我审视与自我教学的能力,重塑了基础模型训练范式。
参考资料:
https://ornith.ai/ornith_1_5.html
https://huggingface.co/collections/ornith-ai/ornith-15
更多推荐




所有评论(0)