Ornith-1.5:开源AI 现在可以自己进化了,1.5GB 可在手机本地运行
你有没有想过,一个人要怎么才能真正变强?
光靠死记硬背不行。刷题刷到天亮也不行——因为题库总有做完的一天。
真正让人越来越厉害的,是这种能力:自己给自己出题,自己判断"这道题我还不会",然后拼命去搞定它。
这是人类学习的终极形态。而就在最近,一个叫 Ornith-1.5 的开源AI,把这件事第一次做到了。

01|这个 AI 在干什么
PART| 当你上班的时候
.想象一下这个场景:
一个AI模型在独自工作。没有人给它布置任务,没有人告诉它今天该学什么。
它先问自己:"我现在哪里最弱?"
然后它自己生成一道刚好卡在自己能力边界上的题目——不太难,不太简单,就是那种"做三次大概能成功一次"的难度。
接着,它自己设计一套测试规则来评分。
最后,它真的去解这道题,把解题过程喂给自己当训练数据。
这整个过程,循环往复。没有人工干预,没有人工标注,没有人给它说"这道题你做对了"——它自己判断。
这就是 Ornith-1.5 正在做的事情,他们把它叫做"自我改进循环"(self-improvement loop)。

02|这个 AI 让人背脊发凉
PART| 打败Claude
先说一个具体的数字:
Ornith-1.5 最大的版本(397B参数),在一个衡量"AI能不能真正帮程序员写代码、调bug、完成真实工程任务"的测试上(SWE-bench Verified),得分 86分。
Claude Opus 4.8,是 Anthropic 目前最强的闭源商业模型,得分是 85.8分。
这意味着什么?意味着一个完全开源、可以自己下载运行的模型,在真实编程能力上,已经追平了当今世界最贵、最强的商业AI之一。
而且这还只是开始。

03|这个 AI 给自己出题
PART| 可自我进化的 AI
这里有个很反直觉的地方。
很多人以为让AI变强,就是喂给它更多数据。但数据终有穷尽——互联网上有价值的代码、论文、解题过程,早就被各大模型训练过一遍了。
Ornith团队想到的突破口是:不依赖外部数据,而是让模型自己制造训练数据。
但这里有一个隐患:模型如果随便出题,可能会专门出自己会做的简单题(那没意义),也可能出根本无法解答的怪题(也没意义)。
所以他们设计了一套精妙的"奖励机制"来管住这件事——
出的题必须有效可验证(能判断对错)、必须难度刚好在能力边缘(大约五次里成功一次),还必须足够新颖(不能反复出同一类题)。三个条件同时满足,才给高分。
这像不像你当年最好的老师的出题逻辑?

还有一件更离谱的事
Ornith-1.5 还有个 9B 的小版本(约 1.5GB)。
9B是什么概念?大概是目前旗舰版模型参数量的 1/44。手机能跑的那种。
就是这个"手机版",在编程能力测试上的得分,超过了 Google 的 Gemma 4-31B——一个参数量比它大三倍以上的模型。
04|AI 开源追上闭源模型
PART| 可自我进化的 AI
也许你不是AI研究员,也不会去自己下载运行这些模型。但这件事的意义,远不止在技术圈内。
第一层影响:你用的编程工具会更强。
Cursor、GitHub Copilot、各种代码补全工具,背后的模型会越来越多地用上类似这种自我进化的技术。你未来写代码、做数据分析,这些工具会更懂你。
第二层影响:开源正在追上闭源。
过去两年,ChatGPT、Claude、Gemini这些闭源模型遥遥领先,开源模型只能追着跑。但 Ornith-1.5 这类工作在说:这个差距正在快速收窄,而且拐点也许已经到来。
第三层影响:AI进化的逻辑变了。
以前AI变强靠的是:更多数据 + 更大算力 + 更多标注人员。Ornith-1.5 证明了一条新路:自己出题、自己刷题、自己变强。这条路不需要无限的人工投入,只要运行就行。
你有没有那种感觉——某个东西突然开始会自己学习了?

05|AI总结
PART| 开源还是闭源?
Ornith-1.5 是完全开源的,代码和权重都可以下载。
在AI领域,"开源追平闭源"本身就是一件会被反复载入史册的大事。
但更让人细思极恐的,是这件事背后的逻辑转变:
以前,AI越强,需要的人工越多。
而 Ornith-1.5 在说:也许从现在开始,AI越强,它自己就能学得越快,需要的人工反而越少。
这个循环,一旦开始,很难停下来。

06|开源模型,技术附录
PART| 技术核心要点
三阶段训练循环,缺一不可
Ornith-1.5 的自我改进循环由三个阶段串联组成,每一轮迭代都同时训练这三件事:
第一阶段:Task Proposer(任务生成器)
给定一个代码库或运行环境,模型查阅自己过去的任务解决记录,然后提出一批"新任务"。这批任务要求比已经解决过的稍难一点,专门针对当前的能力盲区。
第二阶段:Harness Generator(评测脚手架生成器)
对每道新任务,模型自动生成一套"裁判规则"——包括任务说明、可调用的工具列表、评分逻辑。这个 harness 本身也被打分,标准是:规则清晰、打分忠实、难以被"钻空子"。
第三阶段:Solution Rollout(解题执行)
模型真正去解这道题,执行过程中产生的轨迹(rollout)被用来计算强化学习的奖励。好的轨迹反向更新三个阶段的参数——任务怎么出、规则怎么写、解题怎么做,三者一起优化。
整个过程用的是 GRPO(Group Relative Policy Optimization),这是 DeepSeek-R1 带火的强化学习算法,比传统 PPO 显著降低显存需求,更适合大规模训练。

任务奖励函数的设计细节
任务奖励 R_task 是三项的乘积:
..json
{
R_task = V(q, s) × D(q, s, {τ}) × N(q)
}
V:有效性。脚手架能否正常运行?正确答案是否通过?明显错误答案是否被拦截?任何一条为零,整个任务奖励归零。这是一个硬门槛,防止"无效题"混入训练。
D:前沿难度。对同一道题采样 N 条解题轨迹,统计成功率 p。目标成功率 p* 设为 0.2(即五次里成功一次),用高斯函数度量偏差:
..json
{
D = exp(-(p - p*)² / 2σ²)
}
随着模型变强,同一道题的 p 上升,D 值自然下降,推动生成器去出更难的题——这就是"课程自动进化"的核心机制。
N:新颖度。与历史任务缓冲区里所有任务计算相似度,取最高值后用 1 减去,确保不重复刷同类题。新颖度的权重刻意低于前两项,避免模型追求"奇怪"而忽略"有用"。

评测脚手架的防作弊设计,这是整个框架最容易被忽视、但至关重要的一环。
如果裁判规则本身可以被"钻空子",模型就会学会走捷径而不是真正解题——AI领域把这个问题叫做 reward hacking(奖励函数被破解)。
Ornith 的评测设计做了几件具体的事来防止这种情况:
-
SWE-bench 类任务中,本地仓库的 Git 历史被完整删除,防止模型通过查历史 commit 或 diff 来直接找到答案
- 禁用网络访问
,防止模型联网搜索解决方案
-
NL2Repo 任务中,封锁指定 GitHub 仓库和 pip 包的访问,防止直接复制已有实现
这些"反作弊"设计,让评分数字的含金量大幅提升。
07|三个版本模型参数对比
PART| 不同版本定位差异
规模版本的定位差异
Ornith-1.5-397B(MoE,激活参数约 ~50B)
旗舰版,对标 Claude Opus 4.8。Terminal-Bench 2.1 得 86.1(Claude 是 85.0),SWE-bench Verified 得 86(Claude 是 85.8)。在 WideSearch(深度网页搜索推理)和 BrowseComp(多步网页检索)上反超 Claude,说明长上下文的 agentic 推理能力尤为突出。
Ornith-1.5-35B(MoE,激活参数仅 3B/token)
每次推理只激活 3B 参数,但整体表现大幅超过 Gemma 4-31B 和 Meta Muse Glimmer-30B 这类密集型模型。Terminal-Bench 2.1 得 68.5 vs 43.4(Gemma),SWE-bench Verified 得 79 vs 52(Gemma)。这说明 MoE 架构在推理成本和能力之间的权衡,已经进入一个质变区间。
Ornith-1.5-9B(Dense,附带量化手机版)
最值得关注的可能是这个。9B 参数的密集模型,SWE-bench Verified 得 70.6,比 Gemma 4-31B(52)和 Qwen 3.5-9B(53.2)都高出一大截。量化版可以直接跑在 iPhone 和 Android 设备上,意味着本地化的代码 Agent 在端侧真正成为可能。

08|模型基座的选择
PART| 模型基座
Ornith-1.5 在 Ornith-1.0 基础上扩展,后者以 Qwen 3.5 和 Gemma 4 为基础,经过继续预训练(CPT)、中期训练(mid-training)和后训练(post-training)三阶段处理。Ornith-1.5 则在此之上,用上文描述的自我改进循环做了进一步的强化学习迭代。
这意味着 Ornith 并不是从零训练一个基座,而是在成熟开源基座上做"能力上限的突破"——路线选择本身就说明了团队对"数据墙"的判断:预训练数据的边际收益已经在递减,强化学习阶段的自我改进才是下一步增益的主战场。
更多transformer,VIT,swin tranformer
参考头条号:人工智能研究所
v号:人工智能研究Suo, 启示AI科技
动画详解transformer 在线视频教程


更多推荐




所有评论(0)