「想法也有基因组」:14 个 AI 科学家做学术亲子鉴定,最高分只有 27.3%

摘要:上交等机构提出 IdeaGene 框架与 IG-Bench,把论文拆成可审计的「想法基因」,用 GenomeDiff 追踪它们的继承、突变与丢失。实测 14 个 AI 科学家:谱系推理全对率最高只有 27.3%——idea 写得很像样,血脉却常常接不上。

一、AI 已经会写 idea 了,可它认得出「祖先」吗?

先摆一个事实:今天的自动科研系统——AI Scientist、AI-Researcher、Agent Laboratory 这一类——已经能自己查文献、提假设、跑实验,最后吐出一份像模像样的论文稿。

问题也随之而来:我们凭什么说它做的是「科研」,而不是「像科研的文本」?

现有的评测基本都在问这几件事:检索得准不准、事实错没错、文笔顺不顺、够不够新颖、流程跑没跑通、两篇里人类更喜欢哪一篇。可有一个更硬的问题,几乎没人真正测过——

当一个 idea 声称自己「在延续某个研究方向」时,它到底有没有继承对的机制、修对的缺陷,和它声称要接续的那条线保持连贯?

7 月上旬,上海交通大学 VisionXLab 联合卡内基梅隆大学、上海人工智能实验室、中国科学院大学、中国科学技术大学、华东师范大学、微软等机构挂出一篇论文,题目相当直白:Ideas Have Genomes(想法也有基因组)。开篇引的是达尔文那句「Descent with modification」——继承,并伴随修改。

这篇论文的出发点,是一个很容易被忽略的判断:科研上的进步,和话题上的相近,根本不是一回事。

举两个 CV 人都熟的例子。

YOLO → YOLOv2,是典型的「局部突变」:单阶段检测这个核心机制原封不动留着,锚框、批归一化、多尺度训练把已知短板一个个补上,血缘清清楚楚。

DETR 也做目标检测,但它把 Faster R-CNN 那一整套区域提议流水线换成了 Transformer 的集合预测。它和 Faster R-CNN 共享的是生态位(同一个任务、同一批 benchmark),而不是驱动机制

麻烦就在这儿:标题、摘要、引用边、句向量……这些东西看上面两种关系,长得几乎一模一样。于是模型很容易出现两类翻车——相关论文全检索对了,却认错了亲本机制;生成的 idea 听起来很新,却一条连贯的机制线都没继承下来。

作者把这件缺失的能力起名叫科研谱系能力(scientific lineage competence):能把一篇论文抽象成可继承的想法单元,能追踪这些单元在后续工作里被留下、被改动还是被丢掉,能说清一次演进的主驱动是什么,能拒绝那些「只是话题相关」的伪谱系,最后还能生成一个可以被插进现有谱系、当得起「后代」二字的新 idea。

顺着这条线,论文交出了三块东西:一个把「继承」讲到可审计粒度的框架 IdeaGene,一个能测这件事的基准 IG-Bench(含 IG-Exam 与 IG-Arena 两半),以及一组挺扎心的实测结论。

[图 1:从「论文中心」视角到「基因组中心」视角,只有把想法基因抽出来对齐,继承关系才变得可评估]


二、这个坑,为什么以前的评测填不上?

不是没人研究过相关的东西,而是大家都停在了「论文」这个粒度上。

科学检索与问答这一支,像 LitSearch、SciRepEval,以及各种句向量、文档向量、多文档科学摘要,测的是「你能不能找到 / 表示相关论文」;SciEval 这类科学问答与工作流评测,测的是事实和解题。IG-Bench 想问的是下一步:相关论文都摆在你面前之后,你能不能说清到底哪些想法结构被真正传下去了?

自动科研与创意生成这一支,从 AI Scientist、AI-Researcher、Agent Laboratory、CoI-Agent、SciAgents,到面向新颖性的 SciMON、Nova,热闹得很。但恰恰是它们让谱系评测变得更紧迫:一个 proposal 可以流畅、可以引经据典、可以看上去很懂文献,却依然没继承亲本机制,也没修它自己声称要修的那个缺陷。

科学学与引用结构这一支(科学的科学、库恩的范式革命、引用意图分类,以及最近的方法演化图谱 Intern-Atlas),确实在画科学的演化地图,但它们的最小单位仍是论文、句子或引用边,而不是「想法基因的对齐」。IG-Bench 的做法是把引用和时间降级成候选证据,把「基因组对齐」本身升级成被评测的对象。

大模型评测方法学这一支(LLM-as-judge、Chatbot Arena、位置偏好与长度偏好的纠偏、HELM、SWE-bench、GAIA、τ-bench)提供的是打分工具,但没人告诉裁判该看什么。IG-Bench 的 Arena 部分正是在这套方法学上再加一层:让裁判在「谱系包」和「邻近种群」的条件下打分,而不是孤零零地看一段文本好不好看。

一句话概括这个空位:论文级的相关性太粗,纯偏好的对战太松,中间那一层——可审计的继承结构——一直是空的。

表 1:IG-Bench 与相邻评测范式的定位对比(是否有基因组?是否有 Diff?能否理解?能否生成?)


三、核心方法:先给论文「测序」,再做「亲子鉴定」

IdeaGene 的野心其实很克制。作者反复强调,他们不是要给科学建一套生物学本体论,而是要造一个够小、够硬、能审计的操作层。它只有三块积木。

3.1 第一块:Idea Genome,论文的最小可继承零件

一篇论文(或一个 proposal)被表示成一组 Idea Genome 对象:

G(p)={ gi=(ti,  zi,  ei,  ci) }i=1mp G(p) = \{\, g_i = (t_i,\; z_i,\; e_i,\; c_i) \,\}_{i=1}^{m_p} G(p)={gi=(ti,zi,ei,ci)}i=1mp

其中 tit_iti 是角色类型,ziz_izi 是内容描述,eie_iei 是证据指针(指向原文的某一段、某句话、某个图表或公式),cic_ici 是可选约束。

角色类型只有六种,而且每一种都在谱系推理里承担明确职能:**生态位(niche)**是问题环境,**机制(mechanism)**是可被继承的方法或设计,**观察(observation)**是驱动动机的经验现象,**局限(limitation)**是缺陷与瓶颈,delta 是相对前作的修补与改动,**主张(claim)**是宣称的结果。

抽取这些基因的算子 E:p↦G(p)\mathcal{E}: p \mapsto G(p)E:pG(p),被作者刻意做得比「摘要」窄得多,必须同时满足四条约束:有类型(不能退化成一段无结构的总结)、有证据(可以轻度抽象,但不许掺入原文没有的背景知识和标注者脑补)、最小自足(小到能被单独继承、变异、丢失或重组,又大到能表达一个完整的功能想法)、谱系相关(如果继承、丢失、改动或引入它并不会改变「后代是否连贯」这个判断,那它就只是元数据,不配当基因)。

一句话:Idea Genome 不是论文的缩写,是论文的零件清单。

3.2 第二块:GenomeDiff,一次「亲子鉴定」到底在比什么

给定前作 psp_sps 和后作 ptp_tpt,GenomeDiff Δs→t\Delta_{s \to t}Δst 把两边的基因按类型和语义角色对齐:前作的基因被标成继承(INHERITED)、突变(MUTATED)或丢失(LOST);后作里没对上的,则被标成新增(NOVEL)或外部引入(EXTERNAL)。除此之外,每条记录还要写清这次演进的主驱动、它与周边任务生态的关系,以及一段有证据支撑的理由。

最关键的判据只有一条:驱动机制有没有被继承。

作者专门把「谱系」和「同处一地」分开讲:共享的任务、benchmark、数据集惯例和社群,只构成生态背景(EcologyContext),它能解释两篇论文为什么待在同一个研究环境里,但它本身证明不了血缘。只有基因层面的连续性才撑得起一句「这是它的后代」。共享环境却没有驱动继承,那叫生态位竞争;驱动机制原样带进新环境,那叫适应辐射。

3.3 第三块:六种演化动力学,把「像不像」变成「是不是」

有了对齐结果,两篇论文之间的关系就能被归成六类。前四类算谱系,后两类不算:

动力学 算谱系吗 GenomeDiff 判据 教科书例子
突变 Mutation 驱动机制被继承或局部改动,生态位不变或相邻 YOLO → YOLOv2
适应辐射 Adaptive Radiation 驱动机制保留,但搬进了新任务 / 新领域 / 新评测生态 Transformer → ViT
杂交 Hybridization 后代从两条及以上不同谱系各引入了驱动基因 CLIP 视觉编码器 + 指令微调 LLM → LLaVA
物种形成 Speciation 生态位相同或相近,但前作的驱动机制被一套全新机制取代 Faster R-CNN → DETR
生态位竞争 Niche Competition 同一个生态位,但没有驱动继承 Faster R-CNN vs YOLO
隔离 Isolation 既不共享生态位,也没有驱动继承 BERT vs YOLO

遇到模棱两可的情况,还有一条固定的优先级:杂交优先于物种形成;有谱系证据时物种形成优先于生态位竞争;当「换生态位」才是主驱动时,适应辐射优先于突变。 作者也老实交代,这六类是为了标注和评测一致性而设的操作性类别,不是一套穷尽科学发展的理论。

3.4 IG-Bench:1961 条黄金谱系撑起来的考场

框架落到数据上,就是 IG-Bench:1,961 条黄金谱系轨迹、1,085 个精标 Idea Genome 对象、920 条成对 GenomeDiff 记录,横跨 10 个科学领域(从 NLP、CV、多模态,一路到生物、化学、物理、材料、医学、数学)。

构建流程走了四步:专家先提名各领域的里程碑与前沿论文当种子,再顺着引用、语义检索和领域策展把前后代扩成 3–7 篇的谱系轨迹,然后多轮 LLM 辅助抽取基因、做成对对齐并标注命运与驱动,最后再做一遍全局审计(schema 合法性、答案契约、时间一致性、匿名化泄漏、轨迹连贯性)。

质检这块花了真功夫:50 位来自计算机、生物、物理、材料等学科的硕博标注员,在构建、难度校准和 Arena 对战三个环节介入,分歧由第三人裁决;动力学标签在裁决前的标注者一致率是 84.7%

考场分两半。

IG-Exam(闭合式,考理解):42 种任务、1,029 道题,每道题形式化为

τ=(c,  x,  A,  y,  m) \tau = (c,\; x,\; \mathcal{A},\; y,\; m) τ=(c,x,A,y,m)

其中 ccc 是能力轴、xxx 是匿名化后的上下文、A\mathcal{A}A 是答案空间、yyy 是标准答案。评分是严格全对(exact match)——所有必填字段必须同时正确。作者的理由很硬气:一个答案如果认对了父论文却标错了驱动或基因命运,它在下游生成里根本不可靠。

四条能力轴层层加码:T1 基因抽象(读懂单个基因,5 类任务 125 题)、T2 继承追踪(跨多篇论文对齐基因,12 类 313 题)、T3 演化推理(判断动力学、驱动、基因命运、杂交来源,17 类 409 题)、T4 谱系验证(抓内鬼、找错步、补缺失链、查引用冲突,8 类 182 题)。

T2 里有道题很能说明难度:给你 8 条打乱的想法描述,要求切成两条谱系、每条 4 个并按时间排序。答案是一条 NAS-RL 线(强化学习搜索 → 权重共享 → 可微松弛 → 移动端硬件感知 NAS),一条 Inception 线(NIN → GoogLeNet → Inception-v3 → EfficientNet)。这题人做起来都得琢磨一会儿。

IG-Arena(开放式,考生成):让系统在三种信息设定下写 proposal——Question(只给领域和前沿问题,测的是脑子里存了什么)、Library(再给一堆无序的论文摘要,测论文级上下文的利用)、Lineage(给有序谱系 + Idea Genome + GenomeDiff 证据,测谱系结构的利用)。

打分用的是种群演化分(Population-Evolution Score, PES)。它不孤立地问「这个 idea 好不好」,而是问:把它放进指定的谱系 L\mathcal{L}L 和邻近种群 P\mathcal{P}P 里,它当得起一个连贯的后代吗? 三个维度直接对应达尔文的三个条件:

  • 遗传(Heredity):相对于谱系,它有没有继承并接着做对的亲本基因?机制保住了吗?「局限—delta」对得上吗?
  • 变异(Variation):相对于邻近种群,它有没有引入有意义的新东西?纯粹的花式重组要扣分。
  • 选择(Selection):在这个种群里,它有没有竞争力?可行吗?能不能带出下游方向?

三项各 0–100 分,由 3 个模型裁判(位置随机化)在谱系包条件下打,最后取算术平均:

PES(x∣L,P)=13(H(x∣L)+V(x∣P)+S(x∣L,P)) \mathrm{PES}(x \mid \mathcal{L}, \mathcal{P}) = \frac{1}{3}\Big( H(x \mid \mathcal{L}) + V(x \mid \mathcal{P}) + S(x \mid \mathcal{L}, \mathcal{P}) \Big) PES(xL,P)=31(H(xL)+V(xP)+S(xL,P))

两两对战的 ELO 只作为辅助的偏好诊断保留。裁判可靠性方面,模型裁判间的 Krippendorff’s α=0.74\alpha = 0.74α=0.74,人类裁判与模型裁判在成对排序上的一致率是 80%。

图 2:IG-Bench 的整体设计——论文先被转成审计过的基因组与 GenomeDiff 底座,再分别喂给 IG-Exam 与 IG-Arena


四、实测 14 个 AI 科学家:最高 27.3%,越靠近「验证」越崩

参赛的是 14 个「LLM 科学家」:8 个直连大模型、2 个基于 GPT-5.5 的研究智能体(AI Scientist v2、CoI-Agent),以及 4 个把 GPT-5.5 或 Claude Opus 4.7 包进 Codex / Claude Code 工作流的 CLI 脚手架。IG-Arena 侧覆盖 10 个领域的 30 个前沿任务,三种设定共产出 1,260 份 proposal。

4.1 谱系推理是「组合式」地难

先看最刺眼的数字:IG-Exam 全场最高只有 27.3%(GPT-5.5 + Claude Code),最强的直连大模型 GPT-5.5 是 23.1%,垫底的 MiniMax-M2.7 只有 11.9%。

更值得琢磨的是错法。模型很少是「完全不知道」,而是「局部对、整体配不齐」:认出了父论文,却把动力学标签标错;推对了驱动基因,却把它的命运(继承 / 突变 / 丢失)判错。严格全对的评分方式,正是为了把这种「拼不拢」的失败暴露出来。

按能力轴看,分数一路下滑:T1 基因抽象最高 34.4%,T2 继承追踪最高 37.9%,到 T3 演化推理只剩 25.3%,T4 谱系验证最高 17.4%。T1 只要求读懂一个基因,T4 却要求父本身份、基因兼容性、驱动一致性、证据有效性同时成立——而 T4 恰恰是最接近「生成」的那一轴:一个连谱系真伪都验证不了的系统,也别指望它能稳定地生成连贯后代。
在这里插入图片描述

表 4:IG-Bench 主榜单,IG-Exam 报告全对率,IG-Arena 报告 PES 与 ELO

4.2 工具脚手架帮的是「检索」,不是「一致性」

这是全文我最喜欢的一条发现。

CLI 脚手架的增益高度集中在 T2:Claude Code 把 GPT-5.5 的继承追踪从 25.7% 一路拉到 37.9%——毕竟反复调用工具去取、去比对不同论文的基因,正是它的强项。可这份增益到了 T3 就开始收窄,到了 T4 几乎消失,甚至倒退。

研究智能体那边更直白:AI Scientist v2 和 CoI-Agent 在各条轴上几乎和直连 GPT-5.5 重叠,检索重的工作流并不额外带来谱系推理能力;更微妙的是,它们在 IG-Arena 的 PES 反而低于直连模型,说明多步流水线甚至可能损伤生成的连贯性。

结论有点反直觉,但很清楚:脚手架放大的是「依赖检索」的那部分能力,组合式一致性检查基本原地不动。

图 4:五个同背骨系统的能力雷达图,以及「闭合式理解」与「生成时遗传分」的桥接关系

4.3 谱系上下文不是「普涨」,是「照妖镜」

从 Question 到 Lineage,PES 的涨幅在不同系统之间差得很远:GPT-5.5 在只给问题时就已经拿到 85.2 分,补上谱系只涨了 +2.3;而 Kimi-K2-Thinking 涨了 +6.9,全场中位涨幅是 +4.4

也就是说,结构化的谱系证据不是给所有人发福利,而是把队伍拆开:它区分出了「真的能用上 Idea Genome 结构的系统」和「只是多读了几段文本的系统」。

4.4 涨的全是 Heredity:不缺新,缺根

把 PES 拆开看,故事就更清楚了。

变异(82.7–84.7)和选择(79.7–82.2)几乎纹丝不动,所有的差距都由遗传贡献。

最典型的一格是「Question × 突变」:模型在没有任何谱系材料时凭参数化知识硬编,变异拿到 82.7 分,遗传只有 61.9 分,PES 被拖到 69.2——听起来很像一个改进,但它压根没有一个有效的亲本机制。而「Lineage × 杂交」这一格,遗传涨到 84.2,PES 83.6。

顺带一提,动力学标签本身不是质量分:只给问题时,模型会产出突变、适应辐射、杂交的大杂烩;一旦给了 Library 或 Lineage,超过 97% 的产出都集中到「杂交」上。同样叫杂交,锚在明确亲本基因上的杂交分很高,凭空拼接的杂交分很低。标签只说明「怎么动的」,PES 才回答「这一动站不站得住」。

一句话总结这一节:今天的系统生产「像样」的速度,远远快于生产「连贯」的速度。

[图 3:(a)三种信息设定下的 PES 轨迹;(b)按设定 × 动力学分解,遗传独自解释了 PES 的落差

4.5 PES 和 ELO 会分叉

两两对战的 ELO 与 PES 的相关性是 Spearman ρ=0.82\rho = 0.82ρ=0.82——高,但没高到可以互相替代。分叉最明显的时候,正是一份文笔漂亮但谱系不连贯的 proposal,赢了一份糙一点却根扎得更稳的 proposal。这也是作者坚持把 PES 而不是 ELO 当主指标的原因:偏好衡量的是表面吸引力,PES 衡量的是「能不能被插进种群」。

在附录的一场生物学对战里,裁判把票投给了 A,理由是它更干净地延续了前沿谱系——保留了以结构为先的生成式设计,再叠加实验闭环与因果成分去直击「计算亲和力高、细胞里却不管用」这个已知缺口;而 B 虽然野心更大,却押注在迁移性存疑的体内代理模型上。这几乎就是 Heredity 与 Variation 之争的一个具体切片。

图 5:领域级 PES 热力图——强系统跨领域相对均匀,弱系统在特定领域出现塌陷


写在最后

这篇论文说的是:判断一个 AI 生成的 idea,不该只问「新不新、顺不顺」,而该问「它是谁的后代」——把论文拆成可审计的想法基因,看它究竟继承了什么、改了什么、又丢了什么。而实测结果是,今天最强的 AI 科学家们,「写得像模像样」的能力,远远跑在了「血脉连贯」的能力前面。

IG-Bench 真正戳中的,可能不是模型的能力上限,而是我们评价科研的方式本身。

我们习惯了用「新颖性」给创意打分,可科学史从来不是靠新颖性往前走的——它靠的是「继承并伴随修改」。一个改动之所以成立,是因为它修的是一个真实存在的局限,而它修的方式,又恰好长在前人机制的枝干上。

按这个标准看,今天的自动科研系统更像一台很会说话的重组机器:它能把两条谱系的名词缝在一起,缝得漂亮、缝得像论文,却说不清自己继承的到底是哪一条机制、修的又是哪一个缺陷。作者给出的方向也因此很具体——auto-research 系统真正缺的不是更强的检索,而是组合式的验证模块。

那么你觉得,AI 现在写的 idea,最缺的是「新」,还是「根」?欢迎在评论区聊聊。


参考内容

  • 论文:Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation,Yifan Zhou、Qihao Yang、Yan Li、Donggang Li 等,上海交通大学 VisionXLab / RETHINKLAB 等,2026 年 7 月(arXiv: 2607.08758)
  • 项目主页:https://visionxlab.github.io/IdeasHaveGenomes/
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐