不用最贵的模型,也能打赢生物学 Agent 榜单|DCS Genpilot 评测全公开
过去一年,科研 Agent 的赛道被 Claude Code、Codex、biomni 等一众明星产品塞得满满当当。每当有人问:"你们凭什么做得比它们更好?"——我们决定不再用 PPT 回答这个问题,而是把 DCS Genpilot 拉上真实的生物医学基准,和这些顶级选手同台,一题一题地打。
结果是:在国产开源基座 deepseek-v4-pro-preview的加持下,DCS Genpilot 在多数生物医学任务上追平甚至反超了用 Claude Opus-4.8 的 claude-science,并把其他智能体平台远远甩在身后。
这一次,我们把所有数字摊在桌面上。
01先把"选手"和"规则"讲清楚
没有透明的评测设定,任何"世界最好"都是空话。本轮横评的选手与基座如下:

这里有一个关键信息值得反复强调:除了 claude-science 用的是 Anthropic 最强的闭源模型 Opus-4.8 外,包括 biomni、Genpilot 在内的其余产品,用的都是同一个国产开源基座 deepseek-v4-pro-preview。
也就是说,Genpilot 和 claude-science 之间的差距,不是"谁的大模型更强",而是"谁的 Agent 框架(Harness)更懂生物学"。 这正是我们最想验证的问题。
评测覆盖了三大类、六个维度的公开基准:
-
BixBench(共 205 题,FutureHouse + ScienceMachine)——真实生信数据分析能力
-
LABBench2(FutureHouse / Edison Scientific)——dbqa2 / litqa3 / 综合准确率
-
BioASQ Challenge(欧洲生物医学专家标注)——yes/no、factoid、list 三类文献问答
02核心能力总览:一图看懂 Genpilot 的位置
我们先挑出三个最有代表性的"总分型"指标——BixBench 准确率、LABBench2 综合准确率、bioASQ_factoid strict 准确率,把六个选手放在一起:

结论非常直观:
-
在BixBench上,Genpilot (0.693)在同为deepseek-v4-pro-preview 的四个产品中断层领先,仅次于用Opus-4.8的claude-science (0.790);(BixBench数据集总共有205题,部分智能体平台评测时只是用了50题并进行了题干修改。这里使用BixBench全部测试题)
-
在LABBench2 综合准确率 上,Genpilot 反而登顶,以 0.728 超过 claude-science 的 0.646
-
在bioASQ_factoid strict 上,Genpilot(0.947)全场第一,把 Opus-4.8 阵营也压在身下
一句话:在真实生物医学任务上,一个好的 Harness,真的能让国产开源模型追上、甚至反超顶级闭源模型。
03六大基准全维度雷达图:没有短板的选手
单看几个指标还不够,我们把 Genpilot、claude-science、OpenCode、biomni 放到六个维度的雷达图上,看谁"没有明显短板":

-
Genpilot(红色)的覆盖面几乎在每个方向都顶在最外圈,尤其在 LABBench2-dbqa2、bioASQ yes/no、bioASQ factoid 上形成明显优势
-
claude-science(蓝色)在 BixBench 单点更高,但在 LABBench2-dbqa2 这类"数据库问答"上明显收窄
科研 Agent 最怕的不是某一项特别弱,而是"东强西弱"——真实项目往往需要一路打通文献理解、数据分析、结果解释。Genpilot 的价值,正是这条"没有明显短板"的完整能力曲线。
04BixBench 单项:性价比才是杀手锏
BixBench 是最贴近"真实生信数据分析"的一项——它要求 Agent 真的去理解数据、选对方法、跑出结果。我们把 205 题的准确率单独拎出来排一次序:

-
claude-science(Opus-4.8)0.790,第一
-
DCS Genpilot(deepseek-v4-pro-preview)0.693,第二,且与第一名的差距远小于它与其他国产基座选手的差距;
-
其余同基座产品(OpenCode 0.337、Hermes 0.298、Workbuddy 0.195)明显落后
把"基座成本"这个维度叠加进来,故事就完整了:Genpilot 用的是价格只有 Opus 一小部分的国产开源模型,却把成绩顶到了 Opus 阵营的门口。对绝大多数科研团队来说,这意味着——你不必为"领域里最贵的大模型"买单,也能拿到接近 SOTA 的分析能力。
05完整数据,一张表交代清楚
我们不藏数字。以下是本轮横评的完整结果(加粗为该行最高值):

说明:claude-science 基座为Opus-4.8;其余产品(含 biomni、Genpilot)基座均为deepseek-v4-pro-preview。
在 11 个指标里,Genpilot 拿下了 6 个第一(含并列),是全场夺冠指标最多的选手——而它用的还不是最贵的那个基座。
06为什么是 Genpilot?——差距在 Harness,不在基座
把数据放在一起,一个反直觉但扎实的结论浮出水面:决定生物医学 Agent 上限的,往往不是"你用了多贵的大模型",而是"你的框架有多懂科研"。
同样是 deepseek-v4-pro-preview,Genpilot 与 OpenCode、Hermes、Workbuddy 在 BixBench 上拉开了 0.35 以上的差距;而面对用 Opus-4.8 的 claude-science,Genpilot 也能在一半以上的指标上打平甚至反超。这条差距曲线背后,是 Genpilot 在意图理解、任务编排、工具/流程调度、结果解释上的持续打磨——也就是我们一直在说的 Harness(智能体框架)。
这也带来一个对科研团队非常现实的好处:
-
更低的成本:用国产开源基座就能拿到接近顶级闭源模型的分析能力
-
更稳的能力:六大基准全维度不塌陷,真实项目不"偏科"
-
更强的可及性:不必为最贵的模型买单,也能做完从文献到分析的整条链路
结语
没有人会仅凭一句"我们最好"就选择你。所以这一次,我们把评测、基座、每一个数字都摆在明面上:
在同一条国产开源基座上,DCS Genpilot 用更好的 Harness,把生物医学 Agent 的能力天花板,抬到了顶级闭源模型的身边。
真正的科研生产力,不该只属于负担得起最贵模型的人。Genpilot 想做的,是让每一个研究者,都能用得起、也用得上一个真正会做科研的 AI 同事。
与此同时,Genpilot还能调度多端算力、贯穿科研全链条,真正实现“一站式”生命科学研究。
本文所有数据来自公开基准 BixBench / LABBench2 / BioASQ 的横向评测,原始结果见配套数据表。
更多推荐




所有评论(0)