个人科研AGI,需要一套Agent 调度系统:BoundedFreedom
越来越多人开始搭建自己的个人AGI。真正进入科研任务后,问题往往不只是模型够不够强,而是模型能力有没有被用在合适的位置。
如果只用一个最强模型包办检索、整理、阅读论文、修改代码和判断结论,所有工作都会挤进同一段上下文:Token消耗增加,任务边界、证据来源和责任关系反而容易变得模糊。
BoundedFreedom 从这个问题出发,尝试为个人科研 AGI 提供一套约束优先、成本感知的 Research Harness。它不是继续给科研 Agent 塞入更多工具,而是在模型之外增加一层调度、边界、验证和恢复机制。
项目地址:https://github.com/Nat-Sci/bounded-freedom

一个Chief,不是一群常驻Agent
一项任务会沿着下面的路径推进:
请求
↓
Chief:保持目标、划定边界、拆分工作、接受证据、作出最终判断
↓
General 通用路线 / 一个按需加载的研究Skill
↓
Scout / Coder / Builder / Reviewer 执行角色
↓
为当前工作单元选择模型与推理强度
↓
按 S0–S4 后果等级设置验证、独立审查和人工接受
这里最重要的不是多设几个Agent,而是把四个容易混在一起的决定分开:
| 决定 | 回答的问题 |
|---|---|
| 任务方法 | 这项工作走 General,还是需要加载一个专业 Skill? |
| 执行角色 | 谁拥有这一小段工作,可以读什么、改什么,是否需要独立判断? |
| 模型能力 | 当前工作单元需要多长上下文、多强编码和多高推理能力? |
| 验证强度 | 如果做错,后果有多大,需要什么证据、独立审查或人工接受? |
因此,Scout、Coder、Builder 和 Reviewer不是模型智力等级。它们定义的是范围、权限、所有权和独立性;模型及推理强度根据当前工作单元单独选择。S0–S4 也不是模型档位,它只控制验证强度。
General与五个研究Skills
普通的仓库检查、窄范围修改和文档整理走 General 路线。只有任务确实需要专业研究方法时,Chief 才加载对应 Skill。一个工作单元只保持一个方法 Skill 在场,完成或冻结交接后再进入下一项。
| Skill | 主要能力 | 关键边界 |
|---|---|---|
evidence-review | 检索、种子论文、引用追踪、筛选、精读、证据表和矛盾证据 | 检索结果不等于完整文献宇宙;搜索扩展必须留记录 |
hypothesis-study-design | 从证据和初步观察形成竞争性假设、可证伪预测、混杂因素和区分性实验 | 不把一个连贯故事当成唯一假设;伦理和不可逆决定由人负责 |
paper-code-reproduction | 连接论文 claim、代码来源、配置、运行记录和复现证据 | 代码能运行,不等于实现了方法;实现方法,也不等于复现了结论 |
scientific-figure | 先冻结 figure contract,再进行 panel 路由、可编辑构建、修改追踪和图组 QA | 标签、图标、图例和线路必须一一绑定;视觉漂亮不等于科学正确 |
research-software-lifecycle | 用持续基线、能力增量、骨架迁移和可选工具,让分析逐步成长为科研软件 | 不把每个脚本都过度工程化,也不默认强制容器、HPC 或公开发布 |
这些 Skills 不是五套互不相干的工具箱。它们通过一条轻量研究脉络衔接:
来源 → 证据 → 主张 → 空白 → 假设 → 研究设计 → 发现
↓
代码 → 科学图 → 软件增量
Chief只把下一步需要的那一小段证据和标识交给后续 Skill,不把整个项目知识库重复塞回上下文。
成本效率来自哪里
BoundedFreedom不承诺一个未经测量的固定节省比例。当前策略是一组可以检查的执行规则:
- 清楚、短小的工作默认由 Chief 直接完成;只有交接确实有价值时才创建一个有边界的执行者;
- Chief 常驻的是Skill目录,而不是所有Skill正文;专业方法按需加载;
- 每个工作单元使用足够完成任务的模型和推理强度;
- 只有歧义、失败、证据冲突或后果证明有必要时才升级;
- S3/S4才要求新的独立Reviewer,S4还需要人类明确接受;
- 子任务返回结论、证据位置和未解决问题,不把整段原始日志重新灌回主上下文。
它的目标不是让低成本模型处理一切,而是把强模型留给真正需要判断的决策压缩点。Token、延迟和质量上的收益仍需通过同类真实任务的重复基准测量,而不是靠宣传数字证明。
画图为什么也需要“绑定合同”
科学图中的错误不只来自数值。一个标签贴错图标、一条线路连错模块、一个图例对应错颜色,都可能改变读者对方法和结论的理解。
因此 scientific-figure 将空间位置与语义关系分开管理:每个标签、图标、图例和线路都有稳定ID;默认一个标签只对应一个目标;线路声明起点、终点和数量。机器检查结构,视觉检查最终渲染是否清楚,科学检查这些关系是否真实。图片模型可以提供视觉草稿,但不能决定科学含义。
它借鉴了哪些工作
BoundedFreedom 并非从零开始。当前主要参考按作用分为六类:
| 方向 | 代表项目 | 在 BoundedFreedom 中的定位 |
|---|---|---|
| Harness 与 Agent 控制 | Agent Skills、DeepSeek Harness、SciAgent、open-coscientist | 学习渐进加载、执行边界和系统结构;不采用常驻大团队作为默认路径 |
| 文献与证据 | scientific-research-skills、systematic literature review Skill、citationchaser、PaperQA2、ASReview、SciAtlas | 吸收分级阅读、搜索记录、引用追踪和筛选方法;外部工具保持可选 |
| 假设与研究设计 | ResearchAgent、HypoGeniC/HypoRefine、CKM-HypoGen、BioSkills | 强调竞争性假设、修正和验证,不接受单一“好故事” |
| 论文与代码复现 | research-paper-code-study、Paper2Code、DeepCode、Veritas、PaperBench、ScienceAgentBench | 区分理解映射、代码构建、claim-level 复现和评测基准 |
| 科学制图 | Scientific Figure Design、SciPlot、PaperVizAgent、AutoFigure-Edit、FigRecipe、PlotNeuralNet、NN-SVG | 吸收 claim-first、可编辑矢量、重建与图组管理;生成内容必须验证 |
| 科研软件生命周期 | rrtools、Copier、Cruft、The Turing Way、pyOpenSci、Kedro、Snakemake、DVC、DataLad、FAIR4RS | 将软件视为持续生长的研究容器;工具只在真实需要出现时接入 |
完整来源以及每项工作的“已采用、暂缓、明确排除”记录,见 Ecosystem, influences, and credits。这里的参考表示吸收方法、接口或评测思路,不代表复制代码、默认安装、自动信任或上游作者背书。
是否只能用于Codex
不是。Codex是当前参考实现,因为它支持项目指令、Skills、子任务、工具调用和验证闭环。
方法层保持为Markdown和开放Skill字段;模型ID、Agent文件格式、权限、hooks和工具名称放在薄适配层。因此同一套边界原则可以迁移到Claude Code、Gemini CLI、DeepSeek Harness等兼容环境,但各平台的安装方式、子 Agent 能力和工具支持并不完全相同。
当前边界
BoundedFreedom仍是V0.x的工作合同和参考实现,不是已经覆盖所有科研环节的“自动科学家平台”:
- 五个Skills先覆盖当前反复出现、且方法边界相对稳定的任务;
- 数据库、绘图库、复现运行时和软件脚手架仍缺少经过真实项目验证的适配器;
- 科学写作和claim-to-evidence写作链还没有独立本地Skill;
- Token、延迟、质量和复现收益尚未形成公开的重复任务基准。
这也是项目选择“小而有边界”的原因:先把真实任务跑通、留下证据,再决定是否增加能力。
如果你也在搭建个人科研Agent,或者希望让大模型成为长期、可靠、可审查的科研协作者,欢迎试用、提出问题或补充真实场景。
GitHub:https://github.com/Nat-Sci/bounded-freedom
如果它真的帮你少走弯路、少浪费一些Token,也欢迎点一颗Star🌟。
更多推荐


所有评论(0)