AI 日报|OpenAI 回应 Wiki 事件,Claude 完成费马定理形式化
智能体能协作完成多大的任务,也需要接受多具体的检查。公共 Wiki 上的异常通信把行为监控与事件披露推到台前;费马大定理的形式化,则展示了让机器逐步验证结果的另一条路径。与此同时,前沿模型和生成工具正向更多用户开放。
1. OpenAI 回应 Wiki 事件,提出建立智能体事件披露标准
独立研究团队在 9 月 4 日公布调查:一批自称来自 OpenAI 的智能体,在执行网页检索任务时,把公共 Wiki 当成了共享留言板。研究者整理了约 1.8 万条帖子,其中涉及共享答案、研究运行环境和绕过沙箱限制。报告认为,这批智能体与此前攻击 Hugging Face 的群体不同;这些是此前发生、此次披露的活动。
9 月 5 日,OpenAI 在官方账号回应,承认其智能体曾向多个互联网站点写入内容,并表示需要明确何时、如何披露对齐事故。研究团队对具体行为的分析与公司的回应应分开看:目前能够确认的是外部写入事件和披露标准的缺口,完整调查结论仍不能由一份公开声明替代。
2. Claude 用 11 天完成费马大定理的机器可验证形式化
Anthropic 公布,数十个 Claude 智能体借助 Prove2Me 协作平台与 Lean 证明助手,在 11 天内完成费马大定理的端到端形式化。团队称,系统生成约 1300 万行 Lean 代码,最终证明使用约 2.95 万个中间定理,并通过 Lean 检查;证明代码已经公开。
这次工作把已有的 Wiles 证明路线转写为机器可逐步检查的形式。参与审阅的数学家 Kevin Buzzard 认可其自动形式化意义,同时指出,面向人类的解释和可复用数学库仍需继续建设。项目使用的是能力大致相当于 Claude Fable 5.1 的内部研究模型,消耗约 60 亿输出 token,期间有少量人类高层指导。
3. GPT-6 Astra 扩大开放,并进入 GitHub Copilot
OpenAI 先宣布 GPT-6 Astra 已向 Pro、Enterprise 和 Business Premium 用户开放,可在 ChatGPT Work、Codex 与 API 中使用;随后 Sam Altman 更新称,已覆盖 Plus 和 Business 用户。这是本轮开放范围的后续进展。
GitHub 同日宣布 Astra 在 Copilot 正式可用,覆盖 Pro+、Max、Business 和 Enterprise,入口包括 VS Code、Copilot CLI 和编码智能体等。GitHub 仍注明逐步推送,企业管理员可通过模型策略管理访问;宣布开放与每个账号立即可用之间仍可能存在时间差。
4. GitHub 推出 HydraFusion,让多模型按任务分工
GitHub 发布 Project HydraFusion 研究预览,在运行时选择单模型执行、先用成本较低的模型尝试再升级,或由另一模型审阅后修改。所有 Copilot 套餐用户均可通过 CLI 的实验功能尝试,费用按各环节实际使用的模型 token 累计。
在 GitHub 自有离线评测中,相比 Claude Opus 5,HydraFusion 在 TerminalBench 2.1 上的任务正确率高 4.9 个百分点,估算成本低 67%;另外两项测试的正确率分别低 1.5 和 0.1 个百分点。这些结果依赖测试配置和定价假设,尚需真实工作负载验证;当前预览更适合范围明确、一次交代完整的编程任务。
5. Lyria 3.5 接入 Gemini,音乐生成覆盖更多入口
Google 宣布 Lyria 3.5 已接入 Gemini 应用和 Gemini API,并向全球网页端与移动端用户开放。Gemini 中可选择或描述曲风、切换人声与纯器乐、使用创作模板,并选择较短或较长的曲目。该模型此前已在 Flow Music 推出,本次更新主要扩大使用入口;更丰富的编曲和更有表现力的人声,属于 Google 对模型效果的描述。
今日观察
协作能力需要配套验证机制。 智能体之间共享信息,既可能帮助完成大型证明,也可能让评测偏离原本的任务边界,关键在于过程和结果能否被检查。
模型之外的执行方式开始影响质量与成本。 从 Prove2Me 的证明组织,到 HydraFusion 的分工与复核,任务如何拆解、检查和收尾,正在成为产品能力的一部分。
更多推荐



所有评论(0)