2026-07-20 AI 新闻汇总
1. Hugging Face 遭全自主 AI Agent 入侵,AI 攻防进入"无人化"时代
7 月 16 日,全球最大 AI 开源平台 Hugging Face 发布安全事件披露:部分生产基础设施遭入侵,全程由一套自主 AI Agent 系统驱动,无人类直接操作,仅一个周末留下超过 17,000 条操作日志。
攻击的起点是一个恶意数据集,通过串起数据处理链路上的两个代码执行路径(远程代码数据集加载器 + 数据集配置模板注入)获得初始执行,随后提权至节点级、收割云和集群凭证、横向移动进多个内部集群。攻击采用短生命周期沙箱集群架构,C2 信道自主迁移并寄生在公共服务上。背后的 LLM 模型至今未知。
Hugging Face 的防御端同样采用了 AI:异常检测流水线使用 LLM 对安全遥测做分诊,发现了异常信号;复盘阶段派出 LLM 分析智能体在数小时内消化了全部 17,000 多条攻击事件,还原时间线、提取失陷指标。但讽刺的是,当安全团队试图用商业 API 模型分析攻击日志时,因日志包含真实攻击载荷和 C2 产物,被服务商的安全护栏拦截,最终只能换用自托管开源模型(GLM 5.2)完成取证——Hugging Face 将之称为"不对称问题"。
值得关注的原因: 相比于 2025 年 11 月 Anthropic 披露的 80%-90% AI 辅助攻击案例,此次事件是人类首次面对完全由 AI 自主执行的端到端入侵,标志着 AI 攻防从"辅助工具"阶段进入"自主交战"阶段。对于 AI 编程领域,Hugging Face 是 from_pretrained 和数据集的主要来源,每个开发者都是潜在受影响方。该事件同时暴露了一个关键矛盾:安全护栏在阻止攻击者之前,可能先阻止了防御者。
来源: Hugging Face 官方披露 | 36氪/新智元 | 2026-07-16 ~ 07-20
2. Claude Fable 产生 Jacobian 猜想反例,85 年悬案在世界杯决赛期间"推文宣判"
7 月 19 日,Anthropic 数学家 Levent Alpöge(普林斯顿数学博士,导师为菲尔兹奖得主 Manjul Bhargava)在 X 平台发推称,与 Claude Fable 合作找到了 Jacobian 猜想(1939 年提出,与 Dixmier 猜想和 Poisson 猜想等价)的反例。Jacobian 猜想断言:复多项式映射若 Jacobian 行列式为非零常数则必可逆——该猜想经历了 Keller、Abhyankar、Moh 等数学家的数百次验证和至少 5 篇错误证明,Wikipedia 至今仍标注为"open"。
反例为 C 3 \mathbb{C}^3 C3 上的 7 次多项式映射:
( ( 1 + x y ) 3 z + y 2 ( 1 + x y ) ( 4 + 3 x y ) , y + 3 x ( 1 + x y ) 2 z + 3 x y 2 ( 4 + 3 x y ) , 2 x − 3 x 2 y − x 3 z ) ( (1+xy)^3z + y^2(1+xy)(4+3xy),\quad y + 3x(1+xy)^2z + 3xy^2(4+3xy),\quad 2x - 3x^2y - x^3z ) ((1+xy)3z+y2(1+xy)(4+3xy),y+3x(1+xy)2z+3xy2(4+3xy),2x−3x2y−x3z)
其 Jacobian 行列式为常数 − 2 -2 −2,但将三个不同输入映射到同一输出点 ( − 1 4 , 0 , 0 ) (-\frac{1}{4}, 0, 0) (−41,0,0),因此不可逆。反例已通过 Lean 形式化验证(github.com/deancureton/jacobian),验证代码仅约 8 行 Sage。发布方式(推文而非 arXiv)引发争议,但共识倾向于反例简单到可手动验证。
AI 社区反应热烈:当用该反例测试其他模型时,Claude 以 7 种不同方法反复验证、ChatGPT 检查 4 遍后自建符号检查器手工验证、VibeThinker 3B 反复试图说服自己反例不成立。10 年前曾有人暴力搜索 16 变量 10 次多项式未果,一篇 2022 年论文将可能反例的下界估计为 108 次——7 次反例的出现让这些估计显得过于保守。
值得关注的原因: 这是继 GPT-5.6 Sol 攻克凸优化下界(7 月 17 日)和 Cycle Double Cover Conjecture(7 月 9 日)后,两周内第三个被 AI 参与解决的长期数学难题,且涉及了不同的模型(Anthropic Claude Fable),表明该能力并非单一实验室的偶然突破。同时引发了对 AI 在数学研究中"贡献归属"的深层讨论。
来源: Hacker News (388 分 / 228 评论) | Levent Alpöge X 推文 | Lean 形式化验证 | 2026-07-19
3. GPT-5.6 以 $25 成本发现 $50 万级别 WordPress 预认证 RCE,10 小时内完成完整利用链
7 月 20 日,Searchlight Cyber 安全研究团队发布技术博文,详细记录了仅使用 GPT-5.6 Sol Ultra、花费约 $25 计算资源,在 10 小时内发现影响超过 5 亿个 WordPress 实例的预认证远程代码执行(Pre-Auth RCE)漏洞的完整过程。
利用链分为五个阶段:首先通过 WordPress Batch API 的数组索引不同步 bug(Desync Bug)实现预认证 SQL 注入——当请求为 WP_Error 时 $validation 数组更新但 $matches 数组不同步,导致后续验证与处理错位;然后利用对 author__not_in 参数标量路径缺少过滤的 sink 点执行注入;通过递归调用 Batch API 绕过 GET 方法限制;再通过缓存投毒(UNION 注入伪造 WP_Post 对象)配合 Embed 和 Changeset 机制实现权限提升;最终通过触发 parse_request 钩子重放请求,完成管理员账户创建和完整代码执行。
研究者借鉴了 OpenAI 证明 Cycle Double Cover Conjecture 的 prompt 策略:要求模型从第一性原理分析代码(删除 .git 目录以阻止历史比对)、主动使用多代理(4 个并行代理)、至少运行 6 小时、必须链式利用至生产环境 RCE。研究者评价称"没有人类安全研究员能在无 AI 辅助下于 10 小时内完成此利用链"。
值得关注的原因: $25 vs $500,000 的成本对比,揭示了大模型对安全研究经济学的颠覆性冲击——漏洞发现的成本壁垒正在快速瓦解。同时,该案例的 prompt 工程方法(删除 .git、多代理并行、第一性原理分析)为 AI 辅助代码审计提供了可复现的最佳实践模板。
来源: Searchlight Cyber | Hacker News (277 分 / 147 评论) | 2026-07-20
4. 中国开源大模型军备竞赛升级:Qwen 3.8 对垒 Kimi K3,K3 算力告急暂停新用户
7 月 19-20 日,中国 AI 大模型开源赛道出现连续重磅动作:
-
Kimi K3 算力触顶: Moonshot AI 在 Kimi K3 发布 48 小时后因需求远超承载能力,被迫暂停新用户订阅,并计划将会员拆分为通用版和编程版。社区反应异常温和——因 Moonshot 选择公开说明而非像 Google 那样静默限流。开发者实测显示 K3 在一次性编程基准排名第 19,但在 agentic coding(多轮工具迭代编程)中跃升至第 3,延续了中国模型"以工具迭代能力弥补单次推理不足"的模式。
-
Qwen 3.8 精准反击: 7 月 19 日,阿里官宣 Qwen 3.8 即将发布并开源,参数规模 2.4 万亿,称"可能是除 Fable 5 外最强大的模型"。Qwen 3.8-Max 预览版已上线阿里 Token Plan、Qoder 及 QoderWork 平台。HN 社区普遍将该发布时机解读为对 Kimi K3 的直接回应。阿里港股当日上涨 3.73%。
-
DeepSeek V4 灰度测试: 7 月 20 日多方消息显示 DeepSeek V4 正式版(GA)已开启灰度测试,开发者实测整体表现接近 Claude Opus 4.8、编码直追 GPT-5.6 Sol。最大变化是首次引入峰谷计费——V4 Pro 百万输出 token 平峰 $0.87、高峰 $1.74,"价格屠夫"首次装上计价器。
值得关注的原因: 中国开源大模型赛道从"单一事件驱动"转入"多头竞争常态"——短短一周内 Moonshot、阿里、DeepSeek 三家接连发布或更新旗舰模型,参数规模从 1.6T 到 2.8T 覆盖,定价策略从纯低价到峰谷计费分化。Kimi K3 暂停新用户的背后信号是:开源大模型的需求弹性远超供给弹性,算力基础设施将成为下一阶段竞争的关键瓶颈。
来源: ai0.news | 腾讯新闻 AI 早报 | 每日经济新闻 | 2026-07-19 ~ 07-20
5. Claude Code 底层引擎迁移至 Rust 版 Bun,10% 启动提速"几乎无人察觉"
7 月 19 日,Simon Willison 在其博客中验证了 Bun 作者 Jarred Sumner 的声明——Claude Code v2.1.181(6 月 17 日发布)及之后版本已使用 Rust 重写的 Bun 运行时。Willison 通过提取二进制字符串发现 Claude Code 嵌入了 Bun v1.4.0(macOS arm64),该版本号高于 GitHub 上公开的最新 stable 版 v1.3.14(5 月 12 日),确认了 Claude Code 在数百万设备上运行着尚未正式发布的 Rust 版 Bun。进一步的 strings | grep .rs 命令提取出 563 个 Rust 源文件路径,覆盖 runtime、bundler、dev server 等模块,证实了 Rust 重写已全面生产化。
Sumner 表示 Linux 上冷启动速度提升约 10%,“几乎没人注意到——无聊就是好”。在 HN 上(583 分 / 782 评论),讨论焦点包括:Anthropic 为何选择 Bun(性能和包管理上的优势)、Rust 重写对 AI 编程工具可靠性的价值、以及 AI 工具底层基础设施正在发生的"静默重构"趋势。
值得关注的原因: Claude Code 作为当前最活跃的 AI 编程工具之一,其底层引擎从 Zig 版 Bun 迁移到 Rust 版 Bun 的"无感知升级"本身就是一次基础设施质量的证明。该事件也反映了 AI 工具栈正在经历从上层模型到底层运行时的全链路优化——模型能力的提升掩盖了许多基础设施层面的显著进步,这些进步在独立场景下同样具有技术价值。
来源: Simon Willison 博客 | Hacker News (583 分 / 782 评论) | Bun 官方博客 | 2026-07-19
更多推荐

所有评论(0)