Claude Fable 5惊现Kettle内部标识符:Anthropic模型签名泄露事件深度追踪
Claude Fable 5惊现Kettle内部标识符:Anthropic模型签名泄露事件深度追踪

2026年8月16日深夜,太平洋夏令时间23点29分45秒,X平台用户@chetaslua发布的一条技术帖,在AI开发者圈子里掀起了不小的波澜。这条帖子的核心发现直指Anthropic旗下最贵的公开模型——Claude Fable 5。研究者声称,通过对Claude返回的"思考块签名"进行逆向解析,他们在原本应该只显示claude-fable-5的响应中,发现了一个从未公开过的内部代号:claude-kettle-e2c95a10-v2-prod。
这不是什么官方公告,而是一份来自社区的技术泄露报告。四天过去了,这个发现仍然停留在"单一研究者声称"的阶段,既没有被独立复现,Anthropic方面也始终保持沉默。但这件事之所以值得每一个使用Claude API的开发者关注,不在于它"证明"了什么惊天阴谋,而在于它戳中了一个行业长期存在的灰色地带:当你调用某个模型ID时,你得到的真的是这个模型吗?
签名字段里藏着的"第六字段"
要理解这次泄露,得先搞清楚Claude的"思考块签名"到底是什么东西。按照Anthropic官方文档的说法,每个思考块(thinking block)都会附带一个服务器签名的加密副本,用途是在多轮对话和工具调用场景下验证思考块的真实性。文档还特别加了一句警告:"签名字段是不透明的,不要解释或解析它。"
然而@chetaslua偏偏就这么做了。根据他的描述,签名内部是一个protobuf结构,其中第六个字段存储了实际生成响应的模型标识符。从8月16日深夜开始,他对2582个抽样签名进行了检测,结果是2582个全部携带了同一个值——claude-kettle-e2c95a10-v2-prod。与此同时,另一个内部标签MYCRO_MODEL_MANATEE也出现在同一批元数据中。
"2582分之2582"这个数字的冲击力在于,它暗示这不是偶发的A/B测试片段,而是一次全面的标识符切换。但问题在于,这位研究者没有公开解码方法、没有放出原始签名、没有披露推断出的protobuf schema,甚至连完整的响应元数据都没有。公众能看到的,只有一张汇总图表。这让整个发现处于"看起来可信,但暂时无法验证"的悬置状态。

"Kettle"到底意味着什么?可能性不止一种
很多人看到这条消息的第一反应是:Anthropic偷偷把Fable 5换成了更强的模型?或者反过来,用更便宜的模型冒充Fable 5收费?这些猜测都很自然,但目前的证据距离证明其中任何一个结论,都还有很长的距离。
claude-kettle-e2c95a10-v2-prod这个字符串本身,至少可以对应四种完全不同的解释:
它可能是同一个Fable 5快照的内部服务部署名称。大型AI公司的生产环境里,一个公开模型ID背后往往对应着多个内部服务实例,每个实例有自己的版本标签和路由规则。Kettle完全有可能是某个特定集群或部署环境的代号。
它也可能是一个请求路由器组件的名称。你的请求先经过一层路由网关,网关决定把这个请求转发给哪个推理实例,而这个网关本身在签名中留下了痕迹。
还有一种可能,Kettle指向的是安全栈中的某个分类器。Anthropic的文档明确提到,模型周围的服务基础设施——包括安全分类器、采样逻辑等——是可以独立更新的。如果8月初那次生物分类器重训练(官方宣布把相关回退减少了约85%)触发了新的分类器版本,这个新版本完全可能以Kettle为代号。
最后一种可能性当然也不能排除:它确实是一个不同的模型。但仅凭一个内部标识符,我们无法判断它的权重是否与Fable 5相同、能力是否有差异、甚至它是不是一个尚未发布的继任者。

Anthropic自己的文档,给Kettle留了后门
要判断这次泄露是否构成"违规",得回到Anthropic自己的版本控制政策。在官方文档中,有两句话并排出现,它们之间的张力恰好解释了为什么Kettle可能完全合法:
第一句话是承诺:"Anthropic不会更新现有模型ID的权重或配置。当更新版本可用时,它会以新的模型ID发布。"第二句话则是补充说明:"对于给定的ID,模型权重是固定的,但模型周围的服务基础设施可能会随时间变化。这些基础设施包括请求路由器、安全分类器和采样逻辑等组件。"
文档甚至预见到了行为漂移的可能性:"偶尔,即使模型ID和权重未变,基础设施更新也会在可观察行为上产生微小差异。"换句话说,Anthropic早就给自己留了空间:固定的是模型权重,不是从请求到token的整条链路。如果Kettle只是一个新的路由器部署名称,那它完全符合文档描述,不构成任何政策违反。
真正能让这次泄露"升级"为丑闻的,需要满足两个条件之一:要么证明Kettle背后是一个违反"不更新权重"承诺的新模型,要么证明存在某种机制绕过了Anthropic已有的可见性规则。目前的证据,哪个都够不着。
Fable 5本来就有的"官方回退",和Kettle不是一回事
其实Claude Fable 5早就有文档化的模型切换机制,而且Anthropic从未试图隐藏它。当安全分类器检测到某些敏感请求时——比如攻击性网络安全、双重用途生物学、模型蒸馏或前沿芯片开发——系统会把这部分请求路由到Claude Opus 5。在消费者界面上,这种回退是显式的:你会看到通知、答案中会标明实际服务的模型名称、模型选择器也会自动切换。在API层面,回退同样通过顶层的model字段和专门的回退内容块暴露出来。
Kettle事件与这种官方回退的关键区别在于:回退机制是透明的,而Kettle标识符出现在一个仍然公开标记为claude-fable-5的响应之下。研究者既没有展示回退通知,也没有展示被更改的API模型字段或回退块。如果这些都存在,报道的标题就会是"Anthropic的回退机制被触发了",而不是"Anthropic在静默路由"。
但反过来说,泄露内容同样没有证明任何可见性保证遭到了违反——因为它根本没有说明Kettle是什么。
为什么即使什么都没变,这件事依然重要
固定模型ID本质上是一种信任契约。开发团队之所以敢针对claude-fable-5做基准测试、写评估报告、做成本预测,是因为Anthropic承诺了这个ID背后的权重不会变。如果在公开ID之下运行的是一个从未披露的内部模型,那么每一个基准分数、每一次成本估算、每一轮质量回归测试,都可能被悄然作废。
计费层面的问题更为尖锐。Claude Fable 5的定价是每百万输入token 10美元、输出token 50美元,这是Anthropic公开的最高费率。如果实际服务的模型与计费ID不符,适用哪个费率、由谁来决定,就会变成一个没有答案的问题。当然,目前没有任何证据表明计费发生过异常。重点在于,签名字段恰好是你寻找这类迹象时第一个会检查的地方。
时间线也值得玩味。在Kettle泄露之前的短短九天里,Anthropic已经释放了两个相关信号:8月7日,公司宣布重训练了Fable 5的生物分类器;8月14日,其《负责任扩展政策风险报告》承认存在一个未发布的内部"Model 2",Anthropic称其为相比Claude Mythos 5的"显著改进"且无意发布。这两个都是官方声明,但合在一起描绘出一幅图景:Anthropic正在主动调整围绕Claude Fable 5的系统基础设施,同时保持公开模型ID不变。Kettle如果最终被证实只是又一个基础设施更新,那它不过是同一故事的第三幕——只是这一次,少了披露的部分。

开发者现在该做什么?务实比恐慌更重要
对于日常调用Claude API的开发者来说,一个未经证实的内部标识符,目前还不构成改变技术决策的理由。真正有用的行动是建立属于自己的观测体系:
记录你收到的每个响应中顶层的model字段,留意任何回退内容块的出现。在固定工作负载下持续追踪token消耗量和成本波动。Anthropic文档中记载的回退机制,恰恰会在这些可见位置留下痕迹。这才是对你的业务唯一重要的测试,而且完全不依赖任何人去解码Anthropic的签名格式。
如果你正在使用模型路由服务,低风险的做法是继续正常使用Fable 5,但不要把全部生产流量押在单一模型上。将一部分真实流量分配给Fable 5,同时配置自动故障转移到经过验证的后备模型——比如Claude Opus 5或成本更低的编码专用模型。这样即使未来出现质量回退,它也会变成一个可控的路由决策,而不是一场生产事故。
接下来值得关注的几个信号
Anthropic是否会就此发声,仍然是最关键的变量。一句简单的"Kettle和Manatee是什么"就能让整件事尘埃落定。沉默本身也是一种信息,但解读沉默需要比解读声明更多的谨慎。
独立复现是另一个转折点。如果有人公布原始签名、解码方法和推断出的protobuf schema,这个发现就能从"一个人的图表"变成可核查的技术事实。在那之前,它只能是"目前已知的信息",而非定论。
还需要观察的是可见性表面的变化。如果claude-fable-5的响应开始频繁出现回退通知、API模型字段发生变动、或者回退块的出现频率异常上升,那"官方回退机制"的解释就会更有说服力;反之,如果这些都保持静默,"未记录路径"的猜测就会获得更多 traction。
最后,留意新的模型ID发布。Anthropic的版本策略规定,真正的新版本会以新ID发布。所以如果Kettle确实指向一个真正的继任模型,最确凿的证据将是看到claude-fable-5.1或类似名称的出现——而不是在现有ID下偷偷替换。

常见问题速查
Anthropic真的在偷偷替换Claude Fable 5吗? 目前未经证实。泄露信息显示标记为claude-fable-5的响应携带了内部标识符claude-kettle-e2c95a10-v2-prod,但这不能证明权重被修改、有继任版本被部署、或请求被降级处理。Kettle同样可能是同一Fable 5快照的内部服务部署名称。
Kettle标识符是怎么被发现的? 研究者@chetaslua声称解码了Claude思考块签名字段中的protobuf,从第六个字段读取了模型标识符。Anthropic文档明确称该签名为"不透明"并告诫开发者不要解析,而该研究者的解码方法尚未公开,因此目前无法独立复现。
这违反了Anthropic的固定模型保证吗? 尚不清楚。Anthropic的版本文档承诺不更新现有模型ID的权重或配置,但明确允许模型周边的服务基础设施(路由器、安全分类器、采样逻辑)发生变化。Kettle标识符可能恰好属于这类变化,因此不一定构成违规。
我怎么知道自己被服务的模型有没有变? 查看API响应顶层的model字段和回退内容块,并在固定工作负载上追踪token和成本变化量。Anthropic文档中记载的回退机制会在这些位置留下可见痕迹。没有任何公开API字段会暴露Kettle标识符。
写在最后
实事求是地说,这次泄露只是给某个东西安上了一个名字,并没有证明它究竟是什么。Kettle这个标识符的真实性,仅限于泄露字符串本身所能承载的范围:一位研究者称它从8月16日夜间开始出现,在2582次检测中全部命中。但它所指代的东西——新模型、更名后的部署、路由器组件、分类器——仍然没有答案。
Anthropic自己的文档为整件事提供了一个极为平常的解释框架。在原始签名被公开、或Anthropic说明Kettle到底是什么之前,最理性的态度是将其视为"值得关注但不必恐慌"的信号:保持观察、记录自己的流量数据、维持模型选择的灵活性——而不是因为一个未经证实的内部代号,就推翻现有的技术架构。

更多推荐




所有评论(0)