你花钱买的 Claude,可能被偷偷换了便宜货——一个随机数就能戳穿
你花顶级模型的钱,用到的可能是被悄悄替换的便宜货。最新的研究发现,只要让 AI 反复说一个随机数,就能像验指纹一样,查出你用的 API 到底是不是"原装"。

你有没有想过一个问题:你在某个 API 中转站上花钱买 Claude 的接口,对面回复你的,真的是 Claude 吗?
你问它写代码、写文案,它确实都能回答。但回答得好和回答得"值这个价",是两码事。
**今年 3 月,德国 CISPA 亥姆霍兹信息安全中心的一篇论文,第一次系统审计了这个灰色产业。**他们查了 17 家被广泛使用的 AI 中转站,结果发现:将近一半的接口,都在偷偷给你换模型。
你付的是 GPT 旗舰版的钱,后台跑的可能是一个免费开源模型。
更扎心的是,这事儿过去几乎没有简单的办法能查。直到上个月,一位布拉格经济大学的研究员发现了一个近乎荒谬的真相——
你不需要懂任何技术,只要问 AI 一个问题就够了:「说一个 1 到 100 的随机数。」
AI 说不出随机数,每个模型都有自己的"口音"
布拉格经济大学研究员托马什·布鲁克纳(Tomáš Bruckner)在今年 7 月发表的论文里,对 165 个 AI 模型做了同一件事:反复问它们「请说一个 1 到 100 之间的随机数」,每个模型问 30 次。
结果令人意外——几乎所有模型都给不出真正的随机数,而且每个模型"不随机"的方式各不相同、高度稳定。
这就像人的口音:你让 100 个人说"随机说一个词",每个人都会下意识地带出自己的习惯。AI 也一样。
一些典型例子:
- GPT-4o 偏爱 42、37、57——42 是科幻圈著名的"宇宙终极答案",像是训练数据里的文化烙印。
- Claude Sonnet 5 疯狂输出 47,30 次里有大量回答都是这个数字。
- Qwen3-Max 更极端,30 次全部回答 42,一次都没变过。

布鲁克纳把这种特性叫做「行为指纹」(Behavioral Fingerprint)。原理不复杂:大模型并不是真的在掷骰子,它的输出受训练数据、参数权重和对齐方式的深刻影响。这些影响会留下稳定痕迹——痕迹之稳定,足以用来唯一识别一个模型。
一个随机数怎么戳穿"套壳"
明白了"每个模型有独一无二的指纹",接下来的逻辑就顺了。
如果你在一个 API 中转站上买的是 Claude,但怀疑对方偷偷给你换了便宜模型,你只需要做一件事:反复问它「说一个 1 到 100 的随机数」,看看分布像不像 Claude 的指纹。
如果它 30 次里有大量回答是 47,大概率是真 Claude。但如果它偏爱 42,而且 30 次全是 42——恭喜你,你可能买到的是 Qwen3-Max 的壳。
布鲁克纳的论文标题就叫《一个 Token 就够了》(One Token Is Enough)。整个验证过程每次只需要一个输出 token,成本极低——大约一百条请求就能完成一次审计,验证准确率超过 90%。
这意味着,过去只有专业安全团队才能做的模型鉴伪,现在普通人也能做。
中转站的生意经:花 1 块钱,赚你几十块
你可能会问:中转站为什么要偷换模型?答案很简单——差价。
以 Claude Opus 级别的旗舰模型为例,官方 API 每百万 token 的输入价格可以到 15 美元,而一个开源模型的推理成本可能只要几毛钱。中间差价高达几十倍。
CISPA 的审计给出了更具体的数字:某家中转站按官方费率收费,但实际输出量只有官方标准的 38%。用户以为自己买的是顶配,实际到手的 token 价值只有付费金额的一半。
更严重的是,这些被偷换的模型在推理能力上比官方接口差了 40% 以上,医疗和法律领域的准确率甚至暴跌 47%。
这不只是"花了冤枉钱"的问题。如果你用这种被偷换的模型来做正经业务——写医疗报告、做法律分析、跑自动化流程——结果出错的风险,全部由你承担,而中转站不会告诉你它换了模型。
CISPA 在论文中把这些服务叫做「影子 API」(Shadow API)。它们的共同特点:声称提供与官方模型完全一致的输出,打着「原版直连」「一折优惠」的旗号,活跃在技术论坛、社群和聊天软件里。
你主动把一个不可审计的中间人,配置成了你的 AI 入口。从那一刻起,你就失去了验证能力。
谁在替你承担风险
这件事的影响范围,远比"几家中转站骗钱"要大。
如果你是普通用户,用 AI 写周报、做翻译、查资料,短期内可能感知不到模型被换。但长期来看,你为顶级能力付了钱,却只拿到了打折体验——这不是省不省心的问题,是钱花得不值。
如果你是创业者或团队负责人,用第三方 API 接口搭建产品,风险成倍放大。你的产品体验、用户数据安全、甚至合规责任,都建立在一个你无法验证的底层之上。一旦模型被偷换导致输出出错,用户找的是你,不是中转站。
如果你是研究者或开发者,CISPA 发现了一个更隐蔽的问题:已经有 187 篇顶会论文使用了疑似造假的 API 接口做实验,导致实验数据失真。你引用的某篇论文的结果,可能来自一个被偷换的模型。

现在可以怎么做
好消息是,验证方法并不复杂,而且成本很低。
第一步:直接问随机数。 对着你的 API 接口反复问「请说一个 1 到 100 之间的随机数」,问 20-30 次,记录每次回答。如果分布高度集中在一两个数字上,说明这很可能不是真随机。
第二步:对比已知指纹。 GPT-4o 偏爱 42/37/57,Claude Sonnet 5 疯狂输出 47,Qwen3-Max 全是 42。如果你买的是 Claude 但分布看起来像 Qwen,大概率被换了。
第三步:能用官方就用官方。 如果条件允许,优先走模型厂商的官方 API。价格可能贵一些,但至少你能确定对面跑的是什么。
第四步:别贪便宜到失去底线。 「1 元兑换 285 万 Token」这种价格,本身就在告诉你:要么模型不对,要么服务不稳定。没有哪个顶级模型会亏本给你用。
布鲁克纳的研究还有一个意外收获:这种"行为指纹"不只适用于随机数。随机颜色、随机动物、随机城市——AI 在所有"随机"任务上都暴露出各自的偏好。这意味着,未来你可以用更多维度交叉验证,让套壳模型无处遁形。
结语
这件事最反常识的地方在于:AI 最暴露身份的瞬间,恰恰是它试图"随机"的时候。
大模型的随机并不随机,这本来是个技术小怪癖。但当这个怪癖变成了一面照妖镜,整个 API 中转市场的灰幕就被掀开了一角。
更多推荐




所有评论(0)