以下内容是对《结构递归存续动力学》(SRVD)卷Ⅲ定理5的个人技术解读,仅供讨论参考。

大模型的 Scaling Law 争论已经持续很久。

一方还在坚信“大力出奇迹”——只要继续堆参数、堆数据、堆算力,AGI 就一定会到来。
另一方则越来越焦虑:“天花板可能已经近在眼前”。

先给结论:双方都只对了一半。SRVD 的「饱和衰退定理」给出的判断是:

在固定架构下死撑就一定会撞墙,但如果在衰退到来之前主动切换架构,就能继续增长。

不是“大模型完了”,而是“旧路走不通了,必须换路”。

先说这几个变量是啥

在展示公式之前,先把要用到的变量说清楚,这样后面的公式你就能直接看懂它的工程含义了。

InetI_{net}Inet(有效信息量) :可以理解为模型的有效能力——不是参数量,不是算力消耗,而是模型真正能提取和使用的因果信息量。同样的参数量,架构不同,InetI_{net}Inet 可以差很远。

Imax(D)I_{max}(D)Imax(D)(容量天花板) :在当前架构 DDD 下,模型最多能装多少有效信息。每换一次架构(比如从稠密 Transformer 换到 MoE),这个天花板就被抬高了。

VobjV_{obj}Vobj(客观存续势) :可以粗糙地理解为模型的综合性价比——单位成本带来的有效能力。

γ0\gamma_0γ0(基线折旧率) :模型冻结之后,它和现实世界之间的脱钩速度。数据分布漂移、世界知识更新、用户偏好变化,都是 γ0\gamma_0γ0 的来源。它不是热力学抽象,是可测的工程量。

EstructureE_{structure}Estructure:维持当前架构的基础能耗。模型越大,这个值越高。

TpredT_{pred}Tpred:系统能预判多远的未来。架构越灵活,这个值越大。

一、定理到底在说什么

在固定解码器 DDD 下,有效信息 InetI_{net}Inet 受容量上限 Imax(D)I_{max}(D)Imax(D) 约束,其增长服从 Logistic 方程:

dInetdt=μInet(1−InetImax(D)) \frac{dI_{net}}{dt} = \mu I_{net}\left(1 - \frac{I_{net}}{I_{max}(D)}\right) dtdInet=μInet(1Imax(D)Inet)

Inet≤Imax(D)I_{net} \leq I_{max}(D)InetImax(D) 给出了硬上界,单调增长给出了下界,在最小假设下 Logistic 是标准形式;换用 Gompertz 或 Richards 等其他饱和曲线,IcritI_{crit}Icrit 存在性的结论不变。

存续势 VobjV_{obj}Vobj 随之趋近该架构下的饱和值:

Vobj→Vmax(F)=TpredImax(D)Estructure+kImax(D) V_{obj} \to V_{max}^{(\mathcal{F})} = \frac{T_{pred} I_{max}(D)}{E_{structure} + k I_{max}(D)} VobjVmax(F)=Estructure+kImax(D)TpredImax(D)

关键判据:存在一个临界点 Icrit<Imax(D)I_{crit} < I_{max}(D)Icrit<Imax(D)在这个点,模型还没摸到天花板,但净收益已经归零了。

dVobjdt∣Icrit=γ0Vobj \frac{dV_{obj}}{dt}\bigg|_{I_{crit}} = \gamma_0 V_{obj} dtdVobj Icrit=γ0Vobj

直观理解

I_net 增长(早期,投入产出比高)
    ↓
I_crit(临界点——净增益=0,衰退起点)
    ↓
I_max(D)(容量天花板——F展开的物理极限)
    ↓
物理算力墙(硬件/能耗极限)

关键信息:IcritI_{crit}IcritImaxI_{max}Imax 之前就出现了。衰退早于饱和。

你还没碰到天花板,就已经开始亏了。

二、为什么“边际收益递减”来得比想象中快?

支撑这个结论的核心变量是 γ0\gamma_0γ0(基线折旧率)

γ0\gamma_0γ0 不是热力学抽象。对 LLM 来说,它来自:

来源 含义 可测性
数据分布漂移 训练语料 vs 实时世界的 KL 散度累积 可按时间戳分层量化
知识时效衰减 模型冻结后,事实性准确率随时间下降 可直接测量
概念/风格漂移 用户对话模式、安全偏好变化 可通过 RLHF 偏好对齐度追踪

一个可量化的参考:ICLR 2025 的研究表明,即使训练集中只有 1‰ 的合成数据,也会导致模型崩溃;NeurIPS 2025 的 Knowledge Collapse 工作进一步显示,事实准确性退化可导致高风险领域 40% 的错误率。按这些数据折算,γ0\gamma_0γ010⁻²/月 量级是合理的工程估计——季度级可感,年度级显著。

InetI_{net}Inet 逼近 ImaxI_{max}Imax 时,F\mathcal{F}F 展开的边际收益趋近于零,但 γ0Vobj\gamma_0 V_{obj}γ0Vobj 的折旧项始终存在且随着 VobjV_{obj}Vobj 增大而增大。结果:

继续堆参数,性价比持续下降,并且在到达天花板之前就已经净亏损。

三、那大模型还有未来吗?

SRVD 并没有宣判大模型死刑。它明确给出了两条逃生通道

通道一:主动切换解码器架构(F→T\mathcal{F} \to \mathcal{T}FT 跃迁)

从稠密 Transformer → MoE,从纯预训练 → RL + test-time compute,从单模态 → 多模态/世界模型。每次换 DDDImaxI_{max}Imax 被重置到更高值。

通道二:在 IcritI_{crit}Icrit 到来之前行动

最优策略不是死扛到 loss 不降才想办法,而是在净收益转负之前主动换赛道

当前业界趋势已经印证了这一点:

  • GPT-5/Orion 不及预期:代号“猎户座”的模型相对 GPT-4 的提升幅度,小于 GPT-4 相对 GPT-3 的提升,已进入收益递减阶段。OpenAI 员工评价:“接下来的科学创新会相对很少,将由多年的艰苦工程代替。”

  • 黄仁勋:三种 Scaling Law 共存:NVIDIA CEO 在 CES 2025 明确提出,大模型有三个 Scaling Law 阶段——预训练、后训练、测试时计算(test-time scaling)。“思考得越久,答案越好”——这恰恰是 SRVD “换 DDD = T\mathcal{T}T-跃迁”在业界大佬口中的直接对应。

  • 清华“密度法则”:孙茂松、刘知远团队提出,大模型最大“能力密度”约每 3.5 个月翻一番——每隔 3.5 个月,即可用一半参数量的模型实现当前最优性能。密度法则的本质正是“不换规模换架构”(换 DDD),用算法和数据治理的提升来优化单位参数的智能密度。

  • ICLR 2025 强模型崩溃:研究证明,即使 1‰ 的合成数据也会导致模型崩溃,更大的训练集并不能提升性能。

四、可操作的工程推论

阶段 策略 SRVD 依据
I≪IcritI \ll I_{crit}IIcrit 继续堆算力、堆数据 F\mathcal{F}F 展开边际收益高
I≈IcritI \approx I_{crit}IIcrit 停止纯规模扩展,转向架构探索 净增益趋近于零
超过 IcritI_{crit}Icrit 必须触发 T\mathcal{T}T-跃迁(换架构) 净增益为负,死撑只会加速衰退

一句话判断准则:当你发现 loss 不降、benchmark 饱和时,你其实已经超过了 IcritI_{crit}Icrit——正确动作不是继续堆算力,而是主动换架构。

五、一句话收束

不是大模型一定会撞墙,而是在固定架构下死撑就一定会撞墙

那个墙不是算力天花板,而是热力学衰退点——它比算力天花板来得更早。

SRVD 给大模型时代的真正忠告是:

必须在衰退到来之前,主动完成解码器架构的跃迁。

技术附录

本文基于《结构递归存续动力学》(SRVD)卷Ⅲ定理5(F\mathcal{F}F-展开饱和衰退定理)。核心推导来自 Inet≤Imax(D)I_{net} \leq I_{max}(D)InetImax(D) 容量约束与基线折旧率 γ0\gamma_0γ0(数据分布漂移、知识时效衰减等可测工程量)的存在。

GitHub:https://github.com/fineflowerqq/fineflower
OSF 永久 DOI:10.17605/OSF.IO/MD4Z5

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐