今日学习过程文档:Diffusion 与 VLA入门认知

一、学习目标回顾

今天的目标是:

  • 建立对 Diffusion(扩散模型) 的整体认知(不深入推导)

  • 理解其主流类型、发展脉络、关键变体

  • 明确其与实际系统(文生图模型)的关系

  • 初步建立与 VLA(Vision-Language-Action) 的关联认知


二、Diffusion 核心认知

1. 基本思想

Diffusion 的本质可以概括为:

从随机噪声出发,逐步恢复出结构化数据(如图像)

核心过程:

  • 正向:数据 → 加噪 → 噪声

  • 反向:噪声 → 去噪 → 数据

学习目标:

  • 模型学习的是 “如何去噪”,而不是直接生成图像


2. 三种主流视角(统一理解)

视角

本质

DDPM

逐步去噪的概率模型

Score-based

学习概率分布梯度

Flow / SDE

建模连续变化路径

统一本质:

都是在学习“如何从噪声走到数据”


三、Diffusion 工程落地(Stable Diffusion)

1. 核心结构

Stable Diffusion = 三个模块:

  • VAE:将图像压缩到 latent 空间

  • Text Encoder:将文本转为语义向量

  • Diffusion(U-Net):在 latent 空间进行去噪生成


2. 关键机制

(1)Latent Diffusion

  • 不在像素空间生成

  • 在压缩空间生成 → 提升效率

(2)Cross Attention

  • 将文本信息注入图像生成过程

(3)CFG(Classifier-Free Guidance)

  • 控制生成结果与文本的对齐程度


四、U-Net 与 DiT(结构演进)

1. 为什么使用 U-Net

  • 同时具备:

  • 全局语义(encoder)

  • 局部细节(skip connection)

  • 非常适合图像重建类任务(如去噪)


2. DiT 的引入

DiT(Diffusion Transformer)核心变化:

  • 用 Transformer 替代 U-Net

  • 将图像转为 token 序列处理

关键优势:

  • 全局建模能力强

  • 更适合 scaling

  • 支持多模态统一


3. 当前结论

U-Net 仍是工业主流,DiT 是未来趋势


五、关键新概念

1. AdaLN(Adaptive LayerNorm)

核心思想:

用条件(文本、时间)动态调制网络

作用:

  • 替代 cross-attention(部分场景)

  • 更适合 Transformer 架构


2. Flow(流模型)

核心定义:

定义一条连续路径,将噪声变换为数据

数学形式:

  • 学习一个“速度场”,指导数据如何变化


3. Flow Matching / Rectified Flow

Flow Matching

  • 直接学习“变化方向(速度)”

Rectified Flow

  • 将生成路径“拉直”

优势:

  • 更稳定

  • 更高效

  • 更少步骤


4. 与 Diffusion 对比

方法

学习目标

Diffusion

噪声

Score Model

概率梯度

Flow

变化方向


六、文生图模型现状认知

结论:

各大模型(豆包、即梦、ChatGPT、Grok)不是同一个模型,但采用相似技术范式

统一结构:

文本 → 编码 → 条件生成 → 图像

差异主要在:

  • 架构(U-Net / DiT)

  • 数据

  • 工程实现


七、Diffusion 与 VLA 的关系

1. Diffusion 的作用

在 VLA 中:

  • 用于生成未来状态(图像 / 视频)

  • 可用于生成动作序列(Diffusion Policy)


2. 核心对应关系

当前学习

VLA中的作用

条件生成

指令 → 动作

latent空间

状态表示

diffusion

轨迹生成


3. 关键差异

Diffusion:

  • 生成“内容”

VLA:

  • 生成“动作”


八、当前学习定位

当前阶段属于:

生成模型基础阶段(VLA前置能力)

优势:

  • 已具备生成建模思维

不足:

  • 尚未涉及决策(RL)

  • 尚未涉及控制与交互


九、后续学习方向

下一阶段需要补充:

  1. 序列建模(Transformer / Decision Transformer)

  2. 强化学习(RL)

  3. Action建模(Diffusion Policy)

  4. World Model(环境建模)


十、核心收获总结

今天最重要的三点认知:

Diffusion 本质是“从噪声到数据的逐步建模过程”

Stable Diffusion 是 VAE + Diffusion + Text Conditioning 的工程实现

生成模型可以扩展到 VLA,用于建模未来与动作,但仍需结合 RL 才能完成决策


十一、一句话总结

今天完成了从“理解生成图像”到“理解生成模型在智能系统中的作用”的认知跃迁。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐