记录每天的学习内容2026.3.20--简单那了解Diffusion,对VLA有个认知(AI总结),与ai问答全部对话在https://github.com/101per/learning.git
今日学习过程文档:Diffusion 与 VLA入门认知
一、学习目标回顾
今天的目标是:
-
建立对 Diffusion(扩散模型) 的整体认知(不深入推导)
-
理解其主流类型、发展脉络、关键变体
-
明确其与实际系统(文生图模型)的关系
-
初步建立与 VLA(Vision-Language-Action) 的关联认知
二、Diffusion 核心认知
1. 基本思想
Diffusion 的本质可以概括为:
从随机噪声出发,逐步恢复出结构化数据(如图像)
核心过程:
-
正向:数据 → 加噪 → 噪声
-
反向:噪声 → 去噪 → 数据
学习目标:
-
模型学习的是 “如何去噪”,而不是直接生成图像
2. 三种主流视角(统一理解)
|
视角 |
本质 |
|---|---|
|
DDPM |
逐步去噪的概率模型 |
|
Score-based |
学习概率分布梯度 |
|
Flow / SDE |
建模连续变化路径 |
统一本质:
都是在学习“如何从噪声走到数据”
三、Diffusion 工程落地(Stable Diffusion)
1. 核心结构
Stable Diffusion = 三个模块:
-
VAE:将图像压缩到 latent 空间
-
Text Encoder:将文本转为语义向量
-
Diffusion(U-Net):在 latent 空间进行去噪生成
2. 关键机制
(1)Latent Diffusion
-
不在像素空间生成
-
在压缩空间生成 → 提升效率
(2)Cross Attention
-
将文本信息注入图像生成过程
(3)CFG(Classifier-Free Guidance)
-
控制生成结果与文本的对齐程度
四、U-Net 与 DiT(结构演进)
1. 为什么使用 U-Net
-
同时具备:
-
全局语义(encoder)
-
局部细节(skip connection)
-
非常适合图像重建类任务(如去噪)
2. DiT 的引入
DiT(Diffusion Transformer)核心变化:
-
用 Transformer 替代 U-Net
-
将图像转为 token 序列处理
关键优势:
-
全局建模能力强
-
更适合 scaling
-
支持多模态统一
3. 当前结论
U-Net 仍是工业主流,DiT 是未来趋势
五、关键新概念
1. AdaLN(Adaptive LayerNorm)
核心思想:
用条件(文本、时间)动态调制网络
作用:
-
替代 cross-attention(部分场景)
-
更适合 Transformer 架构
2. Flow(流模型)
核心定义:
定义一条连续路径,将噪声变换为数据
数学形式:
-
学习一个“速度场”,指导数据如何变化
3. Flow Matching / Rectified Flow
Flow Matching
-
直接学习“变化方向(速度)”
Rectified Flow
-
将生成路径“拉直”
优势:
-
更稳定
-
更高效
-
更少步骤
4. 与 Diffusion 对比
|
方法 |
学习目标 |
|---|---|
|
Diffusion |
噪声 |
|
Score Model |
概率梯度 |
|
Flow |
变化方向 |
六、文生图模型现状认知
结论:
各大模型(豆包、即梦、ChatGPT、Grok)不是同一个模型,但采用相似技术范式
统一结构:
文本 → 编码 → 条件生成 → 图像
差异主要在:
-
架构(U-Net / DiT)
-
数据
-
工程实现
七、Diffusion 与 VLA 的关系
1. Diffusion 的作用
在 VLA 中:
-
用于生成未来状态(图像 / 视频)
-
可用于生成动作序列(Diffusion Policy)
2. 核心对应关系
|
当前学习 |
VLA中的作用 |
|---|---|
|
条件生成 |
指令 → 动作 |
|
latent空间 |
状态表示 |
|
diffusion |
轨迹生成 |
3. 关键差异
Diffusion:
-
生成“内容”
VLA:
-
生成“动作”
八、当前学习定位
当前阶段属于:
生成模型基础阶段(VLA前置能力)
优势:
-
已具备生成建模思维
不足:
-
尚未涉及决策(RL)
-
尚未涉及控制与交互
九、后续学习方向
下一阶段需要补充:
-
序列建模(Transformer / Decision Transformer)
-
强化学习(RL)
-
Action建模(Diffusion Policy)
-
World Model(环境建模)
十、核心收获总结
今天最重要的三点认知:
Diffusion 本质是“从噪声到数据的逐步建模过程”
Stable Diffusion 是 VAE + Diffusion + Text Conditioning 的工程实现
生成模型可以扩展到 VLA,用于建模未来与动作,但仍需结合 RL 才能完成决策
十一、一句话总结
今天完成了从“理解生成图像”到“理解生成模型在智能系统中的作用”的认知跃迁。
更多推荐

所有评论(0)