写在前面

【WeThinkIn出品】栏目专注于分享Rocky的认知思考与经验感悟,范围涵盖但不限于AI行业。

欢迎大家关注Rocky的公众号:WeThinkIn
欢迎大家关注Rocky的知乎:Rocky Ding
AIGC算法工程师/开发工程师面试面经秘籍分享:WeThinkIn/Interview-for-Algorithm-Engineer欢迎大家Star~

AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍

Rocky最新撰写AI Agent(AI智能体)的深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

核心导读

很多人看图像生成模型,第一反应还是看样张:像不像、漂不漂亮、文字有没有写对。但如果只停留在样张层面,就很容易误判一篇技术报告的价值。

《Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model》真正值得关注的地方,不是它又做了一个“中文更好”的文生图模型,而是它把一个中文图像生成模型应该具备的能力,拆成了一个比较完整的系统工程:数据体系、知识注入、双语 LLM 文本编码器、字符级 Glyph-Aligned ByT5、DiT 主干、SFT/RLHF/Prompt Engineering/Refiner 后训练链路、编辑模型适配、推理加速,以及一套面向中英文和中文文化语义的评测。

Rocky认为,这篇报告的核心判断可以压缩成一句话:Seedream 2.0 不是在单点追某个 benchmark,而是在证明一件更长期的事情:图像生成模型的竞争,正在从“会画”进入“会理解语言、文化、版式、审美和产品约束”的阶段。

这也是为什么这篇论文要反复强调中文文本渲染、中文文化特征、人工偏好、Prompt Engineering 和编辑能力。因为在真实产品里,用户并不是只要一张“好看的图”。用户要的是:提示词能听懂,中文能写准,文化意象不乱套,复杂结构不崩,海报和设计能落地,编辑时还能保留身份与构图。这些能力不是靠一个模型结构 trick 就能补齐的,而是靠完整生产系统一点点堆出来的。

论文开头用两组雷达图和示例图直接给出结论:Seedream 2.0 在英文和中文两个评测场景里,都试图维持一个比较均衡的能力面,而不是只在审美、结构或文本渲染其中一个维度上冲高分。

在这里插入图片描述

这张图最重要的不是“Seedream 2.0 分数高”,而是它的论证方式:作者把图像生成能力拆成 aesthetics、structure、alignment、Elo、MPS、HPSv2、VQAScore、EvalMuse、TextHit、TextAcc、TextAvail 等多个维度。换句话说,论文并不想把 Seedream 2.0 包装成一个单指标冠军,而是想证明它是一个没有明显短板的产品级基础模型。

在这里插入图片描述

Figure 2 则承担“第一眼能力展示”的角色。它说明 Seedream 2.0 不只是解决英文 prompt 或通用摄影风格,而是要覆盖中文语境、艺术风格、复杂视觉元素和文字表达。对一篇模型技术报告来说,这类图不能替代实验证据,但它能帮助读者理解作者为什么把“中文原生能力”放在核心位置。

问题背景:作者到底想解决什么

论文在 Introduction 里把当前图像生成模型的瓶颈归纳为三类:模型偏科、文本渲染不足、中文文化理解不足。

这三个问题放在一起看,其实是在说同一件事:通用图像生成已经过了只比画质的阶段,下一轮竞争会落到语义控制和场景可用性上。

第一,模型偏科。Midjourney 这类产品有强审美,但复杂 prompt 跟随、结构正确性、精确文字并不总是稳定。Ideogram 在文字上更强,但不代表它在所有审美和结构维度上都最优。一个真正可用的基础模型,需要在多个能力维度之间做平衡,而不是在某一条能力曲线上过拟合。

第二,文本渲染。图像里的文字不是边缘能力。海报、包装、广告、封面、PPT、品牌物料、电商图、门店物料都高度依赖文字。如果模型能画出漂亮背景,却把中文写错,把排版做成贴片,把成语和对联写乱,它在商业设计场景里的价值就会大幅下降。

第三,中文文化理解。中文不是把英文 prompt 翻译一下就完事了。热干面和刀削面不是“noodle”的两种随机变体,马面裙、藏袍、蒙古袍、昆曲服饰也不是“traditional Chinese clothes”的泛化图片。中文图像模型真正难的地方,是要理解本土语义背后的知识、审美和细粒度差异。

所以 Seedream 2.0 的论文结构不是“提出一个网络结构,然后跑实验”,而是按产品级模型的真实生产链路展开:先讲数据,再讲预训练,再讲后训练,再讲编辑适配和加速,最后讲评测。这个顺序很重要,因为它说明作者把能力来源看成一个系统,而不是单一模块。

核心思路:用一句主线串起来

Seedream 2.0 的主线是:用高质量、多层次、可持续更新的数据系统补足知识和分布;用双语 LLM 文本编码器提升中文和复杂 prompt 理解;用 Glyph-Aligned ByT5 补足字符级文字渲染;用多阶段后训练和 RLHF 把预训练能力对齐到人类偏好和产品可用性;再通过编辑适配与加速,把文生图模型变成可部署、可交互的创作基础设施。

论文的技术路线图把训练和推理流程放在同一张图里。这里能看到 Seedream 2.0 的几个核心组件:数据处理、文本编码、字符级文本编码、DiT 生成主干、后训练链路以及推理侧模块。

在这里插入图片描述

这张图是理解全文的入口。Seedream 2.0 没有把“中文能力”只交给最后的 prompt 翻译,也没有把“文字渲染”只交给后处理。它是在训练链路里直接引入中文/英文原生数据、LLM 文本编码器和字符级文本编码,让模型从表示层就能接触这些信息。

模型结构图进一步说明,Seedream 2.0 基本沿用了现代 DiT/MMDiT 路线:图像经过 VAE 编码到 latent,再 patchify 成图像 token;文本 prompt 经文本编码器变成文本 token;图像 token 和文本 token 一起进入 transformer blocks。

在这里插入图片描述

Rocky认为,Seedream 2.0 的“创新密度”不在单个模块看起来多么革命,而在于它把很多行业里已经被证明有效的方向,组合成了一个围绕中文创作场景优化的闭环。LLM 文本编码器、Glyph ByT5、Scaled RoPE、RLHF、Prompt Engineering、Refiner、编辑适配、量化加速,它们各自都不是凭空出现,但组合起来指向一个更现实的问题:模型如何从论文能力变成用户天天可用的创作工具。

方法展开:沿着论文原始逻辑拆解

1. 数据预处理:中文能力先不是模型问题,而是数据系统问题

论文第 2 节先讲数据,而不是先讲模型结构。这一点很值得注意。

在图像生成里,很多能力问题表面看是模型问题,本质上是数据问题。模型不懂中文文化,不一定是结构不够强,也可能是训练数据里没有足够高质量、可学习、描述准确的中文文化样本;模型写错字,不一定只是解码能力弱,也可能是训练数据没有把视觉文字和 prompt 中的字符关系标注清楚。

Seedream 2.0 的预训练数据系统由四类数据组成:高质量数据、分布保持数据、知识注入数据、定向补充数据。

在这里插入图片描述

高质量数据解决的是“画得好”的基础问题,包括清晰度、审美、来源质量。分布保持数据解决的是“不能因为清洗而丢掉世界多样性”的问题。知识注入数据解决的是模型缺少特定概念、实体、文化知识的问题。定向补充数据则针对模型在某些困难 prompt 上的坏例,比如大幅动作、反事实实体和复杂结构。

这套设计背后的方法论是:不能只用一个粗糙质量分过滤数据。真实模型训练需要同时保留质量、分布、知识和困难样本。

论文随后单独讲知识注入。作者构建 taxonomy,再通过多模态检索扩展相关图文对,把特定中文语境里的知识补进训练数据。

在这里插入图片描述

这一步对中文模型尤其关键。中文文化能力不是“中文 tokenizer 支持了”就自动出现。模型要知道什么是马面裙、热干面、昆曲服饰、传统建筑、节庆装饰,它必须在训练数据里看到足够准确的视觉样本和文本描述。否则它只能用通用视觉分布去猜,最后生成的就是“看起来像东方风格”的混合物,而不是语义正确的中国元素。

数据清洗流程则体现了另一个现实:互联网图文数据里噪声太多,尤其是水印、贴纸、错误 OCR、低清、重复图、标题党描述。Seedream 2.0 使用 general quality score、general structure score、OCR detection、deduplication clustering、captioning 等步骤做多阶段过滤。

在这里插入图片描述

这张图在论文里看起来像工程流程图,但它其实很本质。图像生成模型的质量上限,很大程度上取决于训练前的数据治理能力。数据清洗不只是“洗干净”,更是把错误监督信号从训练中拿掉。对于文字渲染和中文文化理解来说,错误 caption、错误 OCR、错误实体对应关系都会变成模型的长期负资产。

作者还引入 active learning engine,用少量标注数据训练分类器,再让分类器从未标注数据中挑出值得人工标注的样本,如此循环提升分类器和数据筛选质量。

在这里插入图片描述

这体现了一个产品级模型团队和普通训练项目的差异:普通项目常常一次性构造数据集,训练完就结束;产品级模型则需要一套能持续发现坏例、补充样本、更新分类器、修复能力短板的数据飞轮。

2. Caption 系统:模型不是只学图,还要学“如何描述图”

Seedream 2.0 的 caption 系统分成通用 caption 和专项 caption。通用 caption 又包括短 caption 和长 caption,分别承担概括主体与补充细节的功能。

在这里插入图片描述

这里有一个容易被忽略的点:图像生成模型不是直接从“图”学到“图”,而是从“文本条件下的图像分布”里学习。因此 caption 的质量,决定了模型能不能把语言里的细节映射到图像里的视觉属性。

短 caption 太粗,模型会学不到细粒度关系;长 caption 如果不准确,会把错误描述灌给模型;只讲客观内容,不讲风格、光影、材质和构图,模型就很难在高审美场景里对齐用户意图。Seedream 2.0 强调 caption 的 accuracy 和 richness,就是在平衡这几个问题。

文本渲染数据则是另一个独立链路。作者使用内部数据与 OCR 工具筛选含有丰富视觉文字的图像,并围绕字体、颜色、大小、位置等信息构造可学习的文字渲染数据。

在这里插入图片描述

Rocky认为,图像模型里的“写字能力”有两层:一层是字符级准确性,另一层是设计级可用性。前者要求字别写错,后者要求字要和图像背景、材质、版式、语境融合。很多模型能做到第一层的一部分,但第二层仍然很难。Seedream 2.0 的数据设计,明显是在尝试同时覆盖这两层。

3. 预训练:LLM 文本编码器是 Seedream 2.0 的关键转向

论文第 3 节进入模型预训练。主干是 Diffusion Transformer,基本遵循 SD3 里的 MMDiT 设计:图像 token 和文本 token 共同进入 self-attention,图像与文本分别使用不同 MLP 处理,并通过 adaptive layer norm 调制。

这一节比较有价值的地方有两个。

第一,作者使用 Scaled RoPE 处理未训练分辨率和长宽比的泛化。普通 2D RoPE 在不同分辨率下位置 ID 分布会变化,Seedream 2.0 通过 scale factor 让图像中心区域在不同分辨率下共享相似 position IDs,从而提升对未训练长宽比和分辨率的适应能力。这个设计不是最显眼的能力点,但对产品很重要,因为真实用户不会总是生成训练时固定比例的图。

第二,也是更核心的一点:Seedream 2.0 使用自研双语 LLM 作为文本编码器,而不是只依赖 CLIP 或 T5。

CLIP 的优势是图文对齐,T5 的优势是细粒度文本理解,但论文认为它们在中文理解上不够强。decoder-only LLM 通常有更强多语言能力,但直接拿来做 diffusion text encoder 会遇到表示分布不匹配、训练不稳定的问题。因此作者对 decoder-only LLM 进行了面向图文对的校准和微调,让它更适合扩散模型使用。

这个选择很有行业意味。过去图像模型的文本编码器更多像一个“提示词特征抽取器”;到了 Seedream 2.0 这里,文本编码器开始承担更强的语言理解和知识承载功能。尤其在中文场景里,prompt 往往包含成语、典故、风格词、专业词、文化实体、复杂关系,如果文本编码器本身理解不够,后面的 DiT 再强也只能生成一个模糊近似。

4. 字符级文本编码:中文写字不是 OCR 反过来那么简单

Seedream 2.0 还加入了 Glyph-Aligned ByT5 作为字符级文本编码器,用来提供 rendered text 的字符级特征。

论文这里做了一个重要区分:只用 ByT5 编码待渲染文本,在长文本场景下可能导致重复字符和布局混乱,因为 ByT5 对整体语义理解不够。作者因此同时使用 LLM 文本编码器和 ByT5:LLM 负责整体语义与上下文理解,ByT5 负责字符级 glyph 一致性,再用 MLP 把 ByT5 embedding 投影到与 LLM text encoder 对齐的空间,拼接后送入 DiT blocks。

这条路线的价值在于,它没有把文字渲染做成一个复杂的外部布局控制系统。传统文本渲染方法常常依赖预设文本框、额外布局规划或 OCR-rendered image 条件。Seedream 2.0 则尽量保持与原始文生图相同的训练和推理流程,只通过文本特征增强来学习文字内容与渲染属性。

从工程角度看,这很关键。模型能力越依赖复杂外部流程,产品链路越难稳定;如果能把字符、语义、版式描述尽量统一到文本条件里,用户使用体验会更自然,系统维护成本也更低。

5. 后训练:把“会生成”推向“用户喜欢”

论文第 4 节是 Seedream 2.0 最像产品模型报告的部分。作者把后训练拆成 CT、SFT、RLHF、Prompt Engineering 和 Refiner。

在这里插入图片描述

Figure 11 的价值在于,它展示了后训练不是一个抽象概念,而是会逐步改变图像的审美、细节、构图和最终质感。预训练模型可能已经会画,但不一定符合用户对“好图”的判断;后训练的目标,就是把基础能力推向人类偏好。

Continuing Training 阶段使用更小但质量更高的数据集,提升审美,同时尽量维持 prompt-following 和结构准确性。作者把数据分成高质量预训练数据和人工精选数据,并用 IQA 模型自动筛选,再配合人工审美数据。为了避免小数据过拟合,继续训练时还混入高质量预训练数据。

SFT 阶段进一步使用少量高艺术质量样本,并训练能精确描述审美与艺术性的 caption 模型。论文还提到在 SFT 中加入模型生成图作为 negative samples,让模型学习真实图与生成图之间的差异。这一点很有意思,因为它把“模型自己的坏味道”也变成监督信号。

但审美优化会带来一个老问题:越追求漂亮,越可能牺牲语义对齐。Seedream 2.0 因此设计了数据重采样算法,在增强 aesthetics 的同时维持 image-text alignment。这里的本质矛盾是:图像生成模型不是越美越好,而是要在美、准、稳之间找到可用平衡。

6. RLHF:多奖励模型让能力维度走向 Pareto 平衡

Seedream 2.0 的 RLHF 部分包括 preference data、reward models 和 feedback learning。论文强调它通过多维偏好标注,同时覆盖图文匹配、文本渲染、审美等维度,避免模型在某个单一奖励上过度优化。

在这里插入图片描述

Figure 12 展示了不同 reward model 的曲线稳定上升,以及 RLHF 对生成结果的可视化影响。这里要注意,reward 曲线上升并不等于模型必然在真实开放场景里全面变好,但它至少说明作者在训练中没有只追单一偏好,而是在尝试构造多目标优化。

论文的 reward model 使用支持中英文的 CLIP,并训练了三个方向:image-text alignment RM、aesthetic RM、text-rendering RM。尤其 text-rendering RM 只在 prompt tag 涉及文字渲染时被选择性使用,这说明团队并不想让所有 prompt 都被文字奖励牵引,而是按任务类型启用奖励信号。

反馈学习阶段则直接优化多个 reward model 输出分数,类似 REFL 范式。作者还做了扩散模型与 LLM 文本编码器的联合微调。Rocky认为,这一点很重要:如果文本编码器也参与反馈学习,那么 RLHF 改变的不只是图像生成器,还可能改变模型理解 prompt 的方式。这会带来更强对齐,也会带来更复杂的稳定性问题。

7. Prompt Engineering:把用户 prompt 翻译成模型喜欢的 prompt

Seedream 2.0 单独设置 Prompt Engineering 模块,是因为真实用户写的 prompt 往往很短、很散、缺少审美细节,而模型训练时见到的 caption 往往更长、更丰富、更结构化。

论文提出使用内部 fine-tuned LLM 对用户 prompt 进行改写,让输入更接近模型偏好的训练分布。作者声称该 PE 模块带来约 30% 的 aesthetic quality 提升、5% 的 image-text alignment 提升,并增加生成多样性。

在这里插入图片描述

Figure 13 展示了同一个原始 prompt 经不同 PE prompt 后生成的多个结果。这里真正值得关注的不是 PE 能让图变好看,而是它把“提示词能力”产品化了。

在很多 AIGC 产品里,用户不会也不应该学习复杂 prompt 工程。平台如果能自动把“用户语言”转成“模型语言”,那 prompt engineering 就不再是用户技巧,而是产品基础设施。工具红利退潮后,模型产品之间的差异会越来越体现在这些看似不起眼的中间层上:提示词改写、意图识别、风格补全、失败重试、偏好记忆、任务路由。

8. Refiner:从 512 到 1024,不只是放大

Seedream 2.0 的 base model 生成 512 分辨率图像,再通过 Refiner 扩展到 1024。论文强调 Refiner 不只是超分辨率,还会修复面部等结构细节,并增强纹理质量。

在这里插入图片描述

Refiner 的训练包括 1024-resolution training 和 texture RLHF。作者用高纹理图像构造随机退化样本,训练 texture reward model,再用它引导 Refiner 优化。

这部分体现了产品模型的一个基本现实:用户看到的是最终图,不是 base model 输出。一个端到端体验往往由多个模型或模块叠加而成。基础模型负责语义和构图,Refiner 负责细节与质感,PE 负责 prompt 分布对齐,RLHF 负责偏好贴近,最终才形成用户感知的“模型能力”。

9. 从文生图到编辑:SeedEdit 说明模型能力可以迁移

论文第 5 节讲如何把 Seedream 2.0 对齐到 instruction-based image editing,也就是 SeedEdit。

作者的基本判断是:文生图模型不仅会生成图,也继承了一定图像理解能力,因此可以适配成图像编辑模型。SeedEdit 的核心思路包括新的数据生成流程、causal diffusion framework、迭代优化策略,以及使用 diffusion model 本身作为 image encoder,而不是常见的 CLIP 或 DINO。

真正具体的改进集中在身份保持。SeedEditV1.0 上线后,团队发现真实人物小脸或强文本条件下容易丢失人脸 ID。例如把人物放到“泰姬陵”前,模型可能因为场景语义偏置把人物脸改得更像印度人。为了解决这个问题,论文引入 multi-expert data fusion、face-aware loss 和 data optimization。

在这里插入图片描述

Figure 15 展示了 GPT score 与 CLIP/AdaFace similarity 的关系。这里的评价维度很现实:编辑模型既要听指令,又要保留原图身份。只追 GPT score,可能改得更符合文字但丢失人脸;只追 similarity,又可能编辑不充分。编辑模型的难点就在这种张力里。

在这里插入图片描述

Figure 16 则说明增强后的方法在背景替换等编辑任务中更能保持人物 ID。对产品来说,这类能力比“能不能生成一张漂亮新图”更难,因为编辑要求模型尊重原图约束。用户不是让模型自由发挥,而是要求它在局部改变和整体一致之间拿捏分寸。

10. 加速:模型只有能跑起来,才进入产品竞争

论文第 6 节讲 CFG/step distillation 和 quantization。

CFG 推理每个 timestep 通常需要两次模型推理,成本高。Seedream 2.0 提出 guidance scale embedding,并基于 Hyper-SD 的 TSCD 做 step distillation,把完整时间步区间分段,再逐步把 segment 数从 16 降到 8、4、2、1,以减少误差累积并保持高保真生成。

量化部分则包括 operator fusion、Attention/GEMM quantization、自适应混合量化、offline smooth、敏感层搜索、lightweight Quant Training,以及低比特 mixed-granularity kernels。论文称 operator 性能有 5% 到 20% 的提升。

这部分不是最适合宣传的亮点,但对商业模型非常关键。图像生成产品的成本结构很硬:延迟、并发、GPU 成本、分辨率、失败重试、编辑链路,都会直接影响毛利和用户体验。一个模型如果只能在实验室里慢慢生成,它很难成为大规模产品能力。

实验与证据:结果能支撑到什么程度

1. 人工评测:Bench-240 和 50 万次偏好比较

Seedream 2.0 的人工评测使用 Bench-240,共 240 个 prompt,每个 prompt 提供中英文版本。prompt 设计覆盖主体关系、动作、图像质量、结构、审美等因素,并根据用户偏好调查校准分布。

作者使用两类人工评估:专家评估和 Elo 总分。专家评估覆盖 text-image alignment、structural correctness、aesthetic quality,使用 1 到 5 的 Likert scale。Elo 总分来自 public reviewers 的两两偏好投票,论文称收集超过 500,000 次 pairwise comparisons,每个模型平均参与超过 30,000 次比较。

在这里插入图片描述

Figure 17 显示,在英文评测里,Seedream 2.0 的 Elo Score 为 1117,高于 Ideogram 2.0 的 1104、Midjourney v6.1 的 1083、FLUX1.1 Pro 的 1082 和 GPT-4o 的 1074。细分维度上,Seedream 2.0 在结构上最高,在 alignment 和 aesthetics 上接近第一梯队。

这里可以得出一个谨慎结论:在作者构造的 Bench-240 和评测流程下,Seedream 2.0 展示了较强的均衡性。它不是所有指标都第一,但短板相对少。

但也要注意,Bench-240 是作者自建 benchmark,虽然包含公开 benchmark 和人工 prompt,但完整 prompt 分布、评审细则、模型版本、采样参数、失败图处理方式都决定了结果解释边界。因此这类结果更适合说明“在作者定义的产品场景里表现强”,不能直接等价于开放世界里绝对领先。

2. 自动评测:VQAScore、EvalMuse 与偏好指标

自动评测主要覆盖英文 prompt,因为外部自动指标对中文支持有限。论文使用 VQAScore 和 EvalMuse 评估 text-image alignment。

在这里插入图片描述

Figure 18 显示 Seedream 2.0 在 EvalMuse 多个细粒度维度上表现强,尤其在 counting、activity 等更困难维度上有优势。论文认为这与人工评测趋势一致。

论文表 1 给出更具体的自动评测结果:

Model VQAScore total EvalMuse Total Object Activity a./h. Attribute Location Color Counting Other
Seedream 2.0 0.8031 0.682 0.747 0.662 0.756 0.821 0.793 0.706 0.477
GPT-4o 0.7974 0.656 0.732 0.644 0.734 0.814 0.782 0.692 0.438
FLUX1.1 Pro 0.7877 0.617 0.694 0.596 0.686 0.819 0.758 0.660 0.362
Ideogram 2.0 0.8226 0.632 0.720 0.617 0.693 0.813 0.743 0.680 0.351
Midjourney v6.1 0.7569 0.583 0.693 0.599 0.619 0.807 0.736 0.637 0.285

这张表里有一个有趣现象:Ideogram 2.0 的 VQAScore total 更高,为 0.8226,但 Seedream 2.0 的 EvalMuse Total 更高,为 0.682。不同自动指标对能力的投影不同,这说明生成模型评测不能只看一个数。

论文表 2 则给出偏好和图像质量相关指标:

Metric GPT-4o FLUX 1.1 Ideogram 2.0 MJ v6.1 RecraftV3 Seedream 2.0
HPSv2 0.2881 0.2946 0.2932 0.2850 0.2991 0.2994
MPS 12.79 13.11 13.01 13.67 13.09 13.61
Internal-Align 28.85 27.75 27.92 28.93 28.90 29.05
Internal-Aes 26.48 25.15 26.40 27.07 26.80 26.97

Seedream 2.0 在 HPSv2 上最高,在 MPS 上接近 Midjourney v6.1,在 internal alignment 上最高,在 internal aesthetics 上略低于 Midjourney v6.1。这个结果和论文主线一致:Seedream 2.0 不是只赌审美极致,而是追求综合平衡。

3. 文本渲染:中文能力是这篇报告最硬的看点之一

文本渲染评测使用 180 个中文 prompt 和 180 个英文 prompt,覆盖 logo、海报、电子屏、印刷字、手写字,以及用薯条、云朵等非常规材料构成文字的场景。

论文定义了一个主观指标 availability rate,以及两个客观指标 text accuracy rate 和 text hit rate:

R a = ( 1 − N e N ) ∗ 100 % R_a = \left(1 - \frac{N_e}{N}\right) * 100\% Ra=(1NNe)100%

其中 N N N 是目标字符总数, N e N_e Ne 是渲染文本与目标文本之间的最小编辑距离。

R h = N c N ∗ 100 % R_h = \frac{N_c}{N} * 100\% Rh=NNc100%

其中 N c N_c Nc 是输出中正确渲染的字符数量。

在这里插入图片描述

Figure 19 是整篇论文最值得细读的图之一。中文文本渲染里,Seedream 2.0 的 Acc Rate 为 78%,Hit Rate 为 82%,Avail Rate 为 78%;MiracleVision 5.0 分别为 65%、66%、45%;Kolors 1.5 分别为 15%、19%、18%。英文文本渲染里,Seedream 2.0 的 Acc Rate 为 89%,Hit Rate 为 91%,Avail Rate 为 86%,和 Recraft V3、Ideogram 2.0 等文字强模型处在同一竞争区间。

中文文本渲染难在两点:字符集大、结构复杂;同时中文文字常常和文化语境绑定,比如对联、招牌、成语、古诗、海报文案。这意味着模型不能只“复制字符形状”,还要理解文字应该出现在哪里、以什么版式出现、如何与背景融为一体。

Rocky认为,Seedream 2.0 在中文文本渲染上的价值不只是一个模型能力点,而是中国本土 AIGC 设计工具能不能进入真实工作流的关键门槛。对设计、电商、营销、品牌、教育内容来说,中文写错一个字,整张图就从“可用”变成“废稿”。

4. 中文文化特征:不是中国风滤镜,而是细粒度语义响应

论文第 7.4 节专门评估 Chinese Characteristics,构造了 350 个 prompt,覆盖传统服饰、食物、艺术技法、建筑和习俗。

在这里插入图片描述

Figure 20 显示,Seedream 2.0 在 response score 上为 3.86,高于 GPT-4o、Kolors 1.5、Hunyuan 和 MiracleVision;在 Chinese aesthetics 上也保持较高分数。

论文进一步按 craftsmanship、animals & plants、food、costume、painting style、cityscape、architecture、festival 等维度分析正确响应比例。

在这里插入图片描述

这里的关键不是“模型更懂中国风”,而是它能不能区分具体概念。比如热干面、刀削面、炸酱面、煎饼果子;藏袍、马面裙、昆曲服饰、蒙古袍。如果模型只会生成一个泛化的“东方传统元素”,它在用户眼里就不可靠。

在这里插入图片描述

Figure 22 说明了为什么中文图像生成不能只靠语言翻译。很多中文文化概念不是英文世界的高频视觉实体,外部模型可能知道“Chinese traditional clothing”,但未必知道“马面裙”和“蒙古袍”的视觉差异。中文原生模型真正要做的是把本土语义变成模型内部稳定的视觉知识。

5. 可视化案例:对齐、结构、审美、文字四条能力线

论文最后给了多组案例,分别展示 alignment、structure、aesthetics 和 text rendering。

在这里插入图片描述

Figure 23 里的 prompt 包括“茶杯形状的云”和“两只绿色盒子在桌上,两只红球在桌下”。这些例子考察的是模型是否能同时理解形状隐喻、数量关系和空间关系。很多模型画面本身不差,但会错在数量、位置或关系上。

在这里插入图片描述

Figure 24 则关注结构。复杂人体动作、手指、肢体、台球姿态、瑜伽姿态都是扩散模型常见失败区。结构正确性不是单纯审美问题,而是模型有没有学到足够稳的物理与人体先验。

在这里插入图片描述

Figure 25 展示电影摄影、Q 版人物等审美案例。Seedream 2.0 的优势在于风格表达比较稳定,但这类样张也最需要谨慎看待,因为审美高度依赖采样参数、prompt 写法、筛图策略和主观偏好。

在这里插入图片描述

Figure 26 是应用价值非常强的案例。英文海报、中文 logo、对联、用黄瓜组成“猫”字、毕业庆祝背景里的“金榜题名”,这些都不是简单 OCR 任务,而是“文字作为视觉元素”的生成任务。模型要同时处理字符准确、材质融合、构图关系和文化语义。

在这里插入图片描述

Figure 27 展示了更丰富的文字生成潜力,包括长句、店铺招牌、海报式文字、中文标题和英文混排。对中文内容创作者来说,这类能力比“再多几个艺术风格”更接近实际工作流。

在这里插入图片描述

Figure 28 则回到中文审美表达。它不能证明模型在所有中文审美场景里都稳定,但能说明团队把中文文化表达当成一条独立能力线,而不是通用模型的附属能力。

这篇工作的边界与可复现性

这篇报告的优势很明显:它展示了一个产品级图像生成基础模型的完整工程链路,而不是只给一个孤立方法。数据系统、模型结构、后训练、RLHF、PE、Refiner、编辑、加速、评测,都被放在同一个叙事里。

但边界也同样明显。

第一,关键训练细节不可复现。论文没有开放模型权重、完整训练数据、采样配置、训练成本、reward model 细节、PE LLM 细节和完整 prompt 集。对研究社区来说,这是一篇技术报告,而不是一篇可完全复现实验论文。

第二,很多结果依赖内部评测和产品环境。Bench-240、中文文化 benchmark、内部偏好模型、人工评审流程都与作者团队设计强相关。它们很有参考价值,但需要外部第三方评测进一步验证。

第三,多阶段系统很强,但归因困难。Seedream 2.0 的能力来自数据、LLM text encoder、Glyph ByT5、SFT、RLHF、PE、Refiner 等多个组件叠加。论文给了部分消融,比如 SeedEdit 的身份保持改进,但没有完整回答每个组件对最终文生图能力的边际贡献。

第四,样张证明能力上限,不证明稳定下限。生成模型产品真正难的是大规模用户 prompt 下的稳定性,包括长尾概念、违规内容、复杂约束、跨语言混写、多轮编辑和连续一致性。论文展示了不少案例,但开放场景稳定性仍然需要真实产品数据来判断。

所以 Rocky 对这篇工作的判断是:它的学术可复现性有限,但工程参考价值很高;它不是一个适合照着复现的开源论文,而是一份值得拆解的商业级图像模型路线图。

如果继续研究/落地,应该关注什么

1. 中文图像模型的护城河,不只是中文 prompt

Seedream 2.0 给出的一个重要启发是:中文图像生成模型的护城河不是“支持中文输入”,而是中文数据、中文知识、中文文字、中文审美和中文产品场景的系统闭环。

如果一个模型只是把中文 prompt 翻译成英文,再交给通用模型生成,它很难真正理解细粒度文化差异。真正的中文能力需要在训练数据、caption、text encoder、reward model、评测集、用户反馈里全链路存在。

2. 文本渲染会成为设计类 AIGC 的关键分水岭

很多图像模型能生成漂亮图,但设计工作流需要文字。海报、电商图、品牌图、菜单、标牌、包装、封面,都要求文字准确、排版自然、风格一致。Seedream 2.0 把 Glyph-Aligned ByT5、文本渲染数据、text-rendering reward model 和专门 benchmark 都放进系统里,说明文字能力已经从“加分项”变成“基础项”。

3. Prompt Engineering 会从个人技巧变成平台能力

论文里的 PE 模块很值得产品团队关注。用户不应该被迫学习复杂 prompt,平台应该理解用户意图、补全风格细节、适配模型分布。未来 AIGC 产品的体验差异,可能越来越不在模型裸能力,而在这些中间层:prompt 改写、任务理解、风格管理、历史偏好、素材约束、失败重试。

4. 编辑能力比生成能力更接近真实生产

文生图适合灵感探索,但真实工作里更多是修改:换背景、保身份、改衣服、调构图、加文字、保品牌元素。SeedEdit 部分说明,图像基础模型的下一步不是只做更强生成,而是迁移到可控编辑。这个方向对商业闭环更重要,因为它更贴近设计师和内容团队的日常迭代。

5. 评测会越来越场景化

Seedream 2.0 用 Bench-240、文本渲染 benchmark、中文文化 benchmark 说明一个趋势:通用 FID/CLIPScore 已经不够用了。模型能力越接近产品场景,评测越要拆到具体任务:数量、空间、材质、文字、人物结构、中文文化、审美偏好、编辑一致性。

术语与概念速查

术语 解释
DiT Diffusion Transformer,把扩散模型主干从 U-Net 转向 Transformer,更适合统一处理图像 token 和文本 token。
MMDiT Multimodal Diffusion Transformer,代表路线之一是 SD3,将图像与文本 token 放在统一注意力结构中建模。
VAE latent 图像先由 VAE 压缩到 latent 空间,扩散模型在 latent 上生成,降低计算成本。
Text Encoder 把 prompt 编码成模型可用的文本特征。Seedream 2.0 使用自研双语 LLM 来增强中文和复杂语义理解。
Glyph-Aligned ByT5 面向字符级 glyph 对齐的 ByT5 模型,用来提升视觉文字渲染的字符准确性。
Scaled RoPE Seedream 2.0 对 2D RoPE 的改造,用 scale factor 改善不同分辨率和长宽比下的位置泛化。
CT Continuing Training,使用更高质量数据继续训练,主要提升审美并保持基础能力。
SFT Supervised Fine-Tuning,通过高质量监督数据把模型进一步对齐到目标风格和能力。
RLHF Reinforcement Learning from Human Feedback,用人类偏好数据训练 reward model,再指导模型优化。
Reward Model 奖励模型,用来给生成结果打分。Seedream 2.0 包括图文对齐、审美和文本渲染等 RM。
Prompt Engineering 这里指平台侧 LLM 自动改写用户 prompt,让 prompt 更符合模型训练分布和审美偏好。
Refiner 后处理/增强模型,将 base model 输出提升到更高分辨率,同时增强细节和纹理。
VQAScore 用视觉问答模型判断图像是否符合文本描述的自动评测指标。
EvalMuse 用于细粒度评估 text-to-image 图文对齐能力的 benchmark/指标体系。
Elo Score 来自成对偏好比较的排名分数,常用于衡量模型在人类偏好下的相对胜率。

拓展思考:值得继续扩展研究与思考的创新点

1. 中文文化知识能否从数据注入走向可解释知识层

Seedream 2.0 通过 taxonomy、多模态检索和中文特色数据补充来增强中文文化能力。但下一步值得研究的是:中文文化知识能否被更结构化地组织?例如,把服饰、建筑、菜系、节日、朝代、地域风格变成可检索、可约束、可评测的知识层,而不是只隐藏在训练数据分布里。

这会影响模型的可控性。如果用户要求“宋代园林,不要明清建筑风格”,模型需要的不只是图像分布,还需要可解释的历史与视觉知识边界。

2. 文本渲染需要从字符准确走向版式智能

Seedream 2.0 已经在中文文字准确率上展示优势,但真实设计场景还需要更强版式智能:标题层级、行距、留白、视觉中心、品牌规范、多语言混排、文字与主体避让、不同媒介尺寸适配。

未来文字渲染模型很可能会和 layout planning、视觉设计 reward model、可编辑矢量/图层输出结合。只生成一张 raster image 还不够,设计师需要能继续编辑的结构化结果。

3. RLHF 多目标优化需要更透明的权重与冲突处理

Seedream 2.0 使用 alignment、aesthetics、text-rendering 等多个 reward model。这里最值得继续研究的是多目标冲突:审美提升可能损害 prompt 准确,文字准确可能牺牲整体构图,结构正确可能让图更保守。如何动态决定 reward 权重,如何按任务类型切换目标,是产品级图像模型的核心问题。

4. PE 模块可以变成用户意图操作系统

论文里的 PE 还主要是 prompt 改写。但如果继续向前,它可以变成更完整的“创作意图操作系统”:识别用户目标、补齐缺失约束、推荐风格、拆解复杂任务、选择生成/编辑/文字渲染/超分链路、自动重试并解释失败原因。

这类系统层能力可能比单模型参数更具产品护城河。因为模型会迭代,工作流会被吸收,但对用户意图和行业场景的理解会沉淀。

5. 开放评测需要覆盖中文真实工作流

Seedream 2.0 提醒我们,中文图像生成评测不能只翻译英文 benchmark。中文用户的真实需求包括中文海报、节日物料、电商详情图、社媒封面、教育插图、品牌视觉、国风但不俗套、特定地域文化、特定行业术语。

未来如果要公平评估中文图像模型,需要一套更开放、更细粒度、更接近真实工作流的中文 benchmark。它不仅要看图片好不好看,还要看是否可商用、可修改、可交付。

最后的判断

Seedream 2.0 这篇报告的价值,不在于它给了一个完全可复现的新算法,也不在于它证明自己在所有公开模型中绝对领先。它真正有价值的地方,是把一个中文图像生成基础模型该怎么做,拆成了一个清晰的系统工程样板。

数据不是附属品,数据是能力来源。文本编码器不是小模块,它决定模型理解世界的语言入口。文字渲染不是炫技,它决定设计场景能不能落地。RLHF 不是论文装饰,它把模型从“能生成”推向“人想用”。Prompt Engineering 不是用户技巧,它会变成平台基础设施。编辑和加速不是后话,它们决定模型能不能进入真实生产。

Rocky认为,Seedream 2.0 的长期意义,是让我们看到中文 AIGC 模型的一条更务实路线:不要只追一个更大的通用模型,而是围绕本土语言、本土文化、本土设计工作流和产品闭环,构建一整套可持续迭代的生成系统。

这也是未来图像生成竞争最本质的变化:从“谁更会画”,走向“谁更懂用户要完成什么”。模型会画,只是入场券;能把语言、文化、审美、编辑、成本和交付串起来,才是真正的基础设施。

推荐阅读

Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法,开发,竞赛,科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:https://zhuanlan.zhihu.com/p/1919046969076195976

2. 深入浅出完整解析扩散模型DDPM、DDIM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

和Rocky一起学习探究扩散模型的本质原理与和核心基础知识,同时不断跟进扩散模型的最新发展。Rocky在本文中对扩散模型的本质做了全面系统的梳理与讲解:https://zhuanlan.zhihu.com/p/1964029619658261252

3、Sora等AI视频大模型的核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用AI视频大模型,从0到1训练自己的AI视频大模型,AI视频大模型性能测评,AI视频领域未来发展等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Sora等AI视频大模型文章地址:https://zhuanlan.zhihu.com/p/706722494

4、Stable Diffusion 3和FLUX.1核心原理,核心基础知识,网络结构,从0到1搭建使用Stable Diffusion 3和FLUX.1进行AI绘画,从0到1上手使用Stable Diffusion 3和FLUX.1训练自己的AI绘画模型,Stable Diffusion 3和FLUX.1性能优化等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion 3和FLUX.1文章地址:https://zhuanlan.zhihu.com/p/684068402

5、Stable Diffusion XL核心基础知识,网络结构,从0到1搭建使用Stable Diffusion XL进行AI绘画,从0到1上手使用Stable Diffusion XL训练自己的AI绘画模型,AI绘画领域的未来发展等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion XL文章地址:https://zhuanlan.zhihu.com/p/643420260

6、Stable Diffusion 1.x-2.x核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用Stable Diffusion进行AI绘画,从0到1上手使用Stable Diffusion训练自己的AI绘画模型,Stable Diffusion性能优化等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion文章地址:https://zhuanlan.zhihu.com/p/632809634

7、ControlNet核心基础知识,核心网络结构,从0到1使用ControlNet进行AI绘画,从0到1训练自己的ControlNet模型,从0到1上手构建ControlNet商业变现应用等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

ControlNet文章地址:https://zhuanlan.zhihu.com/p/660924126

8、LoRA系列模型核心原理,核心基础知识,从0到1使用LoRA模型进行AI绘画,从0到1上手训练自己的LoRA模型,LoRA变体模型介绍,优质LoRA推荐等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

LoRA文章地址:https://zhuanlan.zhihu.com/p/639229126

9、Transformer核心基础知识,核心网络结构,AIGC时代的Transformer新内涵,各AI领域Transformer的应用落地,Transformer未来发展趋势等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Transformer文章地址:https://zhuanlan.zhihu.com/p/709874399

10、最全面的AIGC面经《手把手教你成为AIGC算法工程师,斩获AIGC算法offer!(2024年版)》文章正式发布!

码字不易,欢迎大家多多点赞:

AIGC面经文章地址:https://zhuanlan.zhihu.com/p/651076114

11、50万字大汇总《“三年面试五年模拟”之算法工程师的求职面试“独孤九剑”秘籍》文章正式发布!

码字不易,欢迎大家多多点赞:

算法工程师三年面试五年模拟文章地址:https://zhuanlan.zhihu.com/p/545374303

《三年面试五年模拟》github项目地址(希望大家能多多star):https://github.com/WeThinkIn/Interview-for-Algorithm-Engineer

12、Stable Diffusion WebUI、ComfyUI、Fooocus三大主流AI绘画框架核心知识,从0到1搭建AI绘画框架,从0到1使用AI绘画框架的保姆级教程,深入浅出介绍AI绘画框架的各模块功能,深入浅出介绍AI绘画框架的高阶用法等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

AI绘画框架文章地址:https://zhuanlan.zhihu.com/p/673439761

13、GAN网络核心基础知识,网络架构,GAN经典变体模型,经典应用场景,GAN在AIGC时代的商业应用等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

GAN网络文章地址:https://zhuanlan.zhihu.com/p/663157306

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐