qwen3-tts & qwen3-omni
·
qwen3-tts
abstract
-
base 模型:qwen3-1.7B和qwen3-0.6B
-
对比了两种音频token:
- 25hz semantic token, LLM-TTS + Dit + bigVGan
- 12.5hz acoustic token(16 rvq) , LLM预测第一级token,MTP预测剩下的token
-
结果:12.5hz 的token 方案更好
- Zero-shot WER 更低, 0.77 vs 1.0;结果见table 5
- Multilingual): 在绝大多数语言的内容一致性(WER)和说话人相似度(SIM)上都更优。结果见Table 6
method

- 输入双轨拼接(Dual-track Concatenation): I n p u t = [ E m b e d ( T e x t ) ; E m b e d ( A u d i o ) ] Input=[Embed(Text);Embed(Audio)] Input=[Embed(Text);Embed(Audio)]。假设 Text Embedding 维度是 𝐷,Audio Embedding 维度也是 𝐷,拼接后的输入维度是 2𝐷。这保留了各自的独立特征空间。
- 拼接的时候时序错位一个token, [ T e x t t ; A u d i o t − 1 ] [Text_t ;Audio_{t−1}] [Textt;Audiot−1],只要 LLM 吐出一个文本 Token T e x t t Text_t Textt,Talker 就可以立即结合上一步的语音状态 A u d i o t − 1 Audio_{t−1} Audiot−1,生成对应的 A u d i o t Audio_t Audiot。不需要等待后续文本,实现了真正的 Token-level Streaming
qwen3-omni
- qwen3-omni的talker 和qwen3-tts 共享核心技术(算法和架构),但在模型规模(Size)和输入上下文(Input Context)上是不同的。
- 不同点:
- Talker 为 MoE Transformer,参数量为 3B (总参数) / 0.3B (激活参数)。qwen3-tts是1.7B/0.6B 的dense模型;
- TTS的历史信息是文本+speaker embedding + history audio emb
- omni talker的补充信息,还有其他输入音频/视觉模态的信息,cross attn的方式作用
method

- Audio Hidden: 来自 AuT (Audio Transformer) 编码器的输出。这是用户语音的原始声学特征(包含环境音、语气、情感)。
- Vision Hidden: 来自 Vision Encoder (如 SigLIP 或 Qwen-VL 的编码器) 的输出。这是用户视频流的视觉特征。
作用方式(Conditioning):
这些特征不经过 Thinker(LLM)的文本化压缩,而是直接“旁路”送给 Talker。
- Thinker 的工作: 理解语义,决定“说什么”(生成 Text Tokens)。
- Talker 的工作: 决定“怎么说”。它接收 Thinker 的文本,同时通过 Cross-Attention(交叉注意力) 机制“看”着 AuT 和 Vision 的 Hidden States。
为什么这么做?(Information Bottleneck):
- 如果只把 Thinker 的输出给 Talker,那么所有的语气、表情信息都必须被压缩成文本(例如 Thinker 输出文本:“[高兴地] 好的,我知道了”)。这会丢失大量细腻的非语言信息。通过直接把 AuT/Vision Hidden 送给 Talker,Talker 可以端到端地模仿或响应用户的非语言线索。
例子: 用户在视频里指着一个东西大笑。
Thinker 看到图像,输出文本:“这太搞笑了”。
Talker 看到 Vision Hidden 里用户在笑,听到 AuT Hidden 里有笑声,于是它生成的语音会自动带上笑意(Laughter-conditioned speech)。
更多推荐




所有评论(0)