Qwen-Music — 语义规划 + 声学渲染分离的通用音乐生成
Qwen-Music 技术报告
Section titled “Qwen-Music 技术报告”发布日期: 2026-07-14(arXiv 提交) 来源: https://arxiv.org/abs/2607.11699 工程范式: 音乐生成的”分治”路线——将歌曲创作拆解为语义层(LLM 规划旋律与结构)和声学层(渲染器生成高保真波形),Token 化与渲染各自专业化优化。
音乐生成与通用音频生成的一个核心矛盾:歌曲需要在分钟级时间跨度内同时完成歌词、旋律、节奏、人声表演、配器、音乐结构的联合建模。直接端到端生成要么语义连贯性不足,要么声学保真度太低。
Qwen-Music 的解决方案:将语义创作(LLM 在离散 token 空间完成)与声学渲染(DiT + 频谱 VAE + Refiner)彻底分离。 这是一个三层架构:
- Qwen-Music-Tokenizer(0.6B Conformer):将音频压缩为 25 Hz 单码本语义 token,保留歌词和旋律信息
- Qwen-Music-LLM(3B Dense):自回归预测语义 token,关键创新是 Melody-CoT——先生成旋律计划再生成完整 token 序列
- Qwen-Music-Render(1.3B DiT + Spec-VAE + Band-Mode Refiner):将语义 token 渲染为 48 kHz 立体声波形
放弃”单一模型解决所有问题”的优雅假设,接受三层级各自优化的事实复杂性。
关键架构决策
Section titled “关键架构决策”Qwen-Music-Tokenizer:四阶段训练配方
Section titled “Qwen-Music-Tokenizer:四阶段训练配方”| 阶段 | 目标 | 注意力 | 音频长度 | 初始化 |
|---|---|---|---|---|
| 1 | BestRQ 掩码预测(自监督) | 双向 | 30s crop | 随机 |
| 2 | 因果适应 | 因果 | 30s crop | 阶段1 |
| 3 | 多任务 SFT(CTC + Mel + chroma) | 因果 | 全曲(≤300s) | 阶段2 |
| 4 | VQ 量化 | 因果 | 全曲(≤300s) | 阶段3 |
关键洞察:VQ 插入在 24 层 Conformer 的中间层,而非输出层。前端的 25 Hz 编码器 + VQ 产生 375 bit/s 的单码本流,后端的 post-VQ 层和 heads 在推理时丢弃——这保证了 tokenizer 足够轻量以支撑大规模 LLM 训练。
Melody-CoT:显式旋律规划
Section titled “Melody-CoT:显式旋律规划”这是该报告最核心的工程创新。
工作流:
- RMVPE 提取 50 Hz 声乐音高曲线
- 8× 中值池化下采样至 6.25 Hz(抑制装饰音、颤音等表演级细节)
- 转换为相对 MIDI 表示(全局中位数归一化,丢弃绝对音高寄存器信息)
- 映射到 256 词表
训练模式混合:
- 纯 text-to-music 模式:
[text, music tokens] - 段落级 Melody-CoT:
[text, [verse]melody [chorus]melody, music tokens] - 唯一段落采样:同类型段落(如多个 chorus)只保留一个代表样本
为什么不是 chromagram:实验发现 chromagram 保留了太多伴奏信息,条件信号过强会削弱模型对全局标签的跟随能力。音高轮廓才是更干净的旋律表示。
Qwen-Music-LLM:品质分级预训练课程
Section titled “Qwen-Music-LLM:品质分级预训练课程”- 从 Qwen3.5-Omni 的 3B Dense 变体初始化
- 训练数据:500万+ 小时多语言音乐,覆盖数百种语言
- 七级品质分桶(Q1 最优 → Q7 最劣,去除 Q7),按流派归一化避免风格偏置
- 三阶段课程:Q3-Q6 通用预训练(动态品质采样)→ Q2 Annealing(质量巩固)→ Q1 高质量微调
Qwen-Music-Render:三阶段神经渲染
Section titled “Qwen-Music-Render:三阶段神经渲染”- DiT(1.3B,32层,1024宽,24头):以语义 token + 文本条件(Qwen3-Embedding-0.6B 编码)为条件,通过 conditional flow matching 预测连续声学隐变量
- Spec-VAE:2D-conv 架构,48 kHz 立体声 → 192× 压缩至 25 Hz 128维隐变量 → Spec Decoder 重建复数频谱
- Spec-SnakeBeta:频率感知激活函数——为每个 STFT bin 独立参数化 α 和 β,对数频率初始化
- Band-Mode Refiner(ConvNeXt-1D):按频段分治——低频只修相位、中频修幅度+相位、高频只修幅度
三阶段渲染器训练:
- 阶段1:纯重建 Spec-VAE 预训练
- 阶段2:引入波形域对抗训练(STFT + CQT 判别器)
- 阶段3:冻结 VAE,只训练 Refiner(波形 + 频谱判别器)
音频质量管线
Section titled “音频质量管线”用于渲染器数据筛选的七类检查:元数据编码器溯源、比特率真实性、响度(-25~-5 LUFS)、真假立体声检测、频谱截止分析(噪声基底分离法)
噪声基底感知的截止检测:将频谱截止与噪声基底分别估计——前10%和后10%作为边缘段计算噪声基底,中间段检测带宽截止,两者独立避免误判。
盲测 A/B 偏好(专业评审)
Section titled “盲测 A/B 偏好(专业评审)”| 对比竞品 | Qwen-Music 胜率 |
|---|---|
| vs MiniMax Music 2.5+ | 59.1% |
| vs MiniMax Music 2.6 | 66.7% |
| vs Mureka V8 | 58.3% |
| vs Suno V5 | 55.4% |
| vs Suno V5.5 | 50.3%(微弱优势) |
客观指标(SongBench / SongEval / AudioBox-Aesthetic)
Section titled “客观指标(SongBench / SongEval / AudioBox-Aesthetic)”- 16 项指标中 13 项最佳
- 覆盖音乐性、音频质量、指令跟随等多维度
- 在 Artificial Analysis Music with Vocals Leaderboard 上以 JazzCat 身份参与,排名前三
- 在 AI 生成参考集上,旋律保留准确率优于 Suno V5.5、Suno V5、MiniMax Cover
- 在真实流行歌曲参考集上,大多数指标优于 MiniMax Cover
| 维度 | Qwen-Music | Suno V5.5 | MiniMax Music 2.6 |
|---|---|---|---|
| 架构 | LLM + DiT + Spec-VAE + Refiner | 未公开 | 未公开 |
| Tokenizer | 25 Hz 单码本 Conformer VQ | 未公开 | 未公开 |
| 旋律控制 | Melody-CoT 显式规划 | 隐式 | 隐式 |
| 训练数据 | 500万+ 小时 | 未公开 | 未公开 |
| 后训练 | SFT + DPO + GSPO(三阶段) | 未公开 | 未公开 |
| 渲染器 | 扩散 + 频谱 VAE + 频段精调 | 未公开 | 未公开 |
与同属阿里系的 Qwen3.5-Omni 对比:Qwen3.5-Omni 是通用多模态模型(文本+图像+音频),Qwen-Music 是专用音乐生成系统——两者共享部分基础技术(如 Qwen3.5-Omni 的 3B 变体作为 LLM 初始化),但 Qwen-Music 在音乐领域做了大量定制化工作。
arXiv 提交仅 1 天,早期关注点:
- Melody-CoT 的显式规划思路与 Suno/MiniMax 的隐式方法形成鲜明对比
- 四阶段 tokenizer 训练配方的系统性——比此前音乐 tokenizer 的简单两阶段训练更严谨
- 盲测中全面超越 MiniMax Music 2.6(66.7% 胜率)是重要信号——MiniMax 曾是该领域的领跑者
- 三个组件(tokenizer + LLM + renderer)分别优化 vs 端到端单一模型的取舍争论
可复用的工程经验
Section titled “可复用的工程经验”- 语义与声学分离是音乐生成的正确架构模式:LLM 负责长程结构化创作(旋律、歌词、段落安排),渲染器负责高保真波形合成——两者各自专业化优化比联合训练更容易收敛
- Melody-CoT 相当于音乐领域的”思维链”:在生成完整序列前先输出中间计划(旋律轮廓),这一思路可推广到其他需要结构化输出的生成任务(如视频合成中的场景序列规划)
- 品质分级的预训练课程比单纯丢弃低质量数据更有效:逐步从广泛覆盖过渡到高质量精炼,既保留了数据多样性又保证了最终质量
- 四阶段 tokenizer 训练是可靠的模式:自监督预训练(无标签)→ 因果适应(对齐推理模式)→ 多任务监督(注入语义信息)→ VQ 插入(离散化),每一阶段都为下一阶段提供更好的初始化
- 频段分治的精调策略(Band-Mode Refiner)是解码器后处理的高效模式:低频对相位敏感、高频对幅度敏感,差异化的处理策略比统一精调更有效
- 噪声基底感知的截止检测:将噪声基底和频谱截止分别估计,可以可靠识别”无损容器装 MP3”类欺骗性音频,对训练数据清洗有普适参考价值