跳转到内容

Qwen-Music — 语义规划 + 声学渲染分离的通用音乐生成

发布日期: 2026-07-14(arXiv 提交) 来源: https://arxiv.org/abs/2607.11699 工程范式: 音乐生成的”分治”路线——将歌曲创作拆解为语义层(LLM 规划旋律与结构)和声学层(渲染器生成高保真波形),Token 化与渲染各自专业化优化。

音乐生成与通用音频生成的一个核心矛盾:歌曲需要在分钟级时间跨度内同时完成歌词、旋律、节奏、人声表演、配器、音乐结构的联合建模。直接端到端生成要么语义连贯性不足,要么声学保真度太低。

Qwen-Music 的解决方案:将语义创作(LLM 在离散 token 空间完成)与声学渲染(DiT + 频谱 VAE + Refiner)彻底分离。 这是一个三层架构:

  1. Qwen-Music-Tokenizer(0.6B Conformer):将音频压缩为 25 Hz 单码本语义 token,保留歌词和旋律信息
  2. Qwen-Music-LLM(3B Dense):自回归预测语义 token,关键创新是 Melody-CoT——先生成旋律计划再生成完整 token 序列
  3. Qwen-Music-Render(1.3B DiT + Spec-VAE + Band-Mode Refiner):将语义 token 渲染为 48 kHz 立体声波形

放弃”单一模型解决所有问题”的优雅假设,接受三层级各自优化的事实复杂性。

Qwen-Music-Tokenizer:四阶段训练配方

Section titled “Qwen-Music-Tokenizer:四阶段训练配方”
阶段目标注意力音频长度初始化
1BestRQ 掩码预测(自监督)双向30s crop随机
2因果适应因果30s crop阶段1
3多任务 SFT(CTC + Mel + chroma)因果全曲(≤300s)阶段2
4VQ 量化因果全曲(≤300s)阶段3

关键洞察:VQ 插入在 24 层 Conformer 的中间层,而非输出层。前端的 25 Hz 编码器 + VQ 产生 375 bit/s 的单码本流,后端的 post-VQ 层和 heads 在推理时丢弃——这保证了 tokenizer 足够轻量以支撑大规模 LLM 训练。

这是该报告最核心的工程创新。

工作流

  1. RMVPE 提取 50 Hz 声乐音高曲线
  2. 8× 中值池化下采样至 6.25 Hz(抑制装饰音、颤音等表演级细节)
  3. 转换为相对 MIDI 表示(全局中位数归一化,丢弃绝对音高寄存器信息)
  4. 映射到 256 词表

训练模式混合

  • 纯 text-to-music 模式:[text, music tokens]
  • 段落级 Melody-CoT:[text, [verse]melody [chorus]melody, music tokens]
  • 唯一段落采样:同类型段落(如多个 chorus)只保留一个代表样本

为什么不是 chromagram:实验发现 chromagram 保留了太多伴奏信息,条件信号过强会削弱模型对全局标签的跟随能力。音高轮廓才是更干净的旋律表示。

Qwen-Music-LLM:品质分级预训练课程

Section titled “Qwen-Music-LLM:品质分级预训练课程”
  • 从 Qwen3.5-Omni 的 3B Dense 变体初始化
  • 训练数据:500万+ 小时多语言音乐,覆盖数百种语言
  • 七级品质分桶(Q1 最优 → Q7 最劣,去除 Q7),按流派归一化避免风格偏置
  • 三阶段课程:Q3-Q6 通用预训练(动态品质采样)→ Q2 Annealing(质量巩固)→ Q1 高质量微调
  1. DiT(1.3B,32层,1024宽,24头):以语义 token + 文本条件(Qwen3-Embedding-0.6B 编码)为条件,通过 conditional flow matching 预测连续声学隐变量
  2. Spec-VAE:2D-conv 架构,48 kHz 立体声 → 192× 压缩至 25 Hz 128维隐变量 → Spec Decoder 重建复数频谱
    • Spec-SnakeBeta:频率感知激活函数——为每个 STFT bin 独立参数化 α 和 β,对数频率初始化
  3. Band-Mode Refiner(ConvNeXt-1D):按频段分治——低频只修相位、中频修幅度+相位、高频只修幅度

三阶段渲染器训练

  • 阶段1:纯重建 Spec-VAE 预训练
  • 阶段2:引入波形域对抗训练(STFT + CQT 判别器)
  • 阶段3:冻结 VAE,只训练 Refiner(波形 + 频谱判别器)

用于渲染器数据筛选的七类检查:元数据编码器溯源、比特率真实性、响度(-25~-5 LUFS)、真假立体声检测、频谱截止分析(噪声基底分离法)

噪声基底感知的截止检测:将频谱截止与噪声基底分别估计——前10%和后10%作为边缘段计算噪声基底,中间段检测带宽截止,两者独立避免误判。

对比竞品Qwen-Music 胜率
vs MiniMax Music 2.5+59.1%
vs MiniMax Music 2.666.7%
vs Mureka V858.3%
vs Suno V555.4%
vs Suno V5.550.3%(微弱优势)

客观指标(SongBench / SongEval / AudioBox-Aesthetic)

Section titled “客观指标(SongBench / SongEval / AudioBox-Aesthetic)”
  • 16 项指标中 13 项最佳
  • 覆盖音乐性、音频质量、指令跟随等多维度
  • 在 Artificial Analysis Music with Vocals Leaderboard 上以 JazzCat 身份参与,排名前三
  • 在 AI 生成参考集上,旋律保留准确率优于 Suno V5.5、Suno V5、MiniMax Cover
  • 在真实流行歌曲参考集上,大多数指标优于 MiniMax Cover
维度Qwen-MusicSuno V5.5MiniMax Music 2.6
架构LLM + DiT + Spec-VAE + Refiner未公开未公开
Tokenizer25 Hz 单码本 Conformer VQ未公开未公开
旋律控制Melody-CoT 显式规划隐式隐式
训练数据500万+ 小时未公开未公开
后训练SFT + DPO + GSPO(三阶段)未公开未公开
渲染器扩散 + 频谱 VAE + 频段精调未公开未公开

与同属阿里系的 Qwen3.5-Omni 对比:Qwen3.5-Omni 是通用多模态模型(文本+图像+音频),Qwen-Music 是专用音乐生成系统——两者共享部分基础技术(如 Qwen3.5-Omni 的 3B 变体作为 LLM 初始化),但 Qwen-Music 在音乐领域做了大量定制化工作。

arXiv 提交仅 1 天,早期关注点:

  • Melody-CoT 的显式规划思路与 Suno/MiniMax 的隐式方法形成鲜明对比
  • 四阶段 tokenizer 训练配方的系统性——比此前音乐 tokenizer 的简单两阶段训练更严谨
  • 盲测中全面超越 MiniMax Music 2.6(66.7% 胜率)是重要信号——MiniMax 曾是该领域的领跑者
  • 三个组件(tokenizer + LLM + renderer)分别优化 vs 端到端单一模型的取舍争论
  1. 语义与声学分离是音乐生成的正确架构模式:LLM 负责长程结构化创作(旋律、歌词、段落安排),渲染器负责高保真波形合成——两者各自专业化优化比联合训练更容易收敛
  2. Melody-CoT 相当于音乐领域的”思维链”:在生成完整序列前先输出中间计划(旋律轮廓),这一思路可推广到其他需要结构化输出的生成任务(如视频合成中的场景序列规划)
  3. 品质分级的预训练课程比单纯丢弃低质量数据更有效:逐步从广泛覆盖过渡到高质量精炼,既保留了数据多样性又保证了最终质量
  4. 四阶段 tokenizer 训练是可靠的模式:自监督预训练(无标签)→ 因果适应(对齐推理模式)→ 多任务监督(注入语义信息)→ VQ 插入(离散化),每一阶段都为下一阶段提供更好的初始化
  5. 频段分治的精调策略(Band-Mode Refiner)是解码器后处理的高效模式:低频对相位敏感、高频对幅度敏感,差异化的处理策略比统一精调更有效
  6. 噪声基底感知的截止检测:将噪声基底和频谱截止分别估计,可以可靠识别”无损容器装 MP3”类欺骗性音频,对训练数据清洗有普适参考价值