Qwen2.5 — 数据质量驱动的模型升级
Qwen2.5: 数据质量驱动的模型升级
Section titled “Qwen2.5: 数据质量驱动的模型升级”发布日期: 2024-12 (arXiv 2412.15115) 来源: arXiv 2412.15115 工程范式: 数据质量优先——预训练数据从 7T 扩展到 18T tokens,SFT 样本超 100 万,72B-Instruct 以 1/5 参数超越 Llama-3-405B-Instruct。
Qwen2.5 的核心驱动力是数据质量的系统性提升——更大(7T→18T tokens)、更干净(模型驱动的多维过滤)、更平衡(领域级数据混合优化)。团队相信在合理的架构下,数据质量是模型能力提升的最大杠杆。72B-Instruct 以 Llama-3-405B 1/5 的参数实现超越,验证了这一假设。
关键架构决策
Section titled “关键架构决策”预训练数据(18T tokens)
Section titled “预训练数据(18T tokens)”- 7T → 18T tokens(2.57× 扩展)
- 多维质量过滤:Qwen2-Instruct 模型作为质量过滤器
- 更优的数学和代码数据:整合 Qwen2.5-Math 和 Qwen2.5-Coder 数据
- 合成数据:Qwen2-72B-Instruct + Qwen2-Math-72B-Instruct 生成
- 智能数据混合:Qwen2-Instruct 分类和平衡领域分布
- 降采样过度代表领域(电商、社交媒体、娱乐)
- 升采样高价值领域(技术、科学、学术研究)
架构(继承 Qwen2)
Section titled “架构(继承 Qwen2)”- GQA、SwiGLU、RoPE、Pre-RMSNorm
- 上下文:预训练 4,096 → 扩展至 32,768 tokens(YARN 可达 131K)
- MoE 模型(API 专有):Qwen2.5-Turbo(≈GPT-4o-mini)和 Qwen2.5-Plus(≈GPT-4o)
- Turbo 支持 1M tokens 上下文
超参数缩放法则
Section titled “超参数缩放法则”- 针对 44M 到 14B(密集)和 44M 到 1B 激活(MoE)学习最优 LR 和 batch size
- 用于预测最终 loss 并指导超参数配置
后训练(超 100 万样本)
Section titled “后训练(超 100 万样本)”- SFT:长序列(输出 8K tokens)、数学 CoT、编码(40+ 语言)、指令遵循、结构化数据、逻辑推理(70K 新查询)
- 离线 DPO:关注推理密集型任务
- 在线 GRPO:针对数学和编码的持续优化
- 最终输出长度从 2K 扩展到 8K tokens
Qwen2.5-72B-Instruct vs Llama-3-405B-Instruct
Section titled “Qwen2.5-72B-Instruct vs Llama-3-405B-Instruct”- 以 1/5 的参数超越 5× 更大的模型
- 在多个基准上表现更优
- 验证了数据质量可以弥补模型规模差距
- 生成长度:2K → 8K tokens
- Qwen2.5-Turbo:1M tokens 上下文
- 其他模型:131,072 tokens(YARN + DCA)
专业模型基座
Section titled “专业模型基座”- 作为 Qwen2.5-Math、Qwen2.5-Coder、QwQ 的基础
- 证明了基础模型质量对专业模型上限的决定性影响
vs Llama-3-405B(Meta,5× 更大密集模型),Qwen2.5-72B 以数据质量弥补参数差距。vs 前代 Qwen2(72B),Qwen2.5 的预训练数据 2.57× 扩展带来全面提升。vs DeepSeek-V3(671B MoE),Qwen2.5 的密集旗舰以更小参数在中英文场景中竞争。核心洞察:数据质量是参数缩放之外的第二条独立缩放轴。
可复用的工程经验
Section titled “可复用的工程经验”- 数据质量是一个系统工程——需要多维度过滤、合成数据生成、领域平衡的完整管线
- 模型驱动的数据过滤(用 Qwen2-Instruct 过滤数据)比规则过滤更有效
- 超参数缩放法则可以避免大规模试错成本
- 18T 高质量数据 + 好架构可以弥补 5× 的参数差距
- GRPO(在线 RL)比离线 DPO 更适合数学和编码的持续优化
- SFT 数据的 8K 长输出训练是模型支持长程生成的关键