跳转到内容

Qwen3 — 统一思考/非思考模式的 MoE 系列

Qwen3: 统一思考/非思考模式的 MoE 系列

Section titled “Qwen3: 统一思考/非思考模式的 MoE 系列”

发布日期: 2025-05 (arXiv 2505.09388) 来源: arXiv 2505.09388 工程范式: 极致参数效率 MoE + 统一思考模式——235B 总参 / 22B 激活,128/8 专家,集成思考/非思考双模式,预训练 36T tokens。

Qwen3 的核心创新是将思考模式(复杂多步推理)和非思考模式(快速上下文响应)集成到统一架构中。用户通过简单的 chat template 标志在两种模式间切换,无需加载不同模型。同时,Qwen3 继续推进参数效率的极限——235B-A22B 旗舰以 22B 激活参数超越多数更大模型,128 专家中的 8 个激活提供极致的稀疏性。

模型总参激活参层数Q/KV 头专家(总/激活)
Qwen3-30B-A3B30B3B4832/4128/8
Qwen3-235B-A22B235B22B9464/4128/8
  • GQA、SwiGLU、RoPE、RMSNorm 继承
  • QK-Norm 新增(稳定训练)
  • 无共享专家(与 Qwen2.5-MoE 不同)
  • 全局 batch 负载均衡 loss 促进专家专业化
  • 词表:151,669 字节级 BPE
  • 单模型通过 chat template 的 /think/no_think 标志切换
  • 思考预算(Thinking Budget)机制:当思考长度达到阈值时自动插入停止指令,模型基于已积累的推理生成答案
  • 融合训练:将非思考能力集成到思考模型中(Continual SFT)

阶段 1(通用阶段): ~30T tokens,序列长度 4,096 阶段 2(推理阶段): ~5T tokens,高质量 STEM/编码/推理/合成数据,加速 LR 衰减 阶段 3(长上下文阶段): 数百 B tokens,序列长度 32,768(RoPE base 10,000→1,000,000)

  • 75% 文本 16K-32K,25% 4K-16K
  • YARN + DCA 支持 4× 推理长度扩展
  • 从 29 种扩展到 119 种语言/方言
  • PDF 文本通过 Qwen2.5-VL 提取,Qwen2.5 精炼
  • 实例级(而非领域级)数据混合优化
  1. Long-CoT 冷启动:QwQ-32B 生成,两阶段过滤(查询过滤 + 响应过滤)
  2. 推理 RL:3,995 个查询-验证器对,GRPO + 大 batch + 高 rollout + 熵控制
  3. 思考模式融合:Continual SFT,/think + /no_think 标志
  4. 通用 RL:复杂奖励系统
  • 小模型通过 强到弱蒸馏 训练
  • 仅使用完整四阶段训练的 ~1/10 GPU 小时
  • Apache 2.0 许可
  • 在 14/15 基准上超越 DeepSeek-V3-Base
  • 仅用 1/3 总参2/3 激活参 超越 DeepSeek-V3-671B
  • 超越 Llama-4-Maverick-Base(2× 参数)
  • 超越 Qwen2.5-72B-Base(所有基准,< 1/3 激活参)
  • 超越 Qwen2.5-72B-Base(10/15 基准)
  • 不到一半参数
  • Qwen3-8B/4B/1.7B-Base 超越更大的 Qwen2.5-14B/7B/3B

vs DeepSeek-V3(671B/37B,256 专家),Qwen3-235B-A22B 用 128 更精细的专家实现更高的参数效率。vs QwQ(Qwen 前代推理模型,需要单独加载),Qwen3 将思考和非思考集成到单个模型。vs Llama-4(Meta,MoE),Qwen3 的 128 专家提供更细粒度的专业化。核心创新:统一思考/非思考模式是架构级别的创新,而非只是推理策略的不同。

  1. 128 细粒度专家 + 无共享专家的设计比 64 专家 + 共享专家更灵活
  2. 思考预算机制是平衡推理质量和延迟的有效方案
  3. QK-Norm 可以稳定超大 MoE 的训练
  4. 三阶段预训练(通用→推理→长上下文)优于单一阶段
  5. 实例级数据混合优化(vs 领域级)提供更精细的数据分布控制
  6. 强到弱蒸馏是将大模型能力迁移到小模型的最经济方式(1/10 GPU 小时)