Qwen3 — 统一思考/非思考模式的 MoE 系列
Qwen3: 统一思考/非思考模式的 MoE 系列
Section titled “Qwen3: 统一思考/非思考模式的 MoE 系列”发布日期: 2025-05 (arXiv 2505.09388) 来源: arXiv 2505.09388 工程范式: 极致参数效率 MoE + 统一思考模式——235B 总参 / 22B 激活,128/8 专家,集成思考/非思考双模式,预训练 36T tokens。
Qwen3 的核心创新是将思考模式(复杂多步推理)和非思考模式(快速上下文响应)集成到统一架构中。用户通过简单的 chat template 标志在两种模式间切换,无需加载不同模型。同时,Qwen3 继续推进参数效率的极限——235B-A22B 旗舰以 22B 激活参数超越多数更大模型,128 专家中的 8 个激活提供极致的稀疏性。
关键架构决策
Section titled “关键架构决策”MoE 架构
Section titled “MoE 架构”| 模型 | 总参 | 激活参 | 层数 | Q/KV 头 | 专家(总/激活) |
|---|---|---|---|---|---|
| Qwen3-30B-A3B | 30B | 3B | 48 | 32/4 | 128/8 |
| Qwen3-235B-A22B | 235B | 22B | 94 | 64/4 | 128/8 |
- GQA、SwiGLU、RoPE、RMSNorm 继承
- QK-Norm 新增(稳定训练)
- 无共享专家(与 Qwen2.5-MoE 不同)
- 全局 batch 负载均衡 loss 促进专家专业化
- 词表:151,669 字节级 BPE
统一思考/非思考模式
Section titled “统一思考/非思考模式”- 单模型通过 chat template 的
/think和/no_think标志切换 - 思考预算(Thinking Budget)机制:当思考长度达到阈值时自动插入停止指令,模型基于已积累的推理生成答案
- 融合训练:将非思考能力集成到思考模型中(Continual SFT)
三阶段预训练(36T tokens)
Section titled “三阶段预训练(36T tokens)”阶段 1(通用阶段): ~30T tokens,序列长度 4,096 阶段 2(推理阶段): ~5T tokens,高质量 STEM/编码/推理/合成数据,加速 LR 衰减 阶段 3(长上下文阶段): 数百 B tokens,序列长度 32,768(RoPE base 10,000→1,000,000)
- 75% 文本 16K-32K,25% 4K-16K
- YARN + DCA 支持 4× 推理长度扩展
119 种语言
Section titled “119 种语言”- 从 29 种扩展到 119 种语言/方言
- PDF 文本通过 Qwen2.5-VL 提取,Qwen2.5 精炼
- 实例级(而非领域级)数据混合优化
四阶段后训练(旗舰模型)
Section titled “四阶段后训练(旗舰模型)”- Long-CoT 冷启动:QwQ-32B 生成,两阶段过滤(查询过滤 + 响应过滤)
- 推理 RL:3,995 个查询-验证器对,GRPO + 大 batch + 高 rollout + 熵控制
- 思考模式融合:Continual SFT,
/think+/no_think标志 - 通用 RL:复杂奖励系统
- 小模型通过 强到弱蒸馏 训练
- 仅使用完整四阶段训练的 ~1/10 GPU 小时
- Apache 2.0 许可
Qwen3-235B-A22B-Base 性能
Section titled “Qwen3-235B-A22B-Base 性能”- 在 14/15 基准上超越 DeepSeek-V3-Base
- 仅用 1/3 总参 和 2/3 激活参 超越 DeepSeek-V3-671B
- 超越 Llama-4-Maverick-Base(2× 参数)
- 超越 Qwen2.5-72B-Base(所有基准,< 1/3 激活参)
Qwen3-32B-Base
Section titled “Qwen3-32B-Base”- 超越 Qwen2.5-72B-Base(10/15 基准)
- 不到一半参数
- Qwen3-8B/4B/1.7B-Base 超越更大的 Qwen2.5-14B/7B/3B
vs DeepSeek-V3(671B/37B,256 专家),Qwen3-235B-A22B 用 128 更精细的专家实现更高的参数效率。vs QwQ(Qwen 前代推理模型,需要单独加载),Qwen3 将思考和非思考集成到单个模型。vs Llama-4(Meta,MoE),Qwen3 的 128 专家提供更细粒度的专业化。核心创新:统一思考/非思考模式是架构级别的创新,而非只是推理策略的不同。
可复用的工程经验
Section titled “可复用的工程经验”- 128 细粒度专家 + 无共享专家的设计比 64 专家 + 共享专家更灵活
- 思考预算机制是平衡推理质量和延迟的有效方案
- QK-Norm 可以稳定超大 MoE 的训练
- 三阶段预训练(通用→推理→长上下文)优于单一阶段
- 实例级数据混合优化(vs 领域级)提供更精细的数据分布控制
- 强到弱蒸馏是将大模型能力迁移到小模型的最经济方式(1/10 GPU 小时)