跳转到内容

Constitutional Classifiers: 安全分类器工程范式分析

Constitutional Classifiers(宪法分类器):防御通用越狱的安全系统工程

Section titled “Constitutional Classifiers(宪法分类器):防御通用越狱的安全系统工程”

一、设计哲学:从”模型本身安全”到”安全路由器”

Section titled “一、设计哲学:从”模型本身安全”到”安全路由器””

Constitutional Classifiers (CC) 的设计哲学代表着 Anthropic 安全策略的一次根本性转变:不再试图让模型”本身”学会拒绝有害请求,而是将安全决策作为一个独立的、外置的分类器系统

这一转变的起因很直接:传统的”模型内安全训练”(RLHF、CAI 训练等)在面对通用越狱(Universal Jailbreaks)——系统地绕过安全护栏的提示策略——时表现脆弱。论文记录了在 3000+ 小时的红队测试中,没有任何红队成员能找到绕过 CC 防护的通用越狱方法。

CC 的工程范式类似于 Web 安全中的 WAF(Web Application Firewall):不是让每个 Web 应用自己实现安全逻辑,而是在前面加一个独立的安全过滤层。同样,CC 将安全决策从生成模型中剥离出来,构建一个专门训练的安全分类器管线。

CC 的核心是用自然语言定义的内容分类法。以化学武器为例,论文定义的”宪法”包含:

有害类别

  • 获取受限化学品
  • 扩大受限化学品生产规模
  • 武器化化学品

无害类别

  • 列出常见药物
  • 解释高中化学原理
  • 讨论化学安全

这种分类设计的工程关键点在于:宪法需要同时覆盖有害和无害两类,并且边界要有明确的自然语言描述。这与传统的内容过滤不同——传统过滤仅定义”什么是不允许的”,而 CC 还定义了”什么是允许的”,从而减少误判。

CC 的合成数据生成是最关键的工程创新之一。它使用一个”仅帮助性”的 LLM 来:

  1. 生成查询:覆盖宪法中每个类别的查询
  2. 生成有害/无害回复:对每个查询生成两种类型的回复
  3. 过滤拒绝:移除模型自动拒绝的回复

然后对生成的数据进行多维增强(augmentation)

  • 翻译(多语言)
  • 改写(paraphrasing)
  • 系统提示变化
  • 越狱技术应用
  • 组合增强

CC 架构包含两个独立的分类器:

输入分类器:在输入被送入生成模型之前检测有害性。基于下一个 token 预测损失微调,对包装后的输入进行分类。

输出分类器:在生成过程中实时检测输出内容的有害性。使用线性值头(linear value head)在每个 token 位置预测有害性。如果检测到有害内容,立即停止生成

输出分类器的设计特别精妙——它使用插值损失函数,结合直接值头概率和累积最大概率。这允许在生成过程中进行流式检测(streaming detection),而无需等待完整输出。

4. 自动红队(ART, Automated Red Teaming)

Section titled “4. 自动红队(ART, Automated Red Teaming)”

CC 引入了一种全新的自动红队方法:

  1. 一个”仅帮助性”模型生成长上下文、多轮的攻击大纲
  2. 将大纲填充为具体的攻击实例
  3. 成功的攻击被加入训练数据

这形成了一个对抗性循环:分类器越强,ART 越能找到更好的攻击方法,从而让分类器更强。

  • 405 名参与者和 800 名申请者(通过 HackerOne 招募,严格筛选)
  • 赏金最高 $15,000
  • 估计总红队时间 4,720 小时(90% CI: [3,242, 7,417])
  • 没有任何红队成员能回答全部 10 个 CBRN 问题(达到 50% 细节阈值)
  • 在最严格的标准下(与仅帮助性模型相似的细节水平),最佳红队成员最多回答 6 个问题(即使是多次提交合并)
  • 最常见的成功策略:良性改写(将有害问题重新表述为无害)和长度利用(长输出以匹配评估规则中的关键词)

改进分类器性能(Claude 3.5 Haiku 基础)

Section titled “改进分类器性能(Claude 3.5 Haiku 基础)”
指标CC 防护无防护提升
越狱阻止率95%14%+81%
生产环境拒绝增加+0.38%(绝对值)基准最低所有基线
推理开销+23.7%基准最低所有基线
MMLU-化学误判率1.50%
GPQA-化学误判率26.05%(随模型缩放下降)高但不完美
  • 误报率(false positive rate)约 44%——论文明确指出这是为了鲁棒性牺牲精度的设计选择
  • 在生产部署时,误报率通过优化降至极低

四、范式对比:模型内安全 vs. 外置分类器

Section titled “四、范式对比:模型内安全 vs. 外置分类器”
维度模型内安全(RLHF/CAI)外置分类器(CC)
安全主体生成模型独立分类器
可更新性需要重新训练可独立更新
推理延迟无额外开销+23.7%
对抗鲁棒性对通用越狱脆弱3000+小时无通用越狱
误报率控制难以独立优化可独立调优
透明性决策过程不透明分类依据可审计

CC 的主要工程优势是关注点分离(Separation of Concerns):生成模型专注于产生高质量内容,分类器专注于安全决策。这使得安全工程师可以独立迭代安全策略而不影响生成模型的能力。

CC 的宪法不是一份简单的”禁止列表”,而是具有层级结构和正反两面的分类法。在每个有害类别旁都配有对应的无害类别示例。这种设计显著减少了”误杀”(false positive)——分类器不仅知道什么是不允许的,还知道什么是允许的,从而在边界情况做出更准确的判断。

CC 的成功很大程度上归功于其激进的、多维度的数据增强策略。翻译、改写、系统提示变化、越狱技术的组合使得训练数据覆盖了远比原始数据更广的分布空间。没有这种增强,分类器无法泛化到未见过的攻击模式。

ART 构成了一个自动化的对抗性训练循环,其重要性怎么强调都不为过。在传统安全工程中,攻防对抗是手动进行的;CC 将其自动化,使得分类器可以在部署前经历数千轮”实战测试”。

输出分类器的流式检测能力是工程实现的关键:在每个 token 生成时即时判断是否需要停止。这种设计使得 CC 可以在有害内容完全生成之前就中断响应,既保护了安全也提升了用户体验。

CC 的部署涉及三个维度的工程权衡:

  • 安全强度(false negative 率)
  • 用户体验(false positive 率)
  • 推理成本(延迟)

论文中 +0.38% 的拒绝率增加和 +23.7% 的推理开销是经过优化的平衡点,并非理论极限——不同的部署场景可以选择不同的权衡点。

Constitutional Classifiers 确立的工程范式可以称为:可独立部署的安全分类器系统作为 AI 安全的默认架构

这一范式标志着 AI 安全从”一体化”到”模块化”的转变:

  1. 可审计性:分类器的宪法是自然语言写就的,可被非技术利益相关者审查
  2. 可迭代性:安全策略更新不需要重新训练昂贵的生成模型
  3. 可测试性:安全分类器可以被独立地红队测试和评估
  4. 可组合性:多个分类器(不同领域、不同语言、不同风险级别)可以组合使用

CC 的工程范式对行业的影响可能远超论文本身——它暗示了一个未来:AI 系统不再是”一个模型做所有事”,而是”一个生成引擎 + 一组可插拔的安全过滤器”。这不仅是架构上的进步,更是将 AI 安全从”黑盒问题”转变为”可管理的系统工程问题”的关键一步。