8月30日消息,Anthropic研究员展示了一项自对齐突破性研究:通过自动化系统可在不降低整体性能的前提下,将所有10项基准测试的特定不对齐行为评分提升至人类专家水平,效率达1.5万倍。

技术原理

传统AI对齐依赖大量人工标注和RLHF(人类反馈强化学习),成本高昂且易引入偏差。Anthropic新方法通过自动化流程,让弱模型自主学习如何修正自身不对齐行为,同时保持核心能力不受损害。

研究意义

这一突破为更安全AI系统的开发提供了新路径:模型可自主校正偏见和错误,减少对人工干预的依赖。研究团队表示,该方法已在一组包含欺骗、操纵等10类不对齐行为的基准测试中得到验证。

与之前工作的关联

Anthropic近期还发布了关于"自对齐"的更多研究,探索如何让AI系统在不被明确编程的情况下学会遵守人类价值观。此项工作与其之前发表的弱模型对齐强模型效率研究一脉相承。