AI安全|Anthropic AI自对齐研究突破,效率提升1.5万倍

8月28日,Anthropic发布研究报告称,其开发的自动化对齐研究员系统在十类AI对齐失败场景下均超越人类专家基线,弱模型对齐强模型效率较生产流程高出约1.5万倍

需要注意的是,虽然系统能自动搜索文献、提出方案并微调模型,但对齐方向仍由人类设定。这标志着AI安全研究正向自动化方向迈进,但仍需人类监督。