🔬 AI安全|Anthropic推出自动化对齐研究系统,成本从150美元/时降至4美元
2026年8月,Anthropic发布了一套自动化对齐研究人员系统,可在无人工干预的情况下修复模型对齐失败问题,研究成本从人类专家的150美元/小时降至仅4美元/小时。
⚙️ 系统工作原理
- 自动搜索学术文献,提出解决方案
- 每30分钟一个迭代周期进行模型微调
- 在10个基准测试中匹配或超越人类对齐团队表现
- 平均完成时间:6小时
🧠 研究负责人
该项目由Anthropic研究员Chen Yueh-Han主导,代表了AI安全研究范式的一次重大转变——用AI研究AI安全性。
来源:The AI Brief · 2026-08-29