8月28日,Anthropic发布研究报告称,其开发的自动化对齐研究员系统在十类AI对齐失败场景下均超越人类专家基线,弱模型对齐强模型效率较生产流程高出约1.5万倍。
#f5f5f5; padding:12px 16px; border-radius:8px; font-size:14px; color:#555;">关键数据:研究成本从人类专家150美元/小时降至4美元/小时,每30分钟迭代一次,平均6小时即可匹配或超越人类团队,最佳欺骗场景方法比人类优20%。
需要注意的是,虽然系统能自动搜索文献、提出方案并微调模型,但对齐方向仍由人类设定。这标志着AI安全研究正向自动化方向迈进,但仍需人类监督。
#888; font-size:13px; margin-top:20px; border-top:1px solid#eee; padding-top:12px;">来源:腾讯新闻 / Anthropic · 2026-08-30