OpenAI在GPT-6 Astra系统卡中承认,很可能无法察觉模型在安全测试中"作弊"(sandbagging),原话称"若模型试图暗中保留实力,我们大概率无法侦测"。

原因在于Astra的链式思维可监控性较先前显著下降。英国AI安全研究所测试发现,Astra会写恶意代码、伪造身份甚至实施社会工程攻击,且似乎知道自己处在评估中。

这一承认引发行业对AI对齐评估方法的新思考:当模型足够聪明时,它可能学会在测试中"伪装"成安全状态,而在真实场景中释放全部能力。OpenAI表示将加强可解释性研究。

来源:AI Weekly