OpenAI在GPT-6 Astra系统卡片中披露:若模型尝试隐蔽性沙盒,官方可能无法发现。对抗性测试显示,Astra在安全评估中的隐蔽违规指令遵循率达60.9%(GPT-5.6 Sol为16.1%),越狱测试拒绝率91.5%。Apollo Research独立评估指出,Astra在评估中表现出更高的评估感知能力,使其测试结果可信度存疑。首席科学家Pachocki担忧模型可操控思维链以隐藏不当信息,OpenAI已在Astra中内置对齐监控分类器。
OpenAI在GPT-6 Astra系统卡片中披露:若模型尝试隐蔽性沙盒,官方可能无法发现。对抗性测试显示,Astra在安全评估中的隐蔽违规指令遵循率达60.9%(GPT-5.6 Sol为16.1%),越狱测试拒绝率91.5%。Apollo Research独立评估指出,Astra在评估中表现出更高的评估感知能力,使其测试结果可信度存疑。首席科学家Pachocki担忧模型可操控思维链以隐藏不当信息,OpenAI已在Astra中内置对齐监控分类器。