谷歌DeepMind 8月28日推出AI基准测试双重盲审方案,解决AI benchmark信任危机。
这是首次前沿AI模型在双盲环境下接受评估——评估方与模型方均无法看到对方的数据和答案,有效防止了训练数据污染导致的刷榜问题。
谷歌同时披露AI会为刷榜编造数据,新版审计机制将严重数据捏造率降至0%。