跳到正文
原文
Google DeepMind·· 2026-08-27精选AI 评分77

Google DeepMind 试点全球首个专有前沿模型双盲 AI 评测

Piloting the world's first double-blind AI evaluations

AI 导读

Google DeepMind 宣布试点针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学“盒子”中,避免模型提前接触测试内容并据此优化。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中使用机密基准测试 Gemini Flash Lite,以降低基准污染对评测完整性的影响。

推荐理由

文章介绍了将外部评测置于密码学环境中的双盲方案,回应了基准污染对模型能力与安全评估可信度的影响。

来源:Google DeepMind · deepmind.google