Google DeepMind·· 2026-08-27精选AI 评分77
Google DeepMind 试点全球首个专有前沿模型双盲 AI 评测
Piloting the world's first double-blind AI evaluations
AI 导读
Google DeepMind 宣布试点针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学“盒子”中,避免模型提前接触测试内容并据此优化。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中使用机密基准测试 Gemini Flash Lite,以降低基准污染对评测完整性的影响。
推荐理由
文章介绍了将外部评测置于密码学环境中的双盲方案,回应了基准污染对模型能力与安全评估可信度的影响。
来源:Google DeepMind · deepmind.google