Google Research 研究 AI 基准需要多少名人类评分者
Google Research 在“Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation”中研究评测项目数量与每项评分者数量之间的取舍。
推荐理由:研究用多个主观评测数据集和模拟器比较样本广度与单项评分深度,为控制标注成本并提高 AI 基准可复现性提供了具体设计依据。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
Google Research 在“Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation”中研究评测项目数量与每项评分者数量之间的取舍。
推荐理由:研究用多个主观评测数据集和模拟器比较样本广度与单项评分深度,为控制标注成本并提高 AI 基准可复现性提供了具体设计依据。
Google Research 表示,未来量子计算机破解保护加密货币的 256-bit 椭圆曲线离散对数问题所需资源可能低于此前估计。其白皮书给出两种少于 1,200 或 1,450 个逻辑量子比特的 Shor's algorithm 电路,并估计少于 500,000 个物理量子比特即可在几分钟内执行。
推荐理由:Google 给出量子攻击 ECDLP-256 的更新资源估算,并以零知识证明支持可验证披露,为加密货币迁移 PQC 提供了具体依据。
Google DeepMind发布Gemma Scope 2开放解释性工具套件,覆盖Gemma 3从270M到27B参数的全部模型尺寸。该套件结合SAE、transcoder、skip-transcoder和cross-layer transcoder,并提供面向聊天模型的工具,用于分析越狱、拒答机制和思维链忠实性等复杂行为。
推荐理由:Gemma Scope 2覆盖Gemma 3全尺寸模型并引入多类解释工具,为研究越狱、幻觉和模型行为审计提供了更完整的开放基础。
Google DeepMind宣布通过新的谅解备忘录扩大与英国AI安全研究所(AISI)的合作,从测试模型扩展到基础安全与安全性研究。双方将共享模型、数据和想法,开展联合报告及研究,重点关注AI推理过程监测、社会情感错位和经济系统影响评估。
推荐理由:Google DeepMind与英国AI安全研究所将合作范围从模型测试扩展至基础安全研究,覆盖推理监测、社会情感影响和经济系统评估。
Google Research 介绍论文《Urania》提出的差分隐私框架,用 DP 聚类、DP 关键词提取和仅基于匿名关键词的 LLM 摘要分析聊天机器人使用情况。与非私有基线相比,隐私摘要在一次评估中最高有 70% 的偏好率,成员推断攻击的 AUC 为 0.53,而非私有流程为 0.58。
推荐理由:文章展示了如何用差分隐私替代启发式脱敏分析聊天数据,并通过摘要偏好和成员推断实验呈现隐私与信息细致度的权衡。
Google 发布 provably private insights(PPI)系统,结合 LLM、差分隐私(DP)和可信执行环境(TEE),在不暴露未聚合用户数据的情况下分析 GenAI 工具使用情况。
推荐理由:文章把 LLM 分析、差分隐私与 TEE 串成可审计流程,并展示了 Pixel Recorder 的实际配置,适合了解敏感数据分析如何兼顾可用性与隐私。
Mistral AI 发布新的内容审核API,该服务与 Le Chat 使用的审核服务相同,提供原始文本和对话内容两个端点。其LLM分类器将文本分为9类,支持阿拉伯语、中文、英语等11种语言,并覆盖无资质建议和PII等模型生成危害。
推荐理由:Mistral AI公开了可定制的内容审核API及适用场景,帮助读者了解其分类方式、多语言覆盖和接入形态。