跳到正文

#安全/对齐

今日 0 条
9月30日周三
  1. Ars Technica · AI77

    Google DeepMind 用 SynthIDBio 为 AI 设计蛋白质添加水印

    Google DeepMind 在 Nature 发表研究,提出 SynthIDBio,可在 ProteinMPNN 设计蛋白质时嵌入分布式水印,同时保持蛋白质与目标蛋白结合的功能。

    推荐理由:论文展示了 SynthIDBio 如何在不损害蛋白质功能的前提下嵌入可检测水印,为筛查来源不明的 AI 设计蛋白提供了具体思路。

9月29日周二
  1. Hugging Face Blog66

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 面向使用 MCP 多工具的 LLM 智能体,逐条检查回答中的事实是否由回答所指向的正确来源支持,而不是只判断事实是否存在于汇总证据中。

    推荐理由:论文展示了在 MCP 多源场景中保留来源身份的验证方法,并用医疗智能体数据说明它如何减少错引来源,同时暴露相似来源区分的难点。

9月21日周一
  1. MIT Technology Review · AI82

    MIT Technology Review 如何绘制美国边境“虚拟墙”死亡地图

    MIT Technology Review 通过15个月调查,绘制了美国与墨西哥边境监控塔附近死亡事件的综合地图,并分析监控塔是否在相关人员死亡时已部署且可能覆盖现场。调查整合了近4,000起案件、监控塔位置和卫星影像,使用地形分析估算视线是否可能受阻;文章也说明了记录不完整、死亡时间和塔的实际运行状态难以确认等限制。

    推荐理由:文章系统拆解了如何整合死亡记录、监控塔位置与卫星影像,并明确说明数据缺口和分析边界,为调查型数据项目提供了可复用的方法参考。

9月2日周三
  1. Hugging Face Blog69

    BenchMIRT:LLM 基准测试究竟测量了什么?

    Allen Institute 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试的方法。它基于 100 个 LLM、16 个基准和超过 34K 道题的结果,独立识别出安全与通用推理两个主要维度,并发现 BBQ、WMDP 等基准的得分可能混合了不同能力信号。

    推荐理由:BenchMIRT 将多维 IRT 应用于 100 个 LLM 和 34K 多道题,展示了如何拆解基准分数中的推理与安全信号。

7月1日周三
  1. Berkeley AI Research26

    2026 BAIR 博士毕业生展示

    Berkeley Artificial Intelligence Research(BAIR)公布 2026 届博士毕业生展示,研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science and healthcare 等方向。

6月11日周四
  1. Google Research66

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用于更灵敏地审计差分隐私和机器遗忘。该框架通过相对三样本检验,判断未学习模型更接近安全重训模型还是原始模型,并在 SVT3 隐私机制中用几千个样本检测违规,而既有方法需要 millions 个样本。

    推荐理由:这项工作把机器遗忘审计从简单的两样本比较转向相对三样本检验,并展示了更少样本和更少调参下识别隐私违规的方法。

5月28日周四
  1. Google Research75

    Google 介绍基于零信任聚合的私密分析方案

    Google 介绍了一种用于私密分析的零信任聚合方案,将一次性消息的格基加密协议与 TEE 结合,使设备无需参与多轮交互即可提交数据。该方案确保服务器只能获得匿名聚合结果,并将用于 Android SafetyCore,通过聚合元数据评估端侧安全模型的效果,同时保持用户内容留在设备上。

    推荐理由:文章解释了 Google 如何把一次性加密聚合与 TEE 结合,在降低设备在线要求的同时减少对单一硬件防护的依赖。

4月3日周五
  1. Google Research68

    Google Research 评估大语言模型行为倾向与人类的对齐程度

    Google Research 提出一套评估大语言模型行为倾向对齐程度的框架,将心理问卷改编为现实场景中的情境判断测试,并比较 25 个 LLM 与 550 名参与者的偏好分布。结果显示,小于 25B 的模型方向性对齐较低,大于 120B 及前沿闭源权重模型在 10/10 人类共识场景中接近完全对齐,但在人类共识较低时普遍表现出过度自信,难以反映意见多样性;模型的自我报告与实际行为也存在明显差异。

    推荐理由:研究把心理问卷转化为现实场景中的判断测试,既比较模型与人类共识,也检验模型能否保留分歧意见的范围。

4月1日周三