跳到正文

#论文/研究

今日 1 条
7月8日周三
  1. Google Research78

    Google Research 通过导航改道实验缓解城市交通拥堵

    Google Research 在10个美国城市开展为期六个月的导航改道实验,通过引导不到2%的出行避开约100个拥堵路段,评估系统性交通改善效果。目标路段车速中位数提高约2%,燃料消耗率中位数下降0.5%至1.0%;受影响路段整体车速中位数提高约0.35%,高峰时段提高0.5%,每个城市每年可能节省数千吨 CO2e。

    推荐理由:研究通过10个美国城市的长期对照实验,量化了少量改道对整体车速、燃耗和排放的系统性影响。

7月6日周一
  1. Hugging Face Blog79

    PRX Part 4:Photoroom 详解 PRX 的数据策略

    Photoroom 在 PRX 系列第 4 部分介绍了预训练数据管线:混合公共与内部数据集,用 VLM 为图像生成 100–200 词的详细描述,再通过 Lance 构建数据集、用 Mosaic Data Shards 流式训练。

    推荐理由:文章系统拆解了 PRX 7B 预训练数据管线,从数据格式、VLM 重标注到过滤去重,提供了可复用的工程取舍与实测依据。

7月1日周三
  1. Berkeley AI Research26

    2026 BAIR 博士毕业生展示

    Berkeley Artificial Intelligence Research(BAIR)公布 2026 届博士毕业生展示,研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science and healthcare 等方向。

  2. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。

6月30日周二
6月25日周四
  1. Google Research58

    Google Research 提出线性弹性缓存以优化云成本

    Google Research 提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,并根据实时工作负载动态调整缓存大小和 TTL。该方法在 Spanner 生产服务器中使内存使用量降低 15.5%,缓存未命中增加 5.5%,总拥有成本降低约 5%,实际 I/O 成本仅增加 0.5%。在公开缓存轨迹上,弹性缓存也持续优于固定大小缓存。

  2. Google Research60

    Google Research 研究推理如何解锁大语言模型中的参数化知识

    Google Research 的论文研究发现,在 Gemini-2.5、Qwen3-32B 等推理模型上,即使面对简单单跳事实问题,生成推理轨迹也能召回关闭推理时难以获得的参数化知识。实验将作用归因于计算缓冲和事实启动,并发现中间推理中的幻觉事实会显著降低最终答案正确率;筛选无幻觉轨迹或通过过程奖励鼓励事实支持的中间步骤可提升准确性。

    推荐理由:研究用受控实验区分了额外计算与事实启动两种机制,并展示中间事实的准确性如何影响最终答案可靠性。

6月13日周六
  1. Google Research74

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 汇总两项关于皮肤状况信息工具的研究,考察图像型 AI 如何帮助用户识别病症并判断后续行动。在一项包含 2,345 名参与者的调查中,AI 辅助下的病症命名准确率为 23%,高于标准搜索的 8%,但标准 AI 对下一步行动准确率没有显著提升。

    推荐理由:两项研究分别从大规模调查和真实社区使用出发,展示了图像型 AI 在识别皮肤状况上的帮助及其在下一步医疗决策上的局限。

6月11日周四
  1. Google Research66

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用于更灵敏地审计差分隐私和机器遗忘。该框架通过相对三样本检验,判断未学习模型更接近安全重训模型还是原始模型,并在 SVT3 隐私机制中用几千个样本检测违规,而既有方法需要 millions 个样本。

    推荐理由:这项工作把机器遗忘审计从简单的两样本比较转向相对三样本检验,并展示了更少样本和更少调参下识别隐私违规的方法。

6月8日周一
  1. Google DeepMind82

    Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果

    Google DeepMind 发布一项在塞拉利昂开展的预注册试验结果,显示 Guided Learning 组数学成绩较对照组提高 +0.258 个标准差。超过 113,000 次互动分析显示,Gemini 在 76% 的消息中提出支架式问题,仅在 2% 的情况下直接给出答案;教师仍负责设计课程、设定目标和组织讨论。

    推荐理由:这项预注册试验提供了 Guided Learning 介入数学学习的量化结果,也呈现了教师参与和学生提问方式变化。

6月5日周五
  1. Google Research83

    Google Research 发布 PHRM 手机被动心率监测研究

    Google Research 在 Nature 论文中介绍 PHRM,利用手机前置摄像头在面部解锁后采集 8 秒视频,被动估计心率和每日静息心率。该系统在真实环境验证中对心率的 MAPE 为 6.09%,对 Fitbit Charge 6 日静息心率的 MAE 为 4.39 bpm,并发布 PHRM-mini 模型及大型多肤色研究数据集供符合条件的研究人员申请使用。

    推荐理由:研究展示了手机前置摄像头在日常使用中被动估计心率和静息心率的方法,并用多肤色数据验证其准确性与可用范围。

5月29日周五
  1. Google Research71

    Google Research 发布 I/O 2026 多领域研究成果

    Google Research 总结 I/O 2026 展示的研究进展,涵盖 Gemini for Science、医疗 AI、WeatherNext、Gemini 核心能力、智能体开发平台和量子计算等方向。

    推荐理由:文章集中呈现 Google Research 在科学发现、医疗、天气预测和智能体开发等方向的研究成果及其产品化路径,便于了解研究如何转化为实际工具。

5月28日周四
  1. Google Research75

    Google 介绍基于零信任聚合的私密分析方案

    Google 介绍了一种用于私密分析的零信任聚合方案,将一次性消息的格基加密协议与 TEE 结合,使设备无需参与多轮交互即可提交数据。该方案确保服务器只能获得匿名聚合结果,并将用于 Android SafetyCore,通过聚合元数据评估端侧安全模型的效果,同时保持用户内容留在设备上。

    推荐理由:文章解释了 Google 如何把一次性加密聚合与 TEE 结合,在降低设备在线要求的同时减少对单一硬件防护的依赖。

5月27日周三
5月19日周二
  1. Google DeepMind74

    Google DeepMind:Co-Scientist 加速发现逆转细胞衰老的遗传因素

    Google DeepMind 介绍了研究人员如何使用 Co-Scientist 研究逆转细胞衰老的遗传因素。Co-Scientist 扫描数万篇论文,提出了 20 多个可测试的遗传因素,其中部分假设经实验验证可使细胞进入更年轻且整体功能改善的状态;它还将筛选数据结合文献的分析工作从最多六个月缩短至几天。

    推荐理由:文章展示了 Co-Scientist 如何从文献中生成可测试的遗传因素,并将筛选数据分析从数月压缩到数天。

5月16日周六
  1. Google DeepMind78

    Google DeepMind 的 Co-Scientist 从既有药物中发现肝纤维化候选疗法

    Stanford University School of Medicine 的 Gary Peltz 团队使用 Co-Scientist,从既有药物文献中提出三种肝纤维化候选药物,并与两种人工选药一同进行活体人类肝细胞实验。Co-Scientist 选出的三种药物中有两种阻断了纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的相关损伤反应。

    推荐理由:研究展示了 Co-Scientist 如何从既有药物文献中筛选候选,并通过人类肝细胞实验验证其发现。

  2. Google DeepMind80

    WeatherNext 如何帮助预测 Hurricane Melissa 在 Jamaica 的 Category 5 登陆

    Google DeepMind 的 WeatherNext 帮助 National Hurricane Center 提前五天预测 Hurricane Melissa 将以 Category 5 强度登陆 Jamaica,预测置信度为 80%,提前三天接近 100%。该模型通过 50 个情景组成的 ensemble 同时预测风暴路径和强度,并支持预警、资源调度与疏散协调。

    推荐理由:文章以 Hurricane Melissa 为案例,说明 WeatherNext 如何同时预测路径和强度,并为灾害预警提供更长准备时间。

4月30日周四
  1. Google DeepMind87

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下让 AI 智能体参与患者照护。系统在 98 个基层医疗查询中有 97 个未出现关键错误,并在药物问答和实时音视频模拟中展现能力;在 140 项问诊能力评估中,专家医生整体表现更好,AI co-clinician 在其中 68 项达到或超过基层医生水平。

    推荐理由:文章同时报告了临床证据检索与实时多模态问诊模拟结果,呈现了 AI co-clinician 的能力边界和安全设计。

  2. Google Research84

    Google Research 总结 Empirical Research Assistance 在四类科学问题中的应用

    Google Research 总结 Empirical Research Assistance(ERA)在流行病学、宇宙学、气候研究和神经科学中的四项应用。ERA 被用于预测美国各州流感、COVID-19 和 RSV 住院情况,探索宇宙弦引力辐射的数学解,从 GOES East 卫星数据推导每 10 分钟的柱平均 CO2 估计,并根据斑马鱼神经连接提出可解释的神经回路机制。

    推荐理由:文章通过四个跨学科案例展示 ERA 如何处理预测、理论计算、卫星观测和神经回路建模,具体呈现 AI 辅助科学研究的应用路径。

4月22日周三
4月20日周一
  1. Berkeley AI Research60

    GRASP:面向长时域世界模型的梯度规划方法

    Berkeley AI Research 介绍 GRASP,一种面向世界模型长时域规划的梯度规划器,通过提升状态、对状态迭代注入随机噪声,并避开脆弱的状态输入梯度来优化动作。

    推荐理由:文章解释了长时域世界模型规划为何容易失稳,并给出通过状态提升、状态噪声和梯度重塑改善规划的具体方法。

4月16日周四
  1. Google Research68

    Google Research 发布 Simula:用机制设计和推理从零构建合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文“Reasoning-Driven Synthetic Data Generation and Evaluation”,提出推理优先的 Simula 框架,从第一原则构建无需种子数据的合成数据集。

    推荐理由:文章将合成数据生成重构为机制设计问题,展示如何分别控制覆盖度、多样性、复杂度与质量,为构建专业领域数据集提供可迁移框架。

  2. Google Research72

    Google Research 用 AI 生成合成神经元加速脑图谱绘制

    Google Research 发布 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 的训练数据,使小鼠轴突重建错误率降低 4.4%。按完整小鼠脑的规模估算,这相当于节省 157 person-years 的人工校对工作;MoGen 及其不同物种的训练模型已开源。

    推荐理由:论文展示了合成神经元形状如何降低 PATHFINDER 的重建错误,并将模型改进换算为完整小鼠脑图谱中的人工校对节省量。

4月9日周四
  1. Google Research65

    Google Research 发布 ConvApparel 数据集与用户模拟器反事实验证框架

    Google Research 介绍 ConvApparel 数据集与评估框架,用于衡量 LLM 用户模拟器与真实人类交互之间的现实性差距。该数据集包含超过 4,000 段人类与 AI 的多轮服饰购物对话,总计近 15,000 轮,并通过“Good”和“Bad”两个推荐智能体收集不同用户体验。

    推荐理由:研究用双智能体数据和反事实验证评估用户模拟器,展示了统计拟合与面对未见挫折场景时适应能力之间的差异。

4月3日周五
  1. Google Research68

    Google Research 评估大语言模型行为倾向与人类的对齐程度

    Google Research 提出一套评估大语言模型行为倾向对齐程度的框架,将心理问卷改编为现实场景中的情境判断测试,并比较 25 个 LLM 与 550 名参与者的偏好分布。结果显示,小于 25B 的模型方向性对齐较低,大于 120B 及前沿闭源权重模型在 10/10 人类共识场景中接近完全对齐,但在人类共识较低时普遍表现出过度自信,难以反映意见多样性;模型的自我报告与实际行为也存在明显差异。

    推荐理由:研究把心理问卷转化为现实场景中的判断测试,既比较模型与人类共识,也检验模型能否保留分歧意见的范围。

4月1日周三
3月31日周二
  1. Google Research81

    Google Research 发布量子攻击加密货币的新资源估算与负责任披露方案

    Google Research 表示,未来量子计算机破解保护加密货币的 256-bit 椭圆曲线离散对数问题所需资源可能低于此前估计。其白皮书给出两种少于 1,200 或 1,450 个逻辑量子比特的 Shor's algorithm 电路,并估计少于 500,000 个物理量子比特即可在几分钟内执行。

    推荐理由:Google 给出量子攻击 ECDLP-256 的更新资源估算,并以零知识证明支持可验证披露,为加密货币迁移 PQC 提供了具体依据。

3月25日周三
3月18日周三
  1. Google Research81

    Google Research 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 活动上介绍了 AI 用于个性化医疗、临床协作、公共卫生和生物医学研究的最新进展。相关工作包括 Personal Health Agent、AMIE、MedGemma 和 DeepSomatic,涉及乳腺癌检测、糖尿病视网膜病变筛查、医疗应用开发及基因数据分析。

    推荐理由:文章集中呈现 Google Research 将多模态模型、智能体和开放权重工具推进医疗研究与临床场景的路径,涵盖筛查、诊疗和公共卫生应用。

  2. Google Research85

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research 联合 NHS 机构开展的 AIMS 研究评估了乳腺癌筛查 AI 系统的独立性能及其作为第二读者融入双读流程的可行性。系统将癌症检出率从每 1,000 名女性 7.54 提高到 9.33,并检出原双读流程漏掉的 25% 间隔癌;在 12 个 NHS 筛查点处理 9,266 个病例时,中位 AI 读取时间为 17.7 分钟。

    推荐理由:两项研究从独立性能、临床流程整合和人机协作三个层面提供证据,具体呈现了筛查效率、数据漂移与人工复核的权衡。

3月17日周二
  1. Google Research67

    Google Research 用高温超导问题评测六个 LLM 的科学问答能力

    Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。

    推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。

3月13日周五
  1. Berkeley AI Research69

    SPEX 与 ProxySPEX 将 LLM 交互识别扩展至数千个组件

    Berkeley AI Research 介绍 SPEX 和 ProxySPEX,两种通过消融与稀疏恢复识别模型关键交互的算法。ProxySPEX 利用层级结构,在约 10x 更少的消融次数下达到 SPEX 的性能,并被用于特征归因、数据归因和注意力头归因。两者的代码已集成到 SHAP-IQ 仓库。

    推荐理由:文章系统说明 SPEX 与 ProxySPEX 如何用较少的消融识别特征、训练数据和模型组件之间的关键交互,并展示其解释性应用。

3月12日周四
3月7日周六
  1. Google Research79

    Google Research 发布 WAXAL:覆盖27种非洲语言的开放语音资源

    Google Research 发布 WAXAL,这是一个覆盖27种撒哈拉以南非洲语言的开放语音数据集,服务于自动语音识别(ASR)和文本转语音(TTS)。首批资源包含约1,846小时转录自然语音和超过565小时高保真录音,覆盖超过100 million speakers,并以 CC-BY-4.0 许可开放。数据由非洲学术与社区组织参与采集,Google 计划持续扩展语言覆盖范围。

    推荐理由:WAXAL同时覆盖自然语音识别与高保真语音合成数据,并以开放许可面向27种非洲语言,为低资源语音技术研究提供了可复用基础。

1月10日周六
  1. Berkeley AI Research68

    Berkeley AI Research 发布信息驱动的成像系统设计研究

    Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。

    推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。