跳到正文

#论文/研究

今日 4 条
今天10月2日周五
  1. Hugging Face Blog77

    ServiceNow CoreAI 发布 AutoSynthData,用模型失败生成企业智能体训练数据

    ServiceNow CoreAI 介绍 AutoSynthData,通过目标模型的失败和更强教师模型的成功,生成、验证并迭代企业智能体训练任务。该流程在 EnterpriseOps Gym Hybrid 环境中生成 2,000 个合成样本,使 Gemma-4-26B-A4B-it 的平均 Pass@1 提升 7.2 个百分点,验证器成功率从 63.01% 升至 68.55%。

    推荐理由:文章给出了从模型失败中生成、验证并迭代训练任务的完整流程,并用 EnterpriseOps Gym 实验展示了合成数据对智能体训练的影响。

  2. Ars Technica · AI80

    Ataraxos 击败顶尖 Stratego 选手,16 块 GPU 完成训练

    来自 Carnegie Mellon、MIT、New York University 和 Stanford University 的研究团队开发了 Stratego AI Ataraxos,以 15 胜 1 负、4 和的战绩击败 Pim Niemeijer。该系统使用 16 块 GPU 和几千美元完成训练,Stratego 的核心难点是棋子身份在交战前对对手隐藏。

    推荐理由:研究团队给出了 Ataraxos 对阵顶尖人类选手的战绩和训练成本,展示了 AI 处理长期隐藏信息博弈的一种路径。

10月1日周四
  1. The Decoder87

    Ataraxos击败Stratego顶尖棋手,AI突破高隐藏信息博弈

    Ataraxos在三周内以85%的有效胜率击败Stratego历史最成功棋手Niemeijer,结束了人类在这一高隐藏信息棋类中的优势。该系统使用16块Nvidia H100 GPU训练一周,另用4块GPU训练belief network,成本低于$8,000;研究团队还将代码公开,并在Barrage Stratego、Hanabi和Dou dizhu中报告了相关结果。

    推荐理由:论文展示了Ataraxos在高隐藏信息博弈中的训练与搜索方法,并用训练成本和对弈结果说明其相较DeepNash的效率差异。

  2. Microsoft Research69

    Microsoft Research 用机器学习预测电网空间天气风险

    Microsoft Research 开发了一套机器学习管线,为美国本土 66,935 座变电站生成空间天气风险估计,并可提前 30-60 分钟预警具体风险。系统结合太阳风信息、AE 和 Dst 预测、物理约束、当地地质导电率与电网数据,在 2020-2026 年评估期对重大事件的检测率为 76.5%,对严重事件为 81.2%。

    推荐理由:文章展示了如何把太阳风预测、地质条件与电网数据串成端到端管线,并用多项检测指标说明其提前预警能力。

9月30日周三
  1. Ars Technica · AI77

    Google DeepMind 用 SynthIDBio 为 AI 设计蛋白质添加水印

    Google DeepMind 在 Nature 发表研究,提出 SynthIDBio,可在 ProteinMPNN 设计蛋白质时嵌入分布式水印,同时保持蛋白质与目标蛋白结合的功能。

    推荐理由:论文展示了 SynthIDBio 如何在不损害蛋白质功能的前提下嵌入可检测水印,为筛查来源不明的 AI 设计蛋白提供了具体思路。

  2. Google Research60

    Google Research 提出 Diffusion Controller 统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller,将图像生成的去噪过程重新表述为连续控制问题,用轻量级控制网络调节生成轨迹。该框架支持灰盒和白盒场景,并通过 SFT、RWL 和 PPO 在 Stable Diffusion v1.4 上进行评估;其完全解锁版本相对基线模型取得了 90% 的胜率。

    推荐理由:Diffusion Controller 将推理时引导与微调统一为连续控制框架,并展示了灰盒和白盒场景下兼顾偏好匹配与图像质量的实现路径。

9月29日周二
  1. Hugging Face Blog66

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 面向使用 MCP 多工具的 LLM 智能体,逐条检查回答中的事实是否由回答所指向的正确来源支持,而不是只判断事实是否存在于汇总证据中。

    推荐理由:论文展示了在 MCP 多源场景中保留来源身份的验证方法,并用医疗智能体数据说明它如何减少错引来源,同时暴露相似来源区分的难点。

9月25日周五
  1. Google Research78

    Google Research 介绍用于连贯长视频生成的多智能体框架

    Google Research 介绍了一套基于 Gemini 和 Veo 的 AI 视频联合导演多智能体框架,用于自动规划多镜头叙事并减少角色、场景和物体状态漂移。框架包含 Co-Director、CANVAS、A²RD 和 VQQA,分别覆盖创意编排、视觉连续性、分钟级视频生成和闭环提示词优化,并在多个视频基准上报告了质量与一致性提升。

    推荐理由:Google 将长视频生成拆解为创意编排、视觉记忆、时间扩展和闭环优化四个环节,展示了缓解跨镜头一致性问题的系统化路径。

9月22日周二
9月19日周六
  1. Google Research65

    Google Research 发布 MilleMiglia 中程物流实例生成器

    Google Research 介绍 MilleMiglia,这是一个用 C++ 编写的中程物流实例生成器,可创建包含固定车辆时刻表、配送中心吞吐限制和复杂同步约束的现实基准数据。它通过空间分布、需求和车辆班次等统计分布生成隐私保护的合成网络,覆盖从小型测试到洲际规模实例,并可用于训练 ML 算法。项目代码和文档已在 GitHub 开源,Google 及学术合作伙伴还在开发专用求解器和 API。

    推荐理由:文章解释了中程物流为何难以套用传统 VRP,并展示 MilleMiglia 如何用隐私保护的合成数据支持统一基准与后续求解器研究。

9月18日周五
  1. Google Research74

    Google Research 研究生成式 UI 如何帮助教师创建互动学习内容

    Google Research 发布一项研究实验,利用面向学习优化的生成式 UI,帮助教师按课程目标创建定制的互动教育模拟。研究同时发布了 30 多个英文 STEM 学习互动内容,涵盖物理、化学、生物和数学,并由教师审核。实验包含迭代式生成、自我纠错和 Agent 式自动评估;一项涉及 12 名美国教师的初步研究中,互动内容质量平均评分为 8/10。

    推荐理由:Google 以教师审核和教学护栏为核心,展示了 GenUI 如何生成可定制的 STEM 互动练习及其早期教师反馈。

9月16日周三
  1. Google Research70

    Google Research 提出 Retrieve-for-Train,用扩散模型加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线 RL 生成监督数据,再将集合级检索行为蒸馏到 53.9M 参数的扩散模型中。该模型可在单次非自回归推理中生成完整目标嵌入集合,相比自回归方法实现 12 到 20 倍加速,并在时延规模扩大时保持亚秒至数秒响应。

    推荐理由:论文展示了如何把离线 RL 学到的集合级检索行为蒸馏进扩散模型,以降低复杂搜索的推理延迟并减少人工标注依赖。

9月11日周五
  1. Google Research71

    Google Research 发布 ToolGrad:用文本“梯度”高效生成工具使用数据集

    Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的 API 工具链、再标注对应用户查询的 answer-first 范式生成工具使用数据。

    推荐理由:ToolGrad 将工具链生成与用户查询标注拆开,并用文本反馈迭代 API 工作流,为降低工具使用数据的生成成本提供了可复用思路。

9月4日周五
  1. Google Research84

    Google Research 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia及剑桥等机构合作,发布了雄性果蝇大脑和中枢神经系统的完整连接图谱。该图谱包含超过166,000个神经元和1.25亿个突触连接,是按神经元数量计最大的脑图谱,并可通过 Neuroglancer 查看、探索和下载。研究团队使用计算机和 AI 将电子显微镜图像重建为三维神经结构,图谱经过人类专家标注和校验。

    推荐理由:这项工作展示了 AI 如何协助构建细胞尺度的完整神经连接图,并提供了可视化、探索和下载的数据资源。

9月2日周三
  1. Hugging Face Blog69

    BenchMIRT:LLM 基准测试究竟测量了什么?

    Allen Institute 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试的方法。它基于 100 个 LLM、16 个基准和超过 34K 道题的结果,独立识别出安全与通用推理两个主要维度,并发现 BBQ、WMDP 等基准的得分可能混合了不同能力信号。

    推荐理由:BenchMIRT 将多维 IRT 应用于 100 个 LLM 和 34K 多道题,展示了如何拆解基准分数中的推理与安全信号。

  2. Google Research80

    Google Research 发布 MAPL-EMIT 甲烷羽流全球监测方法

    Google Research 与 NASA JPL 合作提出 MAPL-EMIT,用基于 Swin-S Transformer 的深度学习框架分析 NASA EMIT 高光谱数据,自动完成甲烷增强量化、羽流分割和排放源定位。

    推荐理由:论文展示了如何用深度学习处理 EMIT 高光谱数据,将甲烷羽流检测、范围分割与源头定位整合到可扩展的全球监测流程中。

8月28日周五
  1. Google Research82

    Google Research 推出 Planetary Prediction Engine,自动化全球地理预测建模

    Google Research 介绍 Planetary Prediction Engine(PPE),这是 Google Earth AI 旗下的实验性研究能力,可根据自然语言查询自主完成地理数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理数据发现、特征构建和模型评估串成自动化流程,并用多个领域的基准结果说明其应用价值。

8月27日周四
  1. Google Research61

    Google Research 发布 GlucoFM,用于连续血糖监测的基础模型

    Google Research 介绍 GlucoFM,一种采用双流设计的自监督连续血糖监测基础模型,用于分离较慢的血糖趋势与短期偏差。模型在四个队列的七项临床预测任务中进行评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。GlucoFM 还展示了跨数据集迁移和少样本适应能力。

    推荐理由:文章系统比较了 GlucoFM 在临床预测、餐后血糖预测、跨队列迁移和少样本适应中的表现,并说明双流设计如何利用 CGM 的多时间尺度信号。

8月26日周三
8月25日周二
  1. Hugging Face Blog82

    Quantization-Aware Healing 让压缩后的 4-bit GPT-OSS 60B 在 9 项基准中 7 项超过 BF16 版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4,使 4-bit 模型在 9 项基准中的 7 项超过同架构的 60B bfloat16 版本。

    推荐理由:论文通过 GPT-OSS 120B 压缩实验和 QAH、QAT 对照,具体展示了 4-bit 模型恢复精度与训练稳定性的路径。

8月24日周一
  1. Import AI46

    Import AI 470:机器没有权利;SPADE 自动生成训练环境;Hawkeye 改进 GPU kernels

    METR 研究显示,AI 对网络安全漏洞发现带来显著加速,对数学研究仅有有限加速,而 AI 研究算法进展尚无可测量加速。SPADE 通过 LLM 自博弈交替生成可执行环境和解决任务,使用 Qwen3-4B-Instruct-2507、Qwen3-8B 与 Qwen3-30B-A3B-Instruct-2507 测试,在游戏环境中取得 58.3 的套件平均分,较基础模型高 8.1。

8月22日周六
  1. Google Research71

    Google Research 发布 Biomarker Discovery Framework,用于筛选可穿戴数据中的候选生物标志物

    Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下运行的多智能体系统,用于从可穿戴设备数据中迭代生成、分析和验证候选生物标志物。

    推荐理由:文章展示了如何将多智能体协作、确定性统计计算与对抗验证结合,用于在可穿戴传感器数据中筛选候选生物标志物。

8月21日周五
  1. Google Research66

    Google Research提出ME-POIs框架,用出行数据增强语言模型对地点的理解

    Google Research提出Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的到达时间、停留时长和周边移动模式与地点文本表示结合,以刻画地点的身份和动态功能。该框架在洛杉矶和休斯顿的未见地点测试中,使访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。

    推荐理由:研究将匿名聚合的出行模式融入地点文本表示,并在未见地点的多项属性预测中量化展示了动态空间信息的补充价值。

  2. Hugging Face Blog75

    Hugging Face 研究量化语音识别中的基准优化

    Hugging Face 最新研究测试了 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考文本中的错误、补回音频中被静音的数字,或根据数据集线索切换拼写形式。

    推荐理由:研究用三项测试量化语音识别模型的基准优化现象,展示公开测试集得分与新音频泛化能力之间的偏差。

8月19日周三
  1. Hugging Face Blog75

    ALTK-Evolve 研究智能体需要多少记忆

    Hugging Face Blog 介绍 ALTK-Evolve 在八个模型上的评估,发现智能体记忆需要按模型能力校准,而不是一味累积。gpt-oss-120b 使用精选检索后任务完成率提升 +16.1pp,token 开销仅增加 +5%;DeepSeek-V3.2 使用完整指南集后任务完成率提升 +9.5pp,GLM-5 则未见可测增益。

    推荐理由:文章用八个模型和 AppWorld 结果比较记忆注入策略,具体展示了不同能力模型如何校准记忆规模与推理成本。

8月17日周一
  1. Import AI45

    Import AI 469:DiG-bench 测试 AI 的科学发现能力,RSI Simulator 模拟递归自我改进

    DiG-bench 推出包含 70 个隐藏规则游戏的基准,评估 AI 在陌生环境中通过探索发现规则、更新先验的能力;当前 frontier models 仍难以通关,Opus 5 和 Fable 5 表现最佳,GPT-5.5 紧随其后。文章还介绍 Paradigm Research 的 RSI Simulator,以及 Inherent 用开放权重模型构建 AI 科学家 Faraday 的研究。

  2. Google Research69

    Google Research 推出 PhotoScan 研究框架,用手机照片估计心代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 手机照片估计体脂率、A/G ratio 和 V/S ratio 的深度学习框架。模型先在 UK Biobank 的 35,323 条记录上预训练,再用 677 名成人的 PhotoBIA 数据微调,并在 132 人的独立队列中验证。

    推荐理由:研究用多个独立队列比较 PhotoScan 与 BIA、DXA 在体成分估计和胰岛素抵抗分类上的表现,展示了手机影像的研究价值。

8月13日周四
  1. Microsoft Research73

    MindTopo 基准揭示 VLM 的拓扑空间推理能力

    Microsoft Research 提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现通常优于需要跨多步行动维护拓扑关系的任务,且两者都低于人类表现。研究指出,规划错误常发生在模型未能追踪场景变化后的结构关系或提出违反环境约束的行动。

    推荐理由:MindTopo 将静态识别与交互规划分开评估,具体展示了多模态模型在持续维护空间结构关系时的能力缺口。

8月12日周三
  1. Google Research79

    Google Research 研究发现,前沿大模型的事实性瓶颈在召回而非编码

    Google Research 发布研究,提出 knowledge profiling 框架和包含 2,150 个事实的 WikiProfile 基准,用于区分大语言模型的事实编码、召回与识别能力。

    推荐理由:研究将事实错误拆分为编码与召回两类,并用 WikiProfile 展示思考机制如何恢复部分已编码但难以直接提取的事实。

  2. Google Research87

    Google Research 推进 AMIE 实时音视频临床问诊能力

    Google Research 介绍了基于 Gemini 和 Project Astra 的 AMIE (Video),可在实时视频问诊中感知非语言临床线索、引导虚拟体格检查并进行诊断推理。研究覆盖 100 个场景和 300 次咨询,在核心临床能力上评估结果与初级保健医生相当;但研究仅使用专业患者演员,真实患者和真实临床条件下的实用性仍需进一步验证。

    推荐理由:研究展示了 AMIE 从文本对话扩展到实时音视频问诊的系统设计与评估,也清楚交代了模拟场景和真实患者验证之间的边界。

  3. Microsoft Research76

    Microsoft Research 介绍 CARE-X:结合辅助监督、奖励对齐学习与工具测量的胸片 VLM

    Microsoft Research 介绍研究模型 CARE-X,用于统一处理胸部 X 光片报告生成、病变分类、定位和医学设备评估,并结合辅助预测头提供可调阈值的置信度输出。

    推荐理由:文章系统展示了 CARE-X 如何结合生成、结构化预测与 DAPO,并以工具增强测量处理胸片中的定量诊断任务。

8月11日周二
  1. Hugging Face Blog80

    ALTK-Evolve 对比 ACE:用选择性记忆投递降低智能体推理成本

    Hugging Face Blog 介绍 ALTK-Evolve,并将其与 ACE 在 AppWorld 上进行对比。两者都从智能体历史轨迹中提取可复用经验而不更新模型权重,但 ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力选择性投递 guidelines。

    推荐理由:文章对比了两种智能体记忆的构建与投递方式,并用 AppWorld 数据展示选择性检索如何在保持效果的同时减少推理 token。

8月10日周一
  1. Hugging Face Blog66

    论文提出高效知识蒸馏方法,降低长上下文训练显存与成本

    Multiverse Computing 的论文提出离线 top-K logits 缓存与融合分块 KL loss,使知识蒸馏无需同时驻留 teacher 和 student,并避免构建完整词表与序列的 logits 矩阵。

    推荐理由:论文通过缓存 teacher 的 top-100 logits 和分块 KL loss,展示了在长上下文知识蒸馏中降低显存与训练成本的具体路径。

8月4日周二
  1. Microsoft Research86

    Microsoft Research 发布 Orchard 开源智能体研究框架

    Microsoft Research 发布 Orchard,这是一个面向可扩展智能体研究的开源框架,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,可支持编码、网页导航和个人助理智能体的训练与评测。

    推荐理由:文章拆解了 Orchard Env 如何复用环境、数据和评测流程,并用三个领域的结果展示开放基础设施对智能体训练效率的影响。