跳到正文

#推理

今日 1 条
5月6日周三
  1. Google DeepMind86

    AlphaEvolve:Google DeepMind 的 Gemini 驱动编码智能体拓展多领域应用

    Google DeepMind 介绍 AlphaEvolve 在科研、基础设施和商业领域的应用进展,这一 Gemini 驱动的编码智能体已从试点测试发展为基础设施的核心组件。在具体案例中,DeepConsensus 的变异检测错误减少 30%,电网可行解比例从 14% 提升至超过 88%,Google Spanner 的写放大降低 20%,并帮助多家企业提升训练、推理、仿真或路线规划效率。

    推荐理由:文章汇总了 AlphaEvolve 在科研、基础设施和商业场景中的具体应用,展示其从试点走向规模化部署的路径。

4月30日周四
  1. Google Research84

    Google Research 总结 Empirical Research Assistance 在四类科学问题中的应用

    Google Research 总结 Empirical Research Assistance(ERA)在流行病学、宇宙学、气候研究和神经科学中的四项应用。ERA 被用于预测美国各州流感、COVID-19 和 RSV 住院情况,探索宇宙弦引力辐射的数学解,从 GOES East 卫星数据推导每 10 分钟的柱平均 CO2 估计,并根据斑马鱼神经连接提出可解释的神经回路机制。

    推荐理由:文章通过四个跨学科案例展示 ERA 如何处理预测、理论计算、卫星观测和神经回路建模,具体呈现 AI 辅助科学研究的应用路径。

4月27日周一
  1. Google DeepMind65

    Google DeepMind与韩国科学技术信息通信部宣布AI合作

    Google DeepMind与韩国科学技术信息通信部宣布合作,将在首尔办公室设立AI Campus,支持韩国科研机构使用AI for Science模型推进生命科学、能源、天气与气候研究。双方将探索AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist和WeatherNext等项目的合作,并开展AI人才培养及与韩国AI安全研究所的安全研究。

    推荐理由:Google DeepMind披露了合作的具体落点,涵盖科研设施、模型应用、人才培养与AI安全协作,呈现其国家级AI合作框架。

4月22日周三
4月20日周一
  1. Berkeley AI Research60

    GRASP:面向长时域世界模型的梯度规划方法

    Berkeley AI Research 介绍 GRASP,一种面向世界模型长时域规划的梯度规划器,通过提升状态、对状态迭代注入随机噪声,并避开脆弱的状态输入梯度来优化动作。

    推荐理由:文章解释了长时域世界模型规划为何容易失稳,并给出通过状态提升、状态噪声和梯度重塑改善规划的具体方法。

4月16日周四
  1. Google Research68

    Google Research 发布 Simula:用机制设计和推理从零构建合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文“Reasoning-Driven Synthetic Data Generation and Evaluation”,提出推理优先的 Simula 框架,从第一原则构建无需种子数据的合成数据集。

    推荐理由:文章将合成数据生成重构为机制设计问题,展示如何分别控制覆盖度、多样性、复杂度与质量,为构建专业领域数据集提供可迁移框架。

4月14日周二
  1. Google Research79

    Google Research 推出 Vantage,利用生成式 AI 评估未来技能

    Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。

    推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月9日周四
  1. Google Research65

    Google Research 发布 ConvApparel 数据集与用户模拟器反事实验证框架

    Google Research 介绍 ConvApparel 数据集与评估框架,用于衡量 LLM 用户模拟器与真实人类交互之间的现实性差距。该数据集包含超过 4,000 段人类与 AI 的多轮服饰购物对话,总计近 15,000 轮,并通过“Good”和“Bad”两个推荐智能体收集不同用户体验。

    推荐理由:研究用双智能体数据和反事实验证评估用户模拟器,展示了统计拟合与面对未见挫折场景时适应能力之间的差异。

4月3日周五
  1. Google Research68

    Google Research 评估大语言模型行为倾向与人类的对齐程度

    Google Research 提出一套评估大语言模型行为倾向对齐程度的框架,将心理问卷改编为现实场景中的情境判断测试,并比较 25 个 LLM 与 550 名参与者的偏好分布。结果显示,小于 25B 的模型方向性对齐较低,大于 120B 及前沿闭源权重模型在 10/10 人类共识场景中接近完全对齐,但在人类共识较低时普遍表现出过度自信,难以反映意见多样性;模型的自我报告与实际行为也存在明显差异。

    推荐理由:研究把心理问卷转化为现实场景中的判断测试,既比较模型与人类共识,也检验模型能否保留分歧意见的范围。

  2. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live,提升了语音交互的精度、自然度和响应速度,并支持更可靠的复杂任务执行。

    推荐理由:Gemini 3.1 Flash Live 同时给出语音交互、任务执行和多语言扩展的具体变化,便于判断其开发者与终端使用场景。

3月25日周三
3月17日周二
  1. Mistral AI73

    Mistral AI 与 NVIDIA 合作加速开放前沿模型

    Mistral AI 宣布成为 NVIDIA Nemotron Coalition 创始成员,并计划与 NVIDIA 共同开发开放前沿模型。Mistral AI 将贡献模型架构、训练技术、多模态能力和微调工具,NVIDIA 将提供计算资源、模型开发工具与合成数据生成管线。

    推荐理由:文章同时交代了联盟的合作机制、开放模型计划和 Mistral AI 的分工,便于理解产业协作如何影响模型训练与定制。

  2. Google Research67

    Google Research 用高温超导问题评测六个 LLM 的科学问答能力

    Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。

    推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。

  3. Mistral AI82

    Mistral AI 发布开源 Leanstral 代码智能体

    Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码智能体,采用 6B active parameters,支持在形式化代码仓库中生成并验证证明。

    推荐理由:Leanstral把Lean 4形式化证明引入代码智能体,并用FLTEval比较性能与成本,呈现了可复用的验证式编程路径。

3月13日周五
  1. Berkeley AI Research69

    SPEX 与 ProxySPEX 将 LLM 交互识别扩展至数千个组件

    Berkeley AI Research 介绍 SPEX 和 ProxySPEX,两种通过消融与稀疏恢复识别模型关键交互的算法。ProxySPEX 利用层级结构,在约 10x 更少的消融次数下达到 SPEX 的性能,并被用于特征归因、数据归因和注意力头归因。两者的代码已集成到 SHAP-IQ 仓库。

    推荐理由:文章系统说明 SPEX 与 ProxySPEX 如何用较少的消融识别特征、训练数据和模型组件之间的关键交互,并展示其解释性应用。

3月12日周四
1月10日周六
  1. Berkeley AI Research68

    Berkeley AI Research 发布信息驱动的成像系统设计研究

    Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。

    推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。

12月3日周三
  1. Mistral AI91

    Mistral AI 发布 Mistral 3 模型系列

    Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。

    推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。