跳到正文

#推理

今日 8 条
7月17日周五
7月16日周四
  1. Hugging Face Blog56

    DharmaOCR 对比 Mistral OCR4 与 Unlimited-OCR,展示领域专门化优势

    Hugging Face Blog 介绍 DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章将优势归因于面向巴西葡萄牙语的监督微调,以及用于降低文本退化、提升输出稳定性的 DPO 训练;文中还通过 ENEM 手写作文和小字体文档示例说明多语言模型的识别与稳定性问题。

  2. Hugging Face Blog66

    模型路由并不简单:Hugging Face Blog 解析智能体系统的优化难题

    Hugging Face Blog 介绍其在智能体系统中构建模型路由器的经验,指出路由不应被视为单纯的分类问题,而是要同时优化成本、质量和延迟。

    推荐理由:文章用 AppWorld 实验说明,模型路由的真实成本和延迟受缓存、基础设施及治理约束共同影响,不能只按模型价格或任务难度决策。

7月15日周三
  1. Hugging Face Blog92

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。

    推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。

7月2日周四
7月1日周三
  1. Berkeley AI Research26

    2026 BAIR 博士毕业生展示

    Berkeley Artificial Intelligence Research(BAIR)公布 2026 届博士毕业生展示,研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science and healthcare 等方向。

6月30日周二
  1. Hugging Face Blog45

    为什么专业化不可避免

    优化理论、进化生物学、竞争市场与机器学习共同指向同一结论:在资源有限、目标存在差异时,专注特定任务的系统往往胜过追求全面覆盖的通用系统。Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 的 2026 年研究指出,通用性并非性能优势,真正可行的路径是让系统匹配目标问题。

  2. Google Research82

    Google Research 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。

    推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。

6月27日周六
6月25日周四
  1. Google Research60

    Google Research 研究推理如何解锁大语言模型中的参数化知识

    Google Research 的论文研究发现,在 Gemini-2.5、Qwen3-32B 等推理模型上,即使面对简单单跳事实问题,生成推理轨迹也能召回关闭推理时难以获得的参数化知识。实验将作用归因于计算缓冲和事实启动,并发现中间推理中的幻觉事实会显著降低最终答案正确率;筛选无幻觉轨迹或通过过程奖励鼓励事实支持的中间步骤可提升准确性。

    推荐理由:研究用受控实验区分了额外计算与事实启动两种机制,并展示中间事实的准确性如何影响最终答案可靠性。

6月11日周四
6月9日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

5月29日周五
  1. Google Research71

    Google Research 发布 I/O 2026 多领域研究成果

    Google Research 总结 I/O 2026 展示的研究进展,涵盖 Gemini for Science、医疗 AI、WeatherNext、Gemini 核心能力、智能体开发平台和量子计算等方向。

    推荐理由:文章集中呈现 Google Research 在科学发现、医疗、天气预测和智能体开发等方向的研究成果及其产品化路径,便于了解研究如何转化为实际工具。

5月28日周四
  1. Mistral AI75

    Mistral 在 AI Now Summit 2026 发布工业工程 AI 技术栈并更新 Vibe

    Mistral 发布面向工业工程的集成 AI 技术栈,并与 Airbus、BMW Group 和 ASML 合作,用于设计、仿真和生产优化,同时强调对数据、知识产权和生产环境的控制。Vibe 升级为支持长期、多步骤工作的统一智能体,可执行研究、交付物起草、编码和工具调用;法国 Les Ulis 的新 10 MW 推理数据中心计划于 Q3 2026 开放。

    推荐理由:材料集中展示了 Mistral 面向工业工程、智能体生产力和推理基础设施的整套布局,便于理解其企业产品方向。

5月27日周三
  1. Mistral AI67

    Mistral AI 引入物理 AI,构建工程加速基础能力

    Mistral AI 宣布将 Emmi AI 纳入自身,推出面向工业工程的物理 AI 能力。该类模型从物理求解器输出或测量数据中学习,可根据几何与边界条件在单个 GPU 上以秒级前向推理预测完整物理场。Mistral AI 表示,这项能力将服务于产品设计、工装与工艺优化及实时数字孪生,并作为其企业 AI 平台的一部分面向航空航天、汽车、半导体、能源和工业设备等领域。

    推荐理由:文章说明了物理 AI 如何将工程仿真从小时至数周缩短到秒级,并展示其在设计、制造和数字孪生中的应用路径。

5月23日周六
  1. Mistral AI63

    Mistral AI 收购 Physics AI 公司 Emmi AI 加速工业智能体布局

    Mistral AI 宣布已达成收购 Physics AI 公司 Emmi AI 的最终协议,以增强面向工业企业的 AI 转型能力。Emmi AI 的联合创始人及 30 多名研究人员和工程师将加入 Mistral AI 的 Science 与 Applied AI 团队,其模型将用于工程工作流、实时模拟和数字孪生。

    推荐理由:此次收购将 Physics AI、工程模型与智能体工具调用能力并入 Mistral AI,为理解其工业 AI 布局提供了具体线索。

5月22日周五
  1. Mistral AI89

    Mistral 发布 Mistral Medium 3.5,并为 Vibe 和 Le Chat 推出云端智能体

    Mistral 发布 Mistral Medium 3.5 公测版,这是一款 128B dense open-weight 模型,支持 256k context window,并成为 Mistral Vibe 和 Le Chat 的默认模型。

    推荐理由:Mistral Medium 3.5 将模型发布与云端编码智能体结合,文中同时给出性能、部署条件、价格和人工审批机制,便于评估其实际使用路径。

5月20日周三
  1. Google Research91

    Google Research 开放 ERA 科学研究工具并推出 Computational Discovery

    Google Research 开放由 Gemini 驱动的 Empirical Research Assistance(ERA),用于检索文献、编写和优化科学代码,并通过树搜索评估大量实验方案。

    推荐理由:文章同时交代了 ERA 的研究依据、跨学科实验结果和开放路径,可帮助读者理解科学智能体从代码优化走向实际发现工作的方式。

5月17日周日
  1. Google DeepMind84

    Google DeepMind 发布 Gemini for Science 科学工具与 Science Skills

    Google DeepMind 推出 Gemini for Science,包含 Google Labs 的三个实验工具和 Google Antigravity 中的 Science Skills,用于辅助科学假设生成、计算发现与文献分析。

    推荐理由:这项发布把科学假设生成、计算实验和文献分析整合为可用工具,并展示了 Science Skills 在生命科学工作流中的应用方式。

5月16日周六
  1. Google DeepMind41

    Co-Scientist 为衰老研究开辟新路径

    Calico Life Sciences 利用 Co-Scientist 梳理衰老生物学研究,提出值得实验验证的新假设。围绕整合应激反应(ISR),团队借助 Co-Scientist 设计并迭代实验,获得了对 ISR 在健康与疾病中作用的新发现,计划发表相关结果。

  2. Google DeepMind62

    Google DeepMind 的 Co-Scientist 加速肝病机制发现

    Google DeepMind 介绍 Co-Scientist 如何帮助爱丁堡大学研究团队研究 MASH,整合肝脏生物学与药理学证据并筛选候选组合疗法。针对 resmetirom 仅对少数符合条件患者有效的问题,系统提出 NLRP3 炎症小体连接炎症与代谢的机制假设,该假设随后得到实验验证。

    推荐理由:文章展示了 Co-Scientist 如何整合肝脏生物学与药理学证据,帮助研究者缩小组合疗法搜索范围并提出可实验检验的机制假设。

  3. Google DeepMind45

    Google DeepMind 的 Co-Scientist 如何 объединить 生物学工具探索 ALS 新路径

    MIT 的 Ritu Raman 与 Boston Children’s Hospital 的 Ryan Flynn 借助 Co-Scientist 连接组织工程与 RNA 细胞表面研究,探索 ALS。Co-Scientist 压缩文献梳理过程,帮助 Raman 检验证据、提出可测试假设,并按可行性与潜在风险收益排序研究方向。两人正寻找可用于靶向 ALS 的新型 RNA 机制及潜在 RNA 药物。

  4. Google DeepMind91

    Google DeepMind 发布 Gemini 3.5 Flash,主打前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。

    推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。

5月12日周二
  1. Google DeepMind85

    Google DeepMind发布多智能体科学研究系统Co-Scientist

    Google DeepMind发布基于Gemini的多智能体系统Co-Scientist,用于生成、辩论、排序和迭代完善复杂科学问题的研究假设。系统整合网页搜索、ChEMBL、UniProt等数据库,并在肝纤维化、ALS、细胞衰老等研究中协助科学家提出和筛选可测试方向。

    推荐理由:Co-Scientist展示了多智能体如何通过生成、辩论和迭代完善科学假设,并已在多项生命科学研究中协助推进实验方向。

5月8日周五
  1. Berkeley AI Research64

    Adaptive Parallel Reasoning:高效推理扩展的下一种范式

    Berkeley AI Research 发布对 Adaptive Parallel Reasoning 的综述与观点分析,介绍模型如何在推理时动态决定是否并行、并行线程数及协调方式。

    推荐理由:文章梳理了自适应并行推理的控制流、执行系统与训练奖励设计,帮助读者比较不同方案在准确率、延迟和工程复杂度上的取舍。

5月6日周三
  1. Google DeepMind86

    AlphaEvolve:Google DeepMind 的 Gemini 驱动编码智能体拓展多领域应用

    Google DeepMind 介绍 AlphaEvolve 在科研、基础设施和商业领域的应用进展,这一 Gemini 驱动的编码智能体已从试点测试发展为基础设施的核心组件。在具体案例中,DeepConsensus 的变异检测错误减少 30%,电网可行解比例从 14% 提升至超过 88%,Google Spanner 的写放大降低 20%,并帮助多家企业提升训练、推理、仿真或路线规划效率。

    推荐理由:文章汇总了 AlphaEvolve 在科研、基础设施和商业场景中的具体应用,展示其从试点走向规模化部署的路径。

4月30日周四
  1. Google Research84

    Google Research 总结 Empirical Research Assistance 在四类科学问题中的应用

    Google Research 总结 Empirical Research Assistance(ERA)在流行病学、宇宙学、气候研究和神经科学中的四项应用。ERA 被用于预测美国各州流感、COVID-19 和 RSV 住院情况,探索宇宙弦引力辐射的数学解,从 GOES East 卫星数据推导每 10 分钟的柱平均 CO2 估计,并根据斑马鱼神经连接提出可解释的神经回路机制。

    推荐理由:文章通过四个跨学科案例展示 ERA 如何处理预测、理论计算、卫星观测和神经回路建模,具体呈现 AI 辅助科学研究的应用路径。

4月27日周一
  1. Google DeepMind65

    Google DeepMind与韩国科学技术信息通信部宣布AI合作

    Google DeepMind与韩国科学技术信息通信部宣布合作,将在首尔办公室设立AI Campus,支持韩国科研机构使用AI for Science模型推进生命科学、能源、天气与气候研究。双方将探索AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist和WeatherNext等项目的合作,并开展AI人才培养及与韩国AI安全研究所的安全研究。

    推荐理由:Google DeepMind披露了合作的具体落点,涵盖科研设施、模型应用、人才培养与AI安全协作,呈现其国家级AI合作框架。

4月22日周三
4月20日周一
  1. Berkeley AI Research60

    GRASP:面向长时域世界模型的梯度规划方法

    Berkeley AI Research 介绍 GRASP,一种面向世界模型长时域规划的梯度规划器,通过提升状态、对状态迭代注入随机噪声,并避开脆弱的状态输入梯度来优化动作。

    推荐理由:文章解释了长时域世界模型规划为何容易失稳,并给出通过状态提升、状态噪声和梯度重塑改善规划的具体方法。

4月16日周四
  1. Google Research68

    Google Research 发布 Simula:用机制设计和推理从零构建合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文“Reasoning-Driven Synthetic Data Generation and Evaluation”,提出推理优先的 Simula 框架,从第一原则构建无需种子数据的合成数据集。

    推荐理由:文章将合成数据生成重构为机制设计问题,展示如何分别控制覆盖度、多样性、复杂度与质量,为构建专业领域数据集提供可迁移框架。

4月14日周二
  1. Google Research79

    Google Research 推出 Vantage,利用生成式 AI 评估未来技能

    Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。

    推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月9日周四
  1. Google Research65

    Google Research 发布 ConvApparel 数据集与用户模拟器反事实验证框架

    Google Research 介绍 ConvApparel 数据集与评估框架,用于衡量 LLM 用户模拟器与真实人类交互之间的现实性差距。该数据集包含超过 4,000 段人类与 AI 的多轮服饰购物对话,总计近 15,000 轮,并通过“Good”和“Bad”两个推荐智能体收集不同用户体验。

    推荐理由:研究用双智能体数据和反事实验证评估用户模拟器,展示了统计拟合与面对未见挫折场景时适应能力之间的差异。

4月3日周五
  1. Google Research68

    Google Research 评估大语言模型行为倾向与人类的对齐程度

    Google Research 提出一套评估大语言模型行为倾向对齐程度的框架,将心理问卷改编为现实场景中的情境判断测试,并比较 25 个 LLM 与 550 名参与者的偏好分布。结果显示,小于 25B 的模型方向性对齐较低,大于 120B 及前沿闭源权重模型在 10/10 人类共识场景中接近完全对齐,但在人类共识较低时普遍表现出过度自信,难以反映意见多样性;模型的自我报告与实际行为也存在明显差异。

    推荐理由:研究把心理问卷转化为现实场景中的判断测试,既比较模型与人类共识,也检验模型能否保留分歧意见的范围。

  2. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live,提升了语音交互的精度、自然度和响应速度,并支持更可靠的复杂任务执行。

    推荐理由:Gemini 3.1 Flash Live 同时给出语音交互、任务执行和多语言扩展的具体变化,便于判断其开发者与终端使用场景。