跳到正文

#Agent

今日 10 条
7月7日周二
  1. Berkeley AI Research67

    Berkeley AI Research:近乎免费的智能如何重塑智能体数据系统

    Berkeley AI Research 的文章认为,AI 推理成本快速下降将推动智能体成为数据系统的主要工作负载,并带来三类问题:为智能体设计数据系统、为大规模智能体群构建状态与协作基础设施,以及由智能体合成定制数据系统。文章讨论了 agentic speculation、结构化记忆、多智能体协调与故障处理,以及通过验证智能体和证明系统保障自动生成系统的可靠性。

    推荐理由:文章将智能体数据系统拆成支持智能体、承载智能体和由智能体构建三类问题,为理解多智能体规模化运行的工程瓶颈提供了清晰框架。

7月6日周一
  1. Hugging Face Blog76

    Hugging Face Kernels 完成重大更新

    Hugging Face 对 Kernels 项目进行了重大更新,新增 Hub 的 kernel 仓库类型,并通过可信发布者、代码签名和可复现构建改进安全性。项目还重构了 kernels 与 kernel-builder 的 CLI,支持 Torch Stable ABI 和 Apache TVM FFI,并为 Agent 构建、基准测试和迭代优化 kernel 提供工作流基础。

    推荐理由:文章集中说明了 Kernels 在安全、框架兼容和 Agent 工作流上的改造,能帮助开发者判断其对自定义 kernel 开发与分发的实际作用。

6月25日周四
  1. Google DeepMind85

    Google DeepMind 将 computer use 集成至 Gemini 3.5 Flash

    Google DeepMind 宣布 Gemini 3.5 Flash 内置 computer use 工具,可用于构建跨浏览器、移动端和桌面环境执行操作的智能体。开发者和企业可通过 Gemini API 与 Gemini Enterprise Agent Platform 使用该功能,并可启用敏感操作确认和间接提示词注入检测后自动停止等安全措施。

    推荐理由:Gemini 3.5 Flash 将 computer use 纳入内置工具,并配套企业安全措施,展示了构建跨平台智能体时的能力与防护边界。

6月24日周三
  1. Mistral AI75

    Mistral AI 为 Connectors 增加企业连接治理与调试能力

    Mistral AI 为 Connectors 推出多项企业能力,包括按组织或工作区管理连接器及单个工具权限、带 connector scopes 的 API keys、多账户连接器和 Connectors Debugger。

    推荐理由:这次更新覆盖权限治理、自动化身份、多账户连接和故障诊断,较完整地回应了企业部署智能体时的连接管理需求。

6月23日周二
6月16日周二
  1. Google DeepMind84

    Google DeepMind 发布 AI Control Roadmap,构建智能体纵深安全防线

    Google DeepMind 发布 AI Control Roadmap,用纵深防御管理内部 AI 智能体,即使模型对齐不完善,也通过权限控制、威胁建模、监测和阻断降低风险。

    推荐理由:文章系统梳理了 Google DeepMind 的 AI Control Roadmap,展示其如何用监测、阻断和分级响应应对智能体对齐不完善带来的风险。

6月10日周三
  1. Google DeepMind65

    Google DeepMind 联合伙伴启动最高 $10M 的多智能体 AI 安全研究资助

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者、最高 $10M 的多智能体 AI 安全研究资助计划。

    推荐理由:这项资助计划把多智能体安全拆分为测试环境、网络行为、基础设施和监督控制四个研究方向,为相关研究提供了明确的问题框架。

6月9日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

6月5日周五
5月29日周五
  1. Google Research71

    Google Research 发布 I/O 2026 多领域研究成果

    Google Research 总结 I/O 2026 展示的研究进展,涵盖 Gemini for Science、医疗 AI、WeatherNext、Gemini 核心能力、智能体开发平台和量子计算等方向。

    推荐理由:文章集中呈现 Google Research 在科学发现、医疗、天气预测和智能体开发等方向的研究成果及其产品化路径,便于了解研究如何转化为实际工具。

5月28日周四
  1. Mistral AI75

    Mistral 在 AI Now Summit 2026 发布工业工程 AI 技术栈并更新 Vibe

    Mistral 发布面向工业工程的集成 AI 技术栈,并与 Airbus、BMW Group 和 ASML 合作,用于设计、仿真和生产优化,同时强调对数据、知识产权和生产环境的控制。Vibe 升级为支持长期、多步骤工作的统一智能体,可执行研究、交付物起草、编码和工具调用;法国 Les Ulis 的新 10 MW 推理数据中心计划于 Q3 2026 开放。

    推荐理由:材料集中展示了 Mistral 面向工业工程、智能体生产力和推理基础设施的整套布局,便于理解其企业产品方向。

  2. Mistral AI88

    Mistral AI 发布统一智能体 Vibe,整合办公与编码工作流

    Mistral AI 发布统一 AI 智能体 Vibe,将办公任务与编码工作流整合到同一产品中。Work Mode 可跨 Google Workspace、Outlook、SharePoint、Slack、GitHub 等连接器处理研究、数据分析和文档撰写,Code Mode 则支持远程编码会话、GitHub 项目管理和 pull request。

    推荐理由:Vibe 将办公自动化与编码代理整合到同一产品中,并列出连接器、开发环境和部署方案,便于理解其工作流覆盖范围。

  3. Mistral AI80

    Mistral AI 发布开源 Search Toolkit 公测版

    Mistral AI 发布 Search Toolkit 公测版,这是一个用于构建 AI 应用生产级搜索管线的开源框架,将数据摄取、检索和评估统一到同一接口中。

    推荐理由:Search Toolkit 将数据摄取、检索和评估纳入统一接口,并提供可复用的启动模板,降低构建和比较 RAG 搜索管线的整合成本。

5月23日周六
  1. Mistral AI63

    Mistral AI 收购 Physics AI 公司 Emmi AI 加速工业智能体布局

    Mistral AI 宣布已达成收购 Physics AI 公司 Emmi AI 的最终协议,以增强面向工业企业的 AI 转型能力。Emmi AI 的联合创始人及 30 多名研究人员和工程师将加入 Mistral AI 的 Science 与 Applied AI 团队,其模型将用于工程工作流、实时模拟和数字孪生。

    推荐理由:此次收购将 Physics AI、工程模型与智能体工具调用能力并入 Mistral AI,为理解其工业 AI 布局提供了具体线索。

5月22日周五
  1. Mistral AI89

    Mistral 发布 Mistral Medium 3.5,并为 Vibe 和 Le Chat 推出云端智能体

    Mistral 发布 Mistral Medium 3.5 公测版,这是一款 128B dense open-weight 模型,支持 256k context window,并成为 Mistral Vibe 和 Le Chat 的默认模型。

    推荐理由:Mistral Medium 3.5 将模型发布与云端编码智能体结合,文中同时给出性能、部署条件、价格和人工审批机制,便于评估其实际使用路径。

  2. Mistral AI80

    Mistral AI 在 Studio 发布 Connectors,支持内置与自定义 MCP

    Mistral AI 在 Studio 推出 Connectors,将内置连接器和自定义 MCP 接入 API、SDK 及模型和智能体调用。开发者可以集中注册、管理和复用连接器,直接调用工具,并通过 requires_confirmation 实现人工审批;Connectors 已在 Studio 开放 Public Preview。

    推荐理由:Mistral 将内置与自定义 MCP 统一接入 Studio、API 和 Agent SDK,并补充直接调用及人工确认流程,呈现了企业集成的复用方式。

5月20日周三
  1. Google Research91

    Google Research 开放 ERA 科学研究工具并推出 Computational Discovery

    Google Research 开放由 Gemini 驱动的 Empirical Research Assistance(ERA),用于检索文献、编写和优化科学代码,并通过树搜索评估大量实验方案。

    推荐理由:文章同时交代了 ERA 的研究依据、跨学科实验结果和开放路径,可帮助读者理解科学智能体从代码优化走向实际发现工作的方式。

5月19日周二
  1. Google DeepMind74

    Google DeepMind:Co-Scientist 加速发现逆转细胞衰老的遗传因素

    Google DeepMind 介绍了研究人员如何使用 Co-Scientist 研究逆转细胞衰老的遗传因素。Co-Scientist 扫描数万篇论文,提出了 20 多个可测试的遗传因素,其中部分假设经实验验证可使细胞进入更年轻且整体功能改善的状态;它还将筛选数据结合文献的分析工作从最多六个月缩短至几天。

    推荐理由:文章展示了 Co-Scientist 如何从文献中生成可测试的遗传因素,并将筛选数据分析从数月压缩到数天。

5月18日周一
5月17日周日
  1. Google DeepMind84

    Google DeepMind 发布 Gemini for Science 科学工具与 Science Skills

    Google DeepMind 推出 Gemini for Science,包含 Google Labs 的三个实验工具和 Google Antigravity 中的 Science Skills,用于辅助科学假设生成、计算发现与文献分析。

    推荐理由:这项发布把科学假设生成、计算实验和文献分析整合为可用工具,并展示了 Science Skills 在生命科学工作流中的应用方式。

5月16日周六
  1. Google DeepMind64

    Google DeepMind 展示 Co-Scientist 辅助寻找新传染病分子开关

    Google DeepMind 介绍了剑桥大学 Clare Bryant 教授使用 Co-Scientist 研究病原体跨物种传播后引发严重疾病的分子机制。Co-Scientist 从研究计划生成并排序假设,帮助团队将候选蛋白进一步收敛到可实验检验的特定氨基酸;相关实验原本可能需要 two to three years,团队目前预计 six months 内完成。

    推荐理由:案例展示了 Co-Scientist 如何从研究问题生成并排序假设,再逐步收敛到可实验验证的氨基酸靶点。

  2. Google DeepMind41

    Co-Scientist 为衰老研究开辟新路径

    Calico Life Sciences 利用 Co-Scientist 梳理衰老生物学研究,提出值得实验验证的新假设。围绕整合应激反应(ISR),团队借助 Co-Scientist 设计并迭代实验,获得了对 ISR 在健康与疾病中作用的新发现,计划发表相关结果。

  3. Google DeepMind78

    Google DeepMind 的 Co-Scientist 从既有药物中发现肝纤维化候选疗法

    Stanford University School of Medicine 的 Gary Peltz 团队使用 Co-Scientist,从既有药物文献中提出三种肝纤维化候选药物,并与两种人工选药一同进行活体人类肝细胞实验。Co-Scientist 选出的三种药物中有两种阻断了纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的相关损伤反应。

    推荐理由:研究展示了 Co-Scientist 如何从既有药物文献中筛选候选,并通过人类肝细胞实验验证其发现。

  4. Google DeepMind91

    Google DeepMind 发布 Gemini 3.5 Flash,主打前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。

    推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。

5月12日周二
  1. Google DeepMind85

    Google DeepMind发布多智能体科学研究系统Co-Scientist

    Google DeepMind发布基于Gemini的多智能体系统Co-Scientist,用于生成、辩论、排序和迭代完善复杂科学问题的研究假设。系统整合网页搜索、ChEMBL、UniProt等数据库,并在肝纤维化、ALS、细胞衰老等研究中协助科学家提出和筛选可测试方向。

    推荐理由:Co-Scientist展示了多智能体如何通过生成、辩论和迭代完善科学假设,并已在多项生命科学研究中协助推进实验方向。

5月6日周三
  1. Google DeepMind86

    AlphaEvolve:Google DeepMind 的 Gemini 驱动编码智能体拓展多领域应用

    Google DeepMind 介绍 AlphaEvolve 在科研、基础设施和商业领域的应用进展,这一 Gemini 驱动的编码智能体已从试点测试发展为基础设施的核心组件。在具体案例中,DeepConsensus 的变异检测错误减少 30%,电网可行解比例从 14% 提升至超过 88%,Google Spanner 的写放大降低 20%,并帮助多家企业提升训练、推理、仿真或路线规划效率。

    推荐理由:文章汇总了 AlphaEvolve 在科研、基础设施和商业场景中的具体应用,展示其从试点走向规模化部署的路径。

4月30日周四
  1. Google Research84

    Google Research 总结 Empirical Research Assistance 在四类科学问题中的应用

    Google Research 总结 Empirical Research Assistance(ERA)在流行病学、宇宙学、气候研究和神经科学中的四项应用。ERA 被用于预测美国各州流感、COVID-19 和 RSV 住院情况,探索宇宙弦引力辐射的数学解,从 GOES East 卫星数据推导每 10 分钟的柱平均 CO2 估计,并根据斑马鱼神经连接提出可解释的神经回路机制。

    推荐理由:文章通过四个跨学科案例展示 ERA 如何处理预测、理论计算、卫星观测和神经回路建模,具体呈现 AI 辅助科学研究的应用路径。

4月27日周一
  1. Mistral AI81

    Mistral AI 发布企业 AI 编排层 Workflows 公测版

    Mistral AI 发布企业 AI 编排层 Workflows 的 public preview,用于将 AI 流程可靠地部署到生产环境。开发者用 Python 编写工作流,Studio 记录执行轨迹,流程可在中断后恢复并通过 wait_for_input() 暂停等待人工审批。

    推荐理由:Workflows把持久化执行、可观测性和人工审批整合进企业流程,并说明了从开发到部署的具体架构。

  2. Google DeepMind65

    Google DeepMind与韩国科学技术信息通信部宣布AI合作

    Google DeepMind与韩国科学技术信息通信部宣布合作,将在首尔办公室设立AI Campus,支持韩国科研机构使用AI for Science模型推进生命科学、能源、天气与气候研究。双方将探索AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist和WeatherNext等项目的合作,并开展AI人才培养及与韩国AI安全研究所的安全研究。

    推荐理由:Google DeepMind披露了合作的具体落点,涵盖科研设施、模型应用、人才培养与AI安全协作,呈现其国家级AI合作框架。

4月22日周三
4月21日周二
  1. Google DeepMind57

    Google DeepMind携手五家咨询公司加速企业AI转型

    Google DeepMind宣布与Accenture、Bain & Company、BCG、Deloitte和McKinsey合作,帮助企业以负责任的方式规模化采用前沿AI和智能体AI。合作包括开发行业专用AI能力、让伙伴提前使用包括Gemini系列在内的前沿模型,以及连接AI领导层与客户CEO和董事会,重点覆盖金融、制造、零售、媒体和娱乐等行业。

4月16日周四
  1. Google Research68

    Google Research 发布 Simula:用机制设计和推理从零构建合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文“Reasoning-Driven Synthetic Data Generation and Evaluation”,提出推理优先的 Simula 框架,从第一原则构建无需种子数据的合成数据集。

    推荐理由:文章将合成数据生成重构为机制设计问题,展示如何分别控制覆盖度、多样性、复杂度与质量,为构建专业领域数据集提供可迁移框架。

4月14日周二
  1. Google Research79

    Google Research 推出 Vantage,利用生成式 AI 评估未来技能

    Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。

    推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。

4月9日周四
  1. Google Research65

    Google Research 发布 ConvApparel 数据集与用户模拟器反事实验证框架

    Google Research 介绍 ConvApparel 数据集与评估框架,用于衡量 LLM 用户模拟器与真实人类交互之间的现实性差距。该数据集包含超过 4,000 段人类与 AI 的多轮服饰购物对话,总计近 15,000 轮,并通过“Good”和“Bad”两个推荐智能体收集不同用户体验。

    推荐理由:研究用双智能体数据和反事实验证评估用户模拟器,展示了统计拟合与面对未见挫折场景时适应能力之间的差异。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

3月31日周二
  1. Mistral AI76

    Mistral AI 发布面向人类与智能体的 Spaces CLI

    Mistral AI 推出 Spaces CLI,用于脚手架搭建、开发环境配置、配置生成和部署,并通过交互输入的 flag 等价物支持编码智能体无障碍操作。Spaces 还为项目生成 context.json 和 AGENTS.md,借助可查询的插件注册表与显式状态降低智能体执行命令时的猜测和阻塞;文中示例显示,从提示到上线部署用时不到 10 分钟。

    推荐理由:文章以 Spaces 的实际设计取舍为例,系统说明了让 CLI 同时适配人类开发者、编码智能体和自动化流程的方法。

3月29日周日
  1. Google DeepMind79

    Google DeepMind 用 Gemini 探索 AI 时代的智能指针

    Google DeepMind 正在探索由 Gemini 驱动的 AI 智能指针,让用户通过指向和语音在不同应用中调用 AI,而不必反复切换窗口或编写复杂提示词。

    推荐理由:文章从四项交互原则和实验演示出发,具体说明 AI 如何结合指针位置、视觉上下文与语音,减少复杂提示词输入。