Google 研究用分解方法提升小模型的用户意图提取效果
Google Research 介绍一项发表于 EMNLP 2025 的研究,将用户界面轨迹的意图理解拆为逐屏摘要和序列意图抽取两步,以便小型多模态 LLM 在设备端处理。
推荐理由:论文将界面轨迹的意图理解拆成屏幕摘要与序列抽取两步,并以事实级指标分析小模型在端侧场景中的效果与误差来源。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google Research 介绍一项发表于 EMNLP 2025 的研究,将用户界面轨迹的意图理解拆为逐屏摘要和序列意图抽取两步,以便小型多模态 LLM 在设备端处理。
推荐理由:论文将界面轨迹的意图理解拆成屏幕摘要与序列抽取两步,并以事实级指标分析小模型在端侧场景中的效果与误差来源。
Google DeepMind 发布 Gemini 3 Flash,结合 Gemini 3 Pro 级推理与 Flash 级延迟、效率和成本,面向开发者、消费者及企业逐步开放。
推荐理由:Gemini 3 Flash同时给出推理、速度、成本和编码基准数据,并覆盖开发者、消费者与企业入口,便于比较其实际定位。
Mistral AI 发布 Devstral 2 系列编码模型和 Mistral Vibe CLI。Devstral 2 为 123B 参数模型,在 SWE-bench Verified 上 đạt 72.2%,Devstral Small 2 为 24B 参数模型,得分 68.0%,支持 API、本地部署和微调。
推荐理由:Devstral 2 同时覆盖大规模部署与本地运行场景,并配套 Vibe CLI,材料还提供了 SWE-bench Verified 成绩、许可方式和 API 定价,便于比较其性能与使用门槛。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 已通过 Gemini API 在 Google AI Studio 和 Vertex AI 提供预览,价格为 $2/million input tokens 和 $12/million output tokens,适用于 200k tokens 或更短的 prompts。
推荐理由:Gemini 3 Pro同时覆盖智能体编码、单提示词应用生成和多模态推理,并公布了API价格与接入方式,便于评估其开发价值。
Google DeepMind 发布 Gemini 3,首先推出 Gemini 3 Pro 预览版,并在 Gemini app、AI Mode in Search、AI Studio、Vertex AI 和 Gemini CLI 等入口提供使用。
推荐理由:Gemini 3 Pro、Deep Think 与 Google Antigravity 同步亮相,原文集中展示了模型能力、开发入口和智能体工作流变化。
Google DeepMind 发布 Google Antigravity 智能体开发平台,面向端到端软件任务提供浏览器控制、异步交互和多智能体协作。公开预览现已免费开放,兼容 macOS、Linux 和 Windows,并支持 Gemini 3、Claude Sonnet 4.5 和 GPT-OSS。
推荐理由:Antigravity把IDE、浏览器控制和异步多智能体协作整合到同一开发平台,展示了智能体如何执行并验证端到端软件任务。
Google Research推出Generative UI,让AI模型根据用户提示动态生成网页、游戏、工具和应用等定制化交互界面。该能力已在Gemini app中以dynamic view和visual layout实验形式推出,并接入Google Search的AI Mode;美国Google AI Pro和Ultra订阅者可在AI Mode中选择“Thinking”体验。
推荐理由:Google同时给出论文依据、产品入口和偏好评测,能帮助读者理解Generative UI从研究实现走向真实产品时的能力边界与使用条件。
Google DeepMind 发布 SIMA 2,这一研究型智能体结合 Gemini 模型,可在虚拟 3D 世界中理解复杂指令、进行推理、与用户对话并通过自我游戏持续改进。SIMA 2 已在包括 ASKA 和 MineDojo 在内的未训练游戏,以及 Genie 3 生成的新世界中进行测试;目前以有限研究预览形式向少量学者和游戏开发者开放。
推荐理由:文章展示了 SIMA 2 如何结合 Gemini 的推理与自我改进,在未见过的游戏和生成世界中执行复杂任务,并说明其当前局限。
Google Research 在 Research@ 活动上介绍了 Google Earth AI、DeepSomatic 和 Quantum Echoes 等最新进展,涵盖地理空间推理、癌症基因变异分析和量子计算。
推荐理由:文章以 Google Earth AI、DeepSomatic 和 Quantum Echoes 为例,串联研究突破走向真实应用的路径,并展示智能体与开放工具如何加速科学发现。
Google Research 在 UIST’25 介绍 StreetReaderAI,这是一款结合 Gemini、实时场景描述、AI 对话和无障碍导航控制的街景原型,面向盲人和低视力用户。
推荐理由:研究展示了多模态 AI 如何结合街景图像与地理上下文,为盲人用户提供可交互的导航描述,并用用户研究呈现了实际使用偏好与准确性边界。
Google Research 正为 Fitbit 推出基于 Gemini 模型的个人健康教练,并从明天起向符合条件的美国 Fitbit Premium Android 用户开放可选公开预览,iOS 用户随后加入。
推荐理由:Google Research 介绍了健康智能体从生理数据分析到专家协作和安全评估的构建路径,呈现了健康场景落地大模型的具体方法。
Mistral AI 发布 AI Studio,面向企业提供从 AI 原型到生产部署的统一平台。平台由 Observability、Agent Runtime 和 AI Registry 三部分组成,支持评测、反馈追踪、版本管理、治理以及 hybrid、dedicated 和 self-hosted 部署,并开放 private beta 注册。
推荐理由:Mistral 将可观测性、Agent Runtime 和 AI Registry 组合成生产平台,具体呈现了企业从原型走向部署所需的闭环能力。
Google Earth AI 发布新的 Imagery 和 Population foundation models,并介绍由 Gemini 驱动的 Geospatial Reasoning agent,能够拆解复杂地理问题,调用环境、遥感和人口模型及地理工具完成多步分析。
推荐理由:文章集中呈现了 Earth AI 的模型、智能体编排方式与评测结果,便于理解跨模态地理推理如何结合多源数据处理复杂任务。
Mistral AI 为 Le Chat 推出 Memories(beta),支持自动保存信息,并在使用记忆时显示来源链接。用户可以关闭记忆、开启不使用记忆的 incognito chat,以及编辑、删除、导入或导出记忆。Le Chat 还提供 Memory Insights,并计划增加分类、即时遗忘和更清晰的记忆使用记录。
推荐理由:Le Chat 将记忆设计为可查看、编辑、导入导出的系统,并通过来源链接和使用提示增强用户对召回内容的控制。
Mistral AI 发布 Devstral Medium,并将 Devstral Small 升级至 Devstral Small 1.1,面向代码智能体提升性能、提示词泛化和 agentic scaffold 适配能力。
推荐理由:这次更新同时覆盖 Apache 2.0 开源模型与 API 模型,并给出 SWE-Bench Verified 成绩、价格和部署方式,便于比较不同使用路径。
Mistral AI 推出企业级 AI 编码助手 Mistral Code,将 Codestral、Codestral Embed、Devstral 和 Mistral Medium 等模型与 IDE 助手、管理控制和企业支持整合到一个产品中。
推荐理由:Mistral Code 将编码模型、IDE 助手、本地部署和企业管控整合在一起,具体展示了受监管团队采用 AI 编码的部署路径。
Mistral 发布 Agents API,将代码执行、网页搜索、图像生成、Document Library 和 MCP 工具整合到智能体框架中,并支持跨对话记忆与多智能体交接。网页搜索可提升 SimpleQA 表现,Mistral Large 和 Mistral Medium 的得分分别为 75% 和 82.32%,不使用网页搜索时分别为 23% 和 22.08%。
推荐理由:Mistral Agents API 将代码执行、网页搜索、图像生成、文档库和 MCP 工具整合进有状态对话,并支持多智能体交接编排。
Mistral AI 与 All Hands AI 发布面向软件工程任务的智能体大语言模型 Devstral,并以 Apache 2.0 许可证开源。Devstral 在 SWE-Bench Verified 上取得 46.8% 的成绩,较此前开源 SoTA 模型高出 6 个百分点以上;模型可在单张 RTX 4090 或 32GB RAM 的 Mac 上运行。
推荐理由:Devstral 同时给出 SWE-Bench Verified 成绩、部署条件与 Apache 2.0 许可,便于比较其编码能力和实际使用门槛。
Mistral AI 为免费生成式 AI 工作助手 le Chat 推出一组 beta 功能,包括带引用的网页搜索、用于构思和编辑的 Canvas、文档与图像理解、图像生成及任务智能体。文档理解由 Pixtral Large 提供,图像生成接入 Black Forest Labs 的 Flux Pro;这些功能目前均免费提供,并将逐步上线。
推荐理由:Mistral AI 将网页搜索、Canvas、文档理解、图像生成和任务智能体整合进 le Chat,展示了从模型到工作流输出的一体化路径。
Mistral AI 发布 Ministral 3B 和 Ministral 8B,面向端侧计算与边缘场景,支持最高 128k 上下文窗口。Ministral 8B 使用交错滑动窗口注意力以提升推理速度和内存效率,两款模型可用于本地翻译、离线智能助手、分析、机器人及多步 Agent 工作流。
推荐理由:Ministral 3B 和 8B 面向端侧与边缘计算,兼顾低延迟、隐私和多步智能体工作流,适合关注小模型部署的人了解其定位。