Google Research 发布 SymptomAI 研究,探索面向日常症状评估的对话式 AI 智能体
Google Research 介绍 SymptomAI,一组用于日常症状访谈和鉴别诊断的实验性对话式 AI 智能体,并在 n=13,917 的随机研究中与临床专家评估进行比较。
推荐理由:这项大规模研究把日常症状对话、临床专家评估与 Fitbit 生理信号结合起来,呈现了 SymptomAI 在真实场景中的评估方法与边界。
Google Research 介绍 SymptomAI,一组用于日常症状访谈和鉴别诊断的实验性对话式 AI 智能体,并在 n=13,917 的随机研究中与临床专家评估进行比较。
推荐理由:这项大规模研究把日常症状对话、临床专家评估与 Fitbit 生理信号结合起来,呈现了 SymptomAI 在真实场景中的评估方法与边界。
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向高效通用任务、高吞吐智能体工作流和网络安全漏洞处理。
推荐理由:这次发布同时覆盖高质量、低延迟和网络安全场景,并给出 token 效率、基准成绩与价格,便于比较不同模型的部署取舍。
Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,围绕防止模型被滥用、快速检测疫情和设计医疗应对措施展开。过去 12 个月,双方推进了与政府机构、生物安全组织和研究团队的 15 项以上合作,并计划向可信合作伙伴开放 AI 模型和智能体。
推荐理由:文章系统说明了 Google DeepMind 与 Isomorphic Labs 如何将 AI 用于生物安全,并将防滥用、疫情检测与医疗响应连接起来。
Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。
推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。
Google DeepMind 启动 ATL Saathi 的现场试点,这是一款由 Gemini 驱动的网页应用,为印度 Atal Tinkering Labs 的教育工作者提供全天候规划和培训助手。
推荐理由:ATL Saathi把课程微学习、项目生成和安全指导整合到教师工作流中,展示了Gemini在教育场景的具体落地方式。
Google Research 介绍 SensorFM,这一 Large Sensor Foundation Model 在五百万名参与者、超过一万亿分钟的多模态可穿戴传感器数据上预训练。
推荐理由:文章展示了 SensorFM 如何以大规模无标签可穿戴数据学习通用生理表征,并通过多任务评估和 Personal Health Agent 验证其适配价值。
Photoroom 在 PRX 系列第 4 部分介绍了预训练数据管线:混合公共与内部数据集,用 VLM 为图像生成 100–200 词的详细描述,再通过 Lance 构建数据集、用 Mosaic Data Shards 流式训练。
推荐理由:文章系统拆解了 PRX 7B 预训练数据管线,从数据格式、VLM 重标注到过滤去重,提供了可复用的工程取舍与实测依据。
Berkeley Artificial Intelligence Research(BAIR)公布 2026 届博士毕业生展示,研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science and healthcare 等方向。
Hugging Face 与 Cerebras 展示了一套基于 Gemma 4 31B 的实时语音到语音系统,旨在通过更快且更稳定的推理降低对话延迟。
推荐理由:文章拆解了由语音识别、Gemma 4、Qwen3TTS 和 Cerebras 推理组成的开放语音链路,适合了解实时交互的工程取舍。
Google Research 发布覆盖50多个全球城市的建筑级屋顶反射率数据,并上线 Heat Resilience Earth Engine App,帮助城市规划者识别适合部署凉屋顶的建筑和区域。
推荐理由:Google Research 将建筑级屋顶反射率数据扩展至50多个城市,并开放 Earth Engine App,为城市规划者定位高优先级降温改造提供了可操作的数据基础。
Google DeepMind 发布 Nano Banana 2 Lite,并向开发者开放 Gemini Omni Flash,分别用于高速图像生成以及视频生成和对话式编辑。
推荐理由:两款模型分别覆盖高速图像生成与视频生成编辑,并给出延迟、价格、接口和组合用法,便于开发者评估工作流。
DiScoFormer是一种密度与 score Transformer,输入一组数据点后,可在单次前向传播中同时估计其分布的密度和 score,无需针对每个新分布重新训练。
推荐理由:DiScoFormer将密度与 score 估计统一到一个可适应的 Transformer 中,并用高维实验展示其相对 KDE 的误差优势。
Mistral AI 发布 Mistral OCR 4,新增 bounding boxes、区块类型分类和内联置信度分数,支持 170 种语言并可在单个容器中自托管。
推荐理由:OCR 4 将版面定位、区块分类和置信度整合进文档解析,并同时覆盖 API、Document AI 与自托管部署,便于按数据与流程需求选型。
Google 发布一套面向英国自然恢复的矢量化数据集,可识别并分类树篱、石墙和小片林地等细尺度生态特征。该系统基于 Remote Sensing Foundations 的 ViT Backbone,结合亚米级影像和 1 米 LiDAR 数据,并通过 Polsby–Popper 紧致度评分区分林地、木本斑块和线性木本特征。
推荐理由:Google 将高分辨率栅格地图转为可操作的矢量数据集,展示了 AI 如何把生态特征识别推进到保护规划与碳核算。
Google Research 汇总两项关于皮肤状况信息工具的研究,考察图像型 AI 如何帮助用户识别病症并判断后续行动。在一项包含 2,345 名参与者的调查中,AI 辅助下的病症命名准确率为 23%,高于标准搜索的 8%,但标准 AI 对下一步行动准确率没有显著提升。
推荐理由:两项研究分别从大规模调查和真实社区使用出发,展示了图像型 AI 在识别皮肤状况上的帮助及其在下一步医疗决策上的局限。
Google 发布 Gemini 3.5 Live Translate,可自动识别 70+ 种语言并进行接近实时的语音到语音翻译,同时保留说话者的语调、语速和音高。
推荐理由:Gemini 3.5 Live Translate 将连续语音翻译、音色节奏保留与多端接入结合,文中也列出开发者、企业和普通用户的使用入口。
Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。
推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。
Google Research 在 Nature 论文中介绍 PHRM,利用手机前置摄像头在面部解锁后采集 8 秒视频,被动估计心率和每日静息心率。该系统在真实环境验证中对心率的 MAPE 为 6.09%,对 Fitbit Charge 6 日静息心率的 MAE 为 4.39 bpm,并发布 PHRM-mini 模型及大型多肤色研究数据集供符合条件的研究人员申请使用。
推荐理由:研究展示了手机前置摄像头在日常使用中被动估计心率和静息心率的方法,并用多肤色数据验证其准确性与可用范围。
Google Research 总结 I/O 2026 展示的研究进展,涵盖 Gemini for Science、医疗 AI、WeatherNext、Gemini 核心能力、智能体开发平台和量子计算等方向。
推荐理由:文章集中呈现 Google Research 在科学发现、医疗、天气预测和智能体开发等方向的研究成果及其产品化路径,便于了解研究如何转化为实际工具。
Mistral AI 宣布将 Emmi AI 纳入自身,推出面向工业工程的物理 AI 能力。该类模型从物理求解器输出或测量数据中学习,可根据几何与边界条件在单个 GPU 上以秒级前向推理预测完整物理场。Mistral AI 表示,这项能力将服务于产品设计、工装与工艺优化及实时数字孪生,并作为其企业 AI 平台的一部分面向航空航天、汽车、半导体、能源和工业设备等领域。
推荐理由:文章说明了物理 AI 如何将工程仿真从小时至数周缩短到秒级,并展示其在设计、制造和数字孪生中的应用路径。
Mistral 发布 Mistral Medium 3.5 公测版,这是一款 128B dense open-weight 模型,支持 256k context window,并成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:Mistral Medium 3.5 将模型发布与云端编码智能体结合,文中同时给出性能、部署条件、价格和人工审批机制,便于评估其实际使用路径。
Google DeepMind 为实验性原型 Project Genie 推出 Street View grounding 能力,将美国地点的真实街景作为生成世界的起始位置。
推荐理由:Project Genie 将 Street View 的真实地点接入可交互世界生成,既扩展了用户的探索方式,也为智能体和机器人提供了贴近现实的虚拟环境。
Google DeepMind 发布 Gemini Omni Flash,这是 Gemini Omni 系列的首个模型,可组合图像、音频、视频和文本输入生成视频,并通过对话编辑视频。
推荐理由:Gemini Omni Flash 将多模态输入、对话式视频编辑和物理理解结合起来,并已通过多个 Google 产品开放使用。
Google 扩展 Search、Gemini、Chrome、Pixel 和 Cloud 中的内容透明度与验证工具,用于识别内容来源、AI 生成痕迹及编辑记录。
推荐理由:Google 将 SynthID 与 C2PA 验证扩展到 Search、Chrome、Gemini、Pixel 和 Cloud,呈现了内容溯源工具从单一产品走向跨平台协作的路径。
Google DeepMind宣布与新加坡政府及多家机构开展新的国家级AI合作,聚焦医疗、生命科学、教育、科研、劳动力发展和可持续性。合作包括探索AI临床协作、利用AlphaFold推进传染病研究、开发面向视障跑者的Gemma助手,以及培训研究人员使用科学智能体工具。
Google DeepMind 的 WeatherNext 帮助 National Hurricane Center 提前五天预测 Hurricane Melissa 将以 Category 5 强度登陆 Jamaica,预测置信度为 80%,提前三天接近 100%。该模型通过 50 个情景组成的 ensemble 同时预测风暴路径和强度,并支持预警、资源调度与疏散协调。
推荐理由:文章以 Hurricane Melissa 为案例,说明 WeatherNext 如何同时预测路径和强度,并为灾害预警提供更长准备时间。
Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。
推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。
Google Research 通过全球合作伙伴关系、开源软件和开放数据推动开放科学,相关资源已服务全球超过250,000名研究人员和开发者。其成果涵盖基因组学、神经科学、地球与大气建模、生物多样性及医疗健康,包括处理250万名个体基因组数据的工具、MedGemma 和 NeuralGCM。 Open Health Stack 已在超过10个国家部署,覆盖超过6500万名受益者。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下让 AI 智能体参与患者照护。系统在 98 个基层医疗查询中有 97 个未出现关键错误,并在药物问答和实时音视频模拟中展现能力;在 140 项问诊能力评估中,专家医生整体表现更好,AI co-clinician 在其中 68 项达到或超过基层医生水平。
推荐理由:文章同时报告了临床证据检索与实时多模态问诊模拟结果,呈现了 AI co-clinician 的能力边界和安全设计。
Google Research 总结 Empirical Research Assistance(ERA)在流行病学、宇宙学、气候研究和神经科学中的四项应用。ERA 被用于预测美国各州流感、COVID-19 和 RSV 住院情况,探索宇宙弦引力辐射的数学解,从 GOES East 卫星数据推导每 10 分钟的柱平均 CO2 估计,并根据斑马鱼神经连接提出可解释的神经回路机制。
推荐理由:文章通过四个跨学科案例展示 ERA 如何处理预测、理论计算、卫星观测和神经回路建模,具体呈现 AI 辅助科学研究的应用路径。
Google Photos 已在 Auto frame 中加入基于3D场景理解和生成式 AI 的自动重构功能,可在拍摄后调整相机位置、方向和焦距,生成新的照片视角。该方法先估计3D点图与人脸信息,再用生成式 latent diffusion 模型补全原照片未捕捉到的区域,并可改善人像广角镜头造成的透视畸变。
推荐理由:Google Photos 将3D场景估计与生成式修补结合,用于自动调整人像视角和广角畸变,展示了生成式编辑介入拍摄构图的具体路径。
Google Research 发布 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 的训练数据,使小鼠轴突重建错误率降低 4.4%。按完整小鼠脑的规模估算,这相当于节省 157 person-years 的人工校对工作;MoGen 及其不同物种的训练模型已开源。
推荐理由:论文展示了合成神经元形状如何降低 PATHFINDER 的重建错误,并将模型改进换算为完整小鼠脑图谱中的人工校对节省量。
Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。
推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。
推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。
Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。
推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。
Google DeepMind 正在探索由 Gemini 驱动的 AI 智能指针,让用户通过指向和语音在不同应用中调用 AI,而不必反复切换窗口或编写复杂提示词。
推荐理由:文章从四项交互原则和实验演示出发,具体说明 AI 如何结合指针位置、视觉上下文与语音,减少复杂提示词输入。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js 和 LiteRT.js 的 XR Blocks,将自然语言转换为物理感知的 Android XR 应用。
推荐理由:Google 将 Gemini 的长上下文推理与 XR Blocks 模板结合,把自然语言生成物理感知的 Android XR 原型,展示了教育和交互场景的快速验证路径。
Google Research 介绍了 S2Vec,这一自监督框架将建筑、道路、商铺等建成环境要素映射到 S2 Geometry 网格,并通过 masked autoencoding 学习通用地理嵌入。在评估中,S2Vec 对未见地区的人口密度和收入等社会经济指标预测表现突出;环境任务通常需要与卫星图像嵌入结合。
Google Research 在 The Check Up 活动上介绍了 AI 用于个性化医疗、临床协作、公共卫生和生物医学研究的最新进展。相关工作包括 Personal Health Agent、AMIE、MedGemma 和 DeepSomatic,涉及乳腺癌检测、糖尿病视网膜病变筛查、医疗应用开发及基因数据分析。
推荐理由:文章集中呈现 Google Research 将多模态模型、智能体和开放权重工具推进医疗研究与临床场景的路径,涵盖筛查、诊疗和公共卫生应用。
Google Research 联合 NHS 机构开展的 AIMS 研究评估了乳腺癌筛查 AI 系统的独立性能及其作为第二读者融入双读流程的可行性。系统将癌症检出率从每 1,000 名女性 7.54 提高到 9.33,并检出原双读流程漏掉的 25% 间隔癌;在 12 个 NHS 筛查点处理 9,266 个病例时,中位 AI 读取时间为 17.7 分钟。
推荐理由:两项研究从独立性能、临床流程整合和人机协作三个层面提供证据,具体呈现了筛查效率、数据漂移与人工复核的权衡。