跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 41–60 条 · 共 87 条
7月28日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini Robotics 2,提升机器人的全身智能与协作能力

    Google DeepMind 发布 Gemini Robotics 2,包含 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,支持人形机器人全身控制、灵巧操作、具身推理和多机器人协作。

    推荐理由:Google DeepMind同时更新了全身控制、灵巧操作、具身推理和端侧适配,呈现了机器人从单步执行走向多步骤协作的技术路径。

7月23日周四
  1. Google Research78

    Google Research 发布 SymptomAI 研究,探索面向日常症状评估的对话式 AI 智能体

    Google Research 介绍 SymptomAI,一组用于日常症状访谈和鉴别诊断的实验性对话式 AI 智能体,并在 n=13,917 的随机研究中与临床专家评估进行比较。

    推荐理由:这项大规模研究把日常症状对话、临床专家评估与 Fitbit 生理信号结合起来,呈现了 SymptomAI 在真实场景中的评估方法与边界。

7月21日周二
7月16日周四
  1. Google DeepMind75

    Google DeepMind 与 Isomorphic Labs 发布生物韧性方案

    Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,围绕防止模型被滥用、快速检测疫情和设计医疗应对措施展开。过去 12 个月,双方推进了与政府机构、生物安全组织和研究团队的 15 项以上合作,并计划向可信合作伙伴开放 AI 模型和智能体。

    推荐理由:文章系统说明了 Google DeepMind 与 Isomorphic Labs 如何将 AI 用于生物安全,并将防滥用、疫情检测与医疗响应连接起来。

7月15日周三
  1. Hugging Face Blog92

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。

    推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。

7月13日周一
7月9日周四
  1. Google Research80

    Google Research 发布 SensorFM,探索可穿戴健康数据的通用基础模型

    Google Research 介绍 SensorFM,这一 Large Sensor Foundation Model 在五百万名参与者、超过一万亿分钟的多模态可穿戴传感器数据上预训练。

    推荐理由:文章展示了 SensorFM 如何以大规模无标签可穿戴数据学习通用生理表征,并通过多任务评估和 Personal Health Agent 验证其适配价值。

7月6日周一
  1. Hugging Face Blog79

    PRX Part 4:Photoroom 详解 PRX 的数据策略

    Photoroom 在 PRX 系列第 4 部分介绍了预训练数据管线:混合公共与内部数据集,用 VLM 为图像生成 100–200 词的详细描述,再通过 Lance 构建数据集、用 Mosaic Data Shards 流式训练。

    推荐理由:文章系统拆解了 PRX 7B 预训练数据管线,从数据格式、VLM 重标注到过滤去重,提供了可复用的工程取舍与实测依据。

7月1日周三
  1. Google Research77

    Google Research 发布覆盖50多个城市的 Heat Resilience 屋顶反射率数据与 Earth Engine App

    Google Research 发布覆盖50多个全球城市的建筑级屋顶反射率数据,并上线 Heat Resilience Earth Engine App,帮助城市规划者识别适合部署凉屋顶的建筑和区域。

    推荐理由:Google Research 将建筑级屋顶反射率数据扩展至50多个城市,并开放 Earth Engine App,为城市规划者定位高优先级降温改造提供了可操作的数据基础。

6月30日周二
6月23日周二
6月17日周三
  1. Google Research77

    Google 发布用于自然恢复的 Earth AI 矢量数据集

    Google 发布一套面向英国自然恢复的矢量化数据集,可识别并分类树篱、石墙和小片林地等细尺度生态特征。该系统基于 Remote Sensing Foundations 的 ViT Backbone,结合亚米级影像和 1 米 LiDAR 数据,并通过 Polsby–Popper 紧致度评分区分林地、木本斑块和线性木本特征。

    推荐理由:Google 将高分辨率栅格地图转为可操作的矢量数据集,展示了 AI 如何把生态特征识别推进到保护规划与碳核算。

6月13日周六
  1. Google Research74

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 汇总两项关于皮肤状况信息工具的研究,考察图像型 AI 如何帮助用户识别病症并判断后续行动。在一项包含 2,345 名参与者的调查中,AI 辅助下的病症命名准确率为 23%,高于标准搜索的 8%,但标准 AI 对下一步行动准确率没有显著提升。

    推荐理由:两项研究分别从大规模调查和真实社区使用出发,展示了图像型 AI 在识别皮肤状况上的帮助及其在下一步医疗决策上的局限。

6月9日周二
  1. Google DeepMind87

    Google 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,可自动识别 70+ 种语言并进行接近实时的语音到语音翻译,同时保留说话者的语调、语速和音高。

    推荐理由:Gemini 3.5 Live Translate 将连续语音翻译、音色节奏保留与多端接入结合,文中也列出开发者、企业和普通用户的使用入口。

  2. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

6月5日周五
  1. Google Research83

    Google Research 发布 PHRM 手机被动心率监测研究

    Google Research 在 Nature 论文中介绍 PHRM,利用手机前置摄像头在面部解锁后采集 8 秒视频,被动估计心率和每日静息心率。该系统在真实环境验证中对心率的 MAPE 为 6.09%,对 Fitbit Charge 6 日静息心率的 MAE 为 4.39 bpm,并发布 PHRM-mini 模型及大型多肤色研究数据集供符合条件的研究人员申请使用。

    推荐理由:研究展示了手机前置摄像头在日常使用中被动估计心率和静息心率的方法,并用多肤色数据验证其准确性与可用范围。

5月29日周五
  1. Google Research71

    Google Research 发布 I/O 2026 多领域研究成果

    Google Research 总结 I/O 2026 展示的研究进展,涵盖 Gemini for Science、医疗 AI、WeatherNext、Gemini 核心能力、智能体开发平台和量子计算等方向。

    推荐理由:文章集中呈现 Google Research 在科学发现、医疗、天气预测和智能体开发等方向的研究成果及其产品化路径,便于了解研究如何转化为实际工具。

5月27日周三
  1. Mistral AI67

    Mistral AI 引入物理 AI,构建工程加速基础能力

    Mistral AI 宣布将 Emmi AI 纳入自身,推出面向工业工程的物理 AI 能力。该类模型从物理求解器输出或测量数据中学习,可根据几何与边界条件在单个 GPU 上以秒级前向推理预测完整物理场。Mistral AI 表示,这项能力将服务于产品设计、工装与工艺优化及实时数字孪生,并作为其企业 AI 平台的一部分面向航空航天、汽车、半导体、能源和工业设备等领域。

    推荐理由:文章说明了物理 AI 如何将工程仿真从小时至数周缩短到秒级,并展示其在设计、制造和数字孪生中的应用路径。