跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 121–140 条 · 共 168 条
3月7日周六
  1. Google Research77

    Google SpeciesNet 模型识别近2500类野生动物

    Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。

    推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。

2月20日周五
2月19日周四
2月13日周五
2月5日周四
  1. Google Research66

    Google Research介绍Natively Adaptive Interfaces框架,以多模态AI智能体提升无障碍设计

    Google Research介绍Natively Adaptive Interfaces(NAI)框架,尝试用原生嵌入界面的多模态AI智能体替代静态导航,让应用根据用户情境和偏好动态调整。

    推荐理由:Google Research提出将智能体原生嵌入界面,通过多模态协作和社区共创缩小无障碍功能滞后,为通用设计提供了可复用框架。

2月4日周三
  1. Google Research77

    Google 与 Included Health 将开展全国性随机研究评估虚拟医疗中的 AI

    Google 宣布与 Included Health 合作,在获 Institutional Review Board(IRB)批准后开展一项面向全国、经同意参与者的前瞻性随机研究,评估对话式 AI 在真实虚拟医疗工作流中的表现。

    推荐理由:研究将把对话式 AI 从模拟和可行性测试推进到全国范围的随机对照研究,为评估真实虚拟医疗中的安全性与实用性提供更严格证据。

1月30日周五
  1. Google DeepMind83

    Google DeepMind 推出 Project Genie 互动世界原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一款由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性网页原型。

    推荐理由:Project Genie 将 Genie 3 的世界模型能力封装为可操作原型,展示了从生成环境到实时探索和视频导出的完整体验。

1月28日周三
  1. Google Research73

    Google Research 发布 ATLAS:多语言模型的实用 scaling laws

    Google Research 发布 ATLAS 多语言模型研究,基于 774 次训练运行、400+ 种语言和 48 种语言评测,提出可适应语言混合的 scaling laws。

    推荐理由:论文将多语言预训练、语言迁移和微调决策统一到可操作的 scaling laws 中,为不同语言组合下的模型规模、数据量与计算预算规划提供了量化参考。

1月23日周五
  1. Google Research65

    Google 研究用分解方法提升小模型的用户意图提取效果

    Google Research 介绍一项发表于 EMNLP 2025 的研究,将用户界面轨迹的意图理解拆为逐屏摘要和序列意图抽取两步,以便小型多模态 LLM 在设备端处理。

    推荐理由:论文将界面轨迹的意图理解拆成屏幕摘要与序列抽取两步,并以事实级指标分析小模型在端侧场景中的效果与误差来源。

1月16日周五
  1. Google DeepMind72

    Google DeepMind 发布 D4RT,统一动态 4D 场景重建与跟踪

    Google DeepMind 推出 D4RT,一种统一的 AI 模型,用于跨空间与时间进行 4D 场景重建和跟踪。D4RT 采用基于查询的 Transformer 编解码架构,在测试中比此前 state of the art 方法快 18x 至 300x;处理一分钟视频约需 5 秒,而此前方法最多需要 10 分钟。

    推荐理由:D4RT 将动态场景重建与跟踪统一到查询式架构中,并以速度数据展示其在实时空间理解场景中的应用潜力。

1月14日周三
  1. Google Research68

    Google Research 研究用硬刹车事件评估道路路段碰撞风险

    Google Research 发现,Android Auto 收集的硬刹车事件(HBE)频率与道路路段实际碰撞率呈显著正相关,可作为道路安全评估的先行指标。研究结合 Virginia 和 California 的公开事故数据与匿名聚合的 Android Auto 数据,并使用 10 年事故记录和负二项回归进行验证;观测到 HBE 的路段数量是报告事故路段的 18 倍。

    推荐理由:研究用两州公开事故数据和 Android Auto 聚合数据验证了硬刹车事件作为高密度道路风险先行指标的可行性。

  2. Google Research82

    Google发布MedGemma 1.5 4B并推出MedASR医疗语音识别模型

    Google发布MedGemma 1.5 4B,扩展对CT、MRI和全切片组织病理图像的支持,并改进胸部X光定位、纵向影像 review、实验室报告提取和医疗文本问答等能力。

    推荐理由:Google同时更新了MedGemma的高维医疗影像与文本能力,并发布MedASR,文中的基准数据可帮助开发者比较其适配医疗场景的起点。

  3. Google Research74

    Google Research 展示动态表面码推进量子纠错

    Google Quantum AI 在 Willow 处理器上实验展示了采用动态电路的表面码量子纠错,并提出 hexagonal、walking 和 iSWAP 三种电路。hexagonal 电路仅需每个量子比特连接三个 coupler,walking 电路将泄漏相关误差降低超过一个数量级,iSWAP 电路达到 1.56 的误差抑制因子。

    推荐理由:研究通过三种动态表面码展示了在连接布局、泄漏误差和双量子比特门选择上的适应空间,为量子硬件与纠错协议协同设计提供了具体实验依据。

12月17日周三
12月16日周二
  1. Google DeepMind85

    Google DeepMind发布Gemma Scope 2解释性工具套件

    Google DeepMind发布Gemma Scope 2开放解释性工具套件,覆盖Gemma 3从270M到27B参数的全部模型尺寸。该套件结合SAE、transcoder、skip-transcoder和cross-layer transcoder,并提供面向聊天模型的工具,用于分析越狱、拒答机制和思维链忠实性等复杂行为。

    推荐理由:Gemma Scope 2覆盖Gemma 3全尺寸模型并引入多类解释工具,为研究越狱、幻觉和模型行为审计提供了更完整的开放基础。

  2. Google Research73

    Google Research 的 Paper Assistant Tool 为 STOC 2026 理论计算机科学论文提供自动反馈

    Google Research 为 STOC 2026 创建了由 Gemini 2.5 Deep Think 驱动的 Paper Assistant Tool,在论文提交前提供自动反馈,帮助作者发现计算错误、变量不一致和证明中的逻辑漏洞。

    推荐理由:这项试验展示了专用 AI 工具如何在人工同行评审前检查理论论文,并给出错误识别、反馈速度与作者使用感受等具体结果。

12月11日周四
  1. Google DeepMind66

    Google DeepMind扩大与英国AI安全研究所的合作

    Google DeepMind宣布通过新的谅解备忘录扩大与英国AI安全研究所(AISI)的合作,从测试模型扩展到基础安全与安全性研究。双方将共享模型、数据和想法,开展联合报告及研究,重点关注AI推理过程监测、社会情感错位和经济系统影响评估。

    推荐理由:Google DeepMind与英国AI安全研究所将合作范围从模型测试扩展至基础安全研究,覆盖推理监测、社会情感影响和经济系统评估。

  2. Google Research61

    Google Research 发布 Urania:用差分隐私分析 AI 聊天机器人使用情况

    Google Research 介绍论文《Urania》提出的差分隐私框架,用 DP 聚类、DP 关键词提取和仅基于匿名关键词的 LLM 摘要分析聊天机器人使用情况。与非私有基线相比,隐私摘要在一次评估中最高有 70% 的偏好率,成员推断攻击的 AUC 为 0.53,而非私有流程为 0.58。

    推荐理由:文章展示了如何用差分隐私替代启发式脱敏分析聊天数据,并通过摘要偏好和成员推断实验呈现隐私与信息细致度的权衡。