跳到正文

#Google

今日 9 条
4月30日周四
  1. Google Research84

    Google Research 总结 Empirical Research Assistance 在四类科学问题中的应用

    Google Research 总结 Empirical Research Assistance(ERA)在流行病学、宇宙学、气候研究和神经科学中的四项应用。ERA 被用于预测美国各州流感、COVID-19 和 RSV 住院情况,探索宇宙弦引力辐射的数学解,从 GOES East 卫星数据推导每 10 分钟的柱平均 CO2 估计,并根据斑马鱼神经连接提出可解释的神经回路机制。

    推荐理由:文章通过四个跨学科案例展示 ERA 如何处理预测、理论计算、卫星观测和神经回路建模,具体呈现 AI 辅助科学研究的应用路径。

4月27日周一
  1. Google DeepMind65

    Google DeepMind与韩国科学技术信息通信部宣布AI合作

    Google DeepMind与韩国科学技术信息通信部宣布合作,将在首尔办公室设立AI Campus,支持韩国科研机构使用AI for Science模型推进生命科学、能源、天气与气候研究。双方将探索AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist和WeatherNext等项目的合作,并开展AI人才培养及与韩国AI安全研究所的安全研究。

    推荐理由:Google DeepMind披露了合作的具体落点,涵盖科研设施、模型应用、人才培养与AI安全协作,呈现其国家级AI合作框架。

4月23日周四
  1. Google Research78

    Google Photos 的 Auto frame 可在拍摄后重构照片视角

    Google Photos 已在 Auto frame 中加入基于3D场景理解和生成式 AI 的自动重构功能,可在拍摄后调整相机位置、方向和焦距,生成新的照片视角。该方法先估计3D点图与人脸信息,再用生成式 latent diffusion 模型补全原照片未捕捉到的区域,并可改善人像广角镜头造成的透视畸变。

    推荐理由:Google Photos 将3D场景估计与生成式修补结合,用于自动调整人像视角和广角畸变,展示了生成式编辑介入拍摄构图的具体路径。

4月22日周三
4月21日周二
  1. Google DeepMind57

    Google DeepMind携手五家咨询公司加速企业AI转型

    Google DeepMind宣布与Accenture、Bain & Company、BCG、Deloitte和McKinsey合作,帮助企业以负责任的方式规模化采用前沿AI和智能体AI。合作包括开发行业专用AI能力、让伙伴提前使用包括Gemini系列在内的前沿模型,以及连接AI领导层与客户CEO和董事会,重点覆盖金融、制造、零售、媒体和娱乐等行业。

4月16日周四
  1. Google Research68

    Google Research 发布 Simula:用机制设计和推理从零构建合成数据集

    Google Research 在 Transactions on Machine Learning Research 发表论文“Reasoning-Driven Synthetic Data Generation and Evaluation”,提出推理优先的 Simula 框架,从第一原则构建无需种子数据的合成数据集。

    推荐理由:文章将合成数据生成重构为机制设计问题,展示如何分别控制覆盖度、多样性、复杂度与质量,为构建专业领域数据集提供可迁移框架。

  2. Google Research72

    Google Research 用 AI 生成合成神经元加速脑图谱绘制

    Google Research 发布 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 的训练数据,使小鼠轴突重建错误率降低 4.4%。按完整小鼠脑的规模估算,这相当于节省 157 person-years 的人工校对工作;MoGen 及其不同物种的训练模型已开源。

    推荐理由:论文展示了合成神经元形状如何降低 PATHFINDER 的重建错误,并将模型改进换算为完整小鼠脑图谱中的人工校对节省量。

  3. Google DeepMind79

    Google 发布 Gemini 3.1 Flash TTS 语音模型

    Google 发布 Gemini 3.1 Flash TTS,提升语音质量、可控性和表现力,并支持原生多说话人对话及 70+ languages。模型新增 audio tags,可通过自然语言控制语气、语速和表达方式,并在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中分阶段提供预览或使用。

    推荐理由:Gemini 3.1 Flash TTS 将音频标签、场景指令和说话人设置结合,展示了开发者如何更细致地控制语音表达与多轮角色表现。

4月14日周二
  1. Google Research79

    Google Research 推出 Vantage,利用生成式 AI 评估未来技能

    Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。

    推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月9日周四
  1. Google Research65

    Google Research 发布 ConvApparel 数据集与用户模拟器反事实验证框架

    Google Research 介绍 ConvApparel 数据集与评估框架,用于衡量 LLM 用户模拟器与真实人类交互之间的现实性差距。该数据集包含超过 4,000 段人类与 AI 的多轮服饰购物对话,总计近 15,000 轮,并通过“Good”和“Bad”两个推荐智能体收集不同用户体验。

    推荐理由:研究用双智能体数据和反事实验证评估用户模拟器,展示了统计拟合与面对未见挫折场景时适应能力之间的差异。

4月3日周五
  1. Google Research68

    Google Research 评估大语言模型行为倾向与人类的对齐程度

    Google Research 提出一套评估大语言模型行为倾向对齐程度的框架,将心理问卷改编为现实场景中的情境判断测试,并比较 25 个 LLM 与 550 名参与者的偏好分布。结果显示,小于 25B 的模型方向性对齐较低,大于 120B 及前沿闭源权重模型在 10/10 人类共识场景中接近完全对齐,但在人类共识较低时普遍表现出过度自信,难以反映意见多样性;模型的自我报告与实际行为也存在明显差异。

    推荐理由:研究把心理问卷转化为现实场景中的判断测试,既比较模型与人类共识,也检验模型能否保留分歧意见的范围。

  2. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

4月1日周三
3月31日周二
  1. Google Research81

    Google Research 发布量子攻击加密货币的新资源估算与负责任披露方案

    Google Research 表示,未来量子计算机破解保护加密货币的 256-bit 椭圆曲线离散对数问题所需资源可能低于此前估计。其白皮书给出两种少于 1,200 或 1,450 个逻辑量子比特的 Shor's algorithm 电路,并估计少于 500,000 个物理量子比特即可在几分钟内执行。

    推荐理由:Google 给出量子攻击 ECDLP-256 的更新资源估算,并以零知识证明支持可验证披露,为加密货币迁移 PQC 提供了具体依据。

3月29日周日
  1. Google DeepMind79

    Google DeepMind 用 Gemini 探索 AI 时代的智能指针

    Google DeepMind 正在探索由 Gemini 驱动的 AI 智能指针,让用户通过指向和语音在不同应用中调用 AI,而不必反复切换窗口或编写复杂提示词。

    推荐理由:文章从四项交互原则和实验演示出发,具体说明 AI 如何结合指针位置、视觉上下文与语音,减少复杂提示词输入。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live,提升了语音交互的精度、自然度和响应速度,并支持更可靠的复杂任务执行。

    推荐理由:Gemini 3.1 Flash Live 同时给出语音交互、任务执行和多语言扩展的具体变化,便于判断其开发者与终端使用场景。

3月25日周三
  1. Google Research77

    Google 发布 Vibe Coding XR,用 Gemini 和 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js 和 LiteRT.js 的 XR Blocks,将自然语言转换为物理感知的 Android XR 应用。

    推荐理由:Google 将 Gemini 的长上下文推理与 XR Blocks 模板结合,把自然语言生成物理感知的 Android XR 原型,展示了教育和交互场景的快速验证路径。

3月18日周三
  1. Google Research81

    Google Research 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 活动上介绍了 AI 用于个性化医疗、临床协作、公共卫生和生物医学研究的最新进展。相关工作包括 Personal Health Agent、AMIE、MedGemma 和 DeepSomatic,涉及乳腺癌检测、糖尿病视网膜病变筛查、医疗应用开发及基因数据分析。

    推荐理由:文章集中呈现 Google Research 将多模态模型、智能体和开放权重工具推进医疗研究与临床场景的路径,涵盖筛查、诊疗和公共卫生应用。

  2. Google Research85

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research 联合 NHS 机构开展的 AIMS 研究评估了乳腺癌筛查 AI 系统的独立性能及其作为第二读者融入双读流程的可行性。系统将癌症检出率从每 1,000 名女性 7.54 提高到 9.33,并检出原双读流程漏掉的 25% 间隔癌;在 12 个 NHS 筛查点处理 9,266 个病例时,中位 AI 读取时间为 17.7 分钟。

    推荐理由:两项研究从独立性能、临床流程整合和人机协作三个层面提供证据,具体呈现了筛查效率、数据漂移与人工复核的权衡。

3月17日周二
  1. Google Research67

    Google Research 用高温超导问题评测六个 LLM 的科学问答能力

    Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。

    推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。

3月12日周四
  1. Google Research83

    Google Research推出Groundsource,用Gemini将新闻报道转化为洪水数据

    Google Research推出Groundsource,利用Gemini从80种语言的新闻报道中提取洪水事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度;相关数据集已开放,并用于支持最多提前24小时的城市暴洪预测及Google Flood Hub的覆盖扩展。

    推荐理由:Groundsource展示了如何用Gemini从多语言新闻中提取并校验灾害时空信息,为缺乏统一观测体系的洪水研究补充历史数据。

3月7日周六
  1. Google Research79

    Google Research 发布 WAXAL:覆盖27种非洲语言的开放语音资源

    Google Research 发布 WAXAL,这是一个覆盖27种撒哈拉以南非洲语言的开放语音数据集,服务于自动语音识别(ASR)和文本转语音(TTS)。首批资源包含约1,846小时转录自然语音和超过565小时高保真录音,覆盖超过100 million speakers,并以 CC-BY-4.0 许可开放。数据由非洲学术与社区组织参与采集,Google 计划持续扩展语言覆盖范围。

    推荐理由:WAXAL同时覆盖自然语音识别与高保真语音合成数据,并以开放许可面向27种非洲语言,为低资源语音技术研究提供了可复用基础。

  2. Google Research77

    Google SpeciesNet 模型识别近2500类野生动物

    Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。

    推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。