跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 101–120 条 · 共 120 条
4月16日周四
  1. Google DeepMind79

    Google 发布 Gemini 3.1 Flash TTS 语音模型

    Google 发布 Gemini 3.1 Flash TTS,提升语音质量、可控性和表现力,并支持原生多说话人对话及 70+ languages。模型新增 audio tags,可通过自然语言控制语气、语速和表达方式,并在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中分阶段提供预览或使用。

    推荐理由:Gemini 3.1 Flash TTS 将音频标签、场景指令和说话人设置结合,展示了开发者如何更细致地控制语音表达与多轮角色表现。

4月14日周二
  1. Google Research79

    Google Research 推出 Vantage,利用生成式 AI 评估未来技能

    Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。

    推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月9日周四
  1. Google Research65

    Google Research 发布 ConvApparel 数据集与用户模拟器反事实验证框架

    Google Research 介绍 ConvApparel 数据集与评估框架,用于衡量 LLM 用户模拟器与真实人类交互之间的现实性差距。该数据集包含超过 4,000 段人类与 AI 的多轮服饰购物对话,总计近 15,000 轮,并通过“Good”和“Bad”两个推荐智能体收集不同用户体验。

    推荐理由:研究用双智能体数据和反事实验证评估用户模拟器,展示了统计拟合与面对未见挫折场景时适应能力之间的差异。

4月3日周五
  1. Google Research68

    Google Research 评估大语言模型行为倾向与人类的对齐程度

    Google Research 提出一套评估大语言模型行为倾向对齐程度的框架,将心理问卷改编为现实场景中的情境判断测试,并比较 25 个 LLM 与 550 名参与者的偏好分布。结果显示,小于 25B 的模型方向性对齐较低,大于 120B 及前沿闭源权重模型在 10/10 人类共识场景中接近完全对齐,但在人类共识较低时普遍表现出过度自信,难以反映意见多样性;模型的自我报告与实际行为也存在明显差异。

    推荐理由:研究把心理问卷转化为现实场景中的判断测试,既比较模型与人类共识,也检验模型能否保留分歧意见的范围。

  2. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

4月1日周三
3月31日周二
  1. Google Research81

    Google Research 发布量子攻击加密货币的新资源估算与负责任披露方案

    Google Research 表示,未来量子计算机破解保护加密货币的 256-bit 椭圆曲线离散对数问题所需资源可能低于此前估计。其白皮书给出两种少于 1,200 或 1,450 个逻辑量子比特的 Shor's algorithm 电路,并估计少于 500,000 个物理量子比特即可在几分钟内执行。

    推荐理由:Google 给出量子攻击 ECDLP-256 的更新资源估算,并以零知识证明支持可验证披露,为加密货币迁移 PQC 提供了具体依据。

3月29日周日
  1. Google DeepMind79

    Google DeepMind 用 Gemini 探索 AI 时代的智能指针

    Google DeepMind 正在探索由 Gemini 驱动的 AI 智能指针,让用户通过指向和语音在不同应用中调用 AI,而不必反复切换窗口或编写复杂提示词。

    推荐理由:文章从四项交互原则和实验演示出发,具体说明 AI 如何结合指针位置、视觉上下文与语音,减少复杂提示词输入。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live,提升了语音交互的精度、自然度和响应速度,并支持更可靠的复杂任务执行。

    推荐理由:Gemini 3.1 Flash Live 同时给出语音交互、任务执行和多语言扩展的具体变化,便于判断其开发者与终端使用场景。

3月25日周三
  1. Google Research77

    Google 发布 Vibe Coding XR,用 Gemini 和 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js 和 LiteRT.js 的 XR Blocks,将自然语言转换为物理感知的 Android XR 应用。

    推荐理由:Google 将 Gemini 的长上下文推理与 XR Blocks 模板结合,把自然语言生成物理感知的 Android XR 原型,展示了教育和交互场景的快速验证路径。

3月18日周三
  1. Google Research81

    Google Research 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 活动上介绍了 AI 用于个性化医疗、临床协作、公共卫生和生物医学研究的最新进展。相关工作包括 Personal Health Agent、AMIE、MedGemma 和 DeepSomatic,涉及乳腺癌检测、糖尿病视网膜病变筛查、医疗应用开发及基因数据分析。

    推荐理由:文章集中呈现 Google Research 将多模态模型、智能体和开放权重工具推进医疗研究与临床场景的路径,涵盖筛查、诊疗和公共卫生应用。

  2. Google Research85

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research 联合 NHS 机构开展的 AIMS 研究评估了乳腺癌筛查 AI 系统的独立性能及其作为第二读者融入双读流程的可行性。系统将癌症检出率从每 1,000 名女性 7.54 提高到 9.33,并检出原双读流程漏掉的 25% 间隔癌;在 12 个 NHS 筛查点处理 9,266 个病例时,中位 AI 读取时间为 17.7 分钟。

    推荐理由:两项研究从独立性能、临床流程整合和人机协作三个层面提供证据,具体呈现了筛查效率、数据漂移与人工复核的权衡。

3月17日周二
  1. Google Research67

    Google Research 用高温超导问题评测六个 LLM 的科学问答能力

    Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。

    推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。

3月12日周四
  1. Google Research83

    Google Research推出Groundsource,用Gemini将新闻报道转化为洪水数据

    Google Research推出Groundsource,利用Gemini从80种语言的新闻报道中提取洪水事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度;相关数据集已开放,并用于支持最多提前24小时的城市暴洪预测及Google Flood Hub的覆盖扩展。

    推荐理由:Groundsource展示了如何用Gemini从多语言新闻中提取并校验灾害时空信息,为缺乏统一观测体系的洪水研究补充历史数据。

3月7日周六
  1. Google Research79

    Google Research 发布 WAXAL:覆盖27种非洲语言的开放语音资源

    Google Research 发布 WAXAL,这是一个覆盖27种撒哈拉以南非洲语言的开放语音数据集,服务于自动语音识别(ASR)和文本转语音(TTS)。首批资源包含约1,846小时转录自然语音和超过565小时高保真录音,覆盖超过100 million speakers,并以 CC-BY-4.0 许可开放。数据由非洲学术与社区组织参与采集,Google 计划持续扩展语言覆盖范围。

    推荐理由:WAXAL同时覆盖自然语音识别与高保真语音合成数据,并以开放许可面向27种非洲语言,为低资源语音技术研究提供了可复用基础。

  2. Google Research77

    Google SpeciesNet 模型识别近2500类野生动物

    Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。

    推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。