跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 1–20 条 · 共 120 条
今天10月2日周五
  1. The Decoder79

    Google 在 Gemini 中以 Skills 取代 Gems

    Google 正在向全球 Gemini 聊天用户推出 Skills,以取代 Gems。用户可用“/”加名称调用保存的任务指令,Gemini 还能从历史对话生成 Skills,并在检测到匹配提示词时自动运行。Skills 支持文本文件、PDF 和图像作为参考资料,现有 Gems 会自动转换;Gems 将于 11 月对个人账户停用,并在之后分批停止支持 Workspace 客户。

    推荐理由:Google 将 Gems 迁移为可调用、可组合的 Skills,并公布了资料引用、自动生成和后续协作集成安排。

  2. The Verge · AI76

    Google 据报测试向出版商支付 AI 搜索内容费用

    据报道,Google 已启动一项向出版商支付费用的试点计划,约有 100 家出版商参与,其内容对 Search 的 AI Overviews、AI Mode 及 Gemini chatbot 的贡献会影响收入。最早加入的一家出版商一年收入超过 $1 million,几个月前加入的另一家收入约为 $50,000 至 $60,000;该计划面临出版商诉讼和监管机构对网页流量影响的审查。

    推荐理由:报道呈现了 Google 向内容参与 AI 搜索的出版商付费的试点规模与收入差异,也交代了该安排面临的流量和监管压力。

10月1日周四
  1. The Verge · AI88

    Google 发布 Gemini 4 Argon,暂限受信任的网络安全防御者使用

    Google 发布下一代前沿模型 Gemini 4 Argon,称其在复杂工作流、软件工程、法律与金融等企业知识工作及网络安全防御方面具备前沿性能。该模型目前仅向一组受信任的网络安全防御者开放,Google 将在扩大开放前加强关键前沿安全措施,包括防范滥用和提示词注入攻击并监测失配。

    推荐理由:Google 仅向受信任的网络安全防御者开放 Gemini 4 Argon,并将重点完善滥用、提示词注入和失配防护。

  2. Google DeepMind90

    Google DeepMind 发布 Gemini 4 Argon,强化长程推理与网络安全防御

    Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。

    推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。

9月30日周三
  1. Ars Technica · AI77

    Google DeepMind 用 SynthIDBio 为 AI 设计蛋白质添加水印

    Google DeepMind 在 Nature 发表研究,提出 SynthIDBio,可在 ProteinMPNN 设计蛋白质时嵌入分布式水印,同时保持蛋白质与目标蛋白结合的功能。

    推荐理由:论文展示了 SynthIDBio 如何在不损害蛋白质功能的前提下嵌入可检测水印,为筛查来源不明的 AI 设计蛋白提供了具体思路。

  2. Google DeepMind86

    Google DeepMind 发布 SynthID Bio,为AI生成蛋白质添加生物水印

    Google DeepMind 发布 SynthID Bio,可将不可见签名嵌入AI生成的蛋白质序列和预测的3D结构,并在合成后的物理蛋白质中验证。实验显示,经过水印处理的蛋白质结合剂在VEGF-A、SARS-CoV-2 spike protein RBD和PD-L1三种目标上保持了与未加水印设计相当的命中率、结合亲和力和自然序列多样性。

    推荐理由:SynthID Bio把水印嵌入蛋白质序列和预测结构,并在实验中保持生物功能,为AI生成生物设计的来源核验提供了具体路径。

  3. Google Research60

    Google Research 提出 Diffusion Controller 统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller,将图像生成的去噪过程重新表述为连续控制问题,用轻量级控制网络调节生成轨迹。该框架支持灰盒和白盒场景,并通过 SFT、RWL 和 PPO 在 Stable Diffusion v1.4 上进行评估;其完全解锁版本相对基线模型取得了 90% 的胜率。

    推荐理由:Diffusion Controller 将推理时引导与微调统一为连续控制框架,并展示了灰盒和白盒场景下兼顾偏好匹配与图像质量的实现路径。

9月25日周五
  1. Google Research78

    Google Research 介绍用于连贯长视频生成的多智能体框架

    Google Research 介绍了一套基于 Gemini 和 Veo 的 AI 视频联合导演多智能体框架,用于自动规划多镜头叙事并减少角色、场景和物体状态漂移。框架包含 Co-Director、CANVAS、A²RD 和 VQQA,分别覆盖创意编排、视觉连续性、分钟级视频生成和闭环提示词优化,并在多个视频基准上报告了质量与一致性提升。

    推荐理由:Google 将长视频生成拆解为创意编排、视觉记忆、时间扩展和闭环优化四个环节,展示了缓解跨镜头一致性问题的系统化路径。

  2. Google DeepMind83

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,生成具备唇形同步、表情和连续对话能力的动态视觉化身。该功能支持异步工具调用、97 种语言间切换,并已在 Gemini Enterprise 提供;自定义化身目前仅通过企业 allowlisting 开放,所有输出均带有 SynthID 水印。

    推荐理由:Google DeepMind 展示了 Live Avatar 在实时对话、异步工具调用、多语言同步和品牌定制上的企业应用方式。

9月24日周四
  1. Google DeepMind85

    Google DeepMind 更新 Private AI Compute,支持私有的跨设备持久记忆

    Google DeepMind 发布 Private AI Compute 技术更新,引入服务器端持久记忆,让 AI 可在设备间保留上下文,同时维持端侧隐私标准。用户数据存放在加密存储中,解密密钥仅由个人设备持有,云端通过硬件强制的安全隔离环境临时处理数据。Google DeepMind 还发布更新后的技术白皮书、服务器软件的防篡改公开记录,并提供独立网络安全审计结果。

    推荐理由:文章具体说明了云端持久记忆如何结合设备密钥、加密通道与安全隔离环境,在跨设备连续体验和隐私控制之间取得平衡。

9月23日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,用于生成可定制的角色声音、逐句指导场景对白和大规模语音内容。

    推荐理由:两款模型分别覆盖创意驱动与高量低成本语音生成,并提供声音定制、逐句导演和同意验证,展示了语音模型面向生产应用的能力边界。

9月19日周六
  1. Google Research65

    Google Research 发布 MilleMiglia 中程物流实例生成器

    Google Research 介绍 MilleMiglia,这是一个用 C++ 编写的中程物流实例生成器,可创建包含固定车辆时刻表、配送中心吞吐限制和复杂同步约束的现实基准数据。它通过空间分布、需求和车辆班次等统计分布生成隐私保护的合成网络,覆盖从小型测试到洲际规模实例,并可用于训练 ML 算法。项目代码和文档已在 GitHub 开源,Google 及学术合作伙伴还在开发专用求解器和 API。

    推荐理由:文章解释了中程物流为何难以套用传统 VRP,并展示 MilleMiglia 如何用隐私保护的合成数据支持统一基准与后续求解器研究。

9月18日周五
  1. Google Research74

    Google Research 研究生成式 UI 如何帮助教师创建互动学习内容

    Google Research 发布一项研究实验,利用面向学习优化的生成式 UI,帮助教师按课程目标创建定制的互动教育模拟。研究同时发布了 30 多个英文 STEM 学习互动内容,涵盖物理、化学、生物和数学,并由教师审核。实验包含迭代式生成、自我纠错和 Agent 式自动评估;一项涉及 12 名美国教师的初步研究中,互动内容质量平均评分为 8/10。

    推荐理由:Google 以教师审核和教学护栏为核心,展示了 GenUI 如何生成可定制的 STEM 互动练习及其早期教师反馈。

9月16日周三
  1. NVIDIA Blog63

    Emerald AI、Google与NVIDIA成立联盟推动灵活用电的AI数据中心

    Emerald AI、Google与NVIDIA宣布成立AI Energy Management Alliance(AEMA),推动可根据电网状况动态调整用电的AI数据中心。联盟提出技术中立、以性能为基础的要求,涵盖响应速度、持续时间、可预测性、应急行为、技术标准和运营数据共享,并计划与公用事业及电网运营商合作,探索更快的AI基础设施并网路径。

    推荐理由:文章介绍了AEMA面向AI数据中心的性能化灵活用电框架,涵盖响应指标、互联成本和电网协作,为理解AI基础设施扩张中的电力约束提供了具体背景。

  2. Google Research70

    Google Research 提出 Retrieve-for-Train,用扩散模型加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线 RL 生成监督数据,再将集合级检索行为蒸馏到 53.9M 参数的扩散模型中。该模型可在单次非自回归推理中生成完整目标嵌入集合,相比自回归方法实现 12 到 20 倍加速,并在时延规模扩大时保持亚秒至数秒响应。

    推荐理由:论文展示了如何把离线 RL 学到的集合级检索行为蒸馏进扩散模型,以降低复杂搜索的推理延迟并减少人工标注依赖。