Google DeepMind 推出 Project Genie 互动世界原型
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一款由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性网页原型。
推荐理由:Project Genie 将 Genie 3 的世界模型能力封装为可操作原型,展示了从生成环境到实时探索和视频导出的完整体验。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一款由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性网页原型。
推荐理由:Project Genie 将 Genie 3 的世界模型能力封装为可操作原型,展示了从生成环境到实时探索和视频导出的完整体验。
Google Research 介绍一项发表于 EMNLP 2025 的研究,将用户界面轨迹的意图理解拆为逐屏摘要和序列意图抽取两步,以便小型多模态 LLM 在设备端处理。
推荐理由:论文将界面轨迹的意图理解拆成屏幕摘要与序列抽取两步,并以事实级指标分析小模型在端侧场景中的效果与误差来源。
Google DeepMind 推出 D4RT,一种统一的 AI 模型,用于跨空间与时间进行 4D 场景重建和跟踪。D4RT 采用基于查询的 Transformer 编解码架构,在测试中比此前 state of the art 方法快 18x 至 300x;处理一分钟视频约需 5 秒,而此前方法最多需要 10 分钟。
推荐理由:D4RT 将动态场景重建与跟踪统一到查询式架构中,并以速度数据展示其在实时空间理解场景中的应用潜力。
Google发布MedGemma 1.5 4B,扩展对CT、MRI和全切片组织病理图像的支持,并改进胸部X光定位、纵向影像 review、实验室报告提取和医疗文本问答等能力。
推荐理由:Google同时更新了MedGemma的高维医疗影像与文本能力,并发布MedASR,文中的基准数据可帮助开发者比较其适配医疗场景的起点。
Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。
推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。
Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。
推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。
Google DeepMind 发布 Gemini 3 Flash,结合 Gemini 3 Pro 级推理与 Flash 级延迟、效率和成本,面向开发者、消费者及企业逐步开放。
推荐理由:Gemini 3 Flash同时给出推理、速度、成本和编码基准数据,并覆盖开发者、消费者与企业入口,便于比较其实际定位。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,新增 Parametric、Search、Multimodal 三项基准,并更新 FACTS Grounding Benchmark v2。
推荐理由:FACTS Benchmark Suite 将内部知识、网页搜索、图像问答和上下文 grounding 分开评测,并公开 3,513 个样例,便于比较模型在不同事实性任务上的表现。
研究人员利用 AlphaFold 预测植物及耐热藻类 glycerate kinase(GLYK)的结构,并通过分子模拟发现植物 GLYK 的三个柔性环在高温下会失稳。团队以藻类 GLYK 的刚性结构替换这些区域,设计出的杂合酶在最高 65 °C 下仍保持稳定,为培育更耐热的作物提供了研究路径。
推荐理由:研究展示了如何结合 AlphaFold 结构预测与分子模拟定位酶的热不稳定区域,并据此设计出耐受更高温度的杂合酶。
Google Research 发布 Massive Sound Embedding Benchmark(MSEB),用于统一评测检索、推理、分类、转录、分割、聚类、重排和重建八类声音理解能力。
推荐理由:MSEB 将语音与生物声学等场景纳入统一评测,并拆分八类能力,帮助比较通用声音表示与专用系统的差距。
Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。
推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。
Google DeepMind 回顾 AlphaFold 自 2020 年以来对科学研究的影响,包括 AlphaFold Protein Database 被超过 3 million 名研究者在 190 多个国家使用,以及相关研究在疾病理解、药物研发和生物学发现中的应用。
推荐理由:文章以五年应用数据和具体科研案例梳理 AlphaFold 的扩散路径,呈现其从蛋白质结构预测工具走向数字生物学平台的过程。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),面向开发者提供高保真图像生成与编辑能力,目前通过 Gemini API 在 Google AI Studio 和 Vertex AI 以付费预览形式推出。
推荐理由:这篇发布说明集中展示了 Gemini 3 Pro Image 在文字渲染、图像控制、语言本地化和 Google Search grounding 方面的开发者用法。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),主打更强的推理、世界知识、文字渲染和图像编辑控制。
推荐理由:Nano Banana Pro 将更强的推理、文字渲染和创作控制结合到图像生成与编辑中,并给出了面向消费者、开发者和专业用户的使用入口。
Google Research 介绍了一种端到端实时语音到语音翻译模型,可保留原说话者的声音,并将延迟降至 2 秒。该技术已用于 Google Meet 服务器端功能和 Pixel 10 的端侧功能,当前支持英语与西班牙语、德语、法语、意大利语、葡萄牙语之间的翻译。
推荐理由:文章具体说明了端到端语音翻译如何将延迟降至 2 秒,并展示其在 Google Meet 与 Pixel 10 上的落地方式。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 已通过 Gemini API 在 Google AI Studio 和 Vertex AI 提供预览,价格为 $2/million input tokens 和 $12/million output tokens,适用于 200k tokens 或更短的 prompts。
推荐理由:Gemini 3 Pro同时覆盖智能体编码、单提示词应用生成和多模态推理,并公布了API价格与接入方式,便于评估其开发价值。
Google DeepMind 宣布在新加坡开设新的研究实验室,以推进亚太地区的 AI 研究、Gemini 核心能力和区域应用。新加坡团队将与政府、企业、学术机构及社会组织合作,重点关注语言与文化包容性。该公司还介绍了与新加坡机构在 AlphaFold、AI agent sandbox、Project Aquarium、SEA-LION v4 和 AI 教育等方面的合作。
推荐理由:Google DeepMind 将新加坡研究实验室与区域合作结合,覆盖 Gemini、语言文化包容性及公共服务等应用方向。
Google DeepMind 发布 Gemini 3,首先推出 Gemini 3 Pro 预览版,并在 Gemini app、AI Mode in Search、AI Studio、Vertex AI 和 Gemini CLI 等入口提供使用。
推荐理由:Gemini 3 Pro、Deep Think 与 Google Antigravity 同步亮相,原文集中展示了模型能力、开发入口和智能体工作流变化。
Google Research推出Generative UI,让AI模型根据用户提示动态生成网页、游戏、工具和应用等定制化交互界面。该能力已在Gemini app中以dynamic view和visual layout实验形式推出,并接入Google Search的AI Mode;美国Google AI Pro和Ultra订阅者可在AI Mode中选择“Thinking”体验。
推荐理由:Google同时给出论文依据、产品入口和偏好评测,能帮助读者理解Generative UI从研究实现走向真实产品时的能力边界与使用条件。
Google DeepMind 和 Google Research 发布 WeatherNext 2,可将全球天气预测提速 8x,分辨率最高达到 1 小时,并从单一起始条件生成数百种天气情景。
推荐理由:WeatherNext 2 同时提升预测速度、分辨率和情景覆盖,并开放至多个 Google 平台,展示了天气模型从研究走向应用的路径。