Hugging Face 发布 Transformers.js v4
Hugging Face 发布 Transformers.js v4,新增以 C++ 重写的 WebGPU Runtime,可在浏览器、Node、Bun 和 Deno 中运行 WebGPU 加速模型。
推荐理由:Transformers.js v4同时改进了WebGPU运行时、构建产物和模型加载接口,并扩展了可在JavaScript环境中运行的模型范围。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
Hugging Face 发布 Transformers.js v4,新增以 C++ 重写的 WebGPU Runtime,可在浏览器、Node、Bun 和 Deno 中运行 WebGPU 加速模型。
推荐理由:Transformers.js v4同时改进了WebGPU运行时、构建产物和模型加载接口,并扩展了可在JavaScript环境中运行的模型范围。
Google 宣布与 Included Health 合作,在获 Institutional Review Board(IRB)批准后开展一项面向全国、经同意参与者的前瞻性随机研究,评估对话式 AI 在真实虚拟医疗工作流中的表现。
推荐理由:研究将把对话式 AI 从模拟和可行性测试推进到全国范围的随机对照研究,为评估真实虚拟医疗中的安全性与实用性提供更严格证据。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过180种智能体配置评估单智能体与四类多智能体架构。
推荐理由:这项研究用180种智能体配置比较不同架构,展示任务可分解性、顺序依赖和工具数量如何影响性能与可靠性。
Google Research 发布 ATLAS 多语言模型研究,基于 774 次训练运行、400+ 种语言和 48 种语言评测,提出可适应语言混合的 scaling laws。
推荐理由:论文将多语言预训练、语言迁移和微调决策统一到可操作的 scaling laws 中,为不同语言组合下的模型规模、数据量与计算预算规划提供了量化参考。
Google Research 介绍一项发表于 EMNLP 2025 的研究,将用户界面轨迹的意图理解拆为逐屏摘要和序列意图抽取两步,以便小型多模态 LLM 在设备端处理。
推荐理由:论文将界面轨迹的意图理解拆成屏幕摘要与序列抽取两步,并以事实级指标分析小模型在端侧场景中的效果与误差来源。
Google DeepMind 推出 D4RT,一种统一的 AI 模型,用于跨空间与时间进行 4D 场景重建和跟踪。D4RT 采用基于查询的 Transformer 编解码架构,在测试中比此前 state of the art 方法快 18x 至 300x;处理一分钟视频约需 5 秒,而此前方法最多需要 10 分钟。
推荐理由:D4RT 将动态场景重建与跟踪统一到查询式架构中,并以速度数据展示其在实时空间理解场景中的应用潜力。
Google Quantum AI 在 Willow 处理器上实验展示了采用动态电路的表面码量子纠错,并提出 hexagonal、walking 和 iSWAP 三种电路。hexagonal 电路仅需每个量子比特连接三个 coupler,walking 电路将泄漏相关误差降低超过一个数量级,iSWAP 电路达到 1.56 的误差抑制因子。
推荐理由:研究通过三种动态表面码展示了在连接布局、泄漏误差和双量子比特门选择上的适应空间,为量子硬件与纠错协议协同设计提供了具体实验依据。
Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。
推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。
Google DeepMind 发布 Gemini 3 Flash,结合 Gemini 3 Pro 级推理与 Flash 级延迟、效率和成本,面向开发者、消费者及企业逐步开放。
推荐理由:Gemini 3 Flash同时给出推理、速度、成本和编码基准数据,并覆盖开发者、消费者与企业入口,便于比较其实际定位。
Google Research 为 STOC 2026 创建了由 Gemini 2.5 Deep Think 驱动的 Paper Assistant Tool,在论文提交前提供自动反馈,帮助作者发现计算错误、变量不一致和证明中的逻辑漏洞。
推荐理由:这项试验展示了专用 AI 工具如何在人工同行评审前检查理论论文,并给出错误识别、反馈速度与作者使用感受等具体结果。
Google DeepMind宣布通过新的谅解备忘录扩大与英国AI安全研究所(AISI)的合作,从测试模型扩展到基础安全与安全性研究。双方将共享模型、数据和想法,开展联合报告及研究,重点关注AI推理过程监测、社会情感错位和经济系统影响评估。
推荐理由:Google DeepMind与英国AI安全研究所将合作范围从模型测试扩展至基础安全研究,覆盖推理监测、社会情感影响和经济系统评估。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,新增 Parametric、Search、Multimodal 三项基准,并更新 FACTS Grounding Benchmark v2。
推荐理由:FACTS Benchmark Suite 将内部知识、网页搜索、图像问答和上下文 grounding 分开评测,并公开 3,513 个样例,便于比较模型在不同事实性任务上的表现。
Google Research 在两篇新论文中提出 Titans 架构与 MIRAS 理论框架,通过可随数据流更新的深层神经网络记忆模块,让模型在运行时选择性保留新信息。
推荐理由:文章系统介绍了 Titans 与 MIRAS 如何通过可在线更新的深层记忆模块处理超长上下文,并给出语言、基因组和时间序列任务上的实验比较。
Google Research 发布 Massive Sound Embedding Benchmark(MSEB),用于统一评测检索、推理、分类、转录、分割、聚类、重排和重建八类声音理解能力。
推荐理由:MSEB 将语音与生物声学等场景纳入统一评测,并拆分八类能力,帮助比较通用声音表示与专用系统的差距。
Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。
推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。
科学家借助 AlphaFold 和 cryo-EM 解析了 apoB100 的结构,该蛋白构成低密度脂蛋白(LDL)的分子支架。模型显示,apoB100 形成包裹 LDL 颗粒的笼状外壳,并带有维持颗粒在血液中完整的带状结构,为预防、诊断和治疗高胆固醇及 ASCVD 提供了新的研究方向。
推荐理由:研究将 cryo-EM 图像与 AlphaFold 的原子级预测结合,解析了 apoB100 包裹 LDL 颗粒的结构,为理解和精准干预 ASCVD 提供了结构依据。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 已通过 Gemini API 在 Google AI Studio 和 Vertex AI 提供预览,价格为 $2/million input tokens 和 $12/million output tokens,适用于 200k tokens 或更短的 prompts。
推荐理由:Gemini 3 Pro同时覆盖智能体编码、单提示词应用生成和多模态推理,并公布了API价格与接入方式,便于评估其开发价值。
Google DeepMind 发布 Gemini 3,首先推出 Gemini 3 Pro 预览版,并在 Gemini app、AI Mode in Search、AI Studio、Vertex AI 和 Gemini CLI 等入口提供使用。
推荐理由:Gemini 3 Pro、Deep Think 与 Google Antigravity 同步亮相,原文集中展示了模型能力、开发入口和智能体工作流变化。
Google DeepMind 发布 SIMA 2,这一研究型智能体结合 Gemini 模型,可在虚拟 3D 世界中理解复杂指令、进行推理、与用户对话并通过自我游戏持续改进。SIMA 2 已在包括 ASKA 和 MineDojo 在内的未训练游戏,以及 Genie 3 生成的新世界中进行测试;目前以有限研究预览形式向少量学者和游戏开发者开放。
推荐理由:文章展示了 SIMA 2 如何结合 Gemini 的推理与自我改进,在未见过的游戏和生成世界中执行复杂任务,并说明其当前局限。
Google Research 在 NeurIPS 2025 论文中提出 Nested Learning,将模型架构和优化算法视为相互嵌套、同时优化的多层学习问题,以应对持续学习中的灾难性遗忘。
推荐理由:文章将模型架构与优化算法统一为多层嵌套优化问题,并以 Hope 展示连续记忆和长上下文处理的设计路径。