Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 母公司 Alphabet 发布 Gemini 4 Argon,面向编码、研究和写作等任务,重点用于防御性网络安全。该模型目前通过 Fairwind Program 向部分网络安全合作伙伴开放,Google 称其能够自主发现、验证并修复关键软件漏洞。
Google 母公司 Alphabet 发布 Gemini 4 Argon,面向编码、研究和写作等任务,重点用于防御性网络安全。该模型目前通过 Fairwind Program 向部分网络安全合作伙伴开放,Google 称其能够自主发现、验证并修复关键软件漏洞。
Satlyt完成$8M种子轮融资,正在开发让多家公司卫星运行AI模型并共享计算任务的软件。公司此前已将Google DeepMind的Gemma部署到Momentus运营的航天器上,使有关机载软件错误的传输数据量减少60%以上;本周其软件将随TakeMe2Space航天器发射,并计划明年尝试连接两颗卫星形成共享计算系统。
听力科技初创公司 Legato 发布可购买的 AI 助听眼镜 Legato Frames,起售价为 $999,面向轻度至中度听力损失的成年人。眼镜通过 AI 区分人声与背景噪音,在设备端完成处理,不使用摄像头或录音;产品重 34 克,续航 10-12 小时,并支持处方镜片和 Bluetooth 音频串流。
Google 在兼容的 Android 设备上的 Gemini Live 推出 Guided Vision,为摄像头拍摄的内容提供实时音频描述。它可帮助用户阅读小字、描述环境、查找或识别物体,并支持在 Gemini 应用和 Google TalkBack 中使用;Android 9 及以上设备还可通过设置添加辅助功能快捷方式。
OpenAI 全球推出 ChatGPT 的虚拟试穿和 Favorites 功能,用户可上传自拍、全身照或商品图片,在购物结果中预览服装和配饰效果。新功能使用 ChatGPT Images 2.5,并可将收藏商品与试穿图片保存到应用 Library;用户还可以描述穿搭或上传名人造型图片,让 ChatGPT 寻找可购买的商品。
推荐理由:文章梳理了 ChatGPT 将虚拟试穿与商品收藏接入购物结果的具体方式,也交代了其与 Google 等既有服务的竞争背景。
Tavus 推出 Griffin,这是一种用于实时面对面视频对话的 Human Interaction Model。Tavus 的研究显示,48%的参与者在一分钟视频通话后认为 Griffin 是真人;在一项 Nvidia 测试中,Griffin 得分为 3.83,真人为 3.92,上一代最佳 AI 模型为 2.80。
OpenAI 在 DevDay 发布由 GPT-6 Astra 驱动的 Dots 智能体,主打长期任务、知识工作和构建虚拟世界,但目前仅限 $100/月及以上的 ChatGPT Pro 用户使用。
推荐理由:文章围绕 Dots 与 Muse 的价格、任务范围和隐私取舍展开比较,呈现了 OpenAI 进军智能体市场的产品策略。
Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。
推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。
Google DeepMind 发布 SynthID Bio,可将不可见签名嵌入AI生成的蛋白质序列和预测的3D结构,并在合成后的物理蛋白质中验证。实验显示,经过水印处理的蛋白质结合剂在VEGF-A、SARS-CoV-2 spike protein RBD和PD-L1三种目标上保持了与未加水印设计相当的命中率、结合亲和力和自然序列多样性。
推荐理由:SynthID Bio把水印嵌入蛋白质序列和预测结构,并在实验中保持生物功能,为AI生成生物设计的来源核验提供了具体路径。
AMD 与 World Labs 宣布,AMD 将在获得监管批准后于年底前收购这家世界模型公司,交易估值为 $8.2 billion。
推荐理由:这笔交易将 World Labs 的世界模型与 AMD 的 AI 业务放在同一竞争框架中,材料也交代了其技术用途和产品基础。
Simon Willison 开发了实验性工具 Photo Scrubber,可识别人脸并自动进行模糊处理,以避免分享带有可识别面孔的陌生人照片。该工具使用 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并采用 BlazeFace 人脸检测模型;原文还提到 GPT-6 Astra 参与了工具构建。
Condé Nast 与 AWS Generative AI Innovation Center 基于 Amazon Bedrock、Amazon OpenSearch Service 和 TwelveLabs Marengo,构建了跨视频画面、音频和字幕的意图检索系统。
推荐理由:文章以 Condé Nast 的生产案例说明多模态视频检索如何通过解耦架构和异步处理兼顾大规模回填与低延迟搜索。
Microsoft Research 推出 Quine,这是一个面向生物学复杂性的多模态世界模型与交互式研究系统,可连接科学工具、文献、湿实验和研究人员。在与 Broad Institute 合作的胰腺癌研究中,Quine 对数千种化合物进行预测和排序,最高排名化合物在多个湿实验中产生了最大的预期细胞状态变化,筛选到候选验证仅用一个周末完成。
推荐理由:Quine把生物学世界模型与科学工具、文献和实验连接起来,并以胰腺癌细胞状态研究展示了从预测到湿实验验证的工作流程。
xAI 的 Grok 4.7 已在 Amazon Bedrock 模型目录上线,支持编码、长时智能体和知识工作,提供 500K token 上下文窗口与 low、medium、high、xhigh 四档推理强度。
推荐理由:文章把 Grok 4.7 在 Amazon Bedrock 上的接入方式、推理开销和权限配置串联起来,便于开发者评估长任务部署方案。
Microsoft Research Asia – Singapore 成立一周年,正通过前沿 AI 研究、合作伙伴关系和人才培养,推动研究成果在现实场景中落地。实验室聚焦下一代 AI 模型与智能体系统、领域 AI、AI-native 研究实践及生态与人才发展,并已在医疗、金融、教育和科技等领域开展合作。
AWS 介绍如何在 SageMaker AI 上使用 AWS vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,通过持久双向连接流式发送文本并接收音频。教程提供仓库、部署脚本和 Gradio 客户端,音频以 24 kHz PCM chunks 返回,并说明 SageMaker 实例池、环境配置、端点调用与资源清理流程。
推荐理由:文章给出从环境配置到资源清理的完整部署路径,并说明双向流式连接与实例池配置,便于复现实时语音输出方案。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时语音对话结合,生成具备唇形同步、表情和连续对话能力的动态视觉化身。该功能支持异步工具调用、97 种语言间切换,并已在 Gemini Enterprise 提供;自定义化身目前仅通过企业 allowlisting 开放,所有输出均带有 SynthID 水印。
推荐理由:Google DeepMind 展示了 Live Avatar 在实时对话、异步工具调用、多语言同步和品牌定制上的企业应用方式。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 LFM2.5-VL-DSpark draft model,通过 speculative decoding 在不改变输出质量的情况下加速推理。
推荐理由:这次发布展示了 DSpark 如何在不改变输出质量的前提下加速 VLM 推理,并给出端侧与 H100 上的实测收益和部署方式。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放发布覆盖2800多种病毒的预测蛋白复合物3D结构。
推荐理由:文章说明了开放病毒蛋白复合物数据集及生成流程的来源、规模和用途,展示 AI 结构预测如何支持疫情研究准备。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,用于生成可定制的角色声音、逐句指导场景对白和大规模语音内容。
推荐理由:两款模型分别覆盖创意驱动与高量低成本语音生成,并提供声音定制、逐句导演和同意验证,展示了语音模型面向生产应用的能力边界。
Mistral AI 宣布与 Mozilla 合作,由 Mistral 模型为 Firefox Smart Window(beta)提供支持,帮助用户理解复杂搜索、找回浏览记录中的重要内容,并根据浏览器标签页整理信息。该功能将先面向法国和北美用户,英国和德国预计于今年晚些时候跟进;对话默认不会保存到 Mozilla 服务器,Mistral 等合作方同意零数据保留。
推荐理由:Mistral AI 与 Mozilla 将开放模型接入 Firefox Smart Window,材料同时交代了地区范围、隐私机制和本地化语言方向。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,通过离线 RL 生成监督数据,再将集合级检索行为蒸馏到 53.9M 参数的扩散模型中。该模型可在单次非自回归推理中生成完整目标嵌入集合,相比自回归方法实现 12 到 20 倍加速,并在时延规模扩大时保持亚秒至数秒响应。
推荐理由:论文展示了如何把离线 RL 学到的集合级检索行为蒸馏进扩散模型,以降低复杂搜索的推理延迟并减少人工标注依赖。
Hugging Face 发布 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能,包含 11 条媒体管线和 73 个节点,覆盖文生图、图生图、放大、检测、背景移除及图生视频。
推荐理由:文章以完整案例展示 Gradio Workflow 如何把多种媒体管线组合为可编辑画布,并自动提供 REST 与 MCP 接口,便于迁移到实际应用。
Google DeepMind 发布 AlphaGenome Atlas,为人类基因组约 9 billion 个单核苷酸变体预计算分子影响预测,并通过网站、AlphaGenome API 和 Google Antigravity skill 提供访问。
推荐理由:AlphaGenome Atlas 将约 9 billion 个单核苷酸变体的预测整合为可检索资源,并展示了其在罕见病和群体遗传研究中的应用。
Google Research 与 HHMI Janelia及剑桥等机构合作,发布了雄性果蝇大脑和中枢神经系统的完整连接图谱。该图谱包含超过166,000个神经元和1.25亿个突触连接,是按神经元数量计最大的脑图谱,并可通过 Neuroglancer 查看、探索和下载。研究团队使用计算机和 AI 将电子显微镜图像重建为三维神经结构,图谱经过人类专家标注和校验。
推荐理由:这项工作展示了 AI 如何协助构建细胞尺度的完整神经连接图,并提供了可视化、探索和下载的数据资源。
Google DeepMind 和 Google Research 发布 WeatherNext 3 全球天气模型,使用实时卫星数据每小时生成高分辨率预报。模型可在最高 5-kilometer 分辨率下预测天气变量,并提供 100-meter 风速、云量和太阳辐射等清洁能源相关数据。
推荐理由:WeatherNext 3 将实时卫星观测、小时级更新和更高空间分辨率结合起来,并延伸到降水与可再生能源预测。
Hugging Face发布NeoMME系列多模态多语言编码器,提供260M和800M两种规模,使用单个双向Transformer处理文本token与原始图像patch,并从零开始训练。
推荐理由:NeoMME同时展示了单塔多模态编码、视觉文档检索和索引压缩方案,便于比较效率、检索质量与存储成本之间的取舍。
Google Research 与 NASA JPL 合作提出 MAPL-EMIT,用基于 Swin-S Transformer 的深度学习框架分析 NASA EMIT 高光谱数据,自动完成甲烷增强量化、羽流分割和排放源定位。
推荐理由:论文展示了如何用深度学习处理 EMIT 高光谱数据,将甲烷羽流检测、范围分割与源头定位整合到可扩展的全球监测流程中。
Google DeepMind推出Agentic视频理解功能,覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,可动态搜索视频中的画面、音频和转录内容。
推荐理由:Google DeepMind给出了Agentic视频理解的工作方式、基准变化和接入示例,便于开发者评估长视频分析的成本与实现路径。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。
推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。
Google Research 介绍 Planetary Prediction Engine(PPE),这是 Google Earth AI 旗下的实验性研究能力,可根据自然语言查询自主完成地理数据发现、清理、特征工程、模型训练与评估。
推荐理由:文章展示了 PPE 如何把地理数据发现、特征构建和模型评估串成自动化流程,并用多个领域的基准结果说明其应用价值。
Google DeepMind 推出 Gemini Omni 1.1 Flash,为开发者提供场景延展、首尾帧插值、视频参考和最高4K输出等生成视频能力。模型可分析最多10秒的既有上下文,视频可按10秒增量延展至累计40秒;360p预览生成速度最高提升60%,成本为720p的三分之一。
推荐理由:Gemini Omni 1.1 Flash把场景延展、首尾帧控制、视频参考和4K输出整合进开发接口,呈现了生成视频从原型到制作的具体工作流。
Google Research 介绍 GlucoFM,一种采用双流设计的自监督连续血糖监测基础模型,用于分离较慢的血糖趋势与短期偏差。模型在四个队列的七项临床预测任务中进行评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。GlucoFM 还展示了跨数据集迁移和少样本适应能力。
推荐理由:文章系统比较了 GlucoFM 在临床预测、餐后血糖预测、跨队列迁移和少样本适应中的表现,并说明双流设计如何利用 CGM 的多时间尺度信号。
Google Research 介绍发表于 CHI 2026 的研究原型 AgentHands,它将 LLM 生成的 GestureEvents 与用户的 XR 环境、TTS 和手部动画同步,把语音指令转化为空间中的交互式手势。
Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下运行的多智能体系统,用于从可穿戴设备数据中迭代生成、分析和验证候选生物标志物。
推荐理由:文章展示了如何将多智能体协作、确定性统计计算与对抗验证结合,用于在可穿戴传感器数据中筛选候选生物标志物。
Google DeepMind 回顾了从 DQN、AlphaGo、AlphaZero、MuZero 到 AlphaStar 的游戏 AI 研究,并介绍与 Fenris Creations 合作探索 EVE Universe 中的 AI 智能体。
推荐理由:文章梳理了 Google DeepMind 从游戏智能体研究到 EVE Universe 合作的路径,具体呈现了持续学习、记忆和长期规划等研究挑战。
Google Research提出Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的到达时间、停留时长和周边移动模式与地点文本表示结合,以刻画地点的身份和动态功能。该框架在洛杉矶和休斯顿的未见地点测试中,使访问意图预测相对提升最高81.9%,价格等级分类提升75.1%,繁忙程度估计准确率提升24.7%。
推荐理由:研究将匿名聚合的出行模式融入地点文本表示,并在未见地点的多项属性预测中量化展示了动态空间信息的补充价值。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 风格的 late interaction 检索,并可直接加载 PyLate、Stanford-NLP ColBERT 和部分 ColPali 系列模型。
推荐理由:文章系统说明了 MultiVectorEncoder 的工作原理、检索取舍和接入方式,适合评估 late interaction 是否适合现有搜索架构。
Google Research 介绍 PhotoScan,一种从标准 2D 手机照片估计体脂率、A/G ratio 和 V/S ratio 的深度学习框架。模型先在 UK Biobank 的 35,323 条记录上预训练,再用 677 名成人的 PhotoBIA 数据微调,并在 132 人的独立队列中验证。
推荐理由:研究用多个独立队列比较 PhotoScan 与 BIA、DXA 在体成分估计和胰岛素抵抗分类上的表现,展示了手机影像的研究价值。
Microsoft Research 提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现通常优于需要跨多步行动维护拓扑关系的任务,且两者都低于人类表现。研究指出,规划错误常发生在模型未能追踪场景变化后的结构关系或提出违反环境约束的行动。
推荐理由:MindTopo 将静态识别与交互规划分开评估,具体展示了多模态模型在持续维护空间结构关系时的能力缺口。