Google Research 发布 TimesFM-3 多变量时间序列基础模型
Google Research 发布 TimesFM-3,这是一个原生支持多变量预测的时间序列基础模型,拥有 330 million parameters,并在超过 1 trillion 个时间点上预训练。
推荐理由:TimesFM-3把多变量输入、已知未来特征与单次推理结合起来,并在三个公开基准上进行比较,便于了解其适用场景与技术取舍。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google Research 发布 TimesFM-3,这是一个原生支持多变量预测的时间序列基础模型,拥有 330 million parameters,并在超过 1 trillion 个时间点上预训练。
推荐理由:TimesFM-3把多变量输入、已知未来特征与单次推理结合起来,并在三个公开基准上进行比较,便于了解其适用场景与技术取舍。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。
推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。
Google DeepMind 推出 Gemini Omni 1.1 Flash,为开发者提供场景延展、首尾帧插值、视频参考和最高4K输出等生成视频能力。模型可分析最多10秒的既有上下文,视频可按10秒增量延展至累计40秒;360p预览生成速度最高提升60%,成本为720p的三分之一。
推荐理由:Gemini Omni 1.1 Flash把场景延展、首尾帧控制、视频参考和4K输出整合进开发接口,呈现了生成视频从原型到制作的具体工作流。
Google DeepMind 发布 Gemini 3.5 Transcribe,用于精确的实时语音转写和智能语音交互。模型通过 Gemini API 提供实时流式与预录音频处理两类 API,支持自定义词汇、自动检测和转写超过 85 种语言,以及最多三位说话人的识别。
推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式和预录音频处理,并给出WER、延迟及多语言支持等指标,便于评估其开发适用场景。
IBM Granite Team 介绍 Granite 4.2 推理模型家族的构建过程,模型分为 3B、8B 和 30B 三种规模,均基于 Granite-4.1 基座模型进行后训练。
推荐理由:文章系统梳理了 Granite 4.2 从预训练、SFT 到多阶段 RL 的构建流程,并说明不同规模模型的智能体训练差异。
Liquid AI 发布 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,通过 speculative decoding 在不改变 greedy decoding 输出的前提下提升推理速度。
推荐理由:LFM2.5-DSpark同时给出H100与M4 Max上的实测加速、函数调用延迟变化和llama.cpp及SGLang接入方式,便于评估部署收益。
Microsoft Research 发布 Skala 1.1,这一深度学习 DFT 泛函使用比前代多 2.5x 的数据训练,在 GMTKN55 的 55 个类别中有 32 个获得金牌,并将加权平均误差降至 2.8 kcal/mol。
推荐理由:Skala 1.1同时展示了精度提升、软件集成与持续性能评测,勾勒出机器学习 DFT 走向科研工作流的实现路径。
Google DeepMind 发布 Gemini 3.7 Flash,称其在编码、知识工作和网页开发工作流上较 Gemini 3.6 Flash 有明显提升。
推荐理由:Gemini 3.7 Flash给出了多项编码、文档处理和工作流基准对比,并同步公布了API价格,便于评估其生产环境价值。
Google DeepMind发布手语转文本模型SL2T,首先支持ASL到英语,并为Pixel 11上的Gboard和Live Transcribe提供手语输入功能。SL2T使用超过100,000小时、覆盖50多种手语的数据训练,端侧MediaPipe Holistic仅上传身体姿态坐标进行翻译;在FLEURS-ASL基准上取得70 BLEURT的zero-shot分数。
推荐理由:SL2T将大规模多语言训练、端侧姿态追踪与隐私设计结合,并已进入Gboard和Live Transcribe,展示了手语翻译落地面临的关键技术取舍。
NVIDIA Magpie Multilingual TTS 发布更新版开放权重模型,参数量为 364M,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。
推荐理由:文章集中展示了 Magpie TTS 的语言覆盖、延迟指标与部署方式,便于评估开放权重语音模型在生产场景中的取舍。
Meta 发布 Muse Glimmer-30B,一款面向本地智能体场景的开源多模态模型,采用 30B 参数架构并以 Apache 2.0 许可证发布。模型包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频、工具调用与对象检测,并获得 Transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持。
推荐理由:文章同时给出 Muse Glimmer 的架构、基准结果和多种部署示例,便于比较其本地智能体定位与实际使用路径。
Google DeepMind 发布并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini,用于预测气旋路径、强度和风结构。
推荐理由:WeatherNext 将气旋路径、强度和风场预测整合到单一模型,并开放代码与权重,展示了 AI 天气预报从研究走向实际应用的路径。
Mistral AI 发布 Shieldstral,这是一个采用 Apache 2.0 的3B open-weights 多模态安全分类器,可在推理时通过自然语言问题指定审核策略,无需重新训练。
推荐理由:Shieldstral把安全审核改写为可在推理时更换的自然语言问题,并以3B规模覆盖文本与图像,适合关注灵活审核策略的读者。
Google DeepMind 发布 Gemini Robotics ER 2,用于让机器人理解连续视频、编排多步任务并协同工作。
推荐理由:Gemini Robotics ER 2 将连续视频理解、工具编排和多机器人协作结合起来,并给出任务进度与安全评测结果。
Google DeepMind发布音乐生成模型Lyria 3.5,并将其上线Google Flow Music。新模型改进了旋律复杂度、歌词质量与提示词遵循、歌声表现和发音,并支持更便捷地控制输出的节奏与时长。
推荐理由:Lyria 3.5同时更新旋律、歌词、歌声和节奏时长控制,适合了解Google Flow Music的创作能力变化。
Google DeepMind 发布 Gemini Robotics 2,包含 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,支持人形机器人全身控制、灵巧操作、具身推理和多机器人协作。
推荐理由:Google DeepMind同时更新了全身控制、灵巧操作、具身推理和端侧适配,呈现了机器人从单步执行走向多步骤协作的技术路径。
NVIDIA 发布 Cosmos-H-Dreams,这是一款面向手术机器人的实时、动作条件生成式模拟器,可根据初始 RGB 帧和实时机器人运动学生成后续视频帧。
推荐理由:文章完整介绍了从 Cosmos-H-Surgical-Simulator 到实时交互模拟器的蒸馏路径,并给出训练、推理和自有数据适配方案。
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向高效通用任务、高吞吐智能体工作流和网络安全漏洞处理。
推荐理由:这次发布同时覆盖高质量、低延迟和网络安全场景,并给出 token 效率、基准成绩与价格,便于比较不同模型的部署取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是一款基于 3.5 Flash、经过微调以快速发现、验证和修复漏洞的轻量网络安全模型。
推荐理由:文章结合 CyberGym、Big Sleep 和 Chrome 生产流水线评测,展示了轻量模型在大规模漏洞发现与修复中的效率和效果。
Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。
推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。