跳到正文

#模型发布

今日 1 条
今天10月2日周五
  1. NVIDIA Blog87

    GPT-6 Astra Ultrafast 借助 NVIDIA Blackwell GPUs 加速生成

    GPT-6 Astra Ultrafast 已通过 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPUs 上,token 生成速度最高可达 Astra Standard 模式的 8x。

    推荐理由:文章说明 GPT-6 Astra Ultrafast 如何借助 NVIDIA Blackwell GPUs 提升生成速度,并展示加速对编码智能体工作流的具体作用。

10月1日周四
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 4 Argon,强化长程推理与网络安全防御

    Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。

    推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。

9月30日周三
  1. AWS Machine Learning Blog87

    GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 已在 Amazon Bedrock 正式上线,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并较 GPT-6 Sol 的最佳成绩高 6.4 个百分点。

    推荐理由:文章将 GPT-6.1 Sol 的任务成本、编码表现、工具约束处理和 Bedrock 生产控制放在同一工作流中说明,便于评估落地条件。

9月29日周二
  1. Hugging Face Blog85

    NVIDIA Kumo Tabular 发布,面向表格预测实现无需训练的上下文学习

    NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向过程中根据带标签行预测新行,支持分类和回归,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三个规模,基于人工表格数据预训练,并通过 Hugging Face 和开源库发布,采用 OpenMDW-1.1 许可。

    推荐理由:Kumo Tabular 将表格预测转为无需训练和特征工程的上下文学习,并公开代码、权重与四项基准结果,便于评估其效率与适用范围。

  2. AWS Machine Learning Blog75

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供。该模型面向范围明确的编码与知识工作,强调更快速度和大多数任务更低的单任务成本,并支持 AWS 的数据驻留、权限、审计与监控控制。

    推荐理由:文章同时给出 Claude Sonnet 5.5 的适用任务、与 Opus 5.5 的分工及 AWS 上的调用步骤,便于评估部署路径。

9月28日周一
  1. Hugging Face Blog84

    Holo4 发布,面向通用计算机操作智能体

    Holo4 发布 27B dense 和 35B-A3B MoE 两种规格,可通过 GUI、代码、MCP 和 API 操作软件,并在 H Models API 提供服务。Holo4 27B 在 OSWorld 2.0 上得分 61.7%,35B-A3B 得分 30.9%;官方同时发布 Holotron4 Nano、模型权重、训练轨迹和评测成本信息。

    推荐理由:Holo4把 GUI、代码、MCP 和 API 操作整合到同一模型中,并公开轨迹与成本对比,便于评估其在真实工作流中的适用范围。

9月24日周四
9月23日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,用于生成可定制的角色声音、逐句指导场景对白和大规模语音内容。

    推荐理由:两款模型分别覆盖创意驱动与高量低成本语音生成,并提供声音定制、逐句导演和同意验证,展示了语音模型面向生产应用的能力边界。

9月21日周一
  1. Microsoft Research74

    Microsoft Research 发布 RetroChimera 合成预测模型

    Microsoft Research 发布 RetroChimera,用于从目标分子反向预测合成路线。该模型结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测;在十个具有挑战性的目标上成功完成九个多步路线,优于文中列出的其他模型。

    推荐理由:文章同时介绍了 RetroChimera 的集成架构、专家盲测结果和开源入口,便于了解其在稀有反应与多步合成规划中的实际表现。

9月16日周三
9月3日周四
  1. Google DeepMind87

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 发布 WeatherNext 3 全球天气模型,使用实时卫星数据每小时生成高分辨率预报。模型可在最高 5-kilometer 分辨率下预测天气变量,并提供 100-meter 风速、云量和太阳辐射等清洁能源相关数据。

    推荐理由:WeatherNext 3 将实时卫星观测、小时级更新和更高空间分辨率结合起来,并延伸到降水与可再生能源预测。

  2. Hugging Face Blog78

    Hugging Face发布NeoMME多模态多语言编码器

    Hugging Face发布NeoMME系列多模态多语言编码器,提供260M和800M两种规模,使用单个双向Transformer处理文本token与原始图像patch,并从零开始训练。

    推荐理由:NeoMME同时展示了单塔多模态编码、视觉文档检索和索引压缩方案,便于比较效率、检索质量与存储成本之间的取舍。

  3. Google DeepMind91

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码、智能体任务与多步推理,后者面向漏洞发现和自动修复。

    推荐理由:Gemini 3.8 将通用推理编码与网络安全能力拆分为两个版本,并给出价格、基准和实际使用案例,便于比较其适用场景与成本。

9月1日周二
  1. Google Research77

    Google Research 发布 TimesFM-3 多变量时间序列基础模型

    Google Research 发布 TimesFM-3,这是一个原生支持多变量预测的时间序列基础模型,拥有 330 million parameters,并在超过 1 trillion 个时间点上预训练。

    推荐理由:TimesFM-3把多变量输入、已知未来特征与单次推理结合起来,并在三个公开基准上进行比较,便于了解其适用场景与技术取舍。

  2. Microsoft Research76

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。

    推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。

8月28日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增可控视频生成能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,为开发者提供场景延展、首尾帧插值、视频参考和最高4K输出等生成视频能力。模型可分析最多10秒的既有上下文,视频可按10秒增量延展至累计40秒;360p预览生成速度最高提升60%,成本为720p的三分之一。

    推荐理由:Gemini Omni 1.1 Flash把场景延展、首尾帧控制、视频参考和4K输出整合进开发接口,呈现了生成视频从原型到制作的具体工作流。

8月27日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,用于精确的实时语音转写和智能语音交互。模型通过 Gemini API 提供实时流式与预录音频处理两类 API,支持自定义词汇、自动检测和转写超过 85 种语言,以及最多三位说话人的识别。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式和预录音频处理,并给出WER、延迟及多语言支持等指标,便于评估其开发适用场景。

8月25日周二
  1. Hugging Face Blog85

    Granite 4.2 推理模型家族构建方法解析

    IBM Granite Team 介绍 Granite 4.2 推理模型家族的构建过程,模型分为 3B、8B 和 30B 三种规模,均基于 Granite-4.1 基座模型进行后训练。

    推荐理由:文章系统梳理了 Granite 4.2 从预训练、SFT 到多阶段 RL 的构建流程,并说明不同规模模型的智能体训练差异。

8月21日周五
  1. Hugging Face Blog82

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.18 倍

    Liquid AI 发布 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,通过 speculative decoding 在不改变 greedy decoding 输出的前提下提升推理速度。

    推荐理由:LFM2.5-DSpark同时给出H100与M4 Max上的实测加速、函数调用延迟变化和llama.cpp及SGLang接入方式,便于评估部署收益。

  2. Microsoft Research74

    Microsoft Research 发布 Skala 1.1,提升预测性 DFT 精度并扩展软件集成

    Microsoft Research 发布 Skala 1.1,这一深度学习 DFT 泛函使用比前代多 2.5x 的数据训练,在 GMTKN55 的 55 个类别中有 32 个获得金牌,并将加权平均误差降至 2.8 kcal/mol。

    推荐理由:Skala 1.1同时展示了精度提升、软件集成与持续性能评测,勾勒出机器学习 DFT 走向科研工作流的实现路径。

8月14日周五
8月12日周三
  1. Google DeepMind91

    Google DeepMind发布SL2T手语转文本模型,登陆Gboard和Live Transcribe

    Google DeepMind发布手语转文本模型SL2T,首先支持ASL到英语,并为Pixel 11上的Gboard和Live Transcribe提供手语输入功能。SL2T使用超过100,000小时、覆盖50多种手语的数据训练,端侧MediaPipe Holistic仅上传身体姿态坐标进行翻译;在FLEURS-ASL基准上取得70 BLEURT的zero-shot分数。

    推荐理由:SL2T将大规模多语言训练、端侧姿态追踪与隐私设计结合,并已进入Gboard和Live Transcribe,展示了手语翻译落地面临的关键技术取舍。

8月11日周二
  1. Hugging Face Blog82

    NVIDIA Magpie TTS 发布多语言开放权重版本,支持 12 种语言与低延迟部署

    NVIDIA Magpie Multilingual TTS 发布更新版开放权重模型,参数量为 364M,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。

    推荐理由:文章集中展示了 Magpie TTS 的语言覆盖、延迟指标与部署方式,便于评估开放权重语音模型在生产场景中的取舍。

8月10日周一
  1. Hugging Face Blog91

    Meta 发布开源多模态模型 Muse Glimmer-30B,面向本地智能体应用

    Meta 发布 Muse Glimmer-30B,一款面向本地智能体场景的开源多模态模型,采用 30B 参数架构并以 Apache 2.0 许可证发布。模型包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频、工具调用与对象检测,并获得 Transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持。

    推荐理由:文章同时给出 Muse Glimmer 的架构、基准结果和多种部署示例,便于比较其本地智能体定位与实际使用路径。

8月6日周四
8月4日周二
7月30日周四
  1. Google DeepMind75

    Google DeepMind发布Lyria 3.5并上线Google Flow Music

    Google DeepMind发布音乐生成模型Lyria 3.5,并将其上线Google Flow Music。新模型改进了旋律复杂度、歌词质量与提示词遵循、歌声表现和发音,并支持更便捷地控制输出的节奏与时长。

    推荐理由:Lyria 3.5同时更新旋律、歌词、歌声和节奏时长控制,适合了解Google Flow Music的创作能力变化。

7月28日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini Robotics 2,提升机器人的全身智能与协作能力

    Google DeepMind 发布 Gemini Robotics 2,包含 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,支持人形机器人全身控制、灵巧操作、具身推理和多机器人协作。

    推荐理由:Google DeepMind同时更新了全身控制、灵巧操作、具身推理和端侧适配,呈现了机器人从单步执行走向多步骤协作的技术路径。

7月27日周一
7月21日周二
7月17日周五
7月15日周三
  1. Hugging Face Blog92

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。

    推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。

7月8日周三
  1. Mistral AI79

    Mistral AI 发布具身导航模型 Robostral Navigate

    Mistral AI 发布 Robostral Navigate,这是一个 8B 具身导航模型,仅使用单个 RGB 摄像头和自然语言指令控制机器人移动。在未见过的 R2R-CE 验证环境中成功率为 76.6%,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:Robostral Navigate 展示了单 RGB 相机与 8B 模型在连续环境导航中的组合方案,并公开了训练数据与方法细节。

7月2日周四
7月1日周三
6月30日周二
  1. Google Research82

    Google Research 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。

    推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。

6月23日周二
6月11日周四