Amazon 发布开源决策模型 Strands Decider 2B
Amazon Web Services 发布开源决策模型 Strands Decider 2B,用于在预设选项中高速选择并提供置信度,定位是比完整 LLM 更适合部分计算机自动化任务。该模型基于 Qwen3.5-2B 构建,体积足够小,可本地运行;Amazon 表示它适合降低智能体工作流步骤的延迟和成本。
推荐理由:文章梳理了决策模型相对完整 LLM 的定位,并具体说明其在智能体工作流中的低延迟、低成本和置信度优势。
Amazon Web Services 发布开源决策模型 Strands Decider 2B,用于在预设选项中高速选择并提供置信度,定位是比完整 LLM 更适合部分计算机自动化任务。该模型基于 Qwen3.5-2B 构建,体积足够小,可本地运行;Amazon 表示它适合降低智能体工作流步骤的延迟和成本。
推荐理由:文章梳理了决策模型相对完整 LLM 的定位,并具体说明其在智能体工作流中的低延迟、低成本和置信度优势。
NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向过程中根据带标签行预测新行,支持分类和回归,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三个规模,基于人工表格数据预训练,并通过 Hugging Face 和开源库发布,采用 OpenMDW-1.1 许可。
推荐理由:Kumo Tabular 将表格预测转为无需训练和特征工程的上下文学习,并公开代码、权重与四项基准结果,便于评估其效率与适用范围。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 LFM2.5-VL-DSpark draft model,通过 speculative decoding 在不改变输出质量的情况下加速推理。
推荐理由:这次发布展示了 DSpark 如何在不改变输出质量的前提下加速 VLM 推理,并给出端侧与 H100 上的实测收益和部署方式。
Microsoft Research 发布 RetroChimera,用于从目标分子反向预测合成路线。该模型结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测;在十个具有挑战性的目标上成功完成九个多步路线,优于文中列出的其他模型。
推荐理由:文章同时介绍了 RetroChimera 的集成架构、专家盲测结果和开源入口,便于了解其在稀有反应与多步合成规划中的实际表现。
Hugging Face发布NeoMME系列多模态多语言编码器,提供260M和800M两种规模,使用单个双向Transformer处理文本token与原始图像patch,并从零开始训练。
推荐理由:NeoMME同时展示了单塔多模态编码、视觉文档检索和索引压缩方案,便于比较效率、检索质量与存储成本之间的取舍。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。
推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。
NVIDIA Magpie Multilingual TTS 发布更新版开放权重模型,参数量为 364M,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。
推荐理由:文章集中展示了 Magpie TTS 的语言覆盖、延迟指标与部署方式,便于评估开放权重语音模型在生产场景中的取舍。
Meta 发布 Muse Glimmer-30B,一款面向本地智能体场景的开源多模态模型,采用 30B 参数架构并以 Apache 2.0 许可证发布。模型包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频、工具调用与对象检测,并获得 Transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持。
推荐理由:文章同时给出 Muse Glimmer 的架构、基准结果和多种部署示例,便于比较其本地智能体定位与实际使用路径。
Hugging Face Blog 介绍 DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章将优势归因于面向巴西葡萄牙语的监督微调,以及用于降低文本退化、提升输出稳定性的 DPO 训练;文中还通过 ENEM 手写作文和小字体文档示例说明多语言模型的识别与稳定性问题。
Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。
推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。
Mistral AI 发布 Leanstral 1.5,这是一款采用 Apache-2.0 许可、119B total、6B active parameters 的开源模型,面向 Lean 4 形式化验证。
推荐理由:Leanstral 1.5 同时给出形式化数学基准、代码验证案例和开源使用入口,展现了模型从定理证明走向实际软件验证的路径。
Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。
推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散和 26B MoE 架构,在专用 GPU 上实现最高 4 倍的文本生成速度。
推荐理由:DiffusionGemma展示了文本扩散在本地低并发推理中的速度优势,也明确交代了与标准 Gemma 4 的质量和云端成本取舍。
Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。
推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。
Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码智能体,采用 6B active parameters,支持在形式化代码仓库中生成并验证证明。
推荐理由:Leanstral把Lean 4形式化证明引入代码智能体,并用FLTEval比较性能与成本,呈现了可复用的验证式编程路径。
Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。
推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。
Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。
推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。