跳到正文

全部动态

今日 5 条
8月12日周三
  1. Google DeepMind91

    Google DeepMind发布SL2T手语转文本模型,登陆Gboard和Live Transcribe

    Google DeepMind发布手语转文本模型SL2T,首先支持ASL到英语,并为Pixel 11上的Gboard和Live Transcribe提供手语输入功能。SL2T使用超过100,000小时、覆盖50多种手语的数据训练,端侧MediaPipe Holistic仅上传身体姿态坐标进行翻译;在FLEURS-ASL基准上取得70 BLEURT的zero-shot分数。

    推荐理由:SL2T将大规模多语言训练、端侧姿态追踪与隐私设计结合,并已进入Gboard和Live Transcribe,展示了手语翻译落地面临的关键技术取舍。

  2. Google Research87

    Google Research 推进 AMIE 实时音视频临床问诊能力

    Google Research 介绍了基于 Gemini 和 Project Astra 的 AMIE (Video),可在实时视频问诊中感知非语言临床线索、引导虚拟体格检查并进行诊断推理。研究覆盖 100 个场景和 300 次咨询,在核心临床能力上评估结果与初级保健医生相当;但研究仅使用专业患者演员,真实患者和真实临床条件下的实用性仍需进一步验证。

    推荐理由:研究展示了 AMIE 从文本对话扩展到实时音视频问诊的系统设计与评估,也清楚交代了模拟场景和真实患者验证之间的边界。

  3. Microsoft Research76

    Microsoft Research 介绍 CARE-X:结合辅助监督、奖励对齐学习与工具测量的胸片 VLM

    Microsoft Research 介绍研究模型 CARE-X,用于统一处理胸部 X 光片报告生成、病变分类、定位和医学设备评估,并结合辅助预测头提供可调阈值的置信度输出。

    推荐理由:文章系统展示了 CARE-X 如何结合生成、结构化预测与 DAPO,并以工具增强测量处理胸片中的定量诊断任务。

8月11日周二
  1. Hugging Face Blog82

    NVIDIA Magpie TTS 发布多语言开放权重版本,支持 12 种语言与低延迟部署

    NVIDIA Magpie Multilingual TTS 发布更新版开放权重模型,参数量为 364M,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。

    推荐理由:文章集中展示了 Magpie TTS 的语言覆盖、延迟指标与部署方式,便于评估开放权重语音模型在生产场景中的取舍。

8月10日周一
  1. Hugging Face Blog91

    Meta 发布开源多模态模型 Muse Glimmer-30B,面向本地智能体应用

    Meta 发布 Muse Glimmer-30B,一款面向本地智能体场景的开源多模态模型,采用 30B 参数架构并以 Apache 2.0 许可证发布。模型包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频、工具调用与对象检测,并获得 Transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持。

    推荐理由:文章同时给出 Muse Glimmer 的架构、基准结果和多种部署示例,便于比较其本地智能体定位与实际使用路径。

8月6日周四
8月4日周二
7月30日周四
  1. Google DeepMind75

    Google DeepMind发布Lyria 3.5并上线Google Flow Music

    Google DeepMind发布音乐生成模型Lyria 3.5,并将其上线Google Flow Music。新模型改进了旋律复杂度、歌词质量与提示词遵循、歌声表现和发音,并支持更便捷地控制输出的节奏与时长。

    推荐理由:Lyria 3.5同时更新旋律、歌词、歌声和节奏时长控制,适合了解Google Flow Music的创作能力变化。

7月28日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini Robotics 2,提升机器人的全身智能与协作能力

    Google DeepMind 发布 Gemini Robotics 2,包含 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,支持人形机器人全身控制、灵巧操作、具身推理和多机器人协作。

    推荐理由:Google DeepMind同时更新了全身控制、灵巧操作、具身推理和端侧适配,呈现了机器人从单步执行走向多步骤协作的技术路径。

7月21日周二
7月17日周五
7月16日周四
  1. Hugging Face Blog56

    DharmaOCR 对比 Mistral OCR4 与 Unlimited-OCR,展示领域专门化优势

    Hugging Face Blog 介绍 DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章将优势归因于面向巴西葡萄牙语的监督微调,以及用于降低文本退化、提升输出稳定性的 DPO 训练;文中还通过 ENEM 手写作文和小字体文档示例说明多语言模型的识别与稳定性问题。

7月15日周三
  1. Hugging Face Blog92

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。

    推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。

7月8日周三
  1. Mistral AI79

    Mistral AI 发布具身导航模型 Robostral Navigate

    Mistral AI 发布 Robostral Navigate,这是一个 8B 具身导航模型,仅使用单个 RGB 摄像头和自然语言指令控制机器人移动。在未见过的 R2R-CE 验证环境中成功率为 76.6%,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:Robostral Navigate 展示了单 RGB 相机与 8B 模型在连续环境导航中的组合方案,并公开了训练数据与方法细节。

7月2日周四
7月1日周三
6月30日周二
  1. Google Research82

    Google Research 发布 TabFM 表格数据零样本基础模型

    Google Research 发布 TabFM,一款面向表格数据分类和回归的零样本基础模型,可将训练示例与目标行作为统一上下文,在单次前向计算中生成预测。

    推荐理由:TabFM将表格预测转化为上下文学习任务,并通过合成数据训练与混合注意力架构减少传统建模流程中的调参和特征工程工作。

6月23日周二
6月11日周四
6月9日周二
  1. Google DeepMind87

    Google 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,可自动识别 70+ 种语言并进行接近实时的语音到语音翻译,同时保留说话者的语调、语速和音高。

    推荐理由:Gemini 3.5 Live Translate 将连续语音翻译、音色节奏保留与多端接入结合,文中也列出开发者、企业和普通用户的使用入口。

  2. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

5月18日周一
5月16日周六
  1. Google DeepMind91

    Google DeepMind 发布 Gemini 3.5 Flash,主打前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。

    推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。

4月16日周四
  1. Google DeepMind79

    Google 发布 Gemini 3.1 Flash TTS 语音模型

    Google 发布 Gemini 3.1 Flash TTS,提升语音质量、可控性和表现力,并支持原生多说话人对话及 70+ languages。模型新增 audio tags,可通过自然语言控制语气、语速和表达方式,并在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中分阶段提供预览或使用。

    推荐理由:Gemini 3.1 Flash TTS 将音频标签、场景指令和说话人设置结合,展示了开发者如何更细致地控制语音表达与多轮角色表现。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live,提升了语音交互的精度、自然度和响应速度,并支持更可靠的复杂任务执行。

    推荐理由:Gemini 3.1 Flash Live 同时给出语音交互、任务执行和多语言扩展的具体变化,便于判断其开发者与终端使用场景。

3月24日周二
  1. Mistral AI83

    Mistral AI 发布 Voxtral TTS 多语言文本转语音模型

    Mistral AI 发布 4B 参数的 Voxtral TTS,这是其首个文本转语音模型,支持英语、法语、德语、西班牙语等 9 种语言,并提供情绪表达、低延迟生成和自定义声音适配。

    推荐理由:Voxtral TTS同时给出多语言语音生成、低延迟和声音适配细节,并以人工评测呈现其与ElevenLabs模型的对比结果。

3月17日周二
  1. Mistral AI82

    Mistral AI 发布开源 Leanstral 代码智能体

    Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码智能体,采用 6B active parameters,支持在形式化代码仓库中生成并验证证明。

    推荐理由:Leanstral把Lean 4形式化证明引入代码智能体,并用FLTEval比较性能与成本,呈现了可复用的验证式编程路径。

3月7日周六
  1. Google Research77

    Google SpeciesNet 模型识别近2500类野生动物

    Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。

    推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。

2月5日周四
  1. Mistral AI86

    Mistral AI 发布 Voxtral Transcribe 2 语音转写模型

    Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime。

    推荐理由:Voxtral Transcribe 2 同时覆盖批量与实时转写,给出延迟、价格、语言支持和部署方式,便于评估不同语音应用的选型空间。

12月17日周三
  1. Mistral AI79

    Mistral OCR 3 发布,文档解析能力与 Document AI Playground 同步升级

    Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。

    推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。

12月9日周二
  1. Mistral AI87

    Mistral AI 发布 Devstral 2 与 Mistral Vibe CLI

    Mistral AI 发布 Devstral 2 系列编码模型和 Mistral Vibe CLI。Devstral 2 为 123B 参数模型,在 SWE-bench Verified 上 đạt 72.2%,Devstral Small 2 为 24B 参数模型,得分 68.0%,支持 API、本地部署和微调。

    推荐理由:Devstral 2 同时覆盖大规模部署与本地运行场景,并配套 Vibe CLI,材料还提供了 SWE-bench Verified 成绩、许可方式和 API 定价,便于比较其性能与使用门槛。

12月3日周三
  1. Mistral AI91

    Mistral AI 发布 Mistral 3 模型系列

    Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。

    推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。