跳到正文

#多模态

今日 2 条
今天10月2日周五
10月1日周四
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 4 Argon,强化长程推理与网络安全防御

    Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。

    推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。

9月29日周二
  1. AWS Machine Learning Blog82

    Grok 4.7 现已在 Amazon Bedrock 上线

    xAI 的 Grok 4.7 已在 Amazon Bedrock 模型目录上线,支持编码、长时智能体和知识工作,提供 500K token 上下文窗口与 low、medium、high、xhigh 四档推理强度。

    推荐理由:文章把 Grok 4.7 在 Amazon Bedrock 上的接入方式、推理开销和权限配置串联起来,便于开发者评估长任务部署方案。

9月24日周四
9月23日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,用于生成可定制的角色声音、逐句指导场景对白和大规模语音内容。

    推荐理由:两款模型分别覆盖创意驱动与高量低成本语音生成,并提供声音定制、逐句导演和同意验证,展示了语音模型面向生产应用的能力边界。

9月3日周四
  1. Google DeepMind87

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 发布 WeatherNext 3 全球天气模型,使用实时卫星数据每小时生成高分辨率预报。模型可在最高 5-kilometer 分辨率下预测天气变量,并提供 100-meter 风速、云量和太阳辐射等清洁能源相关数据。

    推荐理由:WeatherNext 3 将实时卫星观测、小时级更新和更高空间分辨率结合起来,并延伸到降水与可再生能源预测。

  2. Hugging Face Blog78

    Hugging Face发布NeoMME多模态多语言编码器

    Hugging Face发布NeoMME系列多模态多语言编码器,提供260M和800M两种规模,使用单个双向Transformer处理文本token与原始图像patch,并从零开始训练。

    推荐理由:NeoMME同时展示了单塔多模态编码、视觉文档检索和索引压缩方案,便于比较效率、检索质量与存储成本之间的取舍。

9月1日周二
  1. Microsoft Research76

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款 Apache 2.0 开放权重病理基础模型,分别用于全切片表征学习和从 H&E 预测空间蛋白组。

    推荐理由:两款开放权重模型用蒸馏和轻量编码器降低病理分析成本,并给出不同队列上的性能与资源对比,便于评估其研究用途。

8月28日周五
  1. Google Research82

    Google Research 推出 Planetary Prediction Engine,自动化全球地理预测建模

    Google Research 介绍 Planetary Prediction Engine(PPE),这是 Google Earth AI 旗下的实验性研究能力,可根据自然语言查询自主完成地理数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理数据发现、特征构建和模型评估串成自动化流程,并用多个领域的基准结果说明其应用价值。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增可控视频生成能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,为开发者提供场景延展、首尾帧插值、视频参考和最高4K输出等生成视频能力。模型可分析最多10秒的既有上下文,视频可按10秒增量延展至累计40秒;360p预览生成速度最高提升60%,成本为720p的三分之一。

    推荐理由:Gemini Omni 1.1 Flash把场景延展、首尾帧控制、视频参考和4K输出整合进开发接口,呈现了生成视频从原型到制作的具体工作流。

8月17日周一
  1. Google Research69

    Google Research 推出 PhotoScan 研究框架,用手机照片估计心代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 手机照片估计体脂率、A/G ratio 和 V/S ratio 的深度学习框架。模型先在 UK Biobank 的 35,323 条记录上预训练,再用 677 名成人的 PhotoBIA 数据微调,并在 132 人的独立队列中验证。

    推荐理由:研究用多个独立队列比较 PhotoScan 与 BIA、DXA 在体成分估计和胰岛素抵抗分类上的表现,展示了手机影像的研究价值。

8月12日周三
  1. Google DeepMind91

    Google DeepMind发布SL2T手语转文本模型,登陆Gboard和Live Transcribe

    Google DeepMind发布手语转文本模型SL2T,首先支持ASL到英语,并为Pixel 11上的Gboard和Live Transcribe提供手语输入功能。SL2T使用超过100,000小时、覆盖50多种手语的数据训练,端侧MediaPipe Holistic仅上传身体姿态坐标进行翻译;在FLEURS-ASL基准上取得70 BLEURT的zero-shot分数。

    推荐理由:SL2T将大规模多语言训练、端侧姿态追踪与隐私设计结合,并已进入Gboard和Live Transcribe,展示了手语翻译落地面临的关键技术取舍。

  2. Google Research87

    Google Research 推进 AMIE 实时音视频临床问诊能力

    Google Research 介绍了基于 Gemini 和 Project Astra 的 AMIE (Video),可在实时视频问诊中感知非语言临床线索、引导虚拟体格检查并进行诊断推理。研究覆盖 100 个场景和 300 次咨询,在核心临床能力上评估结果与初级保健医生相当;但研究仅使用专业患者演员,真实患者和真实临床条件下的实用性仍需进一步验证。

    推荐理由:研究展示了 AMIE 从文本对话扩展到实时音视频问诊的系统设计与评估,也清楚交代了模拟场景和真实患者验证之间的边界。

  3. Microsoft Research76

    Microsoft Research 介绍 CARE-X:结合辅助监督、奖励对齐学习与工具测量的胸片 VLM

    Microsoft Research 介绍研究模型 CARE-X,用于统一处理胸部 X 光片报告生成、病变分类、定位和医学设备评估,并结合辅助预测头提供可调阈值的置信度输出。

    推荐理由:文章系统展示了 CARE-X 如何结合生成、结构化预测与 DAPO,并以工具增强测量处理胸片中的定量诊断任务。

8月10日周一
  1. Hugging Face Blog91

    Meta 发布开源多模态模型 Muse Glimmer-30B,面向本地智能体应用

    Meta 发布 Muse Glimmer-30B,一款面向本地智能体场景的开源多模态模型,采用 30B 参数架构并以 Apache 2.0 许可证发布。模型包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频、工具调用与对象检测,并获得 Transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持。

    推荐理由:文章同时给出 Muse Glimmer 的架构、基准结果和多种部署示例,便于比较其本地智能体定位与实际使用路径。

8月6日周四
8月4日周二
7月30日周四
7月28日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini Robotics 2,提升机器人的全身智能与协作能力

    Google DeepMind 发布 Gemini Robotics 2,包含 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,支持人形机器人全身控制、灵巧操作、具身推理和多机器人协作。

    推荐理由:Google DeepMind同时更新了全身控制、灵巧操作、具身推理和端侧适配,呈现了机器人从单步执行走向多步骤协作的技术路径。

7月21日周二
7月15日周三
  1. Hugging Face Blog92

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 发布 Inkling 及 Inkling-Small,前者是具备 975B 总参数、41B 激活参数和 1M 上下文窗口的多模态 MoE 模型,可接收图像、文本和音频输入;Inkling-Small 为 276B 总参数、12B 激活参数。

    推荐理由:文章同时给出 Inkling 的多模态架构、部署门槛与推理支持,便于评估其从实验体验走向实际应用的条件。

7月1日周三
6月23日周二
6月9日周二
  1. Google DeepMind87

    Google 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google 发布 Gemini 3.5 Live Translate,可自动识别 70+ 种语言并进行接近实时的语音到语音翻译,同时保留说话者的语调、语速和音高。

    推荐理由:Gemini 3.5 Live Translate 将连续语音翻译、音色节奏保留与多端接入结合,文中也列出开发者、企业和普通用户的使用入口。

  2. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

5月18日周一
5月16日周六
  1. Google DeepMind91

    Google DeepMind 发布 Gemini 3.5 Flash,主打前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。

    推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

3月17日周二
3月7日周六
  1. Google Research77

    Google SpeciesNet 模型识别近2500类野生动物

    Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。

    推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。

12月17日周三
  1. Mistral AI79

    Mistral OCR 3 发布,文档解析能力与 Document AI Playground 同步升级

    Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。

    推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。

12月3日周三
  1. Mistral AI91

    Mistral AI 发布 Mistral 3 模型系列

    Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。

    推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。