跳到正文

#多模态

今日 6 条
4月16日周四
  1. Google Research72

    Google Research 用 AI 生成合成神经元加速脑图谱绘制

    Google Research 发布 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 的训练数据,使小鼠轴突重建错误率降低 4.4%。按完整小鼠脑的规模估算,这相当于节省 157 person-years 的人工校对工作;MoGen 及其不同物种的训练模型已开源。

    推荐理由:论文展示了合成神经元形状如何降低 PATHFINDER 的重建错误,并将模型改进换算为完整小鼠脑图谱中的人工校对节省量。

4月14日周二
  1. Google Research79

    Google Research 推出 Vantage,利用生成式 AI 评估未来技能

    Google Research 推出研究实验 Vantage,通过 AI avatars 模拟多方对话,帮助高中生和大学生练习并评估批判性思维、协作和创造性思维等未来技能。Vantage 使用 Executive LLM 动态引导对话,再由 AI Evaluator 按教育评估量规分析表现并生成技能图谱;与纽约大学专家评分的比较显示,其一致性接近专家评分之间的一致性。

    推荐理由:Vantage把难以量化的协作与创造力置于可控对话中评估,并用人类专家对照验证了自动评分方法。

4月13日周一
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理、多视角理解、任务规划和任务完成检测能力,并新增仪表读数功能。模型可通过 Gemini API 和 Google AI Studio 使用,官方还提供了开发者 Colab。

    推荐理由:Gemini Robotics-ER 1.6 将空间推理、多视角理解、仪表读数和安全约束结合起来,展示了具身模型面向真实机器人任务的能力变化。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理、Agent工作流和端侧部署。模型支持函数调用、结构化 JSON 输出、图像与视频处理,E2B 和 E4B 还支持音频输入;上下文窗口覆盖 128K 至 256K,并以 Apache 2.0 许可开放。

    推荐理由:Gemma 4同时覆盖端侧设备与开发者硬件,并提供Agent工作流、长上下文和Apache 2.0许可,呈现了开放模型的完整落地路径。

3月29日周日
  1. Google DeepMind79

    Google DeepMind 用 Gemini 探索 AI 时代的智能指针

    Google DeepMind 正在探索由 Gemini 驱动的 AI 智能指针,让用户通过指向和语音在不同应用中调用 AI,而不必反复切换窗口或编写复杂提示词。

    推荐理由:文章从四项交互原则和实验演示出发,具体说明 AI 如何结合指针位置、视觉上下文与语音,减少复杂提示词输入。

3月25日周三
  1. Google Research77

    Google 发布 Vibe Coding XR,用 Gemini 和 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js 和 LiteRT.js 的 XR Blocks,将自然语言转换为物理感知的 Android XR 应用。

    推荐理由:Google 将 Gemini 的长上下文推理与 XR Blocks 模板结合,把自然语言生成物理感知的 Android XR 原型,展示了教育和交互场景的快速验证路径。

3月18日周三
  1. Google Research81

    Google Research 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 活动上介绍了 AI 用于个性化医疗、临床协作、公共卫生和生物医学研究的最新进展。相关工作包括 Personal Health Agent、AMIE、MedGemma 和 DeepSomatic,涉及乳腺癌检测、糖尿病视网膜病变筛查、医疗应用开发及基因数据分析。

    推荐理由:文章集中呈现 Google Research 将多模态模型、智能体和开放权重工具推进医疗研究与临床场景的路径,涵盖筛查、诊疗和公共卫生应用。

  2. Google Research85

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research 联合 NHS 机构开展的 AIMS 研究评估了乳腺癌筛查 AI 系统的独立性能及其作为第二读者融入双读流程的可行性。系统将癌症检出率从每 1,000 名女性 7.54 提高到 9.33,并检出原双读流程漏掉的 25% 间隔癌;在 12 个 NHS 筛查点处理 9,266 个病例时,中位 AI 读取时间为 17.7 分钟。

    推荐理由:两项研究从独立性能、临床流程整合和人机协作三个层面提供证据,具体呈现了筛查效率、数据漂移与人工复核的权衡。

  3. Mistral AI70

    Mistral AI 推出 Forge,帮助企业基于专有知识构建 AI 模型

    Mistral AI 推出 Forge,帮助企业使用内部文档、代码库、结构化数据和运营记录训练面向自身领域的 AI 模型。Forge 支持预训练、后训练、强化学习,以及 dense 和 MoE 架构与多模态输入,可用于定制模型和企业智能体。平台还提供基础设施、数据管道、评估与持续改进能力,并支持由 Mistral Vibe 等代码智能体执行微调、超参数搜索、任务调度和合成数据生成。

    推荐理由:Forge将预训练、后训练和强化学习用于企业专有数据,并覆盖模型评估与持续适配,适合了解定制模型如何服务内部流程。

3月17日周二
  1. Mistral AI73

    Mistral AI 与 NVIDIA 合作加速开放前沿模型

    Mistral AI 宣布成为 NVIDIA Nemotron Coalition 创始成员,并计划与 NVIDIA 共同开发开放前沿模型。Mistral AI 将贡献模型架构、训练技术、多模态能力和微调工具,NVIDIA 将提供计算资源、模型开发工具与合成数据生成管线。

    推荐理由:文章同时交代了联盟的合作机制、开放模型计划和 Mistral AI 的分工,便于理解产业协作如何影响模型训练与定制。

  2. Google Research67

    Google Research 用高温超导问题评测六个 LLM 的科学问答能力

    Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。

    推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。

3月12日周四
  1. Google Research83

    Google Research推出Groundsource,用Gemini将新闻报道转化为洪水数据

    Google Research推出Groundsource,利用Gemini从80种语言的新闻报道中提取洪水事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度;相关数据集已开放,并用于支持最多提前24小时的城市暴洪预测及Google Flood Hub的覆盖扩展。

    推荐理由:Groundsource展示了如何用Gemini从多语言新闻中提取并校验灾害时空信息,为缺乏统一观测体系的洪水研究补充历史数据。

3月7日周六
  1. Google Research77

    Google SpeciesNet 模型识别近2500类野生动物

    Google开发的SpeciesNet模型可对相机陷阱图像中的2,498类动物进行分类,并已作为开源工具供下载、适配和改进。模型基于超过65M张标注图像训练,可在标准笔记本上每天处理约30,000张图像;在测试中,99.4%的含动物图像被识别,83%的预测达到物种级别,其中94.5%正确。过去一年,研究团队已将其用于哥伦比亚、美国爱达荷州、澳大利亚和坦桑尼亚等地的野生动物监测。

    推荐理由:SpeciesNet将大规模相机陷阱图像识别转为可本地运行和适配的开放工具,文中数据与项目案例展示了它在野生动物监测中的实际用法。

1月10日周六
  1. Berkeley AI Research68

    Berkeley AI Research 发布信息驱动的成像系统设计研究

    Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。

    推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。

12月17日周三
  1. Mistral AI79

    Mistral OCR 3 发布,文档解析能力与 Document AI Playground 同步升级

    Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。

    推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。

12月3日周三
  1. Mistral AI91

    Mistral AI 发布 Mistral 3 模型系列

    Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。

    推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。

11月19日周三
  1. Mistral AI54

    Mistral AI 宣布在德国扩大布局并与 SAP、Helsing 开展战略合作

    Mistral AI 宣布扩大在德国的业务布局,与 SAP 建立多年合作,将其模型整合进 SAP 的 AI Foundation,并共同开发面向欧洲复杂行业和行政机构的解决方案。Mistral AI 还将与 Helsing 加快开发用于国防和安全场景的视觉语言行动模型,同时增加德国本地团队并计划在未来几个月开设办公室。