跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

139条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–139 条 · 共 139 条
11月14日周五
  1. Google Research81

    Google发布Natural Forests of the World 2020全球自然森林地图与数据集

    Google Research与Google DeepMind发布Natural Forests of the World 2020,这是首个区分自然森林与其他树木覆盖的全球一致10米分辨率地图,独立数据集验证准确率为92.2%。

    推荐理由:该项目将季节性卫星影像、地形数据与时空视觉模型结合,为区分自然森林和其他树木覆盖提供了全球一致的10米基线。

11月13日周四
  1. Google DeepMind83

    Google DeepMind 发布 SIMA 2,推进可推理和自我改进的虚拟世界智能体

    Google DeepMind 发布 SIMA 2,这一研究型智能体结合 Gemini 模型,可在虚拟 3D 世界中理解复杂指令、进行推理、与用户对话并通过自我游戏持续改进。SIMA 2 已在包括 ASKA 和 MineDojo 在内的未训练游戏,以及 Genie 3 生成的新世界中进行测试;目前以有限研究预览形式向少量学者和游戏开发者开放。

    推荐理由:文章展示了 SIMA 2 如何结合 Gemini 的推理与自我改进,在未见过的游戏和生成世界中执行复杂任务,并说明其当前局限。

11月11日周二
  1. Google DeepMind69

    Google DeepMind 研究通过重组视觉表征让 AI 更接近人类认知

    Google DeepMind 发布发表于 Nature 的新研究,提出一种让视觉模型表征更接近人类知识结构的方法。研究以 THINGS 数据集训练 SigLIP-SO400M 上的小型适配器,生成包含数百万次类人“找不同”判断的 AligNet 数据集,再用于微调其他模型。

    推荐理由:研究把人类视觉判断转化为大规模训练数据,展示了重组视觉表征如何同时改善人类对齐、少样本学习和分布偏移下的可靠性。

11月6日周四
  1. Google DeepMind78

    Google DeepMind 发布多项 AI 生态系统研究,预测森林砍伐风险并绘制物种分布

    Google DeepMind 发布三项生物圈研究进展,包括用卫星数据预测森林砍伐风险、以 Graph Neural Net 绘制物种分布,以及更新动物声音分类模型 Perch 2.0。

    推荐理由:Google DeepMind 将森林风险预测、物种分布制图与生物声学识别放入同一生态系统框架,展示了多模态 AI 支持保护行动的路径。

11月5日周三
  1. Google Research72

    Google 发布 ForestCast,用深度学习预测森林砍伐风险

    Google Research 与 Google DeepMind 发布 ForestCast,并公开首个用于训练深度学习模型预测森林砍伐风险的基准数据集。该方法仅使用 Landsat 和 Sentinel 2 等卫星数据及 change history,基于 vision transformers 预测未来砍伐风险,准确率可匹配或超过依赖道路等专门地理信息的方法。

    推荐理由:ForestCast 将森林砍伐风险预测从依赖地区性地图转向纯卫星数据,并公开训练与评测数据,便于复现和扩展。

10月31日周五
  1. Google Research70

    Google Research 展示 Earth AI、DeepSomatic 与 Quantum Echoes 等研究进展

    Google Research 在 Research@ 活动上介绍了 Google Earth AI、DeepSomatic 和 Quantum Echoes 等最新进展,涵盖地理空间推理、癌症基因变异分析和量子计算。

    推荐理由:文章以 Google Earth AI、DeepSomatic 和 Quantum Echoes 为例,串联研究突破走向真实应用的路径,并展示智能体与开放工具如何加速科学发现。

10月30日周四
  1. Google Research80

    Google 发布可验证隐私洞察系统,用于分析 GenAI 使用情况

    Google 发布 provably private insights(PPI)系统,结合 LLM、差分隐私(DP)和可信执行环境(TEE),在不暴露未聚合用户数据的情况下分析 GenAI 工具使用情况。

    推荐理由:文章把 LLM 分析、差分隐私与 TEE 串成可审计流程,并展示了 Pixel Recorder 的实际配置,适合了解敏感数据分析如何兼顾可用性与隐私。

  2. Google Research76

    Google Research 推出 StreetReaderAI:用多模态 AI 让街景对盲人更易访问

    Google Research 在 UIST’25 介绍 StreetReaderAI,这是一款结合 Gemini、实时场景描述、AI 对话和无障碍导航控制的街景原型,面向盲人和低视力用户。

    推荐理由:研究展示了多模态 AI 如何结合街景图像与地理上下文,为盲人用户提供可交互的导航描述,并用用户研究呈现了实际使用偏好与准确性边界。

10月28日周二
  1. Google Research81

    Google Research 推出基于 Gemini 的个人健康教练公开预览

    Google Research 正为 Fitbit 推出基于 Gemini 模型的个人健康教练,并从明天起向符合条件的美国 Fitbit Premium Android 用户开放可选公开预览,iOS 用户随后加入。

    推荐理由:Google Research 介绍了健康智能体从生理数据分析到专家协作和安全评估的构建路径,呈现了健康场景落地大模型的具体方法。

10月23日周四
  1. Google Research84

    Google Earth AI 发布遥感与人口基础模型及地理推理智能体

    Google Earth AI 发布新的 Imagery 和 Population foundation models,并介绍由 Gemini 驱动的 Geospatial Reasoning agent,能够拆解复杂地理问题,调用环境、遥感和人口模型及地理工具完成多步分析。

    推荐理由:文章集中呈现了 Earth AI 的模型、智能体编排方式与评测结果,便于理解跨模态地理推理如何结合多源数据处理复杂任务。

3月17日周一
3月7日周五
  1. Mistral AI83

    Mistral OCR 发布文档理解 API

    Mistral AI 发布 Mistral OCR 文档理解 API,可处理图像和 PDF,提取交错的文本与图像、表格及公式,并支持多语言和结构化输出。该 API 以 mistral-ocr-latest 提供,价格为 1000 pages / $,批量推理时约为每美元 2 倍页数;模型已成为 Le Chat 的默认文档理解模型,并可在 la Plateforme 试用。

    推荐理由:Mistral OCR 将复杂文档解析、结构化输出与自托管选项结合,并用多项基准和处理速度数据说明其适用场景。

2月17日周一
  1. Mistral AI75

    Mistral AI 发布区域语言模型 Mistral Saba

    Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,针对中东和南亚数据训练,支持阿拉伯语及多种印度源语言。模型可通过 API 使用,也能在客户安全环境中本地部署,并可在单 GPU 系统上以超过 150 tokens 每秒的速度响应。Mistral Saba 还支持通过微调适配能源、金融市场和医疗等领域。

    推荐理由:Mistral Saba 将区域语言、文化语境与本地部署结合,展示了专用模型在速度、成本和定制化上的取舍。

11月18日周一
  1. Mistral AI85

    Mistral AI 为 le Chat 带来网页搜索、Canvas 与任务智能体等更新

    Mistral AI 为免费生成式 AI 工作助手 le Chat 推出一组 beta 功能,包括带引用的网页搜索、用于构思和编辑的 Canvas、文档与图像理解、图像生成及任务智能体。文档理解由 Pixtral Large 提供,图像生成接入 Black Forest Labs 的 Flux Pro;这些功能目前均免费提供,并将逐步上线。

    推荐理由:Mistral AI 将网页搜索、Canvas、文档理解、图像生成和任务智能体整合进 le Chat,展示了从模型到工作流输出的一体化路径。

  2. Mistral AI85

    Mistral AI 发布 Pixtral Large 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 的 124B open-weights 多模态模型,配备 1B 参数视觉编码器和 128K 上下文窗口。

    推荐理由:Pixtral Large 将图像理解、文档与图表分析纳入 Mistral Large 2 体系,并公布了多项基准结果与使用入口。

9月17日周二
  1. Mistral AI83

    Mistral AI 发布 Mistral Small v24.09 并推出免费 API 层与 Pixtral 12B 图像能力

    Mistral AI 推出 la Plateforme 免费层,全面下调模型 API 价格,并发布 22B 参数的 Mistral Small v24.09。Pixtral 12B 现可在 le Chat 免费使用,支持扫描、分析、搜索和描述图像及知识文件,并采用 Apache 2.0 许可证。

    推荐理由:这次更新同时覆盖免费 API、模型降价、Mistral Small v24.09 和 Pixtral 12B 图像能力,便于比较不同部署与成本选择。

  2. Mistral AI85

    Mistral AI 发布多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用400M参数视觉编码器和基于 Mistral Nemo 12B 的多模态解码器。模型支持可变图像尺寸、任意数量图像及128k tokens上下文,在 MMMU 上 đạt52.5%,并提供 Apache 2.0 许可,可通过 Le Chat、La Plateforme、mistral-inference 或 vLLM 使用。

    推荐理由:Pixtral 12B同时覆盖图像理解与文本任务,原文还给出了128k tokens上下文、Apache 2.0许可及本地运行方式。

7月18日周四
  1. Mistral AI83

    Mistral AI 发布 Mistral NeMo 12B 模型

    Mistral AI 与 NVIDIA 合作发布 Mistral NeMo,一款 12B 模型,支持最高 128k tokens 上下文窗口,并提供 base 与 instruction-tuned checkpoints。

    推荐理由:Mistral NeMo同时给出128k上下文窗口、Tekken分词器和Apache 2.0许可,便于比较其多语言与部署适用性。

2月26日周一
  1. Mistral AI86

    Mistral Large 与 Mistral Small 发布,支持 Azure、函数调用和 JSON 输出

    Mistral AI 发布 Mistral Large,称其为最新且最先进的语言模型,可通过 La Plateforme 和 Azure 使用,并支持多语言推理、32K tokens 上下文、函数调用与 JSON 输出。公司同时发布面向低延迟和成本优化的 Mistral Small,以及 mistral-small-2402 和 mistral-large-2402 endpoints。

    推荐理由:Mistral Large 同时提供多语言推理、32K tokens 上下文、函数调用和 JSON 输出,并通过 La Plateforme 与 Azure 开放。