跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

139条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–120 条 · 共 139 条
1月30日周五
  1. Google DeepMind83

    Google DeepMind 推出 Project Genie 互动世界原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一款由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性网页原型。

    推荐理由:Project Genie 将 Genie 3 的世界模型能力封装为可操作原型,展示了从生成环境到实时探索和视频导出的完整体验。

1月23日周五
  1. Google Research65

    Google 研究用分解方法提升小模型的用户意图提取效果

    Google Research 介绍一项发表于 EMNLP 2025 的研究,将用户界面轨迹的意图理解拆为逐屏摘要和序列意图抽取两步,以便小型多模态 LLM 在设备端处理。

    推荐理由:论文将界面轨迹的意图理解拆成屏幕摘要与序列抽取两步,并以事实级指标分析小模型在端侧场景中的效果与误差来源。

1月16日周五
  1. Google DeepMind72

    Google DeepMind 发布 D4RT,统一动态 4D 场景重建与跟踪

    Google DeepMind 推出 D4RT,一种统一的 AI 模型,用于跨空间与时间进行 4D 场景重建和跟踪。D4RT 采用基于查询的 Transformer 编解码架构,在测试中比此前 state of the art 方法快 18x 至 300x;处理一分钟视频约需 5 秒,而此前方法最多需要 10 分钟。

    推荐理由:D4RT 将动态场景重建与跟踪统一到查询式架构中,并以速度数据展示其在实时空间理解场景中的应用潜力。

1月14日周三
  1. Google Research82

    Google发布MedGemma 1.5 4B并推出MedASR医疗语音识别模型

    Google发布MedGemma 1.5 4B,扩展对CT、MRI和全切片组织病理图像的支持,并改进胸部X光定位、纵向影像 review、实验室报告提取和医疗文本问答等能力。

    推荐理由:Google同时更新了MedGemma的高维医疗影像与文本能力,并发布MedASR,文中的基准数据可帮助开发者比较其适配医疗场景的起点。

1月10日周六
  1. Berkeley AI Research68

    Berkeley AI Research 发布信息驱动的成像系统设计研究

    Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。

    推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。

12月17日周三
  1. Mistral AI79

    Mistral OCR 3 发布,文档解析能力与 Document AI Playground 同步升级

    Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。

    推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。

12月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 FACTS Benchmark Suite 评测大语言模型事实性

    Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,新增 Parametric、Search、Multimodal 三项基准,并更新 FACTS Grounding Benchmark v2。

    推荐理由:FACTS Benchmark Suite 将内部知识、网页搜索、图像问答和上下文 grounding 分开评测,并公开 3,513 个样例,便于比较模型在不同事实性任务上的表现。

12月5日周五
  1. Google DeepMind63

    Google DeepMind 利用 AlphaFold 设计更耐热的光合作用酶

    研究人员利用 AlphaFold 预测植物及耐热藻类 glycerate kinase(GLYK)的结构,并通过分子模拟发现植物 GLYK 的三个柔性环在高温下会失稳。团队以藻类 GLYK 的刚性结构替换这些区域,设计出的杂合酶在最高 65 °C 下仍保持稳定,为培育更耐热的作物提供了研究路径。

    推荐理由:研究展示了如何结合 AlphaFold 结构预测与分子模拟定位酶的热不稳定区域,并据此设计出耐受更高温度的杂合酶。

12月4日周四
12月3日周三
  1. Mistral AI91

    Mistral AI 发布 Mistral 3 模型系列

    Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。

    推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。

11月26日周三
  1. Google DeepMind82

    AlphaFold 五年影响:从蛋白质结构预测走向数字生物学

    Google DeepMind 回顾 AlphaFold 自 2020 年以来对科学研究的影响,包括 AlphaFold Protein Database 被超过 3 million 名研究者在 190 多个国家使用,以及相关研究在疾病理解、药物研发和生物学发现中的应用。

    推荐理由:文章以五年应用数据和具体科研案例梳理 AlphaFold 的扩散路径,呈现其从蛋白质结构预测工具走向数字生物学平台的过程。

11月20日周四
  1. Google DeepMind86

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),面向开发者提供高保真图像生成与编辑能力,目前通过 Gemini API 在 Google AI Studio 和 Vertex AI 以付费预览形式推出。

    推荐理由:这篇发布说明集中展示了 Gemini 3 Pro Image 在文字渲染、图像控制、语言本地化和 Google Search grounding 方面的开发者用法。

11月19日周三
  1. Google Research86

    Google 推出延迟 2 秒的实时语音到语音翻译技术

    Google Research 介绍了一种端到端实时语音到语音翻译模型,可保留原说话者的声音,并将延迟降至 2 秒。该技术已用于 Google Meet 服务器端功能和 Pixel 10 的端侧功能,当前支持英语与西班牙语、德语、法语、意大利语、葡萄牙语之间的翻译。

    推荐理由:文章具体说明了端到端语音翻译如何将延迟降至 2 秒,并展示其在 Google Meet 与 Pixel 10 上的落地方式。

  2. Google DeepMind90

    Google DeepMind 发布 Gemini 3,Gemini 3 Pro 开放预览

    Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 已通过 Gemini API 在 Google AI Studio 和 Vertex AI 提供预览,价格为 $2/million input tokens 和 $12/million output tokens,适用于 200k tokens 或更短的 prompts。

    推荐理由:Gemini 3 Pro同时覆盖智能体编码、单提示词应用生成和多模态推理,并公布了API价格与接入方式,便于评估其开发价值。

  3. Google DeepMind60

    Google DeepMind 将在新加坡开设新的 AI 研究实验室

    Google DeepMind 宣布在新加坡开设新的研究实验室,以推进亚太地区的 AI 研究、Gemini 核心能力和区域应用。新加坡团队将与政府、企业、学术机构及社会组织合作,重点关注语言与文化包容性。该公司还介绍了与新加坡机构在 AlphaFold、AI agent sandbox、Project Aquarium、SEA-LION v4 和 AI 教育等方面的合作。

    推荐理由:Google DeepMind 将新加坡研究实验室与区域合作结合,覆盖 Gemini、语言文化包容性及公共服务等应用方向。

  4. Google Research87

    Google推出Generative UI,Gemini与AI Mode可按提示生成交互界面

    Google Research推出Generative UI,让AI模型根据用户提示动态生成网页、游戏、工具和应用等定制化交互界面。该能力已在Gemini app中以dynamic view和visual layout实验形式推出,并接入Google Search的AI Mode;美国Google AI Pro和Ultra订阅者可在AI Mode中选择“Thinking”体验。

    推荐理由:Google同时给出论文依据、产品入口和偏好评测,能帮助读者理解Generative UI从研究实现走向真实产品时的能力边界与使用条件。

11月17日周一
  1. Google DeepMind85

    Google DeepMind 发布 WeatherNext 2 天气预测模型

    Google DeepMind 和 Google Research 发布 WeatherNext 2,可将全球天气预测提速 8x,分辨率最高达到 1 小时,并从单一起始条件生成数百种天气情景。

    推荐理由:WeatherNext 2 同时提升预测速度、分辨率和情景覆盖,并开放至多个 Google 平台,展示了天气模型从研究走向应用的路径。