Google DeepMind 更新 Veo 3.1 Ingredients to Video,支持原生竖屏与 4K 输出
Google DeepMind 更新 Veo 3.1 Ingredients to Video,增强基于参考图生成视频时的角色、背景和物体一致性,并支持更丰富的对话与叙事。
推荐理由:Veo 3.1 此次更新同时覆盖参考图一致性、原生竖屏和高分辨率输出,清晰展示了从移动端短视频到专业制作的适用范围。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,增强基于参考图生成视频时的角色、背景和物体一致性,并支持更丰富的对话与叙事。
推荐理由:Veo 3.1 此次更新同时覆盖参考图一致性、原生竖屏和高分辨率输出,清晰展示了从移动端短视频到专业制作的适用范围。
Mistral AI 发布 Mistral OCR 3,相较 Mistral OCR 2 在表单、扫描文档、复杂表格和手写内容上取得 74% 的整体胜率。模型支持提取文本与嵌入图像、Markdown 和结构化 JSON 输出,并以 $2 per 1,000 pages 提供 API,Batch API 价格为 $1 per 1,000 pages。
推荐理由:Mistral OCR 3 给出了相较 OCR 2 的具体提升、价格和 API 入口,便于评估文档解析场景的部署成本与迁移路径。
Google DeepMind 发布 Gemini 3 Flash,结合 Gemini 3 Pro 级推理与 Flash 级延迟、效率和成本,面向开发者、消费者及企业逐步开放。
推荐理由:Gemini 3 Flash同时给出推理、速度、成本和编码基准数据,并覆盖开发者、消费者与企业入口,便于比较其实际定位。
Mistral AI 发布 Devstral 2 系列编码模型和 Mistral Vibe CLI。Devstral 2 为 123B 参数模型,在 SWE-bench Verified 上 đạt 72.2%,Devstral Small 2 为 24B 参数模型,得分 68.0%,支持 API、本地部署和微调。
推荐理由:Devstral 2 同时覆盖大规模部署与本地运行场景,并配套 Vibe CLI,材料还提供了 SWE-bench Verified 成绩、许可方式和 API 定价,便于比较其性能与使用门槛。
Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。
推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),面向开发者提供高保真图像生成与编辑能力,目前通过 Gemini API 在 Google AI Studio 和 Vertex AI 以付费预览形式推出。
推荐理由:这篇发布说明集中展示了 Gemini 3 Pro Image 在文字渲染、图像控制、语言本地化和 Google Search grounding 方面的开发者用法。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),主打更强的推理、世界知识、文字渲染和图像编辑控制。
推荐理由:Nano Banana Pro 将更强的推理、文字渲染和创作控制结合到图像生成与编辑中,并给出了面向消费者、开发者和专业用户的使用入口。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 已通过 Gemini API 在 Google AI Studio 和 Vertex AI 提供预览,价格为 $2/million input tokens 和 $12/million output tokens,适用于 200k tokens 或更短的 prompts。
推荐理由:Gemini 3 Pro同时覆盖智能体编码、单提示词应用生成和多模态推理,并公布了API价格与接入方式,便于评估其开发价值。
Google DeepMind 发布 Gemini 3,首先推出 Gemini 3 Pro 预览版,并在 Gemini app、AI Mode in Search、AI Studio、Vertex AI 和 Gemini CLI 等入口提供使用。
推荐理由:Gemini 3 Pro、Deep Think 与 Google Antigravity 同步亮相,原文集中展示了模型能力、开发入口和智能体工作流变化。
Google DeepMind 和 Google Research 发布 WeatherNext 2,可将全球天气预测提速 8x,分辨率最高达到 1 小时,并从单一起始条件生成数百种天气情景。
推荐理由:WeatherNext 2 同时提升预测速度、分辨率和情景覆盖,并开放至多个 Google 平台,展示了天气模型从研究走向应用的路径。
Google DeepMind 发布 SIMA 2,这一研究型智能体结合 Gemini 模型,可在虚拟 3D 世界中理解复杂指令、进行推理、与用户对话并通过自我游戏持续改进。SIMA 2 已在包括 ASKA 和 MineDojo 在内的未训练游戏,以及 Genie 3 生成的新世界中进行测试;目前以有限研究预览形式向少量学者和游戏开发者开放。
推荐理由:文章展示了 SIMA 2 如何结合 Gemini 的推理与自我改进,在未见过的游戏和生成世界中执行复杂任务,并说明其当前局限。
Google Earth AI 发布新的 Imagery 和 Population foundation models,并介绍由 Gemini 驱动的 Geospatial Reasoning agent,能够拆解复杂地理问题,调用环境、遥感和人口模型及地理工具完成多步分析。
推荐理由:文章集中呈现了 Earth AI 的模型、智能体编排方式与评测结果,便于理解跨模态地理推理如何结合多源数据处理复杂任务。
Mistral AI 发布 Devstral Medium,并将 Devstral Small 升级至 Devstral Small 1.1,面向代码智能体提升性能、提示词泛化和 agentic scaffold 适配能力。
推荐理由:这次更新同时覆盖 Apache 2.0 开源模型与 API 模型,并给出 SWE-Bench Verified 成绩、价格和部署方式,便于比较不同使用路径。
Mistral AI 发布首个推理模型 Magistral,提供24B参数的开源 Magistral Small 与企业版 Magistral Medium。Magistral Medium 在 AIME2024 上得分73.6%,多数投票@64时为90%;Small分别为70.7%和83.3%。
推荐理由:Magistral同时提供开源与企业版本,并公布AIME2024成绩和部署入口,便于比较其推理能力、透明性与实际使用路径。
Mistral AI 与 All Hands AI 发布面向软件工程任务的智能体大语言模型 Devstral,并以 Apache 2.0 许可证开源。Devstral 在 SWE-Bench Verified 上取得 46.8% 的成绩,较此前开源 SoTA 模型高出 6 个百分点以上;模型可在单张 RTX 4090 或 32GB RAM 的 Mac 上运行。
推荐理由:Devstral 同时给出 SWE-Bench Verified 成绩、部署条件与 Apache 2.0 许可,便于比较其编码能力和实际使用门槛。
Mistral AI 发布 Mistral Small 3.1,改进文本性能和多模态理解,支持最高 128k tokens 上下文,推理速度为 150 tokens per second。
推荐理由:Mistral Small 3.1 同时覆盖长上下文、多模态和低延迟部署,并提供 base 与 instruct 检查点,适合比较开源小模型的实用取舍。
Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,针对中东和南亚数据训练,支持阿拉伯语及多种印度源语言。模型可通过 API 使用,也能在客户安全环境中本地部署,并可在单 GPU 系统上以超过 150 tokens 每秒的速度响应。Mistral Saba 还支持通过微调适配能源、金融市场和医疗等领域。
推荐理由:Mistral Saba 将区域语言、文化语境与本地部署结合,展示了专用模型在速度、成本和定制化上的取舍。
Mistral AI 发布 Codestral 25.01,这是 Codestral 的升级版,采用更高效的架构和改进后的 tokenizer,代码生成与补全速度约提升 2 倍,上下文长度为 256k。
推荐理由:这次更新同时给出了架构、速度、上下文窗口和 FIM 基准变化,并说明了 IDE、API 及本地部署入口。
Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 的 124B open-weights 多模态模型,配备 1B 参数视觉编码器和 128K 上下文窗口。
推荐理由:Pixtral Large 将图像理解、文档与图表分析纳入 Mistral Large 2 体系,并公布了多项基准结果与使用入口。
Mistral AI 发布 Ministral 3B 和 Ministral 8B,面向端侧计算与边缘场景,支持最高 128k 上下文窗口。Ministral 8B 使用交错滑动窗口注意力以提升推理速度和内存效率,两款模型可用于本地翻译、离线智能助手、分析、机器人及多步 Agent 工作流。
推荐理由:Ministral 3B 和 8B 面向端侧与边缘计算,兼顾低延迟、隐私和多步智能体工作流,适合关注小模型部署的人了解其定位。