跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 141–160 条 · 共 160 条
11月5日周三
  1. Google Research81

    Google Research探索基于太空的可扩展AI基础设施系统设计

    Google Research发布Project Suncatcher早期研究,提出由太阳能卫星、Google TPU和自由空间光链路组成的可扩展太空AI基础设施。研究讨论了卫星间达到数十Tbps通信、紧密编队控制和TPU耐辐射等挑战,并报告单组收发器已实现800 Gbps单向传输。Google计划与Planet合作,于2027年初发射两颗原型卫星进行验证。

    推荐理由:Google Research将卫星编队、光通信、轨道动力学与TPU耐辐射测试放在同一系统框架中,呈现了太空AI基础设施的关键约束。

10月31日周五
  1. Google Research70

    Google Research 展示 Earth AI、DeepSomatic 与 Quantum Echoes 等研究进展

    Google Research 在 Research@ 活动上介绍了 Google Earth AI、DeepSomatic 和 Quantum Echoes 等最新进展,涵盖地理空间推理、癌症基因变异分析和量子计算。

    推荐理由:文章以 Google Earth AI、DeepSomatic 和 Quantum Echoes 为例,串联研究突破走向真实应用的路径,并展示智能体与开放工具如何加速科学发现。

10月23日周四
  1. Google Research84

    Google Earth AI 发布遥感与人口基础模型及地理推理智能体

    Google Earth AI 发布新的 Imagery 和 Population foundation models,并介绍由 Gemini 驱动的 Geospatial Reasoning agent,能够拆解复杂地理问题,调用环境、遥感和人口模型及地理工具完成多步分析。

    推荐理由:文章集中呈现了 Earth AI 的模型、智能体编排方式与评测结果,便于理解跨模态地理推理如何结合多源数据处理复杂任务。

6月10日周二
  1. Mistral AI84

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,提供24B参数的开源 Magistral Small 与企业版 Magistral Medium。Magistral Medium 在 AIME2024 上得分73.6%,多数投票@64时为90%;Small分别为70.7%和83.3%。

    推荐理由:Magistral同时提供开源与企业版本,并公布AIME2024成绩和部署入口,便于比较其推理能力、透明性与实际使用路径。

5月21日周三
  1. Mistral AI87

    Mistral AI 发布 Devstral 智能体编码模型

    Mistral AI 与 All Hands AI 发布面向软件工程任务的智能体大语言模型 Devstral,并以 Apache 2.0 许可证开源。Devstral 在 SWE-Bench Verified 上取得 46.8% 的成绩,较此前开源 SoTA 模型高出 6 个百分点以上;模型可在单张 RTX 4090 或 32GB RAM 的 Mac 上运行。

    推荐理由:Devstral 同时给出 SWE-Bench Verified 成绩、部署条件与 Apache 2.0 许可,便于比较其编码能力和实际使用门槛。

3月17日周一
11月18日周一
  1. Mistral AI85

    Mistral AI 发布 Pixtral Large 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 的 124B open-weights 多模态模型,配备 1B 参数视觉编码器和 128K 上下文窗口。

    推荐理由:Pixtral Large 将图像理解、文档与图表分析纳入 Mistral Large 2 体系,并公布了多项基准结果与使用入口。

10月16日周三
  1. Mistral AI84

    Mistral AI 发布 Ministral 3B 和 Ministral 8B 边缘模型

    Mistral AI 发布 Ministral 3B 和 Ministral 8B,面向端侧计算与边缘场景,支持最高 128k 上下文窗口。Ministral 8B 使用交错滑动窗口注意力以提升推理速度和内存效率,两款模型可用于本地翻译、离线智能助手、分析、机器人及多步 Agent 工作流。

    推荐理由:Ministral 3B 和 8B 面向端侧与边缘计算,兼顾低延迟、隐私和多步智能体工作流,适合关注小模型部署的人了解其定位。

9月17日周二
  1. Mistral AI85

    Mistral AI 发布多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用400M参数视觉编码器和基于 Mistral Nemo 12B 的多模态解码器。模型支持可变图像尺寸、任意数量图像及128k tokens上下文,在 MMMU 上 đạt52.5%,并提供 Apache 2.0 许可,可通过 Le Chat、La Plateforme、mistral-inference 或 vLLM 使用。

    推荐理由:Pixtral 12B同时覆盖图像理解与文本任务,原文还给出了128k tokens上下文、Apache 2.0许可及本地运行方式。

7月24日周三
  1. Mistral AI85

    Mistral AI 发布 Mistral Large 2,支持 128k 上下文与增强工具调用

    Mistral AI 发布 Mistral Large 2,提供 128k 上下文窗口、123B 参数和 80+ 编程语言支持,并面向单节点推理优化。模型强化了编码、推理、指令遵循、函数调用和多语言能力,API 名称为 mistral-large-2407,权重已在 Hugging Face 提供;商业自部署需获取 Mistral Commercial License。

    推荐理由:Mistral Large 2 同时覆盖长上下文、编码、推理和工具调用,并公布了性能、授权与部署入口,便于评估其应用价值。

7月18日周四
  1. Mistral AI83

    Mistral AI 发布 Mistral NeMo 12B 模型

    Mistral AI 与 NVIDIA 合作发布 Mistral NeMo,一款 12B 模型,支持最高 128k tokens 上下文窗口,并提供 base 与 instruction-tuned checkpoints。

    推荐理由:Mistral NeMo同时给出128k上下文窗口、Tekken分词器和Apache 2.0许可,便于比较其多语言与部署适用性。

7月16日周二
  1. Mistral AI74

    Mistral AI 发布 Codestral Mamba 代码模型

    Mistral AI 发布 Codestral Mamba,一款采用 Mamba 架构的 7,285,403,648 参数指令模型,支持免费使用、修改和分发。该模型提供线性时间推理和理论上的无限长度序列建模能力,并在最长 256k tokens 的上下文检索上进行测试。

    推荐理由:Codestral Mamba 将线性时间推理与代码能力结合,并开放权重和部署路径,适合关注长上下文本地代码助手的读者了解其架构取向。

4月17日周三
  1. Mistral AI86

    Mistral AI 发布开放模型 Mixtral 8x22B

    Mistral AI 发布 Mixtral 8x22B,这是一款采用稀疏 Mixture-of-Experts 的开放模型,141B 参数中仅有 39B 激活,并提供 64K tokens 上下文窗口。

    推荐理由:这次发布同时给出开放许可、稀疏激活规模和基准结果,便于比较 Mixtral 8x22B 的性能与成本取舍。

2月26日周一
  1. Mistral AI73

    Mistral AI 发布对话助手 Le Chat

    Mistral AI 发布基于其模型的多语言对话助手 Le Chat,可使用 Mistral Large、Mistral Small 或原型模型 Mistral Next。面向企业推出的 le Chat Enterprise 支持自部署和细粒度审核机制;Le Chat 当前无法访问互联网,可能回答不准确或过时。

    推荐理由:Mistral AI同时给出了个人助手与企业部署版本的定位,便于比较其开放体验和团队使用所需的控制能力。

  2. Mistral AI86

    Mistral Large 与 Mistral Small 发布,支持 Azure、函数调用和 JSON 输出

    Mistral AI 发布 Mistral Large,称其为最新且最先进的语言模型,可通过 La Plateforme 和 Azure 使用,并支持多语言推理、32K tokens 上下文、函数调用与 JSON 输出。公司同时发布面向低延迟和成本优化的 Mistral Small,以及 mistral-small-2402 和 mistral-large-2402 endpoints。

    推荐理由:Mistral Large 同时提供多语言推理、32K tokens 上下文、函数调用和 JSON 输出,并通过 La Plateforme 与 Azure 开放。

12月11日周一
  1. Mistral AI93

    Mistral AI 发布 Mixtral 8x7B 稀疏专家模型

    Mistral AI 发布带有开放权重和Apache 2.0许可的 Mixtral 8x7B,并同步推出 Mixtral 8x7B Instruct。模型总参数量为46.7B,每个 token 使用12.9B参数,官方称其在多数基准上达到或超过 Llama 2 70B 和 GPT3.5,推理速度提升至6x。

    推荐理由:Mixtral 8x7B同时公开权重与Apache 2.0许可,并用稀疏专家架构控制推理成本,适合比较开放模型的性能与部署取舍。

  2. Mistral AI84

    Mistral AI 开放 La Plateforme 平台服务 Beta

    Mistral AI 开放 La Plateforme 的 Beta 访问,提供 mistral-tiny、mistral-small、mistral-medium 三个文本生成端点和 Mistral-embed 嵌入端点。

    推荐理由:Mistral AI 同时公布了三个生成式端点和一个嵌入端点,并披露模型、语言覆盖与基准成绩,便于开发者比较接入选择。

9月27日周三
  1. Mistral AI90

    Mistral AI 发布开放模型 Mistral 7B

    Mistral AI 发布首个 7B-parameter 模型 Mistral 7B,称其在标准英语和代码基准上超过当时所有不超过 13B 参数的开放模型。该模型采用 Apache 2.0 发布,可用于摘要、结构化和问答,并以更低成本运行;Mistral AI 同时开放 GitHub 仓库和 Discord 社区。

    推荐理由:Mistral AI 以 Mistral 7B 的发布展示了小型开放模型在性能、成本和部署灵活性之间的取舍。

  2. Mistral AI88

    Mistral AI 发布 7.3B 参数模型 Mistral 7B

    Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的语言模型,官方称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B。

    推荐理由:这篇发布同时给出 Mistral 7B 与 Llama 系列的基准对比、推理优化机制和 Apache 2.0 使用方式,便于判断小模型的性能与部署成本。