最新精选
第 101–112 条 · 共 112 条Mistral AI 推出 la Plateforme 免费层,全面下调模型 API 价格,并发布 22B 参数的 Mistral Small v24.09。Pixtral 12B 现可在 le Chat 免费使用,支持扫描、分析、搜索和描述图像及知识文件,并采用 Apache 2.0 许可证。
推荐理由:这次更新同时覆盖免费 API、模型降价、Mistral Small v24.09 和 Pixtral 12B 图像能力,便于比较不同部署与成本选择。
Mistral AI 发布原生多模态模型 Pixtral 12B,采用400M参数视觉编码器和基于 Mistral Nemo 12B 的多模态解码器。模型支持可变图像尺寸、任意数量图像及128k tokens上下文,在 MMMU 上 đạt52.5%,并提供 Apache 2.0 许可,可通过 Le Chat、La Plateforme、mistral-inference 或 vLLM 使用。
推荐理由:Pixtral 12B同时覆盖图像理解与文本任务,原文还给出了128k tokens上下文、Apache 2.0许可及本地运行方式。
Mistral AI 发布 Mistral Large 2,提供 128k 上下文窗口、123B 参数和 80+ 编程语言支持,并面向单节点推理优化。模型强化了编码、推理、指令遵循、函数调用和多语言能力,API 名称为 mistral-large-2407,权重已在 Hugging Face 提供;商业自部署需获取 Mistral Commercial License。
推荐理由:Mistral Large 2 同时覆盖长上下文、编码、推理和工具调用,并公布了性能、授权与部署入口,便于评估其应用价值。
Mistral AI 与 NVIDIA 合作发布 Mistral NeMo,一款 12B 模型,支持最高 128k tokens 上下文窗口,并提供 base 与 instruction-tuned checkpoints。
推荐理由:Mistral NeMo同时给出128k上下文窗口、Tekken分词器和Apache 2.0许可,便于比较其多语言与部署适用性。
Mistral AI 发布 Mathstral,这是一个基于 Mistral 7B、面向 STEM 科目和复杂多步数学推理的 instructed 模型。
推荐理由:Mathstral给出了MATH和MMLU等基准结果,并展示了增加推理时计算后的成绩变化,便于比较专用模型的性能与速度取舍。
Mistral AI 发布 Codestral Mamba,一款采用 Mamba 架构的 7,285,403,648 参数指令模型,支持免费使用、修改和分发。该模型提供线性时间推理和理论上的无限长度序列建模能力,并在最长 256k tokens 的上下文检索上进行测试。
推荐理由:Codestral Mamba 将线性时间推理与代码能力结合,并开放权重和部署路径,适合关注长上下文本地代码助手的读者了解其架构取向。
Mistral AI 发布首个代码模型 Codestral,这是一个面向代码生成的 22B 开放权重模型,支持 80+ 种编程语言和 fill-in-the-middle。
推荐理由:Codestral同时提供开放权重模型、32k上下文窗口和多种接入方式,便于比较代码生成性能与实际部署路径。
Mistral AI 发布 Mixtral 8x22B,这是一款采用稀疏 Mixture-of-Experts 的开放模型,141B 参数中仅有 39B 激活,并提供 64K tokens 上下文窗口。
推荐理由:这次发布同时给出开放许可、稀疏激活规模和基准结果,便于比较 Mixtral 8x22B 的性能与成本取舍。
Mistral AI 发布 Mistral Large,称其为最新且最先进的语言模型,可通过 La Plateforme 和 Azure 使用,并支持多语言推理、32K tokens 上下文、函数调用与 JSON 输出。公司同时发布面向低延迟和成本优化的 Mistral Small,以及 mistral-small-2402 和 mistral-large-2402 endpoints。
推荐理由:Mistral Large 同时提供多语言推理、32K tokens 上下文、函数调用和 JSON 输出,并通过 La Plateforme 与 Azure 开放。
Mistral AI 发布带有开放权重和Apache 2.0许可的 Mixtral 8x7B,并同步推出 Mixtral 8x7B Instruct。模型总参数量为46.7B,每个 token 使用12.9B参数,官方称其在多数基准上达到或超过 Llama 2 70B 和 GPT3.5,推理速度提升至6x。
推荐理由:Mixtral 8x7B同时公开权重与Apache 2.0许可,并用稀疏专家架构控制推理成本,适合比较开放模型的性能与部署取舍。
Mistral AI 发布首个 7B-parameter 模型 Mistral 7B,称其在标准英语和代码基准上超过当时所有不超过 13B 参数的开放模型。该模型采用 Apache 2.0 发布,可用于摘要、结构化和问答,并以更低成本运行;Mistral AI 同时开放 GitHub 仓库和 Discord 社区。
推荐理由:Mistral AI 以 Mistral 7B 的发布展示了小型开放模型在性能、成本和部署灵活性之间的取舍。
Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的语言模型,官方称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B。
推荐理由:这篇发布同时给出 Mistral 7B 与 Llama 系列的基准对比、推理优化机制和 Apache 2.0 使用方式,便于判断小模型的性能与部署成本。