Google Research 发布 TurboQuant,以极端压缩降低 AI 内存开销
Google Research 介绍 TurboQuant,以及配套的 QJL 和 PolarQuant 压缩算法,用于降低 LLM 的 KV cache 和高维向量搜索的内存开销。
推荐理由:文章系统介绍了 TurboQuant、QJL 和 PolarQuant 的压缩机制与实验结果,展示其在 KV cache 和向量搜索中的内存与速度收益。
Google Research 介绍 TurboQuant,以及配套的 QJL 和 PolarQuant 压缩算法,用于降低 LLM 的 KV cache 和高维向量搜索的内存开销。
推荐理由:文章系统介绍了 TurboQuant、QJL 和 PolarQuant 的压缩机制与实验结果,展示其在 KV cache 和向量搜索中的内存与速度收益。
Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:Mistral Small 4 将推理、视觉理解和智能体编码整合到单一模型,并公开关键架构、部署配置与性能对比,便于评估实际使用成本。
Mistral AI 宣布成为 NVIDIA Nemotron Coalition 创始成员,并计划与 NVIDIA 共同开发开放前沿模型。Mistral AI 将贡献模型架构、训练技术、多模态能力和微调工具,NVIDIA 将提供计算资源、模型开发工具与合成数据生成管线。
推荐理由:文章同时交代了联盟的合作机制、开放模型计划和 Mistral AI 的分工,便于理解产业协作如何影响模型训练与定制。
Google Research 与 Cornell University 合作,使用 67 个高温超导研究问题评测六个 LLM,并由专家按观点平衡、完整性、简洁性和证据等指标评分。
推荐理由:这项研究比较了开放网络数据与专家精选文献对专业问答的影响,为评估科学领域 LLM 的证据完整性和观点平衡提供了具体案例。
Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码智能体,采用 6B active parameters,支持在形式化代码仓库中生成并验证证明。
推荐理由:Leanstral把Lean 4形式化证明引入代码智能体,并用FLTEval比较性能与成本,呈现了可复用的验证式编程路径。
Berkeley AI Research 介绍 SPEX 和 ProxySPEX,两种通过消融与稀疏恢复识别模型关键交互的算法。ProxySPEX 利用层级结构,在约 10x 更少的消融次数下达到 SPEX 的性能,并被用于特征归因、数据归因和注意力头归因。两者的代码已集成到 SHAP-IQ 仓库。
推荐理由:文章系统说明 SPEX 与 ProxySPEX 如何用较少的消融识别特征、训练数据和模型组件之间的关键交互,并展示其解释性应用。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,评估 AMIE 在基层医疗就诊前采集病史的安全性、诊断推理和用户体验。
推荐理由:研究把 AMIE 从模拟场景带入真实基层医疗流程,呈现了监督式部署的安全结果、诊断表现与实际局限。
Berkeley AI Research 的 NeurIPS 2025 论文提出从带噪测量中直接估计互信息,用于评估成像系统包含的有效信息。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四个领域预测了下游解码性能;其 IDEAL 方法通过优化信息估计来设计成像参数,在滤色器设计中达到与端到端优化相当的结果,同时不需要任务特定的解码器设计。代码已在 GitHub 开源。
推荐理由:论文将成像系统的分辨率、噪声和采样等因素统一到互信息指标中,并展示了该指标评估与优化多类系统的方式。
Mistral AI 发布 Mistral 3,包含14B、8B和3B的Ministral 3小型稠密模型,以及激活41B、总计675B参数的Mistral Large 3,全部采用Apache 2.0许可。
推荐理由:Mistral 3同时覆盖3B至675B参数规模,并提供Apache 2.0许可、量化格式和多种部署路径,便于比较开放模型的性能与落地成本。