跳到正文

#部署/工程

今日 6 条
8月25日周二
  1. Mistral AI57

    Mistral 与 HUMAIN 宣布战略合作推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,将在沙特及中东推进 AI 基础设施、先进模型开发和解决方案部署。双方计划本地化开发模型,重点关注网络安全和语音,并探索利用 HUMAIN 的数据中心支持当地算力需求;合作金额达数亿欧元。双方还将面向沙特受监管行业制定联合市场策略,开发阿拉伯语表现强劲的 frontier models。

8月21日周五
  1. Hugging Face Blog82

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.18 倍

    Liquid AI 发布 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,通过 speculative decoding 在不改变 greedy decoding 输出的前提下提升推理速度。

    推荐理由:LFM2.5-DSpark同时给出H100与M4 Max上的实测加速、函数调用延迟变化和llama.cpp及SGLang接入方式,便于评估部署收益。

8月18日周二
  1. Hugging Face Blog67

    Hugging Face 介绍约束感知 GPU 分配器:同集群利用率最高提升 33 个百分点

    Hugging Face 介绍一种约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比;相同硬件和工作负载下,GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105.1%。

    推荐理由:文章用七组对照实验拆解 GPU 调度中的预留与排队成本,并给出可落地的约束建模、需求预测和滚动优化方案。

8月11日周二
  1. Mistral AI80

    Mistral推出区域推理、优先服务与欧洲主权AI基础设施计划

    Mistral宣布Mistral Regional Endpoints正式可用,客户可选择在欧洲或美国运行推理;Mistral Priority Tier进入公开预览,并提供自定义速率限制和正常运行时间SLA。其平台将支持第三方开源模型,首个接入Z.ai的GLM-5.2,同时通过European Compute Units整合企业多年期承诺,计划到2030年建设最高1 GW的欧洲AI算力。

    推荐理由:Mistral同时推进区域推理、SLA服务和第三方开源模型支持,勾勒出企业控制数据位置、模型选择与算力供给的基础设施路径。

8月6日周四
8月4日周二
  1. Microsoft Research86

    Microsoft Research 发布 Orchard 开源智能体研究框架

    Microsoft Research 发布 Orchard,这是一个面向可扩展智能体研究的开源框架,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,可支持编码、网页导航和个人助理智能体的训练与评测。

    推荐理由:文章拆解了 Orchard Env 如何复用环境、数据和评测流程,并用三个领域的结果展示开放基础设施对智能体训练效率的影响。

7月30日周四
  1. Hugging Face Blog40

    GPU 管理:为什么闲置 GPU 正成为新的“停场飞机”

    企业 AI 的下一项真正瓶颈正从模型智能转向 GPU 利用率:GPU 按日历小时产生融资、折旧、电力和冷却成本,只有执行计算时才产生产出。随着企业从 API 转向自购 GPU、以固定资本成本换取可控的生产成本,采购硬件并不能解决问题,如何持续让集群忙起来才决定投入是否值得。

7月29日周三
7月23日周四
7月10日周五
7月8日周三
  1. Google Research78

    Google Research 通过导航改道实验缓解城市交通拥堵

    Google Research 在10个美国城市开展为期六个月的导航改道实验,通过引导不到2%的出行避开约100个拥堵路段,评估系统性交通改善效果。目标路段车速中位数提高约2%,燃料消耗率中位数下降0.5%至1.0%;受影响路段整体车速中位数提高约0.35%,高峰时段提高0.5%,每个城市每年可能节省数千吨 CO2e。

    推荐理由:研究通过10个美国城市的长期对照实验,量化了少量改道对整体车速、燃耗和排放的系统性影响。

7月7日周二
  1. Berkeley AI Research67

    Berkeley AI Research:近乎免费的智能如何重塑智能体数据系统

    Berkeley AI Research 的文章认为,AI 推理成本快速下降将推动智能体成为数据系统的主要工作负载,并带来三类问题:为智能体设计数据系统、为大规模智能体群构建状态与协作基础设施,以及由智能体合成定制数据系统。文章讨论了 agentic speculation、结构化记忆、多智能体协调与故障处理,以及通过验证智能体和证明系统保障自动生成系统的可靠性。

    推荐理由:文章将智能体数据系统拆成支持智能体、承载智能体和由智能体构建三类问题,为理解多智能体规模化运行的工程瓶颈提供了清晰框架。

  2. Hugging Face Blog80

    Hugging Face Storage 与 SkyPilot 打通跨云 AI 工作负载

    Hugging Face Storage 与 SkyPilot 联合推出 `hf://` 存储后端,让模型、数据集和 Bucket 可挂载到 20+ 云、Kubernetes、Slurm 及本地环境中的 GPU 任务,并免收读取数据的 egress 和 CDN 费用。

    推荐理由:Hugging Face Storage 与 SkyPilot 打通了跨云训练和推理的数据访问,文章同时给出配置方式、费用差异与实测吞吐数据。

7月6日周一
  1. Hugging Face Blog76

    Hugging Face Kernels 完成重大更新

    Hugging Face 对 Kernels 项目进行了重大更新,新增 Hub 的 kernel 仓库类型,并通过可信发布者、代码签名和可复现构建改进安全性。项目还重构了 kernels 与 kernel-builder 的 CLI,支持 Torch Stable ABI 和 Apache TVM FFI,并为 Agent 构建、基准测试和迭代优化 kernel 提供工作流基础。

    推荐理由:文章集中说明了 Kernels 在安全、框架兼容和 Agent 工作流上的改造,能帮助开发者判断其对自定义 kernel 开发与分发的实际作用。

7月1日周三
  1. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。

6月25日周四
  1. Google Research58

    Google Research 提出线性弹性缓存以优化云成本

    Google Research 提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,并根据实时工作负载动态调整缓存大小和 TTL。该方法在 Spanner 生产服务器中使内存使用量降低 15.5%,缓存未命中增加 5.5%,总拥有成本降低约 5%,实际 I/O 成本仅增加 0.5%。在公开缓存轨迹上,弹性缓存也持续优于固定大小缓存。

6月23日周二
6月17日周三
  1. Google DeepMind75

    Google DeepMind与英国政府测试AI规划工具,目标将申请处理时间缩短50%

    Google DeepMind与英国政府等合作开发基于Gemini的AI规划原型,目标帮助规划人员将住宅规划申请的决策时间缩短50%。工具可整理历史文件、识别相关政策、总结咨询反馈并起草评估报告,但最终决定仍由规划人员作出;英国政府计划在早期试验后于2027年向全国所有地方政府开放。

    推荐理由:Google DeepMind与英国政府共同测试的原型把规划资料整理、政策核对和报告起草串成一套流程,呈现了AI介入公共服务时的人工复核与审计安排。

  2. Google Research77

    Google 发布用于自然恢复的 Earth AI 矢量数据集

    Google 发布一套面向英国自然恢复的矢量化数据集,可识别并分类树篱、石墙和小片林地等细尺度生态特征。该系统基于 Remote Sensing Foundations 的 ViT Backbone,结合亚米级影像和 1 米 LiDAR 数据,并通过 Polsby–Popper 紧致度评分区分林地、木本斑块和线性木本特征。

    推荐理由:Google 将高分辨率栅格地图转为可操作的矢量数据集,展示了 AI 如何把生态特征识别推进到保护规划与碳核算。

6月11日周四
6月9日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款采用统一、无编码器架构的多模态模型,支持原生音频输入,并面向本地 Agent 工作流。模型性能接近 26B MoE,运行所需内存低于其一半,可在 16GB RAM 或统一内存的笔记本上本地运行。

    推荐理由:Gemma 4 12B把原生音频与视觉输入、Agent 工作流和本地运行结合在一起,材料也给出了部署与开发入口。

5月23日周六
  1. Mistral AI63

    Mistral AI 收购 Physics AI 公司 Emmi AI 加速工业智能体布局

    Mistral AI 宣布已达成收购 Physics AI 公司 Emmi AI 的最终协议,以增强面向工业企业的 AI 转型能力。Emmi AI 的联合创始人及 30 多名研究人员和工程师将加入 Mistral AI 的 Science 与 Applied AI 团队,其模型将用于工程工作流、实时模拟和数字孪生。

    推荐理由:此次收购将 Physics AI、工程模型与智能体工具调用能力并入 Mistral AI,为理解其工业 AI 布局提供了具体线索。

5月8日周五
  1. Berkeley AI Research64

    Adaptive Parallel Reasoning:高效推理扩展的下一种范式

    Berkeley AI Research 发布对 Adaptive Parallel Reasoning 的综述与观点分析,介绍模型如何在推理时动态决定是否并行、并行线程数及协调方式。

    推荐理由:文章梳理了自适应并行推理的控制流、执行系统与训练奖励设计,帮助读者比较不同方案在准确率、延迟和工程复杂度上的取舍。

4月27日周一
  1. Mistral AI81

    Mistral AI 发布企业 AI 编排层 Workflows 公测版

    Mistral AI 发布企业 AI 编排层 Workflows 的 public preview,用于将 AI 流程可靠地部署到生产环境。开发者用 Python 编写工作流,Studio 记录执行轨迹,流程可在中断后恢复并通过 wait_for_input() 暂停等待人工审批。

    推荐理由:Workflows把持久化执行、可观测性和人工审批整合进企业流程,并说明了从开发到部署的具体架构。

4月22日周三
3月31日周二
  1. Mistral AI76

    Mistral AI 发布面向人类与智能体的 Spaces CLI

    Mistral AI 推出 Spaces CLI,用于脚手架搭建、开发环境配置、配置生成和部署,并通过交互输入的 flag 等价物支持编码智能体无障碍操作。Spaces 还为项目生成 context.json 和 AGENTS.md,借助可查询的插件注册表与显式状态降低智能体执行命令时的猜测和阻塞;文中示例显示,从提示到上线部署用时不到 10 分钟。

    推荐理由:文章以 Spaces 的实际设计取舍为例,系统说明了让 CLI 同时适配人类开发者、编码智能体和自动化流程的方法。

1月22日周四
11月19日周三
  1. Mistral AI54

    Mistral AI 宣布在德国扩大布局并与 SAP、Helsing 开展战略合作

    Mistral AI 宣布扩大在德国的业务布局,与 SAP 建立多年合作,将其模型整合进 SAP 的 AI Foundation,并共同开发面向欧洲复杂行业和行政机构的解决方案。Mistral AI 还将与 Helsing 加快开发用于国防和安全场景的视觉语言行动模型,同时增加德国本地团队并计划在未来几个月开设办公室。

10月24日周五
  1. Mistral AI77

    Mistral AI 发布企业生产级 AI 平台 AI Studio

    Mistral AI 发布 AI Studio,面向企业提供从 AI 原型到生产部署的统一平台。平台由 Observability、Agent Runtime 和 AI Registry 三部分组成,支持评测、反馈追踪、版本管理、治理以及 hybrid、dedicated 和 self-hosted 部署,并开放 private beta 注册。

    推荐理由:Mistral 将可观测性、Agent Runtime 和 AI Registry 组合成生产平台,具体呈现了企业从原型走向部署所需的闭环能力。

9月9日周二
  1. Mistral AI66

    Mistral AI 完成 1.7B€ C 轮融资,投后估值达 11.7B€

    Mistral AI 宣布完成 1.7B€ 的 Series C 融资,投后估值为 11.7B€,由半导体设备制造商 ASML Holding NV 领投。DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 等现有投资者参与本轮融资。

    推荐理由:这轮融资同时引入 ASML 的战略合作,原文交代了资金规模、估值及其对工业与半导体场景研发的用途。