跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 61–80 条 · 共 89 条
4月27日周一
  1. Mistral AI81

    Mistral AI 发布企业 AI 编排层 Workflows 公测版

    Mistral AI 发布企业 AI 编排层 Workflows 的 public preview,用于将 AI 流程可靠地部署到生产环境。开发者用 Python 编写工作流,Studio 记录执行轨迹,流程可在中断后恢复并通过 wait_for_input() 暂停等待人工审批。

    推荐理由:Workflows把持久化执行、可观测性和人工审批整合进企业流程,并说明了从开发到部署的具体架构。

4月24日周五
4月22日周三
4月8日周三
4月1日周三
  1. Hugging Face Blog77

    Hugging Face 推出 gradio.Server,让自定义前端接入 Gradio 后端能力

    Hugging Face 介绍 gradio.Server,它扩展 FastAPI,让 React、Svelte 或原生 HTML/JS 前端接入 Gradio 的排队、SSE、并发控制、gradio_client 和 ZeroGPU 能力。

    推荐理由:文章用完整示例展示 gradio.Server 如何将自定义前端与 Gradio 的排队、并发控制和 ZeroGPU 能力结合,方法可直接迁移到 Spaces 应用。

3月31日周二
  1. Hugging Face Blog79

    Granite 4.0 3B Vision 发布,面向企业文档理解的紧凑型多模态模型

    Hugging Face 发布 Granite 4.0 3B Vision,这款 3B 视觉语言模型面向企业文档理解,支持表格提取、图表理解和语义键值对抽取。模型以 LoRA adapter 形式构建在 Granite 4.0 Micro 之上,可单独使用或与 Docling 集成。

    推荐理由:这款 3B 视觉语言模型将图表、表格和语义键值抽取结合起来,并以 LoRA adapter 形式支持文本与视觉任务切换,适合评估企业文档处理方案。

  2. Mistral AI76

    Mistral AI 发布面向人类与智能体的 Spaces CLI

    Mistral AI 推出 Spaces CLI,用于脚手架搭建、开发环境配置、配置生成和部署,并通过交互输入的 flag 等价物支持编码智能体无障碍操作。Spaces 还为项目生成 context.json 和 AGENTS.md,借助可查询的插件注册表与显式状态降低智能体执行命令时的猜测和阻塞;文中示例显示,从提示到上线部署用时不到 10 分钟。

    推荐理由:文章以 Spaces 的实际设计取舍为例,系统说明了让 CLI 同时适配人类开发者、编码智能体和自动化流程的方法。

3月10日周二
  1. Hugging Face Blog83

    Hugging Face 在 Hub 上推出 Storage Buckets

    Hugging Face 在 Hub 上推出 Storage Buckets,为 checkpoints、处理后数据、Agent traces 和日志等可变 ML 产物提供非版本化、S3-like 对象存储。Buckets 基于 Xet 的分块去重,并支持通过 hf CLI、Python、JavaScript 和 fsspec 管理;还可将数据预热到 AWS 和 GCP 的计算区域。

    推荐理由:Storage Buckets 将可变的 ML 中间产物纳入 Hub,并结合 Xet 去重与预热能力,补足 Git 不适合高频写入的工作层。

3月9日周一
  1. Hugging Face Blog77

    Hugging Face 介绍 Ulysses Sequence Parallelism,支持百万 token 上下文训练

    Hugging Face 介绍 Ulysses Sequence Parallelism 如何通过序列分片、attention head 并行和 all-to-all 通信训练超长上下文,并集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。

    推荐理由:文章系统说明 Ulysses 如何拆分长序列并接入 Hugging Face 训练栈,同时用显存、吞吐和对比数据展示其适用边界。

3月5日周四
  1. Hugging Face Blog68

    Hugging Face 介绍 VLA 在嵌入式机器人平台上的数据采集、微调与优化

    Hugging Face 发布实践指南,介绍如何为“将茶包放入杯子”任务录制机器人数据、微调 ACT 和 SmolVLA,并在 NXP i.MX 95 上进行部署优化。

    推荐理由:文章将数据采集、VLA 微调与嵌入式部署串成一套实践流程,并用 i.MX 95 的延迟与准确率结果说明各环节的取舍。

2月26日周四
2月20日周五
  1. Hugging Face Blog84

    GGML 加入 Hugging Face,继续推进 llama.cpp 与本地 AI 生态

    GGML 的创建者 Georgi Gerganov 及团队加入 Hugging Face,以获得长期资源支持并扩大 ggml 与 llama.cpp 社区。团队仍将 100% 投入 llama.cpp 的维护,在技术方向和社区事务上保持完全自治;项目继续保持 100% 开源和社区驱动。

    推荐理由:这项加入将开源项目的长期资源支持与技术自治结合起来,也交代了 llama.cpp 与 Transformers 在本地推理生态中的协作方向。

2月19日周四
2月13日周五
  1. Hugging Face Blog85

    Hugging Face 发布 CUDA Kernels Agent skill,助力 Claude 和 Codex 编写自定义内核

    Hugging Face 构建了一个 CUDA Kernels Agent skill,指导 Claude 和 Codex 为 diffusers 与 transformers 目标编写带 PyTorch 绑定和基准测试的生产级 CUDA 内核。

    推荐理由:文章展示了如何把 CUDA 专业知识封装为 Agent skill,并用真实 diffusers 与 transformers 目标验证从内核生成、绑定到基准测试的完整流程。

2月9日周一
  1. Hugging Face Blog81

    Hugging Face 发布 Transformers.js v4

    Hugging Face 发布 Transformers.js v4,新增以 C++ 重写的 WebGPU Runtime,可在浏览器、Node、Bun 和 Deno 中运行 WebGPU 加速模型。

    推荐理由:Transformers.js v4同时改进了WebGPU运行时、构建产物和模型加载接口,并扩展了可在JavaScript环境中运行的模型范围。

1月28日周三
1月22日周四
1月16日周五
  1. Google DeepMind72

    Google DeepMind 发布 D4RT,统一动态 4D 场景重建与跟踪

    Google DeepMind 推出 D4RT,一种统一的 AI 模型,用于跨空间与时间进行 4D 场景重建和跟踪。D4RT 采用基于查询的 Transformer 编解码架构,在测试中比此前 state of the art 方法快 18x 至 300x;处理一分钟视频约需 5 秒,而此前方法最多需要 10 分钟。

    推荐理由:D4RT 将动态场景重建与跟踪统一到查询式架构中,并以速度数据展示其在实时空间理解场景中的应用潜力。

1月14日周三
  1. Google Research68

    Google Research 研究用硬刹车事件评估道路路段碰撞风险

    Google Research 发现,Android Auto 收集的硬刹车事件(HBE)频率与道路路段实际碰撞率呈显著正相关,可作为道路安全评估的先行指标。研究结合 Virginia 和 California 的公开事故数据与匿名聚合的 Android Auto 数据,并使用 10 年事故记录和负二项回归进行验证;观测到 HBE 的路段数量是报告事故路段的 18 倍。

    推荐理由:研究用两州公开事故数据和 Android Auto 聚合数据验证了硬刹车事件作为高密度道路风险先行指标的可行性。