Mistral AI 发布企业 AI 编排层 Workflows 公测版
Mistral AI 发布企业 AI 编排层 Workflows 的 public preview,用于将 AI 流程可靠地部署到生产环境。开发者用 Python 编写工作流,Studio 记录执行轨迹,流程可在中断后恢复并通过 wait_for_input() 暂停等待人工审批。
推荐理由:Workflows把持久化执行、可观测性和人工审批整合进企业流程,并说明了从开发到部署的具体架构。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Mistral AI 发布企业 AI 编排层 Workflows 的 public preview,用于将 AI 流程可靠地部署到生产环境。开发者用 Python 编写工作流,Studio 记录执行轨迹,流程可在中断后恢复并通过 wait_for_input() 暂停等待人工审批。
推荐理由:Workflows把持久化执行、可观测性和人工审批整合进企业流程,并说明了从开发到部署的具体架构。
DeepSeek 发布 DeepSeek-V4,推出 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 两个 MoE 模型,均支持 1M-token 上下文窗口。
推荐理由:文章将 DeepSeek-V4 的长上下文架构、智能体训练基础设施与工具调用设计放在一起,便于理解其面向长期任务的工程取舍。
Google DeepMind 提出 Decoupled DiLoCo,通过将训练拆分到彼此解耦的计算岛并异步传输数据,降低跨数据中心训练的带宽依赖并隔离硬件故障。
推荐理由:Decoupled DiLoCo 将异步训练、容错和跨地域低带宽连接结合起来,展示了分布式预训练如何利用异构及闲置算力。
Safetensors 宣布加入 Linux Foundation 旗下的 PyTorch Foundation,成为基金会托管项目,商标、仓库和治理转由 Linux Foundation 管理。
推荐理由:Safetensors 加入 PyTorch Foundation 后获得中立治理,正文还交代了兼容性承诺与后续面向加速器、并行加载和量化格式的路线。
Hugging Face 介绍 gradio.Server,它扩展 FastAPI,让 React、Svelte 或原生 HTML/JS 前端接入 Gradio 的排队、SSE、并发控制、gradio_client 和 ZeroGPU 能力。
推荐理由:文章用完整示例展示 gradio.Server 如何将自定义前端与 Gradio 的排队、并发控制和 ZeroGPU 能力结合,方法可直接迁移到 Spaces 应用。
Hugging Face 发布 Granite 4.0 3B Vision,这款 3B 视觉语言模型面向企业文档理解,支持表格提取、图表理解和语义键值对抽取。模型以 LoRA adapter 形式构建在 Granite 4.0 Micro 之上,可单独使用或与 Docling 集成。
推荐理由:这款 3B 视觉语言模型将图表、表格和语义键值抽取结合起来,并以 LoRA adapter 形式支持文本与视觉任务切换,适合评估企业文档处理方案。
Mistral AI 推出 Spaces CLI,用于脚手架搭建、开发环境配置、配置生成和部署,并通过交互输入的 flag 等价物支持编码智能体无障碍操作。Spaces 还为项目生成 context.json 和 AGENTS.md,借助可查询的插件注册表与显式状态降低智能体执行命令时的猜测和阻塞;文中示例显示,从提示到上线部署用时不到 10 分钟。
推荐理由:文章以 Spaces 的实际设计取舍为例,系统说明了让 CLI 同时适配人类开发者、编码智能体和自动化流程的方法。
Hugging Face 调研 16 个开源 RL 库,比较编排、rollout buffer、权重同步、陈旧样本管理、部分 rollout、LoRA 和分布式训练后端等 7 个维度。
推荐理由:文章将 16 个开源异步 RL 库放在统一框架下比较,梳理了缓冲区、权重同步、样本陈旧和 MoE 支持等工程取舍。
Hugging Face 在 Hub 上推出 Storage Buckets,为 checkpoints、处理后数据、Agent traces 和日志等可变 ML 产物提供非版本化、S3-like 对象存储。Buckets 基于 Xet 的分块去重,并支持通过 hf CLI、Python、JavaScript 和 fsspec 管理;还可将数据预热到 AWS 和 GCP 的计算区域。
推荐理由:Storage Buckets 将可变的 ML 中间产物纳入 Hub,并结合 Xet 去重与预热能力,补足 Git 不适合高频写入的工作层。
Hugging Face 介绍 Ulysses Sequence Parallelism 如何通过序列分片、attention head 并行和 all-to-all 通信训练超长上下文,并集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
推荐理由:文章系统说明 Ulysses 如何拆分长序列并接入 Hugging Face 训练栈,同时用显存、吞吐和对比数据展示其适用边界。
Hugging Face 发布实践指南,介绍如何为“将茶包放入杯子”任务录制机器人数据、微调 ACT 和 SmolVLA,并在 NXP i.MX 95 上进行部署优化。
推荐理由:文章将数据采集、VLA 微调与嵌入式部署串成一套实践流程,并用 i.MX 95 的延迟与准确率结果说明各环节的取舍。
Hugging Face 介绍 Transformers 如何支持 Mixture of Experts,包括 WeightConverter 权重转换、Experts Backend 和 Expert Parallelism。
推荐理由:文章把 MoE 的稀疏计算原理与 Transformers 的加载、后端、专家并行和训练优化串联起来,并用基准数据说明工程改造的收益。
GGML 的创建者 Georgi Gerganov 及团队加入 Hugging Face,以获得长期资源支持并扩大 ggml 与 llama.cpp 社区。团队仍将 100% 投入 llama.cpp 的维护,在技术方向和社区事务上保持完全自治;项目继续保持 100% 开源和社区驱动。
推荐理由:这项加入将开源项目的长期资源支持与技术自治结合起来,也交代了 llama.cpp 与 Transformers 在本地推理生态中的协作方向。
IBM Research 与 UC Berkeley 将 MAST 应用于 ITBench,分析了 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 的 310 条 SRE 执行轨迹。
推荐理由:文章把 ITBench 的成功率拆解为具体失败模式,并针对不同模型给出验证、终止控制和上下文管理等工程改进方向。
Hugging Face 构建了一个 CUDA Kernels Agent skill,指导 Claude 和 Codex 为 diffusers 与 transformers 目标编写带 PyTorch 绑定和基准测试的生产级 CUDA 内核。
推荐理由:文章展示了如何把 CUDA 专业知识封装为 Agent skill,并用真实 diffusers 与 transformers 目标验证从内核生成、绑定到基准测试的完整流程。
Hugging Face 发布 Transformers.js v4,新增以 C++ 重写的 WebGPU Runtime,可在浏览器、Node、Bun 和 Deno 中运行 WebGPU 加速模型。
推荐理由:Transformers.js v4同时改进了WebGPU运行时、构建产物和模型加载接口,并扩展了可在JavaScript环境中运行的模型范围。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过180种智能体配置评估单智能体与四类多智能体架构。
推荐理由:这项研究用180种智能体配置比较不同架构,展示任务可分解性、顺序依赖和工具数量如何影响性能与可靠性。
Mistral AI 调查发现,vLLM 在使用 Mistral Medium 3.1、Prefill/Decode 分离服务、NIXL 和图编译时,系统内存会以 400 MB per minute 增长。
推荐理由:文章完整呈现了从 Heaptrack、pmap 到 BPFtrace 和 GDB 的排查链路,并给出可直接缓解 vLLM 内存泄漏的 UCX 配置。
Google DeepMind 推出 D4RT,一种统一的 AI 模型,用于跨空间与时间进行 4D 场景重建和跟踪。D4RT 采用基于查询的 Transformer 编解码架构,在测试中比此前 state of the art 方法快 18x 至 300x;处理一分钟视频约需 5 秒,而此前方法最多需要 10 分钟。
推荐理由:D4RT 将动态场景重建与跟踪统一到查询式架构中,并以速度数据展示其在实时空间理解场景中的应用潜力。
Google Research 发现,Android Auto 收集的硬刹车事件(HBE)频率与道路路段实际碰撞率呈显著正相关,可作为道路安全评估的先行指标。研究结合 Virginia 和 California 的公开事故数据与匿名聚合的 Android Auto 数据,并使用 10 年事故记录和负二项回归进行验证;观测到 HBE 的路段数量是报告事故路段的 18 倍。
推荐理由:研究用两州公开事故数据和 Android Auto 聚合数据验证了硬刹车事件作为高密度道路风险先行指标的可行性。