跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–20 条 · 共 56 条
今天10月2日周五
  1. AWS Machine Learning Blog88

    AWS 教程:用 Amazon Bedrock AgentCore Runtime Instances 构建多智能体音乐制作流水线

    AWS 介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署由 Composition、Delivery 和 Compliance 三个智能体组成的音乐制作流水线。

    推荐理由:文章用完整的音乐制作示例拆解 Runtime Instances 的部署与编排,展示共享会话、GPU、持久化存储和独立发布如何协同工作。

  2. AWS Machine Learning Blog67

    AWS 介绍如何用 contextual bandits 优化个性化转化漏斗

    AWS 介绍 Amazon Payments 如何在 Amazon SageMaker AI 上部署多目标 contextual multi-armed bandit,为不同客户选择个性化内容并同时优化申请开始、提交和批准三个阶段。

    推荐理由:文章将多目标 LinUCB、延迟反馈和批处理架构串成可复用方案,并用线上 A/B 测试说明内容池质量会直接限制个性化收益。

  3. AWS Machine Learning Blog82

    AWS 教程:用 Amazon Bedrock AgentCore 构建由事件驱动并支持人工介入的智能体

    AWS 介绍了如何基于 Amazon Bedrock AgentCore 构建 ambient agents,让 Amazon S3 上传和定时事件生成任务,由 AgentCore Runtime 执行,并在需要澄清或审批时通过 ask_human 暂停。

    推荐理由:文章用完整参考实现串起事件触发、AgentCore 执行和人工介入,适合了解如何把智能体接入生产工作流。

  4. AWS Machine Learning Blog74

    Claude Platform on AWS 多环境访问配置指南

    AWS Machine Learning Blog 介绍如何为 Claude Platform on AWS 配置多环境访问,在生产工作负载、开发者笔记本和外部 CI/CD 环境之间共享订阅并隔离工作区。教程分别实现跨账户 SigV4、工作区范围 API key,以及基于 OIDC 的临时凭证和短期 token 访问,并给出 IAM 策略、CLI 命令与 Python 示例。

    推荐理由:文章把 Claude Platform on AWS 的三种访问路径拆成可执行步骤,便于按环境选择认证方式并落实工作区隔离。

10月1日周四
  1. The Verge · AI82

    The Verge 调查 Kevin O’Leary 犹他州数据中心项目风波

    The Verge 采访 Josh Dzieza,复盘 Kevin O’Leary 在犹他州推动的 Stratos 数据中心项目如何因 40,000-acre 规模、9 gigawatts 用电量、地方居民不知情和强烈反弹陷入诉讼与停滞。

    推荐理由:这场调查把一个具体数据中心项目与 AI 基础设施竞速相连,呈现地方审批、社区反弹和融资速度之间的冲突。

  2. Microsoft Research69

    Microsoft Research 用机器学习预测电网空间天气风险

    Microsoft Research 开发了一套机器学习管线,为美国本土 66,935 座变电站生成空间天气风险估计,并可提前 30-60 分钟预警具体风险。系统结合太阳风信息、AE 和 Dst 预测、物理约束、当地地质导电率与电网数据,在 2020-2026 年评估期对重大事件的检测率为 76.5%,对严重事件为 81.2%。

    推荐理由:文章展示了如何把太阳风预测、地质条件与电网数据串成端到端管线,并用多项检测指标说明其提前预警能力。

9月30日周三
  1. NVIDIA Blog81

    NVIDIA 与 CoreWeave 推出 Vera Rubin NVL72、Vera CPU 和 Forge,打通智能体生产闭环

    NVIDIA 与 CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,并推出 CoreWeave Forge,用于训练、评估和改进模型与智能体。

    推荐理由:文章串联了 Vera Rubin NVL72、Vera CPU 与 Forge 的发布信息,并给出 Cognition 和 CoreWeave 的测试数据,便于了解智能体从训练到生产的基础设施变化。

  2. AWS Machine Learning Blog62

    AWS 用 Amazon Quick 和 Amazon Bedrock AgentCore 构建合同智能平台

    AWS 介绍了一套基于 Amazon Quick 和 Amazon Bedrock AgentCore 的合同智能平台,将 PDF 合同抽取为结构化数据并写入 Amazon Aurora PostgreSQL,再通过仪表盘和自然语言查询同时支持组合计和单份合同问答。

    推荐理由:文章通过合同场景说明聚合查询为何需要结构化抽取与数据库,并给出双模型校验和确定性服务协同的架构方法。

9月29日周二
  1. AWS Machine Learning Blog64

    Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统

    Condé Nast 与 AWS Generative AI Innovation Center 基于 Amazon Bedrock、Amazon OpenSearch Service 和 TwelveLabs Marengo,构建了跨视频画面、音频和字幕的意图检索系统。

    推荐理由:文章以 Condé Nast 的生产案例说明多模态视频检索如何通过解耦架构和异步处理兼顾大规模回填与低延迟搜索。

  2. AWS Machine Learning Blog73

    AWS 在 SageMaker AI 上使用 vLLM-Omni 部署 Qwen3-TTS 实时语音应用

    AWS 介绍如何在 SageMaker AI 上使用 AWS vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,通过持久双向连接流式发送文本并接收音频。教程提供仓库、部署脚本和 Gradio 客户端,音频以 24 kHz PCM chunks 返回,并说明 SageMaker 实例池、环境配置、端点调用与资源清理流程。

    推荐理由:文章给出从环境配置到资源清理的完整部署路径,并说明双向流式连接与实例池配置,便于复现实时语音输出方案。

9月28日周一
  1. Mistral AI73

    Mistral 在慕尼黑开设德国中心,推进欧洲工业 AI 与 Physics AI

    Mistral 宣布在慕尼黑开设德国中心,组建 Physics AI 和 Industrial AI 研究团队,并为企业伙伴提供应用工程支持。公司称计划到 2030 年建设 1 gigawatt 的欧洲算力,并依托 open-weight 架构支持客户在自有基础设施上运行模型。

    推荐理由:Mistral 将德国据点、Physics AI 研发和本地算力主权结合起来,呈现其切入欧洲工业场景的具体路径。

9月24日周四
  1. Microsoft Research79

    Microsoft Research 为 Physical AI Toolchain 增加机器人推理卸载能力

    Microsoft Research 宣布 Physical AI Toolchain 新增面向机器人的物理 AI 推理卸载能力,可将推理部署到机器人、边缘 GPU 或云端。研究显示,卸载推理能够提升移动操作任务的成功率、响应速度和电池续航,并支持运行更大的 AI 模型。该工具集基于 Kubernetes,支持容器化、自动卸载和分布式编排,并提供 SO-101 与 UR10e 的示例项目。

    推荐理由:文章以移动操作任务的测量结果说明推理卸载对成功率、响应、续航和模型规模的影响,并介绍了基于 Kubernetes 的部署工具。

  2. Google DeepMind85

    Google DeepMind 更新 Private AI Compute,支持私有的跨设备持久记忆

    Google DeepMind 发布 Private AI Compute 技术更新,引入服务器端持久记忆,让 AI 可在设备间保留上下文,同时维持端侧隐私标准。用户数据存放在加密存储中,解密密钥仅由个人设备持有,云端通过硬件强制的安全隔离环境临时处理数据。Google DeepMind 还发布更新后的技术白皮书、服务器软件的防篡改公开记录,并提供独立网络安全审计结果。

    推荐理由:文章具体说明了云端持久记忆如何结合设备密钥、加密通道与安全隔离环境,在跨设备连续体验和隐私控制之间取得平衡。

9月22日周二
  1. NVIDIA Blog80

    NVIDIA Isaac ROS 5.0 推出智能体工作流并支持 ROS Lyrical

    NVIDIA 发布 Isaac ROS 5.0,为基于 ROS 的机器人开发加入智能体工作流,并支持 ROS Lyrical 和 Ubuntu 24.04。新版提供用于设置、操作和 FoundationStereo 微调的技能,以及 agent-ready 文档和 FoundationPose 推理库,后者可将物体位姿感知与跟踪速度提升至 5.5x。

    推荐理由:Isaac ROS 5.0把智能体工作流、ROS Lyrical支持和Jetson部署整合到开源机器人开发中,呈现了从模型适配到实体运行的完整路径。

  2. Hugging Face Blog60

    oMLX 创作者 Jun Kim 加入 Hugging Face 支持 MLX 社区

    oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,继续领导该项目并获得稳定维护与资金支持。oMLX 将保持 Apache 2.0 许可,Hugging Face 计划以其作为新想法的测试平台,并推动 transformers 模型定义更快转为可供不同引擎使用的 MLX 实现。

    推荐理由:Hugging Face 对 oMLX 的维护支持将 MLX 生态中的个人项目纳入长期投入,并明确了模型定义向 MLX 实现迁移的协作方向。

  3. Hugging Face Blog83

    Hugging Face Transformers 支持运行 llama.cpp GGUF 模型

    Hugging Face 为 transformers 增加 GGUF 模型支持,用户可从 Hub 加载量化 checkpoint,并通过熟悉的 Python、PyTorch 和 transformers API 在 Apple Silicon Mac 上进行本地推理。

    推荐理由:Hugging Face 将 GGUF 与 transformers API 结合,并给出 Apple Silicon 上的安装、调用和基准细节,便于开发者评估本地部署方案。