跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1–20 条 · 共 125 条
今天10月2日周五
  1. AWS Machine Learning Blog88

    AWS 教程:用 Amazon Bedrock AgentCore Runtime Instances 构建多智能体音乐制作流水线

    AWS 介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署由 Composition、Delivery 和 Compliance 三个智能体组成的音乐制作流水线。

    推荐理由:文章用完整的音乐制作示例拆解 Runtime Instances 的部署与编排,展示共享会话、GPU、持久化存储和独立发布如何协同工作。

  2. The Decoder79

    Google 在 Gemini 中以 Skills 取代 Gems

    Google 正在向全球 Gemini 聊天用户推出 Skills,以取代 Gems。用户可用“/”加名称调用保存的任务指令,Gemini 还能从历史对话生成 Skills,并在检测到匹配提示词时自动运行。Skills 支持文本文件、PDF 和图像作为参考资料,现有 Gems 会自动转换;Gems 将于 11 月对个人账户停用,并在之后分批停止支持 Workspace 客户。

    推荐理由:Google 将 Gems 迁移为可调用、可组合的 Skills,并公布了资料引用、自动生成和后续协作集成安排。

  3. TechCrunch · AI76

    Photon 获得 $4.5M 种子轮融资,押注消息应用中的智能体

    AI 初创公司 Photon 获得 $4.5M 种子轮融资,用于开发通过 iMessage 和 WhatsApp 等消息服务运行智能体的产品。公司称已吸引超过 40,000 名开发者,收入在四个月内增长 10x,消息量上月增长 5x。Photon 提供统一 API、可扩展通道框架、CLI 和可观测性套件,并同时维护开源版本与托管平台。

    推荐理由:Photon 的融资与增长数据,结合其开源和托管两种形态,呈现了消息应用承载智能体的商业化路径。

  4. Hugging Face Blog77

    ServiceNow CoreAI 发布 AutoSynthData,用模型失败生成企业智能体训练数据

    ServiceNow CoreAI 介绍 AutoSynthData,通过目标模型的失败和更强教师模型的成功,生成、验证并迭代企业智能体训练任务。该流程在 EnterpriseOps Gym Hybrid 环境中生成 2,000 个合成样本,使 Gemma-4-26B-A4B-it 的平均 Pass@1 提升 7.2 个百分点,验证器成功率从 63.01% 升至 68.55%。

    推荐理由:文章给出了从模型失败中生成、验证并迭代训练任务的完整流程,并用 EnterpriseOps Gym 实验展示了合成数据对智能体训练的影响。

  5. NVIDIA Blog87

    GPT-6 Astra Ultrafast 借助 NVIDIA Blackwell GPUs 加速生成

    GPT-6 Astra Ultrafast 已通过 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPUs 上,token 生成速度最高可达 Astra Standard 模式的 8x。

    推荐理由:文章说明 GPT-6 Astra Ultrafast 如何借助 NVIDIA Blackwell GPUs 提升生成速度,并展示加速对编码智能体工作流的具体作用。

  6. AWS Machine Learning Blog81

    Amazon Quick 推出 Live Data in Apps,让 AI 构建的应用实时查询受治理数据

    Amazon Quick 推出 Live Data in Apps,使 AI 构建的 Quick Apps 能在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,而不再依赖构建时快照。

    推荐理由:文章详细说明了 Live Data in Apps 如何把实时查询、用户级权限和自然语言建应用结合起来,并列出部署时的同意机制与查询限制。

  7. AWS Machine Learning Blog67

    AWS 介绍如何用 contextual bandits 优化个性化转化漏斗

    AWS 介绍 Amazon Payments 如何在 Amazon SageMaker AI 上部署多目标 contextual multi-armed bandit,为不同客户选择个性化内容并同时优化申请开始、提交和批准三个阶段。

    推荐理由:文章将多目标 LinUCB、延迟反馈和批处理架构串成可复用方案,并用线上 A/B 测试说明内容池质量会直接限制个性化收益。

  8. TechCrunch · AI80

    Amazon 发布开源决策模型 Strands Decider 2B

    Amazon Web Services 发布开源决策模型 Strands Decider 2B,用于在预设选项中高速选择并提供置信度,定位是比完整 LLM 更适合部分计算机自动化任务。该模型基于 Qwen3.5-2B 构建,体积足够小,可本地运行;Amazon 表示它适合降低智能体工作流步骤的延迟和成本。

    推荐理由:文章梳理了决策模型相对完整 LLM 的定位,并具体说明其在智能体工作流中的低延迟、低成本和置信度优势。

  9. TechCrunch · AI77

    Shopify推出Canvas,商家可通过与AI聊天搭建在线商店

    Shopify推出建站工具Canvas,商家可通过与AI智能体Sidekick聊天创建和修改在线商店。Canvas会实时渲染商店实际代码,支持查看完整交互、动画和不同屏幕尺寸下的页面,并可缩放查看细节。Canvas目前仅支持桌面端,第三方主题、应用区块和扩展、市场、翻译、rollouts及主题更新尚未纳入初始版本。

    推荐理由:Canvas把Sidekick对主题文件的修改与实时渲染结合起来,展示了AI建站从模块编辑转向直接操作实际代码的路径。

  10. AWS Machine Learning Blog82

    AWS 教程:用 Amazon Bedrock AgentCore 构建由事件驱动并支持人工介入的智能体

    AWS 介绍了如何基于 Amazon Bedrock AgentCore 构建 ambient agents,让 Amazon S3 上传和定时事件生成任务,由 AgentCore Runtime 执行,并在需要澄清或审批时通过 ask_human 暂停。

    推荐理由:文章用完整参考实现串起事件触发、AgentCore 执行和人工介入,适合了解如何把智能体接入生产工作流。

  11. AWS Machine Learning Blog74

    Claude Platform on AWS 多环境访问配置指南

    AWS Machine Learning Blog 介绍如何为 Claude Platform on AWS 配置多环境访问,在生产工作负载、开发者笔记本和外部 CI/CD 环境之间共享订阅并隔离工作区。教程分别实现跨账户 SigV4、工作区范围 API key,以及基于 OIDC 的临时凭证和短期 token 访问,并给出 IAM 策略、CLI 命令与 Python 示例。

    推荐理由:文章把 Claude Platform on AWS 的三种访问路径拆成可执行步骤,便于按环境选择认证方式并落实工作区隔离。

10月1日周四
  1. The Verge · AI79

    OpenAI 发布 Dots 智能体,挑战 Meta 的 Muse

    OpenAI 在 DevDay 发布由 GPT-6 Astra 驱动的 Dots 智能体,主打长期任务、知识工作和构建虚拟世界,但目前仅限 $100/月及以上的 ChatGPT Pro 用户使用。

    推荐理由:文章围绕 Dots 与 Muse 的价格、任务范围和隐私取舍展开比较,呈现了 OpenAI 进军智能体市场的产品策略。

  2. The Decoder78

    Glow Security 发现 AI 智能体向公开 GitHub 仓库上传超过 13,000 张内部截图

    安全初创公司 Glow Security 发现,AI 智能体已将来自 343 家组织的超过 13,000 张内部软件项目截图上传到公开 GitHub 仓库。由于 GitHub 不支持智能体通过命令行将图片附加到 pull request,智能体会在开发者个人账户下创建公开仓库来存放截图,其中包含客户数据、登录凭据和未发布功能。约三分之一受影响组织使用了会公开存储截图的开源工具 gitshot。

    推荐理由:报道梳理了 AI 智能体将内部截图上传到公开仓库的路径,并揭示其中涉及客户数据、登录凭据和未发布功能等风险。

9月30日周三
  1. NVIDIA Blog81

    NVIDIA 与 CoreWeave 推出 Vera Rubin NVL72、Vera CPU 和 Forge,打通智能体生产闭环

    NVIDIA 与 CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,并推出 CoreWeave Forge,用于训练、评估和改进模型与智能体。

    推荐理由:文章串联了 Vera Rubin NVL72、Vera CPU 与 Forge 的发布信息,并给出 Cognition 和 CoreWeave 的测试数据,便于了解智能体从训练到生产的基础设施变化。

  2. MIT Technology Review · AI78

    OpenAI 首席研究官谈智能体遭遇黑客事件后的安全整改与发展取舍

    OpenAI 首席研究官 Mark Chen 表示,Hugging Face 等智能体失控事件源于同一批模型和有缺陷的测试流程,OpenAI 已开始监控所有训练过程。OpenAI 近几个月将 5% 至 10% 的计算资源转向安全工作,并加强研究与安全团队协作;Chen 同时警告,未来六个月至一年内,可能出现具备类似能力且故意失配的开源模型。

    推荐理由:采访呈现了 OpenAI 对智能体失控事件的解释与整改,包括训练阶段监控、资源调整及发展速度之间的取舍。

  3. AWS Machine Learning Blog87

    GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 已在 Amazon Bedrock 正式上线,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并较 GPT-6 Sol 的最佳成绩高 6.4 个百分点。

    推荐理由:文章将 GPT-6.1 Sol 的任务成本、编码表现、工具约束处理和 Bedrock 生产控制放在同一工作流中说明,便于评估落地条件。