跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 141–160 条 · 共 181 条
3月31日周二
  1. Hugging Face Blog77

    Hugging Face 发布 TRL v1.0 后训练库

    Hugging Face 发布 TRL v1.0,将 TRL 从研究代码库明确升级为面向生产使用的后训练库,支持超过 75 种后训练方法。新版本让稳定 API 与实验 API 共存,稳定层涵盖 SFT、DPO、Reward modeling、RLOO 和 GRPO 等训练器,最近一个 0.x 版本的迁移工作量较小。

    推荐理由:文章解释了 TRL v1.0 如何以稳定与实验并存的契约应对后训练方法快速变化,并给出异步 GRPO 等后续方向。

3月29日周日
  1. Google DeepMind79

    Google DeepMind 用 Gemini 探索 AI 时代的智能指针

    Google DeepMind 正在探索由 Gemini 驱动的 AI 智能指针,让用户通过指向和语音在不同应用中调用 AI,而不必反复切换窗口或编写复杂提示词。

    推荐理由:文章从四项交互原则和实验演示出发,具体说明 AI 如何结合指针位置、视觉上下文与语音,减少复杂提示词输入。

3月27日周五
  1. Hugging Face Blog73

    Hugging Face 教你将 OpenClaw 迁移到开放模型

    Hugging Face 介绍了把 OpenClaw、Pi 或 Open Code 智能体迁移到开放模型的两条路径:通过 Inference Providers 托管运行,或使用 llama.cpp 在本地运行。托管方案可配置 GLM-5,本地方案示例使用 Qwen3.5-35B-A3B-GGUF,并提供了安装、启动服务器和 OpenClaw 配置命令。

    推荐理由:文章提供了将 OpenClaw 迁移到 Hugging Face 托管模型或本地 llama.cpp 的具体命令与配置,便于读者按硬件和隐私需求选择路径。

3月25日周三
  1. Google Research77

    Google 发布 Vibe Coding XR,用 Gemini 和 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js 和 LiteRT.js 的 XR Blocks,将自然语言转换为物理感知的 Android XR 应用。

    推荐理由:Google 将 Gemini 的长上下文推理与 XR Blocks 模板结合,把自然语言生成物理感知的 Android XR 原型,展示了教育和交互场景的快速验证路径。

3月18日周三
  1. Google Research81

    Google Research 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 活动上介绍了 AI 用于个性化医疗、临床协作、公共卫生和生物医学研究的最新进展。相关工作包括 Personal Health Agent、AMIE、MedGemma 和 DeepSomatic,涉及乳腺癌检测、糖尿病视网膜病变筛查、医疗应用开发及基因数据分析。

    推荐理由:文章集中呈现 Google Research 将多模态模型、智能体和开放权重工具推进医疗研究与临床场景的路径,涵盖筛查、诊疗和公共卫生应用。

  2. Hugging Face Blog79

    Hugging Face 发布《2026 春季开源现状》报告

    Hugging Face 发布《2026 春季开源现状》报告,基于社区活动数据分析竞争、地域、技术趋势和新兴社区。2025 年平台用户增至 13 million,公共模型超过 2 million、公共数据集超过 500,000;中国模型占下载量 41%,Qwen 相关衍生模型超过 200,000 个。

    推荐理由:报告用 Hugging Face 社区数据梳理开源 AI 的地域、规模与应用变化,呈现中国模型增长、小模型普及和机器人社区扩张等趋势。

  3. Mistral AI70

    Mistral AI 推出 Forge,帮助企业基于专有知识构建 AI 模型

    Mistral AI 推出 Forge,帮助企业使用内部文档、代码库、结构化数据和运营记录训练面向自身领域的 AI 模型。Forge 支持预训练、后训练、强化学习,以及 dense 和 MoE 架构与多模态输入,可用于定制模型和企业智能体。平台还提供基础设施、数据管道、评估与持续改进能力,并支持由 Mistral Vibe 等代码智能体执行微调、超参数搜索、任务调度和合成数据生成。

    推荐理由:Forge将预训练、后训练和强化学习用于企业专有数据,并覆盖模型评估与持续适配,适合了解定制模型如何服务内部流程。

3月17日周二
  1. Hugging Face Blog77

    H Company 发布 Holotron-12B 高吞吐电脑操作模型

    H Company 发布多模态电脑操作模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-12B-v2-VL-BF16 和专有数据训练,最终 checkpoint 使用约 14 billion tokens。

    推荐理由:文章同时给出 Holotron-12B 的训练来源、吞吐对比和 Agent 基准结果,便于评估其在高并发电脑操作任务中的实际定位。

3月11日周三
  1. Mistral AI70

    Mistral AI 如何用 Vibe 构建自动生成 Rails 测试的智能体

    Mistral AI 基于开源编码助手 Vibe 构建了一个可在 CI/CD 中自主生成和改进 RSpec 测试的智能体,能够读取 Rails 源码、并行处理文件,并通过 RuboCop 与 SimpleCov 验证结果。

    推荐理由:文章展示了如何用 Vibe、分类型技能和可执行验证工具构建 Rails 测试智能体,并用真实代码库指标检验其效果。

3月10日周二
  1. Hugging Face Blog83

    Hugging Face 在 Hub 上推出 Storage Buckets

    Hugging Face 在 Hub 上推出 Storage Buckets,为 checkpoints、处理后数据、Agent traces 和日志等可变 ML 产物提供非版本化、S3-like 对象存储。Buckets 基于 Xet 的分块去重,并支持通过 hf CLI、Python、JavaScript 和 fsspec 管理;还可将数据预热到 AWS 和 GCP 的计算区域。

    推荐理由:Storage Buckets 将可变的 ML 中间产物纳入 Hub,并结合 Xet 去重与预热能力,补足 Git 不适合高频写入的工作层。

2月20日周五
2月19日周四
2月13日周五
  1. Hugging Face Blog85

    Hugging Face 发布 CUDA Kernels Agent skill,助力 Claude 和 Codex 编写自定义内核

    Hugging Face 构建了一个 CUDA Kernels Agent skill,指导 Claude 和 Codex 为 diffusers 与 transformers 目标编写带 PyTorch 绑定和基准测试的生产级 CUDA 内核。

    推荐理由:文章展示了如何把 CUDA 专业知识封装为 Agent skill,并用真实 diffusers 与 transformers 目标验证从内核生成、绑定到基准测试的完整流程。

2月12日周四
  1. Hugging Face Blog75

    OpenEnv 实践:在真实环境中评测工具调用智能体

    Hugging Face、Meta 与 Turing 介绍了用于真实系统智能体评测的开源框架 OpenEnv,以及生产级日历环境 Calendar Gym。Calendar Gym 通过权限控制、部分可观测性和多步工作流测试智能体,明确日历标识时成功率接近 90%,改用自然语言描述后降至约 40%;超过一半的错误来自工具参数格式错误或调用顺序不当。

    推荐理由:文章通过 Calendar Gym 展示了真实环境评测如何暴露智能体在多步执行、歧义处理和权限约束下的可靠性问题。

2月5日周四
  1. Google Research66

    Google Research介绍Natively Adaptive Interfaces框架,以多模态AI智能体提升无障碍设计

    Google Research介绍Natively Adaptive Interfaces(NAI)框架,尝试用原生嵌入界面的多模态AI智能体替代静态导航,让应用根据用户情境和偏好动态调整。

    推荐理由:Google Research提出将智能体原生嵌入界面,通过多模态协作和社区共创缩小无障碍功能滞后,为通用设计提供了可复用框架。

2月4日周三
  1. Google Research77

    Google 与 Included Health 将开展全国性随机研究评估虚拟医疗中的 AI

    Google 宣布与 Included Health 合作,在获 Institutional Review Board(IRB)批准后开展一项面向全国、经同意参与者的前瞻性随机研究,评估对话式 AI 在真实虚拟医疗工作流中的表现。

    推荐理由:研究将把对话式 AI 从模拟和可行性测试推进到全国范围的随机对照研究,为评估真实虚拟医疗中的安全性与实用性提供更严格证据。

1月30日周五
  1. Google DeepMind83

    Google DeepMind 推出 Project Genie 互动世界原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一款由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性网页原型。

    推荐理由:Project Genie 将 Genie 3 的世界模型能力封装为可操作原型,展示了从生成环境到实时探索和视频导出的完整体验。

1月28日周三