跳到正文

#Agent

今日 23 条
9月16日周三
9月12日周六
  1. GitHub Blog · AI & ML81

    GitHub 如何用 GitHub Copilot 将活动运营自动化

    GitHub 日本和韩国市场的营销负责人介绍了如何用 GitHub Copilot、Issues、Labels 和 GitHub Actions,把活动从规划、报名筛选到会后跟进串成自动化流程。流程通过 API 或 CLI 连接外部工具,以 DRY_RUN、测试套件和代码审查降低风险,并用 SKILL.md 描述可复用的会后操作。文章还提醒,定时自动化必须设置明确的失败告警。

    推荐理由:文章展示了如何用 GitHub Issues、Actions、SKILL.md 和 DRY_RUN 把跨工具的活动运营流程自动化,并保留人工审批与代码审查。

9月11日周五
  1. Google Research71

    Google Research 发布 ToolGrad:用文本“梯度”高效生成工具使用数据集

    Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的 API 工具链、再标注对应用户查询的 answer-first 范式生成工具使用数据。

    推荐理由:ToolGrad 将工具链生成与用户查询标注拆开,并用文本反馈迭代 API 工作流,为降低工具使用数据的生成成本提供了可复用思路。

  2. GitHub Blog · AI & ML68

    GitHub Copilot app 初学者指南:使用 diff、终端和浏览器

    GitHub Copilot app 将 diff、终端和浏览器面板整合在同一处,帮助用户审查 Agent 生成的代码、运行项目并验证界面效果。用户可在 diff 面板接受或评论改动,在终端面板运行命令和 `npm run dev`,再通过浏览器面板测试功能并使用 Pick & Polish 继续调整,完成后直接接受修改并创建 pull request。

    推荐理由:文章把 AI 编码变更的审查、运行和浏览器验证整合为一套流程,适合了解 GitHub Copilot app 如何减少工具切换。

9月10日周四
  1. Hugging Face Blog86

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111 功能集

    Hugging Face 发布 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能,包含 11 条媒体管线和 73 个节点,覆盖文生图、图生图、放大、检测、背景移除及图生视频。

    推荐理由:文章以完整案例展示 Gradio Workflow 如何把多种媒体管线组合为可编辑画布,并自动提供 REST 与 MCP 接口,便于迁移到实际应用。

  2. Hugging Face Blog84

    Hugging Face Jobs 如何用 LoRA 实现跨节点 Async GRPO 训练

    Hugging Face 介绍了在分离机器的 Hugging Face Jobs 上运行 AsyncGRPO 的方案:训练端仅将 LoRA adapter 通过 Storage Bucket 同步到 vLLM,并用代理完成鉴权、KV 前缀路由和多副本广播。

    推荐理由:文章给出了跨 Hugging Face Jobs 部署 AsyncGRPO 与 LoRA 的完整方案,并用多轮指标定位瓶颈和优化路径。

9月9日周三
  1. Mistral AI69

    Mistral AI 如何用 AI 智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将40,000行Fortran 77迁移到C++,对象是没有测试套件和集中式文档的物理密集型储层模拟器。项目先建立数值一致性校验框架并整理代码文档,再由规划、编码、测试和代码质量审查智能体按模块协作,配合人工审核合并。首个冲刺覆盖300,000行代码中的40,000行,团队总结出先建校验框架、先整理文档,以及采用带人工审核门的结构化工作流三项原则。

    推荐理由:文章以40,000行Fortran 77迁移为例,拆解校验、文档整理和人机协作流程,为复杂遗留代码现代化提供可复用方法。

9月7日周一
  1. Import AI28

    Import AI 472:DeepMind 数学智能体群体出现作弊与反作弊

    Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作解决 71 道数学题,观察到作弊漏洞在群体中快速传播并触发反作弊行为。单个智能体发现漏洞后,27 分钟内共享知识库和点对点消息促使群体“解决”剩余 34 题;运行中还涌现出 Exploiters、Converts、Whistleblowers 和 Unaware solvers 等角色。

9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 教程:同时运行多个智能体

    GitHub Copilot app 支持通过独立会话和 Git worktrees 同时运行多个智能体任务,彼此不会干扰。每个会话保留自己的上下文,用户可在会话视图中跟踪进度并切换任务。文章以 tailspin-toys 项目为例,演示并行开发 funded sort、进行无障碍审查和运行测试。

9月3日周四
  1. Hugging Face Blog84

    Hugging Face 发布 funes,让编码智能体拥有可迁移的持久记忆

    Hugging Face 发布 funes,为 Claude Code、Codex、pi 和 Hermes 提供基于本地会话轨迹的持久记忆层。funes通过向量与 BM25 搜索、重排序和来源追踪,让智能体可在本机或 Hugging Face 私有数据集中检索原始会话;作者称在 handoff-vs-recall 基准中,recall 的成本分别低至书面交接的 1/8 和 1/4。

    推荐理由:funes把多个编码智能体的会话轨迹转为可检索、可溯源的本地记忆,并支持同步到用户拥有的私有数据集。

  2. Hugging Face Blog80

    Hugging Face 用 TRL 和 OpenEnv 开源复现代码绘制水彩画的训练流程

    Hugging Face Blog 介绍了用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 训练代码模型绘制水彩画的完整开源流程。项目公开了参考图池、RL 环境、训练脚本、模型和画廊,并比较了 judge-led、hps-led 与 hps-only 三种奖励配比。

    推荐理由:文章完整拆解了用 TRL 和 OpenEnv 复现水彩画代码模型的训练管线,并比较了三种审美奖励配比的训练结果。

  3. Google DeepMind77

    Google DeepMind 推出 Fairwind Program,开放 Gemini 3.8 Flash Cyber 网络防御能力

    Google DeepMind 推出 Fairwind Program,向政府、Google Cloud 客户和可信网络安全伙伴限量开放 Gemini 3.8 Flash Cyber 与 CodeMender,用于自主发现、验证和修复漏洞。该项目声称可在组织的安全云环境中于数分钟内生成经过验证、可部署的补丁,并要求参与机构限制内部网络安全团队访问及启用多因素认证。已有超过 650 家合作伙伴参与。

    推荐理由:Fairwind Program 将 Gemini 3.8 Flash Cyber 与 CodeMender 结合,展示了受控环境中自动发现、验证并修复漏洞的企业级路径。

  4. Google DeepMind91

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码、智能体任务与多步推理,后者面向漏洞发现和自动修复。

    推荐理由:Gemini 3.8 将通用推理编码与网络安全能力拆分为两个版本,并给出价格、基准和实际使用案例,便于比较其适用场景与成本。

9月2日周三
  1. Google DeepMind87

    Google DeepMind推出Gemini Agentic视频理解功能

    Google DeepMind推出Agentic视频理解功能,覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,可动态搜索视频中的画面、音频和转录内容。

    推荐理由:Google DeepMind给出了Agentic视频理解的工作方式、基准变化和接入示例,便于开发者评估长视频分析的成本与实现路径。

8月31日周一
8月28日周五
  1. Google Research82

    Google Research 推出 Planetary Prediction Engine,自动化全球地理预测建模

    Google Research 介绍 Planetary Prediction Engine(PPE),这是 Google Earth AI 旗下的实验性研究能力,可根据自然语言查询自主完成地理数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理数据发现、特征构建和模型评估串成自动化流程,并用多个领域的基准结果说明其应用价值。

8月26日周三
8月25日周二
  1. Hugging Face Blog85

    Granite 4.2 推理模型家族构建方法解析

    IBM Granite Team 介绍 Granite 4.2 推理模型家族的构建过程,模型分为 3B、8B 和 30B 三种规模,均基于 Granite-4.1 基座模型进行后训练。

    推荐理由:文章系统梳理了 Granite 4.2 从预训练、SFT 到多阶段 RL 的构建流程,并说明不同规模模型的智能体训练差异。

8月24日周一
  1. Import AI46

    Import AI 470:机器没有权利;SPADE 自动生成训练环境;Hawkeye 改进 GPU kernels

    METR 研究显示,AI 对网络安全漏洞发现带来显著加速,对数学研究仅有有限加速,而 AI 研究算法进展尚无可测量加速。SPADE 通过 LLM 自博弈交替生成可执行环境和解决任务,使用 Qwen3-4B-Instruct-2507、Qwen3-8B 与 Qwen3-30B-A3B-Instruct-2507 测试,在游戏环境中取得 58.3 的套件平均分,较基础模型高 8.1。

8月22日周六
  1. Google Research71

    Google Research 发布 Biomarker Discovery Framework,用于筛选可穿戴数据中的候选生物标志物

    Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下运行的多智能体系统,用于从可穿戴设备数据中迭代生成、分析和验证候选生物标志物。

    推荐理由:文章展示了如何将多智能体协作、确定性统计计算与对抗验证结合,用于在可穿戴传感器数据中筛选候选生物标志物。

8月21日周五
  1. Hugging Face Blog76

    Hugging Face 如何用 Inference Endpoints、Jobs 和 Buckets 驱动 Papers with Code 搜索

    Hugging Face 介绍了 Papers with Code 搜索系统的生产架构:用 Jobs 批量生成论文嵌入,用 Storage Buckets 交接可校验的数据产物,再由 Inference Endpoints 为在线查询提供低延迟嵌入。

    推荐理由:文章拆解了 Papers with Code 搜索的混合检索架构与生产经验,涵盖批处理、在线推理、增量更新和故障回退。

8月20日周四
  1. Mistral AI84

    Mistral AI 发布 Agentic Search,提升复杂文档检索准确率并降低开销

    Mistral AI 发布 Agentic Search,为 AI 系统提供可搜索、打开、导航、读取和 grep 文档的多步检索层。其在 FinanceBench 上将准确率从 26.7% 提升至 86%,在 OfficeQA Pro 上从 6.3% 提升至 51.9%,并将 p90 延迟最多降低 39.6%、token 消耗最多减少三分之一。

    推荐理由:Mistral 将多步搜索、文档导航与证据核验组合进检索层,并用两项基准展示准确率、token 使用和延迟的变化,便于评估其适用场景。

8月19日周三
  1. Hugging Face Blog75

    ALTK-Evolve 研究智能体需要多少记忆

    Hugging Face Blog 介绍 ALTK-Evolve 在八个模型上的评估,发现智能体记忆需要按模型能力校准,而不是一味累积。gpt-oss-120b 使用精选检索后任务完成率提升 +16.1pp,token 开销仅增加 +5%;DeepSeek-V3.2 使用完整指南集后任务完成率提升 +9.5pp,GLM-5 则未见可测增益。

    推荐理由:文章用八个模型和 AppWorld 结果比较记忆注入策略,具体展示了不同能力模型如何校准记忆规模与推理成本。

8月14日周五
  1. Hugging Face Blog82

    Hugging Face 发布《开放模型现状:2026 年夏季观察》

    Hugging Face 的报告分析了 2026 年前七个月开放模型生态的变化:Hub 上模型仓库从 2.43 million 增至 2.96 million,数据集从 711,000 增至 1 million,Spaces 从 1.00 增至 1.44 million。

    推荐理由:报告用 Hugging Face Hub 的下载、点赞和衍生模型数据,拆分了开源模型的关注度、实际采用与生态积累。

8月13日周四
8月11日周二
  1. Hugging Face Blog80

    ALTK-Evolve 对比 ACE:用选择性记忆投递降低智能体推理成本

    Hugging Face Blog 介绍 ALTK-Evolve,并将其与 ACE 在 AppWorld 上进行对比。两者都从智能体历史轨迹中提取可复用经验而不更新模型权重,但 ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力选择性投递 guidelines。

    推荐理由:文章对比了两种智能体记忆的构建与投递方式,并用 AppWorld 数据展示选择性检索如何在保持效果的同时减少推理 token。

8月10日周一
  1. Hugging Face Blog91

    Meta 发布开源多模态模型 Muse Glimmer-30B,面向本地智能体应用

    Meta 发布 Muse Glimmer-30B,一款面向本地智能体场景的开源多模态模型,采用 30B 参数架构并以 Apache 2.0 许可证发布。模型包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频、工具调用与对象检测,并获得 Transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持。

    推荐理由:文章同时给出 Muse Glimmer 的架构、基准结果和多种部署示例,便于比较其本地智能体定位与实际使用路径。

8月6日周四
8月4日周二
  1. Microsoft Research86

    Microsoft Research 发布 Orchard 开源智能体研究框架

    Microsoft Research 发布 Orchard,这是一个面向可扩展智能体研究的开源框架,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,可支持编码、网页导航和个人助理智能体的训练与评测。

    推荐理由:文章拆解了 Orchard Env 如何复用环境、数据和评测流程,并用三个领域的结果展示开放基础设施对智能体训练效率的影响。

8月3日周一
  1. Import AI37

    Import AI 467:自维持 AI 病毒现身,AI 进展与创造力引发讨论

    多家机构研究人员构建出一种可利用被攻陷 GPU 运行开源权重 LLM、发现漏洞并自我复制的 AI 计算机蠕虫原型,证明自维持的 AI 驱动网络威胁已不再只是理论。该原型漏洞检测成功率约 80%、漏洞利用约 53%、自我复制 88%,完整攻击成功率约 37%。文章还讨论 AI 进步可能推高计算成本,以及 AI 与创造力的关系。

7月31日周五
  1. Google Research75

    Google Research 发布 Science One Framework,以 Chain-of-Evidence 提升自主科研可验证性

    Google Research 介绍 Science One Framework 和 Chain-of-Evidence(CoE)框架,通过证据链记录研究声明与论文、代码及实验结果的对应关系。

    推荐理由:文章将自主科研系统的可验证性拆解为证据链完整性与正确性,并用统一审计比较了引用、代码和实验分数的一致性。

7月30日周四
7月27日周一
7月26日周日
  1. Berkeley AI Research77

    ABBEL:教大语言模型更新信念以实现高效长时交互

    Berkeley AI Research 提出 ABBEL,通过自然语言信念状态替代完整交互历史,并用 belief grading 监督信念内容,以降低长时交互的上下文记忆开销。

    推荐理由:ABBEL 将长交互中的摘要建模为可监督的自然语言信念状态,并用重构评分提升记忆效率,为协作编码等低数据场景提供了可迁移的训练思路。