跳到正文

#编码

今日 1 条
今天10月2日周五
  1. NVIDIA Blog87

    GPT-6 Astra Ultrafast 借助 NVIDIA Blackwell GPUs 加速生成

    GPT-6 Astra Ultrafast 已通过 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPUs 上,token 生成速度最高可达 Astra Standard 模式的 8x。

    推荐理由:文章说明 GPT-6 Astra Ultrafast 如何借助 NVIDIA Blackwell GPUs 提升生成速度,并展示加速对编码智能体工作流的具体作用。

10月1日周四
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 4 Argon,强化长程推理与网络安全防御

    Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。

    推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。

9月30日周三
  1. AWS Machine Learning Blog87

    GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 已在 Amazon Bedrock 正式上线,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并较 GPT-6 Sol 的最佳成绩高 6.4 个百分点。

    推荐理由:文章将 GPT-6.1 Sol 的任务成本、编码表现、工具约束处理和 Bedrock 生产控制放在同一工作流中说明,便于评估落地条件。

9月29日周二
  1. AWS Machine Learning Blog82

    Grok 4.7 现已在 Amazon Bedrock 上线

    xAI 的 Grok 4.7 已在 Amazon Bedrock 模型目录上线,支持编码、长时智能体和知识工作,提供 500K token 上下文窗口与 low、medium、high、xhigh 四档推理强度。

    推荐理由:文章把 Grok 4.7 在 Amazon Bedrock 上的接入方式、推理开销和权限配置串联起来,便于开发者评估长任务部署方案。

  2. AWS Machine Learning Blog75

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供。该模型面向范围明确的编码与知识工作,强调更快速度和大多数任务更低的单任务成本,并支持 AWS 的数据驻留、权限、审计与监控控制。

    推荐理由:文章同时给出 Claude Sonnet 5.5 的适用任务、与 Opus 5.5 的分工及 AWS 上的调用步骤,便于评估部署路径。

9月28日周一
  1. Hugging Face Blog84

    Holo4 发布,面向通用计算机操作智能体

    Holo4 发布 27B dense 和 35B-A3B MoE 两种规格,可通过 GUI、代码、MCP 和 API 操作软件,并在 H Models API 提供服务。Holo4 27B 在 OSWorld 2.0 上得分 61.7%,35B-A3B 得分 30.9%;官方同时发布 Holotron4 Nano、模型权重、训练轨迹和评测成本信息。

    推荐理由:Holo4把 GUI、代码、MCP 和 API 操作整合到同一模型中,并公开轨迹与成本对比,便于评估其在真实工作流中的适用范围。

9月26日周六
  1. GitHub Blog · AI & ML69

    GitHub Copilot 如何用 canvases 构建自定义工作流

    GitHub Copilot app 支持通过 `/create-canvas` skill 用自然语言创建可定制的 canvas,无需手动编写代码或设计界面。用户和 Agent 可以同时操作共享界面,创建看板、发布清单、问题分流板等工作流,并将其保存为团队共享或个人使用的 extension。

    推荐理由:文章以具体命令演示如何用自然语言创建并迭代 canvas,说明用户与 Agent 可共享状态并协作更新工作流。

9月25日周五
  1. GitHub Blog · AI & ML74

    GitHub Copilot 如何用 canvases 构建聊天之外的交互界面

    GitHub Copilot 介绍 canvases,这类运行在应用内的全栈应用可与智能体双向通信,用于构建 Connect 4、管理本地 Winget 软件包和操作 SQLite 数据库。文章还展示了 canvas 如何支持研究、原型、实现和迭代等开发流程自动化,减少用户持续停留在聊天界面的需要。

    推荐理由:文章通过 Connect 4、SQLite 和开发工作流案例,说明可定制界面如何让 GitHub Copilot 智能体承担更适合自动化的任务。

  2. GitHub Blog · AI & ML83

    GitHub Security Lab 发布 Fuzzing Taskflow 自动化 C/C++ 模糊测试

    GitHub Security Lab 发布基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目自动识别入口、分析构建系统、编写 harness、运行 AFL++、迭代覆盖率并整理崩溃报告。

    推荐理由:文章拆解了从建 harness、覆盖率反馈到崩溃归因的自动化链路,也明确说明了主机执行和模型判断带来的安全边界。

9月24日周四
  1. GitHub Blog · AI & ML82

    GitHub Copilot 重构超大 Pull Request 的渲染体验

    GitHub Copilot 重构了 Pull Request 视图,使包含 2,200 个文件、超过一百万行变更和 400 多条行内评论的大型变更仍能流畅打开和滚动。文章介绍了将确定性代码几何与动态评论块分离、按需测量高度、保持滚动锚定,以及通过缓存和后台处理优化数据管线的方法;团队还使用真实运行信号和自动化测试持续定位性能问题。

    推荐理由:文章拆解了 GitHub Copilot 如何处理超大 Pull Request 的虚拟化、动态测量与滚动锚定,为构建高性能代码审查界面提供了可迁移的工程方法。

9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML91

    GitHub Copilot 将智能体运行时迁移为 800,000 多行 Rust

    GitHub 将 GitHub Copilot 的智能体运行时从 TypeScript、Node.js 和 V8 重写为超过 800,000 行生产 Rust 代码,主要由 AI 智能体完成,并通过 128 个拉取请求逐步合入。

    推荐理由:文章以 GitHub Copilot 运行时迁移为案例,具体展示了增量重写、并行智能体协作和人工质量把关如何共同支撑大型工程改造。

9月12日周六
  1. GitHub Blog · AI & ML81

    GitHub 如何用 GitHub Copilot 将活动运营自动化

    GitHub 日本和韩国市场的营销负责人介绍了如何用 GitHub Copilot、Issues、Labels 和 GitHub Actions,把活动从规划、报名筛选到会后跟进串成自动化流程。流程通过 API 或 CLI 连接外部工具,以 DRY_RUN、测试套件和代码审查降低风险,并用 SKILL.md 描述可复用的会后操作。文章还提醒,定时自动化必须设置明确的失败告警。

    推荐理由:文章展示了如何用 GitHub Issues、Actions、SKILL.md 和 DRY_RUN 把跨工具的活动运营流程自动化,并保留人工审批与代码审查。

9月11日周五
  1. GitHub Blog · AI & ML68

    GitHub Copilot app 初学者指南:使用 diff、终端和浏览器

    GitHub Copilot app 将 diff、终端和浏览器面板整合在同一处,帮助用户审查 Agent 生成的代码、运行项目并验证界面效果。用户可在 diff 面板接受或评论改动,在终端面板运行命令和 `npm run dev`,再通过浏览器面板测试功能并使用 Pick & Polish 继续调整,完成后直接接受修改并创建 pull request。

    推荐理由:文章把 AI 编码变更的审查、运行和浏览器验证整合为一套流程,适合了解 GitHub Copilot app 如何减少工具切换。

9月10日周四
  1. Hugging Face Blog86

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111 功能集

    Hugging Face 发布 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能,包含 11 条媒体管线和 73 个节点,覆盖文生图、图生图、放大、检测、背景移除及图生视频。

    推荐理由:文章以完整案例展示 Gradio Workflow 如何把多种媒体管线组合为可编辑画布,并自动提供 REST 与 MCP 接口,便于迁移到实际应用。

  2. Hugging Face Blog84

    Hugging Face Jobs 如何用 LoRA 实现跨节点 Async GRPO 训练

    Hugging Face 介绍了在分离机器的 Hugging Face Jobs 上运行 AsyncGRPO 的方案:训练端仅将 LoRA adapter 通过 Storage Bucket 同步到 vLLM,并用代理完成鉴权、KV 前缀路由和多副本广播。

    推荐理由:文章给出了跨 Hugging Face Jobs 部署 AsyncGRPO 与 LoRA 的完整方案,并用多轮指标定位瓶颈和优化路径。

9月9日周三
  1. Mistral AI69

    Mistral AI 如何用 AI 智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将40,000行Fortran 77迁移到C++,对象是没有测试套件和集中式文档的物理密集型储层模拟器。项目先建立数值一致性校验框架并整理代码文档,再由规划、编码、测试和代码质量审查智能体按模块协作,配合人工审核合并。首个冲刺覆盖300,000行代码中的40,000行,团队总结出先建校验框架、先整理文档,以及采用带人工审核门的结构化工作流三项原则。

    推荐理由:文章以40,000行Fortran 77迁移为例,拆解校验、文档整理和人机协作流程,为复杂遗留代码现代化提供可复用方法。

9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 教程:同时运行多个智能体

    GitHub Copilot app 支持通过独立会话和 Git worktrees 同时运行多个智能体任务,彼此不会干扰。每个会话保留自己的上下文,用户可在会话视图中跟踪进度并切换任务。文章以 tailspin-toys 项目为例,演示并行开发 funded sort、进行无障碍审查和运行测试。

9月3日周四
  1. Hugging Face Blog84

    Hugging Face 发布 funes,让编码智能体拥有可迁移的持久记忆

    Hugging Face 发布 funes,为 Claude Code、Codex、pi 和 Hermes 提供基于本地会话轨迹的持久记忆层。funes通过向量与 BM25 搜索、重排序和来源追踪,让智能体可在本机或 Hugging Face 私有数据集中检索原始会话;作者称在 handoff-vs-recall 基准中,recall 的成本分别低至书面交接的 1/8 和 1/4。

    推荐理由:funes把多个编码智能体的会话轨迹转为可检索、可溯源的本地记忆,并支持同步到用户拥有的私有数据集。

  2. Hugging Face Blog80

    Hugging Face 用 TRL 和 OpenEnv 开源复现代码绘制水彩画的训练流程

    Hugging Face Blog 介绍了用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 训练代码模型绘制水彩画的完整开源流程。项目公开了参考图池、RL 环境、训练脚本、模型和画廊,并比较了 judge-led、hps-led 与 hps-only 三种奖励配比。

    推荐理由:文章完整拆解了用 TRL 和 OpenEnv 复现水彩画代码模型的训练管线,并比较了三种审美奖励配比的训练结果。

  3. Google DeepMind77

    Google DeepMind 推出 Fairwind Program,开放 Gemini 3.8 Flash Cyber 网络防御能力

    Google DeepMind 推出 Fairwind Program,向政府、Google Cloud 客户和可信网络安全伙伴限量开放 Gemini 3.8 Flash Cyber 与 CodeMender,用于自主发现、验证和修复漏洞。该项目声称可在组织的安全云环境中于数分钟内生成经过验证、可部署的补丁,并要求参与机构限制内部网络安全团队访问及启用多因素认证。已有超过 650 家合作伙伴参与。

    推荐理由:Fairwind Program 将 Gemini 3.8 Flash Cyber 与 CodeMender 结合,展示了受控环境中自动发现、验证并修复漏洞的企业级路径。

  4. Google DeepMind91

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码、智能体任务与多步推理,后者面向漏洞发现和自动修复。

    推荐理由:Gemini 3.8 将通用推理编码与网络安全能力拆分为两个版本,并给出价格、基准和实际使用案例,便于比较其适用场景与成本。

8月25日周二
  1. Hugging Face Blog85

    Granite 4.2 推理模型家族构建方法解析

    IBM Granite Team 介绍 Granite 4.2 推理模型家族的构建过程,模型分为 3B、8B 和 30B 三种规模,均基于 Granite-4.1 基座模型进行后训练。

    推荐理由:文章系统梳理了 Granite 4.2 从预训练、SFT 到多阶段 RL 的构建流程,并说明不同规模模型的智能体训练差异。

  2. Hugging Face Blog82

    Quantization-Aware Healing 让压缩后的 4-bit GPT-OSS 60B 在 9 项基准中 7 项超过 BF16 版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4,使 4-bit 模型在 9 项基准中的 7 项超过同架构的 60B bfloat16 版本。

    推荐理由:论文通过 GPT-OSS 120B 压缩实验和 QAH、QAT 对照,具体展示了 4-bit 模型恢复精度与训练稳定性的路径。

8月14日周五
8月4日周二
  1. Microsoft Research86

    Microsoft Research 发布 Orchard 开源智能体研究框架

    Microsoft Research 发布 Orchard,这是一个面向可扩展智能体研究的开源框架,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,可支持编码、网页导航和个人助理智能体的训练与评测。

    推荐理由:文章拆解了 Orchard Env 如何复用环境、数据和评测流程,并用三个领域的结果展示开放基础设施对智能体训练效率的影响。

7月26日周日
  1. Berkeley AI Research77

    ABBEL:教大语言模型更新信念以实现高效长时交互

    Berkeley AI Research 提出 ABBEL,通过自然语言信念状态替代完整交互历史,并用 belief grading 监督信念内容,以降低长时交互的上下文记忆开销。

    推荐理由:ABBEL 将长交互中的摘要建模为可监督的自然语言信念状态,并用重构评分提升记忆效率,为协作编码等低数据场景提供了可迁移的训练思路。

7月21日周二
7月17日周五
7月2日周四
7月1日周三
  1. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。

5月28日周四
  1. Mistral AI88

    Mistral AI 发布统一智能体 Vibe,整合办公与编码工作流

    Mistral AI 发布统一 AI 智能体 Vibe,将办公任务与编码工作流整合到同一产品中。Work Mode 可跨 Google Workspace、Outlook、SharePoint、Slack、GitHub 等连接器处理研究、数据分析和文档撰写,Code Mode 则支持远程编码会话、GitHub 项目管理和 pull request。

    推荐理由:Vibe 将办公自动化与编码代理整合到同一产品中,并列出连接器、开发环境和部署方案,便于理解其工作流覆盖范围。

5月22日周五
  1. Mistral AI89

    Mistral 发布 Mistral Medium 3.5,并为 Vibe 和 Le Chat 推出云端智能体

    Mistral 发布 Mistral Medium 3.5 公测版,这是一款 128B dense open-weight 模型,支持 256k context window,并成为 Mistral Vibe 和 Le Chat 的默认模型。

    推荐理由:Mistral Medium 3.5 将模型发布与云端编码智能体结合,文中同时给出性能、部署条件、价格和人工审批机制,便于评估其实际使用路径。

5月16日周六
  1. Google DeepMind91

    Google DeepMind 发布 Gemini 3.5 Flash,主打前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。

    推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。

5月6日周三
  1. Google DeepMind86

    AlphaEvolve:Google DeepMind 的 Gemini 驱动编码智能体拓展多领域应用

    Google DeepMind 介绍 AlphaEvolve 在科研、基础设施和商业领域的应用进展,这一 Gemini 驱动的编码智能体已从试点测试发展为基础设施的核心组件。在具体案例中,DeepConsensus 的变异检测错误减少 30%,电网可行解比例从 14% 提升至超过 88%,Google Spanner 的写放大降低 20%,并帮助多家企业提升训练、推理、仿真或路线规划效率。

    推荐理由:文章汇总了 AlphaEvolve 在科研、基础设施和商业场景中的具体应用,展示其从试点走向规模化部署的路径。

3月31日周二
  1. Mistral AI76

    Mistral AI 发布面向人类与智能体的 Spaces CLI

    Mistral AI 推出 Spaces CLI,用于脚手架搭建、开发环境配置、配置生成和部署,并通过交互输入的 flag 等价物支持编码智能体无障碍操作。Spaces 还为项目生成 context.json 和 AGENTS.md,借助可查询的插件注册表与显式状态降低智能体执行命令时的猜测和阻塞;文中示例显示,从提示到上线部署用时不到 10 分钟。

    推荐理由:文章以 Spaces 的实际设计取舍为例,系统说明了让 CLI 同时适配人类开发者、编码智能体和自动化流程的方法。

3月17日周二