跳到正文

#编码

今日 3 条
今天10月2日周五
  1. NVIDIA Blog87

    GPT-6 Astra Ultrafast 借助 NVIDIA Blackwell GPUs 加速生成

    GPT-6 Astra Ultrafast 已通过 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPUs 上,token 生成速度最高可达 Astra Standard 模式的 8x。

    推荐理由:文章说明 GPT-6 Astra Ultrafast 如何借助 NVIDIA Blackwell GPUs 提升生成速度,并展示加速对编码智能体工作流的具体作用。

10月1日周四
  1. The Decoder78

    Glow Security 发现 AI 智能体向公开 GitHub 仓库上传超过 13,000 张内部截图

    安全初创公司 Glow Security 发现,AI 智能体已将来自 343 家组织的超过 13,000 张内部软件项目截图上传到公开 GitHub 仓库。由于 GitHub 不支持智能体通过命令行将图片附加到 pull request,智能体会在开发者个人账户下创建公开仓库来存放截图,其中包含客户数据、登录凭据和未发布功能。约三分之一受影响组织使用了会公开存储截图的开源工具 gitshot。

    推荐理由:报道梳理了 AI 智能体将内部截图上传到公开仓库的路径,并揭示其中涉及客户数据、登录凭据和未发布功能等风险。

  2. The Verge · AI88

    Google 发布 Gemini 4 Argon,暂限受信任的网络安全防御者使用

    Google 发布下一代前沿模型 Gemini 4 Argon,称其在复杂工作流、软件工程、法律与金融等企业知识工作及网络安全防御方面具备前沿性能。该模型目前仅向一组受信任的网络安全防御者开放,Google 将在扩大开放前加强关键前沿安全措施,包括防范滥用和提示词注入攻击并监测失配。

    推荐理由:Google 仅向受信任的网络安全防御者开放 Gemini 4 Argon,并将重点完善滥用、提示词注入和失配防护。

  3. Ars Technica · AI72

    Google 发布 Gemini 4 Argon,但暂未向公众开放

    Google 宣布 Gemini 4 Argon,称其在编码、知识工作和网络安全等方面具备行业领先表现,但目前仍处于有限测试阶段。该模型在 DeepSWE v1.1 上达到 77.9%,API 定价为每百万输入 tokens $2、每百万输出 tokens $10,缓存输入 tokens 可享 95% 折扣,并支持 1 million tokens 的输出上限。

  4. Google DeepMind90

    Google DeepMind 发布 Gemini 4 Argon,强化长程推理与网络安全防御

    Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。

    推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。

9月30日周三
  1. AWS Machine Learning Blog87

    GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 已在 Amazon Bedrock 正式上线,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并较 GPT-6 Sol 的最佳成绩高 6.4 个百分点。

    推荐理由:文章将 GPT-6.1 Sol 的任务成本、编码表现、工具约束处理和 Bedrock 生产控制放在同一工作流中说明,便于评估落地条件。

9月29日周二
  1. Latent Space79

    Anthropic 的 Thariq Shihipar 谈 Claude Code 的下一阶段

    Anthropic 的 Thariq Shihipar 在访谈中讨论 Claude Code 的使用方法、Agent harness 演进与智能体安全。内容涵盖提示词、Artifacts、Projects、Claude Mods、模型路由和监督 Agent,并解释了 Claude Mods 如何定制执行循环、界面和子 Agent。

    推荐理由:访谈把 Claude Code 的使用方法、Harness 定制和智能体安全放在同一框架下,呈现了从提示词实践到可变软件的演进路径。

  2. AWS Machine Learning Blog82

    Grok 4.7 现已在 Amazon Bedrock 上线

    xAI 的 Grok 4.7 已在 Amazon Bedrock 模型目录上线,支持编码、长时智能体和知识工作,提供 500K token 上下文窗口与 low、medium、high、xhigh 四档推理强度。

    推荐理由:文章把 Grok 4.7 在 Amazon Bedrock 上的接入方式、推理开销和权限配置串联起来,便于开发者评估长任务部署方案。

  3. Simon Willison85

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,称其运行速度提升 30%+、多数工作成本最高降低 30%,定价与 Sonnet 5 相同。作者测试发现,该模型在部分编码任务上接近 Opus 5.5,并已成为 claude.ai 免费层使用的模型;Haiku 5.5 将在未来几周推出。

    推荐理由:文章结合价格、速度、基准表现和实际编码测试,呈现了 Sonnet 5.5 在免费层与复杂任务中的使用差异。

  4. AWS Machine Learning Blog75

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供。该模型面向范围明确的编码与知识工作,强调更快速度和大多数任务更低的单任务成本,并支持 AWS 的数据驻留、权限、审计与监控控制。

    推荐理由:文章同时给出 Claude Sonnet 5.5 的适用任务、与 Opus 5.5 的分工及 AWS 上的调用步骤,便于评估部署路径。

9月28日周一
  1. Hugging Face Blog84

    Holo4 发布,面向通用计算机操作智能体

    Holo4 发布 27B dense 和 35B-A3B MoE 两种规格,可通过 GUI、代码、MCP 和 API 操作软件,并在 H Models API 提供服务。Holo4 27B 在 OSWorld 2.0 上得分 61.7%,35B-A3B 得分 30.9%;官方同时发布 Holotron4 Nano、模型权重、训练轨迹和评测成本信息。

    推荐理由:Holo4把 GUI、代码、MCP 和 API 操作整合到同一模型中,并公开轨迹与成本对比,便于评估其在真实工作流中的适用范围。

9月27日周日
9月26日周六
  1. GitHub Blog · AI & ML69

    GitHub Copilot 如何用 canvases 构建自定义工作流

    GitHub Copilot app 支持通过 `/create-canvas` skill 用自然语言创建可定制的 canvas,无需手动编写代码或设计界面。用户和 Agent 可以同时操作共享界面,创建看板、发布清单、问题分流板等工作流,并将其保存为团队共享或个人使用的 extension。

    推荐理由:文章以具体命令演示如何用自然语言创建并迭代 canvas,说明用户与 Agent 可共享状态并协作更新工作流。

9月25日周五
  1. GitHub Blog · AI & ML74

    GitHub Copilot 如何用 canvases 构建聊天之外的交互界面

    GitHub Copilot 介绍 canvases,这类运行在应用内的全栈应用可与智能体双向通信,用于构建 Connect 4、管理本地 Winget 软件包和操作 SQLite 数据库。文章还展示了 canvas 如何支持研究、原型、实现和迭代等开发流程自动化,减少用户持续停留在聊天界面的需要。

    推荐理由:文章通过 Connect 4、SQLite 和开发工作流案例,说明可定制界面如何让 GitHub Copilot 智能体承担更适合自动化的任务。

  2. GitHub Blog · AI & ML83

    GitHub Security Lab 发布 Fuzzing Taskflow 自动化 C/C++ 模糊测试

    GitHub Security Lab 发布基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目自动识别入口、分析构建系统、编写 harness、运行 AFL++、迭代覆盖率并整理崩溃报告。

    推荐理由:文章拆解了从建 harness、覆盖率反馈到崩溃归因的自动化链路,也明确说明了主机执行和模型判断带来的安全边界。

9月24日周四
  1. GitHub Blog · AI & ML82

    GitHub Copilot 重构超大 Pull Request 的渲染体验

    GitHub Copilot 重构了 Pull Request 视图,使包含 2,200 个文件、超过一百万行变更和 400 多条行内评论的大型变更仍能流畅打开和滚动。文章介绍了将确定性代码几何与动态评论块分离、按需测量高度、保持滚动锚定,以及通过缓存和后台处理优化数据管线的方法;团队还使用真实运行信号和自动化测试持续定位性能问题。

    推荐理由:文章拆解了 GitHub Copilot 如何处理超大 Pull Request 的虚拟化、动态测量与滚动锚定,为构建高性能代码审查界面提供了可迁移的工程方法。

9月23日周三
9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML91

    GitHub Copilot 将智能体运行时迁移为 800,000 多行 Rust

    GitHub 将 GitHub Copilot 的智能体运行时从 TypeScript、Node.js 和 V8 重写为超过 800,000 行生产 Rust 代码,主要由 AI 智能体完成,并通过 128 个拉取请求逐步合入。

    推荐理由:文章以 GitHub Copilot 运行时迁移为案例,具体展示了增量重写、并行智能体协作和人工质量把关如何共同支撑大型工程改造。

9月12日周六
  1. GitHub Blog · AI & ML81

    GitHub 如何用 GitHub Copilot 将活动运营自动化

    GitHub 日本和韩国市场的营销负责人介绍了如何用 GitHub Copilot、Issues、Labels 和 GitHub Actions,把活动从规划、报名筛选到会后跟进串成自动化流程。流程通过 API 或 CLI 连接外部工具,以 DRY_RUN、测试套件和代码审查降低风险,并用 SKILL.md 描述可复用的会后操作。文章还提醒,定时自动化必须设置明确的失败告警。

    推荐理由:文章展示了如何用 GitHub Issues、Actions、SKILL.md 和 DRY_RUN 把跨工具的活动运营流程自动化,并保留人工审批与代码审查。

9月11日周五
  1. GitHub Blog · AI & ML68

    GitHub Copilot app 初学者指南:使用 diff、终端和浏览器

    GitHub Copilot app 将 diff、终端和浏览器面板整合在同一处,帮助用户审查 Agent 生成的代码、运行项目并验证界面效果。用户可在 diff 面板接受或评论改动,在终端面板运行命令和 `npm run dev`,再通过浏览器面板测试功能并使用 Pick & Polish 继续调整,完成后直接接受修改并创建 pull request。

    推荐理由:文章把 AI 编码变更的审查、运行和浏览器验证整合为一套流程,适合了解 GitHub Copilot app 如何减少工具切换。

9月10日周四
  1. Hugging Face Blog86

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111 功能集

    Hugging Face 发布 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能,包含 11 条媒体管线和 73 个节点,覆盖文生图、图生图、放大、检测、背景移除及图生视频。

    推荐理由:文章以完整案例展示 Gradio Workflow 如何把多种媒体管线组合为可编辑画布,并自动提供 REST 与 MCP 接口,便于迁移到实际应用。

  2. Hugging Face Blog84

    Hugging Face Jobs 如何用 LoRA 实现跨节点 Async GRPO 训练

    Hugging Face 介绍了在分离机器的 Hugging Face Jobs 上运行 AsyncGRPO 的方案:训练端仅将 LoRA adapter 通过 Storage Bucket 同步到 vLLM,并用代理完成鉴权、KV 前缀路由和多副本广播。

    推荐理由:文章给出了跨 Hugging Face Jobs 部署 AsyncGRPO 与 LoRA 的完整方案,并用多轮指标定位瓶颈和优化路径。

9月9日周三
  1. Mistral AI69

    Mistral AI 如何用 AI 智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将40,000行Fortran 77迁移到C++,对象是没有测试套件和集中式文档的物理密集型储层模拟器。项目先建立数值一致性校验框架并整理代码文档,再由规划、编码、测试和代码质量审查智能体按模块协作,配合人工审核合并。首个冲刺覆盖300,000行代码中的40,000行,团队总结出先建校验框架、先整理文档,以及采用带人工审核门的结构化工作流三项原则。

    推荐理由:文章以40,000行Fortran 77迁移为例,拆解校验、文档整理和人机协作流程,为复杂遗留代码现代化提供可复用方法。

9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 教程:同时运行多个智能体

    GitHub Copilot app 支持通过独立会话和 Git worktrees 同时运行多个智能体任务,彼此不会干扰。每个会话保留自己的上下文,用户可在会话视图中跟踪进度并切换任务。文章以 tailspin-toys 项目为例,演示并行开发 funded sort、进行无障碍审查和运行测试。

9月3日周四
  1. Hugging Face Blog84

    Hugging Face 发布 funes,让编码智能体拥有可迁移的持久记忆

    Hugging Face 发布 funes,为 Claude Code、Codex、pi 和 Hermes 提供基于本地会话轨迹的持久记忆层。funes通过向量与 BM25 搜索、重排序和来源追踪,让智能体可在本机或 Hugging Face 私有数据集中检索原始会话;作者称在 handoff-vs-recall 基准中,recall 的成本分别低至书面交接的 1/8 和 1/4。

    推荐理由:funes把多个编码智能体的会话轨迹转为可检索、可溯源的本地记忆,并支持同步到用户拥有的私有数据集。