跳到正文

#编码

今日 2 条
今天10月2日周五
  1. NVIDIA Blog87

    GPT-6 Astra Ultrafast 借助 NVIDIA Blackwell GPUs 加速生成

    GPT-6 Astra Ultrafast 已通过 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPUs 上,token 生成速度最高可达 Astra Standard 模式的 8x。

    推荐理由:文章说明 GPT-6 Astra Ultrafast 如何借助 NVIDIA Blackwell GPUs 提升生成速度,并展示加速对编码智能体工作流的具体作用。

10月1日周四
  1. The Verge · AI88

    Google 发布 Gemini 4 Argon,暂限受信任的网络安全防御者使用

    Google 发布下一代前沿模型 Gemini 4 Argon,称其在复杂工作流、软件工程、法律与金融等企业知识工作及网络安全防御方面具备前沿性能。该模型目前仅向一组受信任的网络安全防御者开放,Google 将在扩大开放前加强关键前沿安全措施,包括防范滥用和提示词注入攻击并监测失配。

    推荐理由:Google 仅向受信任的网络安全防御者开放 Gemini 4 Argon,并将重点完善滥用、提示词注入和失配防护。

  2. Ars Technica · AI72

    Google 发布 Gemini 4 Argon,但暂未向公众开放

    Google 宣布 Gemini 4 Argon,称其在编码、知识工作和网络安全等方面具备行业领先表现,但目前仍处于有限测试阶段。该模型在 DeepSWE v1.1 上达到 77.9%,API 定价为每百万输入 tokens $2、每百万输出 tokens $10,缓存输入 tokens 可享 95% 折扣,并支持 1 million tokens 的输出上限。

  3. Google DeepMind90

    Google DeepMind 发布 Gemini 4 Argon,强化长程推理与网络安全防御

    Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。

    推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。

9月30日周三
  1. AWS Machine Learning Blog87

    GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 已在 Amazon Bedrock 正式上线,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并较 GPT-6 Sol 的最佳成绩高 6.4 个百分点。

    推荐理由:文章将 GPT-6.1 Sol 的任务成本、编码表现、工具约束处理和 Bedrock 生产控制放在同一工作流中说明,便于评估落地条件。

9月29日周二
  1. AWS Machine Learning Blog82

    Grok 4.7 现已在 Amazon Bedrock 上线

    xAI 的 Grok 4.7 已在 Amazon Bedrock 模型目录上线,支持编码、长时智能体和知识工作,提供 500K token 上下文窗口与 low、medium、high、xhigh 四档推理强度。

    推荐理由:文章把 Grok 4.7 在 Amazon Bedrock 上的接入方式、推理开销和权限配置串联起来,便于开发者评估长任务部署方案。

  2. Simon Willison85

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,称其运行速度提升 30%+、多数工作成本最高降低 30%,定价与 Sonnet 5 相同。作者测试发现,该模型在部分编码任务上接近 Opus 5.5,并已成为 claude.ai 免费层使用的模型;Haiku 5.5 将在未来几周推出。

    推荐理由:文章结合价格、速度、基准表现和实际编码测试,呈现了 Sonnet 5.5 在免费层与复杂任务中的使用差异。

  3. AWS Machine Learning Blog75

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供。该模型面向范围明确的编码与知识工作,强调更快速度和大多数任务更低的单任务成本,并支持 AWS 的数据驻留、权限、审计与监控控制。

    推荐理由:文章同时给出 Claude Sonnet 5.5 的适用任务、与 Opus 5.5 的分工及 AWS 上的调用步骤,便于评估部署路径。

9月28日周一
  1. Hugging Face Blog84

    Holo4 发布,面向通用计算机操作智能体

    Holo4 发布 27B dense 和 35B-A3B MoE 两种规格,可通过 GUI、代码、MCP 和 API 操作软件,并在 H Models API 提供服务。Holo4 27B 在 OSWorld 2.0 上得分 61.7%,35B-A3B 得分 30.9%;官方同时发布 Holotron4 Nano、模型权重、训练轨迹和评测成本信息。

    推荐理由:Holo4把 GUI、代码、MCP 和 API 操作整合到同一模型中,并公开轨迹与成本对比,便于评估其在真实工作流中的适用范围。

9月3日周四
  1. Google DeepMind91

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码、智能体任务与多步推理,后者面向漏洞发现和自动修复。

    推荐理由:Gemini 3.8 将通用推理编码与网络安全能力拆分为两个版本,并给出价格、基准和实际使用案例,便于比较其适用场景与成本。

8月25日周二
  1. Hugging Face Blog85

    Granite 4.2 推理模型家族构建方法解析

    IBM Granite Team 介绍 Granite 4.2 推理模型家族的构建过程,模型分为 3B、8B 和 30B 三种规模,均基于 Granite-4.1 基座模型进行后训练。

    推荐理由:文章系统梳理了 Granite 4.2 从预训练、SFT 到多阶段 RL 的构建流程,并说明不同规模模型的智能体训练差异。

8月14日周五
7月21日周二
7月17日周五
7月2日周四
5月16日周六
  1. Google DeepMind91

    Google DeepMind 发布 Gemini 3.5 Flash,主打前沿智能与行动能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,面向智能体和编码任务,已通过 Gemini 应用、Google Search 的 AI Mode 及多项开发者和企业平台提供。

    推荐理由:Gemini 3.5 Flash 将智能体、编码速度与安全训练放在同一发布中,并给出基准结果和面向个人、开发者及企业的开放入口。

3月17日周二
  1. Mistral AI82

    Mistral AI 发布开源 Leanstral 代码智能体

    Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码智能体,采用 6B active parameters,支持在形式化代码仓库中生成并验证证明。

    推荐理由:Leanstral把Lean 4形式化证明引入代码智能体,并用FLTEval比较性能与成本,呈现了可复用的验证式编程路径。

12月9日周二
  1. Mistral AI87

    Mistral AI 发布 Devstral 2 与 Mistral Vibe CLI

    Mistral AI 发布 Devstral 2 系列编码模型和 Mistral Vibe CLI。Devstral 2 为 123B 参数模型,在 SWE-bench Verified 上 đạt 72.2%,Devstral Small 2 为 24B 参数模型,得分 68.0%,支持 API、本地部署和微调。

    推荐理由:Devstral 2 同时覆盖大规模部署与本地运行场景,并配套 Vibe CLI,材料还提供了 SWE-bench Verified 成绩、许可方式和 API 定价,便于比较其性能与使用门槛。