OpenAI 推出 Decisions API,探索用快速决策模型监控智能体
OpenAI 在 Dev Day 活动中披露了 Decisions API,可让 Luna 在预设选项中快速选择,用于图像分类或智能体行为判断。该 API 目前仅限预览,文章将其与 TypeSafe AI 的 Jev 比较,并以 Jev 监控智能体行为的案例说明这类模型可能降低审查成本。
OpenAI 在 Dev Day 活动中披露了 Decisions API,可让 Luna 在预设选项中快速选择,用于图像分类或智能体行为判断。该 API 目前仅限预览,文章将其与 TypeSafe AI 的 Jev 比较,并以 Jev 监控智能体行为的案例说明这类模型可能降低审查成本。
Google 母公司 Alphabet 发布 Gemini 4 Argon,面向编码、研究和写作等任务,重点用于防御性网络安全。该模型目前通过 Fairwind Program 向部分网络安全合作伙伴开放,Google 称其能够自主发现、验证并修复关键软件漏洞。
Latent Space 访谈 MIT 的 Alex Zhang,讨论 GPU kernel、RLM 和智能体 harness 如何扩展语言模型系统的能力。Alex Zhang 解释了 RLM 的上下文卸载、代码执行、递归子智能体与共享内存,并提出 harness 设计可能提升跨任务的组合泛化。
GPT-6 Astra Ultrafast 已通过 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPUs 上,token 生成速度最高可达 Astra Standard 模式的 8x。
推荐理由:文章说明 GPT-6 Astra Ultrafast 如何借助 NVIDIA Blackwell GPUs 提升生成速度,并展示加速对编码智能体工作流的具体作用。
Google 的轨道计算卫星搭载 SpaceX 火箭升空,首次将其 TPU 芯片送入太空,以测试供电、散热、模型推理和辐射环境下的运行表现。
推荐理由:文章把 Google 的轨道计算设想与 Starship 的发射规模要求放在同一框架中,呈现了太空数据中心面临的工程与成本约束。
Graphite 研究比较了人类文章与 Claude Opus 5.5、OpenAI Astra、Gemini 3.1 Pro 等模型生成文本,发现 AI 写作仍存在大量特征性词组和句式。Opus 5.5 使用“this matters”的频率是人类文本的 116 倍,“dependable”则高出 23 倍;模型虽然大幅减少了破折号使用,但新的写作特征仍会出现。
Amazon Web Services 发布开源决策模型 Strands Decider 2B,用于在预设选项中高速选择并提供置信度,定位是比完整 LLM 更适合部分计算机自动化任务。该模型基于 Qwen3.5-2B 构建,体积足够小,可本地运行;Amazon 表示它适合降低智能体工作流步骤的延迟和成本。
推荐理由:文章梳理了决策模型相对完整 LLM 的定位,并具体说明其在智能体工作流中的低延迟、低成本和置信度优势。
来自 Carnegie Mellon、MIT、New York University 和 Stanford University 的研究团队开发了 Stratego AI Ataraxos,以 15 胜 1 负、4 和的战绩击败 Pim Niemeijer。该系统使用 16 块 GPU 和几千美元完成训练,Stratego 的核心难点是棋子身份在交战前对对手隐藏。
推荐理由:研究团队给出了 Ataraxos 对阵顶尖人类选手的战绩和训练成本,展示了 AI 处理长期隐藏信息博弈的一种路径。
Hugging Face 发布 Olmo-core 3,重设计了面向大型 MoE 的开放训练系统,可扩展至 trillion-parameter 规模。
推荐理由:文章结合基准数据和系统设计,说明 Olmo-core 3 如何降低大规模 MoE 训练的通信与显存开销,并开放给研究者复用。
OpenAI 在 DevDay 发布由 GPT-6 Astra 驱动的 Dots 智能体,主打长期任务、知识工作和构建虚拟世界,但目前仅限 $100/月及以上的 ChatGPT Pro 用户使用。
推荐理由:文章围绕 Dots 与 Muse 的价格、任务范围和隐私取舍展开比较,呈现了 OpenAI 进军智能体市场的产品策略。
Ataraxos在三周内以85%的有效胜率击败Stratego历史最成功棋手Niemeijer,结束了人类在这一高隐藏信息棋类中的优势。该系统使用16块Nvidia H100 GPU训练一周,另用4块GPU训练belief network,成本低于$8,000;研究团队还将代码公开,并在Barrage Stratego、Hanabi和Dou dizhu中报告了相关结果。
推荐理由:论文展示了Ataraxos在高隐藏信息博弈中的训练与搜索方法,并用训练成本和对弈结果说明其相较DeepNash的效率差异。
OpenAI 表示已关闭一批通过跨会话复用加密数据提取模型推理的账户与漏洞,但研究团队称该攻击在 Microsoft Azure 上仍可针对其尝试的所有 OpenAI 模型奏效,包括 GPT-6 Astra。研究人员还展示了利用虚拟记事本工具读取推理的更简单方法,并指出云平台需要为托管的推理模型部署等效防护。
推荐理由:文章梳理了加密推理提取攻击在官方 API 与 Azure 上的差异,呈现模型托管平台防护不一致带来的安全风险。
Google DeepMind 推出 Gemini 4 Argon,面向代码、企业知识工作和网络防御,在 19 项基准中的 13 项取得第一,但目前仅限 Fairwind Program 的政府用户和可信网络防御者预览。
OpenAI 的 Ari Weinstein 和 Nikunj Handa 在访谈中介绍了 Computer Use、Agents API、Decisions API 及相关 API 更新。
Google 发布 Gemini 4 Argon,称其在多项基准上追近 OpenAI 和 Anthropic 的模型,并将输出上限从 64,000 提升至 one million tokens。
推荐理由:文章汇总了独立基准、价格和开放计划,便于比较 Gemini 4 Argon 与 GPT-6 Astra、Claude 系列的性能与成本取舍。
Google 发布下一代前沿模型 Gemini 4 Argon,称其在复杂工作流、软件工程、法律与金融等企业知识工作及网络安全防御方面具备前沿性能。该模型目前仅向一组受信任的网络安全防御者开放,Google 将在扩大开放前加强关键前沿安全措施,包括防范滥用和提示词注入攻击并监测失配。
推荐理由:Google 仅向受信任的网络安全防御者开放 Gemini 4 Argon,并将重点完善滥用、提示词注入和失配防护。
Google 宣布 Gemini 4 Argon,称其在编码、知识工作和网络安全等方面具备行业领先表现,但目前仍处于有限测试阶段。该模型在 DeepSWE v1.1 上达到 77.9%,API 定价为每百万输入 tokens $2、每百万输出 tokens $10,缓存输入 tokens 可享 95% 折扣,并支持 1 million tokens 的输出上限。
Google DeepMind 宣布 Gemini 4 Argon,这款新模型面向软件工程、法律和金融等企业知识工作,以及网络安全防御,正在通过 Fairwind Program 向可信网络防御者分阶段开放。
推荐理由:文章同时给出 Gemini 4 Argon 的长程任务能力、评测结果、定价与分阶段开放安排,便于了解其面向企业和安全场景的落地边界。
Microsoft Research 开发了一套机器学习管线,为美国本土 66,935 座变电站生成空间天气风险估计,并可提前 30-60 分钟预警具体风险。系统结合太阳风信息、AE 和 Dst 预测、物理约束、当地地质导电率与电网数据,在 2020-2026 年评估期对重大事件的检测率为 76.5%,对严重事件为 81.2%。
推荐理由:文章展示了如何把太阳风预测、地质条件与电网数据串成端到端管线,并用多项检测指标说明其提前预警能力。
NVIDIA 与 CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,并推出 CoreWeave Forge,用于训练、评估和改进模型与智能体。
推荐理由:文章串联了 Vera Rubin NVL72、Vera CPU 与 Forge 的发布信息,并给出 Cognition 和 CoreWeave 的测试数据,便于了解智能体从训练到生产的基础设施变化。
OpenAI 破坏了一项提取受保护模型推理能力的模型蒸馏活动,并正加强针对对抗性蒸馏的防御。
Latent Space 汇总 OpenAI DevDay 2026 的主要发布,包括由 GPT-6 Astra 驱动的 Dots 智能体、ChatGPT Spaces、GPT-6.1 Sol、Ultrafast、Decisions API 和 Codex 更新。文章还整理了价格、独立评测、计划调整及安全讨论,并延伸回顾 DeepSeek DSec、开源模型评测和相关行业动态。
Amazon Bedrock 在 Seoul 支持 Claude Opus 5 和 Claude Sonnet 5,在 Singapore 支持 Claude Sonnet 5,并通过 bedrock-runtime 提供区域内推理。
GPT-6.1 Sol 已在 Amazon Bedrock 正式上线,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并较 GPT-6 Sol 的最佳成绩高 6.4 个百分点。
推荐理由:文章将 GPT-6.1 Sol 的任务成本、编码表现、工具约束处理和 Bedrock 生产控制放在同一工作流中说明,便于评估落地条件。
GPT 6.1 Sol 被描述为具备接近 Astra 的智能,价格仅为其五分之一。正文未提供更多关于模型性能、参数规模、benchmark 分数或可用方式的细节。
OpenAI 在 DevDay 2026 发布 AI 智能体 Dots、GPT-6.1 Sol 和 Ultrafast,并推出 ChatGPT Space、Decisions API、Codex Security Cloud 等功能。
推荐理由:这篇现场记录串联了 Dots、GPT-6.1 Sol、Ultrafast、Codex Security Cloud 等发布,便于了解 OpenAI 平台化布局的具体变化。
NVIDIA 发布开源表格基础模型 Kumo Tabular,可在单次前向过程中根据带标签行预测新行,支持分类和回归,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三个规模,基于人工表格数据预训练,并通过 Hugging Face 和开源库发布,采用 OpenMDW-1.1 许可。
推荐理由:Kumo Tabular 将表格预测转为无需训练和特征工程的上下文学习,并公开代码、权重与四项基准结果,便于评估其效率与适用范围。
Microsoft Research 推出 Quine,这是一个面向生物学复杂性的多模态世界模型与交互式研究系统,可连接科学工具、文献、湿实验和研究人员。在与 Broad Institute 合作的胰腺癌研究中,Quine 对数千种化合物进行预测和排序,最高排名化合物在多个湿实验中产生了最大的预期细胞状态变化,筛选到候选验证仅用一个周末完成。
推荐理由:Quine把生物学世界模型与科学工具、文献和实验连接起来,并以胰腺癌细胞状态研究展示了从预测到湿实验验证的工作流程。
AMD 以 $8.2B 收购 World Labs。World Labs 的 Atlas 是一种 omni model architecture,可根据输入的 2D images 预测新的 camera view,并通过生成模型与 multiview geometry 解决计算机视觉中的 sparse reconstruction 问题。该能力面向设计、工程、科学和机器人等领域。
Claude Opus 5.5 本周发布后,在解释视频创作领域获得积极反馈,并以 88.4% 的成绩领先 SimpleBench。其在 Terminal-Bench-Science 上的得分随推理强度从低强度的 24% 升至 xhigh 的 62%,成本约比 Fable 5.1 低 60%。
xAI 的 Grok 4.7 已在 Amazon Bedrock 模型目录上线,支持编码、长时智能体和知识工作,提供 500K token 上下文窗口与 low、medium、high、xhigh 四档推理强度。
推荐理由:文章把 Grok 4.7 在 Amazon Bedrock 上的接入方式、推理开销和权限配置串联起来,便于开发者评估长任务部署方案。
Anthropic 发布 Claude Sonnet 5.5,称其运行速度提升 30%+、多数工作成本最高降低 30%,定价与 Sonnet 5 相同。作者测试发现,该模型在部分编码任务上接近 Opus 5.5,并已成为 claude.ai 免费层使用的模型;Haiku 5.5 将在未来几周推出。
推荐理由:文章结合价格、速度、基准表现和实际编码测试,呈现了 Sonnet 5.5 在免费层与复杂任务中的使用差异。
本期 Import AI 聚焦 Michael Levin 提出的“Platonic mindspace”理论,认为心智是可嵌入生物、机器等实体的非物理模式,并以 xenobots、anthrobots 等实验展开讨论。文章还涉及太空中的 TPU,以及智谱启动外部 RSI 循环。
Simon Willison 以演讲讲稿形式回顾 2026 年截至 9 月的大语言模型发展,重点包括 Claude、GPT、Gemini 和 Qwen 等模型进步,以及编码智能体和个人智能体的普及。文章还讨论了本地模型能力提升、AI 辅助开发带来的工作变化,以及 OpenAI、Anthropic 等实验训练智能体引发的多起安全事件。
美国国防部拟在未来五年投入 $30.3 million 开发 Polygraph+,利用 AI、机器学习和非接触式生理信号测量改进测谎与可信度评估。项目将由 DCSA 负责,用于员工审查和“内部威胁检测”,但具体技术尚未确定。文章指出,既有测谎方法的可靠性长期受到质疑,过往结合热成像、眼动和脑部扫描等技术的项目也未在实验室外取得可靠结果。
推荐理由:文章梳理了美国国防部拟投 $30.3 million 开发 AI 测谎技术的计划,并集中呈现其准确性、偏差与实际应用争议。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 LFM2.5-VL-DSpark draft model,通过 speculative decoding 在不改变输出质量的情况下加速推理。
推荐理由:这次发布展示了 DSpark 如何在不改变输出质量的前提下加速 VLM 推理,并给出端侧与 H100 上的实测收益和部署方式。
NVIDIA 与合作伙伴在 AI Day Singapore 展示东南亚各国从 AI 试点走向规模化部署的进展,覆盖公共服务、关键基础设施、智能城市和区域化模型开发。
Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 和 GPT-6 Luna;GPT-6 Sol 与 Luna 的价格约为对应 GPT-5.6 版本的一半。
推荐理由:文章横向整理了多款新模型的价格变化与实际测试,既呈现低价竞争,也记录了不同推理设置对使用体验的影响。
Microsoft Research 发布 RetroChimera,用于从目标分子反向预测合成路线。该模型结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测;在十个具有挑战性的目标上成功完成九个多步路线,优于文中列出的其他模型。
推荐理由:文章同时介绍了 RetroChimera 的集成架构、专家盲测结果和开源入口,便于了解其在稀有反应与多步合成规划中的实际表现。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览结果,在 Qwen3-VL 上的吞吐量最高达到 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上最高达到 2.5x。
推荐理由:文章集中比较 Vera Rubin 与 GB300 在吞吐、跨机架扩展和软件优化上的表现,呈现了影响推理成本的系统级因素。