跳到正文

#编码

今日 0 条
8月25日周二
  1. Hugging Face Blog82

    Quantization-Aware Healing 让压缩后的 4-bit GPT-OSS 60B 在 9 项基准中 7 项超过 BF16 版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4,使 4-bit 模型在 9 项基准中的 7 项超过同架构的 60B bfloat16 版本。

    推荐理由:论文通过 GPT-OSS 120B 压缩实验和 QAH、QAT 对照,具体展示了 4-bit 模型恢复精度与训练稳定性的路径。

8月24日周一
  1. Import AI46

    Import AI 470:机器没有权利;SPADE 自动生成训练环境;Hawkeye 改进 GPU kernels

    METR 研究显示,AI 对网络安全漏洞发现带来显著加速,对数学研究仅有有限加速,而 AI 研究算法进展尚无可测量加速。SPADE 通过 LLM 自博弈交替生成可执行环境和解决任务,使用 Qwen3-4B-Instruct-2507、Qwen3-8B 与 Qwen3-30B-A3B-Instruct-2507 测试,在游戏环境中取得 58.3 的套件平均分,较基础模型高 8.1。

8月17日周一
  1. Import AI45

    Import AI 469:DiG-bench 测试 AI 的科学发现能力,RSI Simulator 模拟递归自我改进

    DiG-bench 推出包含 70 个隐藏规则游戏的基准,评估 AI 在陌生环境中通过探索发现规则、更新先验的能力;当前 frontier models 仍难以通关,Opus 5 和 Fable 5 表现最佳,GPT-5.5 紧随其后。文章还介绍 Paradigm Research 的 RSI Simulator,以及 Inherent 用开放权重模型构建 AI 科学家 Faraday 的研究。

7月26日周日
  1. Berkeley AI Research77

    ABBEL:教大语言模型更新信念以实现高效长时交互

    Berkeley AI Research 提出 ABBEL,通过自然语言信念状态替代完整交互历史,并用 belief grading 监督信念内容,以降低长时交互的上下文记忆开销。

    推荐理由:ABBEL 将长交互中的摘要建模为可监督的自然语言信念状态,并用重构评分提升记忆效率,为协作编码等低数据场景提供了可迁移的训练思路。

7月1日周三
  1. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。