跳到正文

#Hugging Face

今日 1 条
今天10月2日周五
  1. Hugging Face Blog77

    ServiceNow CoreAI 发布 AutoSynthData,用模型失败生成企业智能体训练数据

    ServiceNow CoreAI 介绍 AutoSynthData,通过目标模型的失败和更强教师模型的成功,生成、验证并迭代企业智能体训练任务。该流程在 EnterpriseOps Gym Hybrid 环境中生成 2,000 个合成样本,使 Gemma-4-26B-A4B-it 的平均 Pass@1 提升 7.2 个百分点,验证器成功率从 63.01% 升至 68.55%。

    推荐理由:文章给出了从模型失败中生成、验证并迭代训练任务的完整流程,并用 EnterpriseOps Gym 实验展示了合成数据对智能体训练的影响。

9月30日周三
  1. Hugging Face Blog75

    Hugging Face 发布开放 TTS Leaderboard,评估多语言语音合成与语音克隆

    Hugging Face 发布 Open TTS Leaderboard,面向开源和多语言 TTS 模型,通过 WER、CER、RTFx、TTFA 和说话人相似度等指标进行评估。截至 Sep 30, 2026,Hugging Face Hub 上已有超过 8K 个 TTS 模型;榜单还提供试听投票、多语言切换、语音克隆和 H200 GPU、CPU 流式性能比较,后续将开源评测脚本。

    推荐理由:Hugging Face 将客观指标与试听投票结合,覆盖多语言、语音克隆和流式性能,为开放 TTS 模型提供了更可扩展的比较框架。

9月29日周二
  1. Hugging Face Blog66

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 面向使用 MCP 多工具的 LLM 智能体,逐条检查回答中的事实是否由回答所指向的正确来源支持,而不是只判断事实是否存在于汇总证据中。

    推荐理由:论文展示了在 MCP 多源场景中保留来源身份的验证方法,并用医疗智能体数据说明它如何减少错引来源,同时暴露相似来源区分的难点。

9月22日周二
9月16日周三
9月2日周三
  1. Hugging Face Blog69

    BenchMIRT:LLM 基准测试究竟测量了什么?

    Allen Institute 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试的方法。它基于 100 个 LLM、16 个基准和超过 34K 道题的结果,独立识别出安全与通用推理两个主要维度,并发现 BBQ、WMDP 等基准的得分可能混合了不同能力信号。

    推荐理由:BenchMIRT 将多维 IRT 应用于 100 个 LLM 和 34K 多道题,展示了如何拆解基准分数中的推理与安全信号。

8月28日周五
8月25日周二
  1. Hugging Face Blog82

    Quantization-Aware Healing 让压缩后的 4-bit GPT-OSS 60B 在 9 项基准中 7 项超过 BF16 版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4,使 4-bit 模型在 9 项基准中的 7 项超过同架构的 60B bfloat16 版本。

    推荐理由:论文通过 GPT-OSS 120B 压缩实验和 QAH、QAT 对照,具体展示了 4-bit 模型恢复精度与训练稳定性的路径。

8月21日周五
  1. Hugging Face Blog75

    Hugging Face 研究量化语音识别中的基准优化

    Hugging Face 最新研究测试了 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考文本中的错误、补回音频中被静音的数字,或根据数据集线索切换拼写形式。

    推荐理由:研究用三项测试量化语音识别模型的基准优化现象,展示公开测试集得分与新音频泛化能力之间的偏差。

8月19日周三
  1. Hugging Face Blog75

    ALTK-Evolve 研究智能体需要多少记忆

    Hugging Face Blog 介绍 ALTK-Evolve 在八个模型上的评估,发现智能体记忆需要按模型能力校准,而不是一味累积。gpt-oss-120b 使用精选检索后任务完成率提升 +16.1pp,token 开销仅增加 +5%;DeepSeek-V3.2 使用完整指南集后任务完成率提升 +9.5pp,GLM-5 则未见可测增益。

    推荐理由:文章用八个模型和 AppWorld 结果比较记忆注入策略,具体展示了不同能力模型如何校准记忆规模与推理成本。

8月13日周四
8月11日周二
  1. Hugging Face Blog80

    ALTK-Evolve 对比 ACE:用选择性记忆投递降低智能体推理成本

    Hugging Face Blog 介绍 ALTK-Evolve,并将其与 ACE 在 AppWorld 上进行对比。两者都从智能体历史轨迹中提取可复用经验而不更新模型权重,但 ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力选择性投递 guidelines。

    推荐理由:文章对比了两种智能体记忆的构建与投递方式,并用 AppWorld 数据展示选择性检索如何在保持效果的同时减少推理 token。

8月10日周一
  1. Hugging Face Blog66

    论文提出高效知识蒸馏方法,降低长上下文训练显存与成本

    Multiverse Computing 的论文提出离线 top-K logits 缓存与融合分块 KL loss,使知识蒸馏无需同时驻留 teacher 和 student,并避免构建完整词表与序列的 logits 矩阵。

    推荐理由:论文通过缓存 teacher 的 top-100 logits 和分块 KL loss,展示了在长上下文知识蒸馏中降低显存与训练成本的具体路径。

7月15日周三
  1. Hugging Face Blog76

    Hugging Face 发布 Real World VoiceEQ,评估语音 AI 的人类化交互质量

    Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音系统识别、生成和响应语气、情绪、说话人身份及背景信息的能力。该基准覆盖 40 多个语音模型、15+ 个评估维度和 60 多项指标,并基于超过 1 million 条人工评分构建。研究发现,不同模型在技术准确性、情绪理解、对话智能、表现力和鲁棒性上各有侧重,传统基准可能高估真实对话表现,人工听评仍不可替代。

    推荐理由:Real World VoiceEQ 将语音交互拆分为多项能力并引入大规模人工评分,为理解模型在情绪、身份和真实环境中的差异提供了更贴近使用场景的测量框架。

7月1日周三
  1. Hugging Face Blog72

    ScarfBench 发布企业 Java 框架迁移基准,评估 AI 智能体的构建、部署与行为保持能力

    ScarfBench 是一个面向企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、204 个迁移任务和 1,331 个专家编写的测试。

    推荐理由:ScarfBench把企业 Java 框架迁移拆解为构建、部署和行为验证,为比较编码智能体的真实现代化能力提供了可复用基准。

6月30日周二