UK AISI 使用 EvalEval 基础设施开放分享评测结果
UK AI Security Institute(AISI)正在使用 EvalEval 的基础设施,通过 Every Eval Ever schema 和 Evaluation Cards 开放分享可验证的评测结果。
推荐理由:文章展示了如何用统一 schema 和开放 Evaluation Cards 记录评测配置与结果,帮助研究者复核单项研究并比较不同设置下的模型表现。
UK AI Security Institute(AISI)正在使用 EvalEval 的基础设施,通过 Every Eval Ever schema 和 Evaluation Cards 开放分享可验证的评测结果。
推荐理由:文章展示了如何用统一 schema 和开放 Evaluation Cards 记录评测配置与结果,帮助研究者复核单项研究并比较不同设置下的模型表现。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 引入 Hindi 和 Indian English 的 Monsoon 评测集,首批覆盖 Global South 语言。
推荐理由:这项评测把地区、说话人属性和正字法变体纳入公开基准,帮助比较模型在总体 WER 之外的区域差异与识别误差。
Hugging Face 最新研究测试了 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考文本中的错误、补回音频中被静音的数字,或根据数据集线索切换拼写形式。
推荐理由:研究用三项测试量化语音识别模型的基准优化现象,展示公开测试集得分与新音频泛化能力之间的偏差。
DiG-bench 推出包含 70 个隐藏规则游戏的基准,评估 AI 在陌生环境中通过探索发现规则、更新先验的能力;当前 frontier models 仍难以通关,Opus 5 和 Fable 5 表现最佳,GPT-5.5 紧随其后。文章还介绍 Paradigm Research 的 RSI Simulator,以及 Inherent 用开放权重模型构建 AI 科学家 Faraday 的研究。