UK AISI 使用 EvalEval 基础设施开放分享评测结果
UK AI Security Institute(AISI)正在使用 EvalEval 的基础设施,通过 Every Eval Ever schema 和 Evaluation Cards 开放分享可验证的评测结果。
推荐理由:文章展示了如何用统一 schema 和开放 Evaluation Cards 记录评测配置与结果,帮助研究者复核单项研究并比较不同设置下的模型表现。
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
UK AI Security Institute(AISI)正在使用 EvalEval 的基础设施,通过 Every Eval Ever schema 和 Evaluation Cards 开放分享可验证的评测结果。
推荐理由:文章展示了如何用统一 schema 和开放 Evaluation Cards 记录评测配置与结果,帮助研究者复核单项研究并比较不同设置下的模型表现。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 引入 Hindi 和 Indian English 的 Monsoon 评测集,首批覆盖 Global South 语言。
推荐理由:这项评测把地区、说话人属性和正字法变体纳入公开基准,帮助比较模型在总体 WER 之外的区域差异与识别误差。
Hugging Face 最新研究测试了 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考文本中的错误、补回音频中被静音的数字,或根据数据集线索切换拼写形式。
推荐理由:研究用三项测试量化语音识别模型的基准优化现象,展示公开测试集得分与新音频泛化能力之间的偏差。
Hugging Face 宣布 Community Evals 与 Every Eval Ever(EEE)实现互通,可将 EEE 评测记录转换为模型页面所需的 YAML,并同步到模型页面和基准排行榜。
推荐理由:Hugging Face 将 Community Evals 与 EEE 互通,既把评测分数带到模型页面,也保留可追溯的完整记录和复现信息。