跳到正文

#语音

今日 0 条
9月30日周三
  1. Hugging Face Blog75

    Hugging Face 发布开放 TTS Leaderboard,评估多语言语音合成与语音克隆

    Hugging Face 发布 Open TTS Leaderboard,面向开源和多语言 TTS 模型,通过 WER、CER、RTFx、TTFA 和说话人相似度等指标进行评估。截至 Sep 30, 2026,Hugging Face Hub 上已有超过 8K 个 TTS 模型;榜单还提供试听投票、多语言切换、语音克隆和 H200 GPU、CPU 流式性能比较,后续将开源评测脚本。

    推荐理由:Hugging Face 将客观指标与试听投票结合,覆盖多语言、语音克隆和流式性能,为开放 TTS 模型提供了更可扩展的比较框架。

8月28日周五
8月21日周五
  1. Hugging Face Blog75

    Hugging Face 研究量化语音识别中的基准优化

    Hugging Face 最新研究测试了 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考文本中的错误、补回音频中被静音的数字,或根据数据集线索切换拼写形式。

    推荐理由:研究用三项测试量化语音识别模型的基准优化现象,展示公开测试集得分与新音频泛化能力之间的偏差。

7月15日周三
  1. Hugging Face Blog76

    Hugging Face 发布 Real World VoiceEQ,评估语音 AI 的人类化交互质量

    Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音系统识别、生成和响应语气、情绪、说话人身份及背景信息的能力。该基准覆盖 40 多个语音模型、15+ 个评估维度和 60 多项指标,并基于超过 1 million 条人工评分构建。研究发现,不同模型在技术准确性、情绪理解、对话智能、表现力和鲁棒性上各有侧重,传统基准可能高估真实对话表现,人工听评仍不可替代。

    推荐理由:Real World VoiceEQ 将语音交互拆分为多项能力并引入大规模人工评分,为理解模型在情绪、身份和真实环境中的差异提供了更贴近使用场景的测量框架。

3月7日周六
  1. Google Research79

    Google Research 发布 WAXAL:覆盖27种非洲语言的开放语音资源

    Google Research 发布 WAXAL,这是一个覆盖27种撒哈拉以南非洲语言的开放语音数据集,服务于自动语音识别(ASR)和文本转语音(TTS)。首批资源包含约1,846小时转录自然语音和超过565小时高保真录音,覆盖超过100 million speakers,并以 CC-BY-4.0 许可开放。数据由非洲学术与社区组织参与采集,Google 计划持续扩展语言覆盖范围。

    推荐理由:WAXAL同时覆盖自然语音识别与高保真语音合成数据,并以开放许可面向27种非洲语言,为低资源语音技术研究提供了可复用基础。