Mistral AI 发布 Voxtral TTS 多语言文本转语音模型
Mistral AI 发布 4B 参数的 Voxtral TTS,这是其首个文本转语音模型,支持英语、法语、德语、西班牙语等 9 种语言,并提供情绪表达、低延迟生成和自定义声音适配。
推荐理由:Voxtral TTS同时给出多语言语音生成、低延迟和声音适配细节,并以人工评测呈现其与ElevenLabs模型的对比结果。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Mistral AI 发布 4B 参数的 Voxtral TTS,这是其首个文本转语音模型,支持英语、法语、德语、西班牙语等 9 种语言,并提供情绪表达、低延迟生成和自定义声音适配。
推荐理由:Voxtral TTS同时给出多语言语音生成、低延迟和声音适配细节,并以人工评测呈现其与ElevenLabs模型的对比结果。
Google Research 发布 WAXAL,这是一个覆盖27种撒哈拉以南非洲语言的开放语音数据集,服务于自动语音识别(ASR)和文本转语音(TTS)。首批资源包含约1,846小时转录自然语音和超过565小时高保真录音,覆盖超过100 million speakers,并以 CC-BY-4.0 许可开放。数据由非洲学术与社区组织参与采集,Google 计划持续扩展语言覆盖范围。
推荐理由:WAXAL同时覆盖自然语音识别与高保真语音合成数据,并以开放许可面向27种非洲语言,为低资源语音技术研究提供了可复用基础。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime。
推荐理由:Voxtral Transcribe 2 同时覆盖批量与实时转写,给出延迟、价格、语言支持和部署方式,便于评估不同语音应用的选型空间。
Google发布MedGemma 1.5 4B,扩展对CT、MRI和全切片组织病理图像的支持,并改进胸部X光定位、纵向影像 review、实验室报告提取和医疗文本问答等能力。
推荐理由:Google同时更新了MedGemma的高维医疗影像与文本能力,并发布MedASR,文中的基准数据可帮助开发者比较其适配医疗场景的起点。
Google Research 发布 Massive Sound Embedding Benchmark(MSEB),用于统一评测检索、推理、分类、转录、分割、聚类、重排和重建八类声音理解能力。
推荐理由:MSEB 将语音与生物声学等场景纳入统一评测,并拆分八类能力,帮助比较通用声音表示与专用系统的差距。
Google Research 介绍了一种端到端实时语音到语音翻译模型,可保留原说话者的声音,并将延迟降至 2 秒。该技术已用于 Google Meet 服务器端功能和 Pixel 10 的端侧功能,当前支持英语与西班牙语、德语、法语、意大利语、葡萄牙语之间的翻译。
推荐理由:文章具体说明了端到端语音翻译如何将延迟降至 2 秒,并展示其在 Google Meet 与 Pixel 10 上的落地方式。