Hugging Face 发布 Open TTS Leaderboard,评测多语言 TTS 与语音克隆
Hugging Face 发布 Open TTS Leaderboard,使用 WER/CER、RTFx、TTFA 和说话人相似度等客观指标评测开放式、多语言 TTS 模型。
推荐理由:Hugging Face 将多语言、语音克隆、推理速度与流式延迟纳入统一评测,为开放 TTS 模型提供更可扩展的比较维度。
技术方向
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
4 条精选近 30 天 4 条共收录 5 条
Hugging Face 发布 Open TTS Leaderboard,使用 WER/CER、RTFx、TTFA 和说话人相似度等客观指标评测开放式、多语言 TTS 模型。
推荐理由:Hugging Face 将多语言、语音克隆、推理速度与流式延迟纳入统一评测,为开放 TTS 模型提供更可扩展的比较维度。
Google DeepMind 在 Gemini Enterprise 推出 Gemini 3.8 Live with Live Avatar,为实时对话加入近实时视觉化身。
推荐理由:原文集中说明了 Live Avatar 如何结合近实时视频、语音和后台工具调用,并交代了 97 种语言、定制化身与 SynthID 水印等落地细节。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向创意声音设计与高吞吐、成本高效的语音生成。
推荐理由:原文同时交代两款 TTS 模型的定位、声音定制与逐句导演能力,以及 Google AI Studio 和 Gemini API 的开放入口,便于判断其创作与部署场景。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化语音交互与高复杂度、多步骤推理任务。
推荐理由:原文同时给出两款模型的定位、语音交互能力、基准成绩与开发者和企业端入口,便于比较其适用场景。