做配音或语音应用的可以看下这个 TTS 排行榜,HeyGen 转发的 Artificial Analysis 榜单,各家模型水平一目了然。
#语音合成
HeyGen 第一次做 TTS 就拿下 Elo 1,201 的榜首,价格还比 Eleven v4 便宜一半,做语音客服的可以听听样例对比。
Fish Audio 新出了 Drama 3 语音模型,用大白话就能指挥配音的情绪和节奏,一句话里还能中途换情绪,API 里就能试。
Kokoro-82M 蒸馏出个 8M 参数的小模型,CPU 单线程就能实时跑语音,没 GPU 也能玩,还有在线试听。
Fish Audio 新出的 Drama 3,用大白话就能指挥配音的情绪和节奏,一句台词中间变情绪也不用重录,API 里能直接试。
想本地跑 Qwen3-TTS 流式语音的朋友看这个,部署配置和踩坑都帮你填好了,配合 vllm-omni main 分支直接开跑。
ElevenLabs 出了个便宜一半的 Eleven v4 Turbo,语音质量榜上反超自家老大哥,速度还更快,做语音产品的可以看看价格对比。
ElevenLabs 把自家语音合成做成了 Reader 应用,三端都能用,长文章懒得看可以直接听。
做配音的可以试试,v4 直接在台词里写 [laughs]、[long pause] 这类标注就能控制语气和停顿,不用反复生成了。
ElevenLabs 的 v4 能用 10 秒录音克隆声音,还能在脚本里标注叹气、耳语这些细节,Turbo 版延迟很低,做语音应用的可以试试。
AWS 手把手教程:在 SageMaker 上用 vLLM-Omni 跑 Qwen3-TTS,流式输出语音,想做实时语音应用的可以跟着搭。
ElevenLabs出了v4,配音里能直接标注笑声、耳语这些导演指令,Turbo版延迟只有150毫秒,做实时语音对话的可以看看。
ElevenLabs 新的 Eleven v4 拿了语音合成榜第一,支持 90 多种语言,发音准确率 91.7%,就是价格比 Google 贵不少。
教你用 SageMaker 一键部署阿里开源的 Qwen3-TTS 语音模型,短音频就能克隆音色,还能跨语言保持同一个人声。
Google 刚发了两个 TTS 模型,能用 30 秒音频克隆音色、支持 100 多种语言,做游戏配音或有声书可以试试
谷歌新出的 Gemini 3.8 Flash TTS 能控制语气语调还能克隆声音,中文说得挺好,AI Studio 里免费用,做配音的可以试试。
Google 的 TTS 模型又更新了,发音准确率登顶,多语言表现也不错,做语音相关的可以看看价格和速度对比。
语音合成圈的榜单更新了,Gemini 3.8 Flash TTS 发音准确率干到 89.5%,不过序列和术语两项分别被 SpaceXAI 和 Qwen 的模型拿走,各家各有强项。
Philipp Schmid 演示了 Gemini 3.8 TTS 怎么用 20 秒录音复刻你的声音,或者用提示词造一个全新音色,流程就三步。
Google 新出的 TTS 模型支持 30 秒音频克隆音色,还能让多个角色用不同声音对话,生成 1 分多钟音频只要 2.74 美分。
Google 的 Gemini 3.8 Flash TTS 来了,30 秒音频就能克隆你的声音,还能逐句加笑声叹气,在 Hume 基准上排第一。
Google 在 Gemini API 里开放了逐行调语气的语音生成,能控制节奏、情绪甚至笑声停顿,还自带 SynthID 水印,做语音产品的可以去 AI Studio 试试。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。