做配音或语音应用的可以看下这个 TTS 排行榜,HeyGen 转发的 Artificial Analysis 榜单,各家模型水平一目了然。
#TTS
HeyGen 第一次做 TTS 就拿下 Elo 1,201 的榜首,价格还比 Eleven v4 便宜一半,做语音客服的可以听听样例对比。
博主分享了自己做游戏的全流程:Claude 写剧情、Codex 出图、Tripo 建模绑骨骼、小米 TTS 配音,想自己动手做小游戏的话可以照着试。
Fish Audio 新出了 Drama 3 语音模型,用大白话就能指挥配音的情绪和节奏,一句话里还能中途换情绪,API 里就能试。
一个 8.5MB 的 TTS 模型,笔记本 CPU 就能跑,速度是实时的 25 倍,音质只比原版 Kokoro 低一点,还开源了代码和音频样本。
ElevenLabs 出了个便宜一半的 Eleven v4 Turbo,语音质量榜上反超自家老大哥,速度还更快,做语音产品的可以看看价格对比。
有人晒了一条 Gemini 3.8 Flash TTS 的提示词,指定百年前慢速英音配音,还能让子 Agent 循环打磨,搞音频生成的可以抄走试试。
ElevenLabs 新语音模型来了,写台词时直接标注情绪、停顿、笑声就能让声音照着演,Turbo 版首次出声只要 150ms 左右,做播客和实时对话的可以试试。
做配音的可以试试,v4 直接在台词里写 [laughs]、[long pause] 这类标注就能控制语气和停顿,不用反复生成了。
有人用 Opus 做了个上下五千年视频,本地 TTS 效果太差,准备换成 Gemini 3.8 TTS,想搭类似工作流的可以看看。
ElevenLabs出了v4,配音里能直接标注笑声、耳语这些导演指令,Turbo版延迟只有150毫秒,做实时语音对话的可以看看。
ElevenLabs 新的 Eleven v4 拿了语音合成榜第一,支持 90 多种语言,发音准确率 91.7%,就是价格比 Google 贵不少。
这篇不聊概念,讲一个真实上线的阿拉伯语语音产品怎么搭:6 个 MCP 服务器做检索、自训的 6B 路由模型和 TTS 都开源了,做语音 Agent 的能抄不少作业。
NotebookLM 升级了 Gemini 3.8 TTS,中文终于自然了,推文还顺带整理了四套 AI 做视频的完整路线,做知识类视频的可以直接抄作业。
谷歌新出的 Gemini 3.8 Flash TTS 能控制语气语调还能克隆声音,中文说得挺好,AI Studio 里免费用,做配音的可以试试。
Google 的 TTS 模型又更新了,发音准确率登顶,多语言表现也不错,做语音相关的可以看看价格和速度对比。
语音合成圈的榜单更新了,Gemini 3.8 Flash TTS 发音准确率干到 89.5%,不过序列和术语两项分别被 SpaceXAI 和 Qwen 的模型拿走,各家各有强项。
Google 把 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 开放进 AI Studio 和 API 了,能自定义声音、写剧本让两个角色对话,做配音的可以去试试。
Google 出了两款新 TTS 模型,Gemini 3.8 Flash TTS 主打表现力,做配音或语音交互的可以上 AI Studio 先试试效果。
Gemini 3.8 的语音合成变便宜了,能一次生成多人对话,2000 多种声音可选还能克隆,Simon Willison 已经拿来做 demo 玩了。
Google 新出的 TTS 模型支持 30 秒音频克隆音色,还能让多个角色用不同声音对话,生成 1 分多钟音频只要 2.74 美分。
Google 新出的 Gemini 3.8 Flash TTS 能用一句话描述就造出音色,还能一段剧本生成双人对话,做播客和配音的可以试试。
Google 的 Gemini 3.8 Flash TTS 来了,30 秒音频就能克隆你的声音,还能逐句加笑声叹气,在 Hume 基准上排第一。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。
Google 的 Gemini 3.8 Flash 和 Flash-Lite 语音模型今天开始上线,开发者直接在 Gemini API 里调用,NotebookLM 和 Google Vids 也同步集成了。
Google 新出的 Gemini 3.8 Flash 语音模型,2000 多个音色支持 100 种语言,还能克隆声音,Hume 基准第一名。
Google 出了两个新 TTS 模型,Gemini 3.8 Flash TTS 和 Flash-Lite 版,语音更有表现力,去 AI Studio 就能试,做语音应用的可玩玩。
谷歌新出的两款 TTS 模型能逐行控制台词语气,还能用 30 秒录音复制声音,做播客有声书的朋友可以去 AI Studio 试试。
Qwen 一次发了五款语音模型,能识别方言、区分多个说话人还能标注情绪,价格还砍了 95%,做语音应用的可以看看。
阿里 Qwen 把语音识别、合成、实时对话打包成五个模型一起发,ASR 最高打 0.5 折,做播客或有声书的可以试试 TTS-Next。