#音频模型
共 9 条 · 7 天 0 条 · 30 天 4 条
信息流里打上「音频模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月19日
9月16日
谷歌发布Gemini 3.8 Live音频模型,定价低于OpenAI GPT-Live-1
谷歌新出的Gemini 3.8 Live音频模型,一小时才1.38美元,比OpenAI的GPT-Live-1便宜很多,适合开发者用。
7月23日
DeepgramAI Nova-3和Aura-2在OpenRouter上线
Deepgram的Nova-3做语音转文字、Aura-2做文字转语音,现在都能在OpenRouter上用了,多语言语音库很实用。
6月10日
Gemini 3.5 Live Translate 上线,支持 70+ 语言低延迟翻译
做多语言实时翻译或语音应用的开发者,终于有了一个低延迟、支持 70+ 语言且能自动检测语种的音频模型,值得在 AI Studio 上直接试玩。
6月9日
6月4日
MOSS-Audio开源模型统一语音、音乐、环境音,登顶Hugging Face
做音频Agent或播客工具的开发者终于不用在闭源高价和割裂方案间纠结——MOSS-Audio一个模型搞定语音+声音+音乐,直接本地跑,建议立刻拉下来试试。
5月13日