#实时语音
谷歌新出的Gemini 3.8 Live和Extended Thinking,能一边说话一边思考,比如查资料时能同步汇报进度,比普通语音助手更智能。
谷歌发布了Gemini 3.8 Live和Extended Thinking功能,前者在人工分析质量指数上达到82.6分(第一),后者能后台思考并异步调用工具。Gemini 3.8 Live的输入成本为每分钟0.005美元,输出成本为每分钟0.018美元,在τ-banking代理任务完成度上达到35.1分(第一)。
OpenAI 新出的 GPT-Live-1 语音助手,能一边听你说话一边自己说话,还不会停顿,每分钟才 5 毛钱,比之前那些要等一下的语音助手好用多了。
OpenAI 推出了 GPT-Live-1 实时语音模型 API,支持打断处理和工具调用,能帮你快速构建全双工语音应用,比之前的方案更高效。
OpenAI新推Ultrafast,由Cerebras加速,每秒能生成750 tokens,主打实时语音和客服,速度快,试试看。
微软弄了个能边听边说的语音模型MAI Realtime,支持16种语言,还能中途换语言,比Copilot现在的语音更自然。
LiveKit 用 Gemma 4 31B 做实时语音,延迟比 GPT-4.1 低5倍,成本仅六分之一,酒店测试胜出,值得试试。
阿里刚发的Qwen-Audio-3.0-Realtime,实时语音四项升级,又快又聪明,做语音交互项目的可以试试。
阿里新模型Qwen-Audio-3.0-Realtime能实时语音对话、调用工具、感知情绪,语音指令和综合排名都超过了GPT-Realtime-2。
xAI 把 Grok 的实时语音做成 API 了,三个模型直接上 Vercel AI Gateway,AI SDK 7 就能调,做语音应用省大事了。
Anthropic 正在为 Claude 语音模式加入模型选择器,做语音交互应用或重度使用 Claude 语音的用户值得关注,未来可能告别单一 Haiku 限制。
实时语音 AI 终于有了具体可落地的商业场景,做创业或产品经理的可以直接从中找灵感,17 个方向覆盖了从法律到医疗的多个垂直领域,值得收藏研究。
做 Voice Agent 的开发者终于有了开箱即用的集成方案——Agora Skills 配合 Codex 几分钟就能跑通实时语音对话,延迟接近真人通话,建议做陪伴、交互类 Agent 的团队直接试。
实时语音助手开发者终于有了速度最快的 STT 模型——每秒处理 303 秒音频,成本还低,做语音交互的团队可以直接在 Together AI 上试试。