#语音智能体
ElevenLabs 给 ElevenAgents 加了个 Architect,说句话或打几个字就能帮你搭、调语音智能体,做客服或外呼的团队可以试试。
OpenAI 官方转发了一家叫 Proaction 的团队,用 GPT-Live-1 做语音智能体打电话约车辆保养,真人兜底,这种落地方式可以参考。
Proaction 拿 Codex 加语音智能体做车队运营的定制演示,案例里写了怎么用 OpenAI API 搭起来,做演示的人可以参考
Vapi 这个语音智能体平台一年要接 10 亿次电话,客户有 Amazon 和 Uber,两个创始人聊了他们换过十几个方向才走到今天的故事。
OpenAI 给 ChatGPT 手机版加了语音智能体,动动嘴就能写邮件、做 PPT、总结 Slack 消息,Plus 用户还能手机电脑接力干活。
SpaceXAI发布了Grok Voice Think Fast 2.0,可通过API或Agent Builder使用,构建和部署语音智能体,功能强大,值得一试。
想看语音智能体怎么调试?这个演示用 Google ADK + Gemini Live,再用 LangSmith 看清楚工具调用和 token 花费,直观。
做语音智能体怕出问题?LangSmith 直接帮你追踪 pipecat、livekit、OpenAI Realtime 和 Gemini 这四个框架的生产数据,调试延迟和错误就靠它了。
Together AI 搞了个语音智能体 demo,能边看屏幕边说话,用了 Parakeet、MiniMax Speech 2.8 和 M3,实时性很强。
客服自动化在交通行业落地了——Trainline 用语音智能体处理退款,做客户服务或票务系统的团队值得关注这个实际用例。
语音智能体开发者可以直接用 GBrain 快速搭建基于 Gemini Live 的语音交互系统,开源且功能完整,值得一试。
想快速上手语音智能体开发的开发者,这个教程直接给你一条捷径——用Claude Code和AssemblyAI的API,省去拼接12个组件的麻烦,建议跟着视频实操一遍。
做语音助手或客服机器人的开发者,现在可以用一条提示词把聊天智能体变成语音智能体,省去集成多个模型的麻烦,值得直接上手试。
做教育科技或语音交互的团队值得关注——ElevenLabs 把历史人物语音化,让学习从单向阅读变成双向对话,直接可用的场景比想象中多。
做语音智能体或对话系统的团队终于有了一个能同时测准确性和体验感的基准——EVA-Bench 覆盖了企业场景和噪声鲁棒性,直接帮你对比不同架构的优劣,建议点开看看具体指标设计。
语音智能体开发者终于有了一个生产级模型——Gemini 3.1 Flash Live 在复杂函数调用和长时推理上表现领先,做语音交互的团队可以直接上手试试。