OpenAI 自己拆解了 GPT-Live 怎么做到 1 秒内全双工对话,还开源了 WARP 协议,想搞实时语音的可以看这套架构。
OpenAI 复盘了 6 个月内构建 GPT-Live 语音系统的过程。GPT-Live 实现全双工对话,端到端延迟低于 1 秒。系统采用异步委托机制,快路径处理语音,慢路径调用 GPT-5.5 处理复杂逻辑。媒体前端从 Python 迁移到 Go 语言,降低了音频数据包延迟波动。自定义协议 WARP 基于 WebRTC 优化,将连接建立从 6 次网络往返缩减到 1 次。
OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的 GPT-Live 是OpenAI 最新一代的语音模型,它摒弃了原有的“轮流检测器”,实现了全双工(Full-d...
OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的 GPT-Live 是OpenAI 最新一代的语音模型,它摒弃了原有的“轮流检测器”,实现了全双工(Full-duplex)——即 AI 可以边听边说,完全模仿真人的对话习惯。 为了做到不到 1 秒的极致超低延迟,OpenAI 在底层技术上做了重磅升级。 “嘴巴”和“大脑”分工合作(异步委托机制): 快路径(前端语音):专门负责“聊天和接话”,把语音数据以极快速度在用户和语音模型间传递。 慢路径(后台大脑):遇到复杂逻辑、搜索或调用工具时,后台会异步请出 GPT-5.5 等超强大模型来思考,思考完再把结果送回语音模型。 重构底层代码与网络传输: 改用 Go 语言:把媒体前端和推理逻辑从 Python 替换为 Go 语言,大大降低了音频数据包的延迟波动。 自定义传输协议 WARP:基于 WebRTC 进行了优化,推出了开源规范 WARP,把原本建立语音连接所需的 6 次网络往返缩减到 1 次(甚至单个 UDP 包就能启动),实现“秒连”。 更详细↓ best.xiaohu.ai/article/openai… 💬 0 🔄 0 ❤️ 4 👀 982 📊 1 ⚡