GPT-Live: OpenAI 推出全双工语音模型,实时对话更自然

OpenAI推出了GPT-Live,一个新的语音模型世代,主打更自然的实时人机对话。 核心升级是全…

精选理由

OpenAI 新出的 GPT-Live 能边听边说,打断处理很自然,适合日常语音交互。

AI 摘要

OpenAI 发布了 GPT-Live,一个基于全双工架构的语音模型,支持边听边说,无需等待用户说完再响应。该模型具备更好的时间感、实时翻译能力和更鲜明的对话人格,可在后台将复杂问题委托给前沿模型处理后自然带回对话。从演示看,对话流畅度和打断处理比之前有明显进步,目标是将语音从辅助输入推向主要交互界面。

原文 · berryxia

OpenAI推出了GPT-Live,一个新的语音模型世代,主打更自然的实时人机对话。 核心升级是全…

OpenAI推出了GPT-Live,一个新的语音模型世代,主打更自然的实时人机对话。

核心升级是全双工架构(full-duplex),模型可以一边听一边说,不用等用户说完再响应。

同时具备更好的时间感、实时翻译能力,以及更鲜明的对话人格。

它还能在后台把复杂问题委托给前沿模型处理,再把结果自然地带回对话里。

从演示来看,对话的流畅度和打断处理比之前有明显进步,目标是让语音交互真正接近人与人之间的自然交流。

这其实是把语音从“辅助输入方式”进一步推向“主要交互界面”的尝试,尤其在移动端和日常使用场景里。