SeedRealtime 一个模型同时搞定看和听,你指着东西问它“这个怎么弄”,它能结合手势秒懂,比 GPT Live 多了视频全双工。
SeedRealtime 将声音、画面、时序与表达纳入同一个模型,听、看、理解、推理、说话全在一个模型内完成。相比主流多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音)或依赖外置 VAD 的半双工逻辑,SeedRealtime 在连续音视频流上同步进行感知、理解、决策与表达。实测中,用户指着天龙功放按键问“这个怎么弄”,模型能结合画面、手势和视线方向判断指代。据称 OpenAI GPT Live 仍是音频全双工,SeedRealtime 做到了视频、音频、文本的全模态全双工。
SeedRealtime,一个能看懂画面、理解手势、识别物品的全模态全双工交互模型。 现有主流音视频实时交互,要么是多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音),延迟层层叠加,信...
SeedRealtime,一个能看懂画面、理解手势、识别物品的全模态全双工交互模型。 现有主流音视频实时交互,要么是多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音),延迟层层叠加,信息逐级损耗。要么号称端到端,但轮次判断仍然依赖外置 VAD 模块,本质上还是一问一答的半双工逻辑。 用户说话的时候,模型在等。模型说话的时候,用户也在等。 SeedRealtime 将声音、画面、时序与表达纳入到同一个模型实时决策,听、看、理解、推理、说话全在一个模型里。在连续音视频流上,感知、理解、决策与表达同步进行,使听到的和看到的能够参与每次的实时判断。 比如当用户说"这个怎么弄","这个"是什么?在纯语音系统,问题无解。 在 SeedRealtime 里,模型会结合当前画面、用户的手势、视线方向和历史操作,判断"这个"的具体指向。 当遇到同音词或语音模糊时,也能借助视觉场景消除歧义。 这里可以看我的实测,手指着天龙功放按键,模型理解回答,很自然。 据说 OpenAI GPT Live 也只是音频全双工,SeedRealtime 则是全模态(视频、音频、文本)全双工,强啊! Your browser does not support the video tag. 🔗 View on Twitter 💬 0 🔄 0 ❤️ 1 👀 631 ⚡