17:13向阳乔木@vista8SeedRealtime 将声音、画面、时序与表达纳入同一个模型,听、看、理解、推理、说话全在一个模型内完成。相比主流多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音)或依赖外置 VAD 的半双工逻辑,SeedRealtime 在连续音视频流上同步进行感知、理解、决策与表达。实测中,用户指着天龙功放按键问“这个怎么弄”,模型能结合画面、手势和视线方向判断指代。据称 OpenAI GPT Live 仍是音频全双工,SeedRealtime 做到了视频、音频、文本的全模态全双工。AI模型SeedRealtimeOpenAI GPT Live多模态5 个信源在谈事件专题推荐理由:SeedRealtime 一个模型同时搞定看和听,你指着东西问它“这个怎么弄”,它能结合手势秒懂,比 GPT Live 多了视频全双工。原文稍后读已读值得跟进有用关注 SeedRealtime