主要来源向阳乔木
查看原文事件专题 · 多源确认
SeedRealtime 全模态全双工模型:看懂画面、理解手势
SeedRealtime 将声音、画面、时序与表达纳入同一个模型,听、看、理解、推理、说话全在一个模型内完成。相比主流多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音)或依赖外置 VAD 的半双工逻辑,SeedRealtime 在连续音视频流上同步进行感知、理解、决策与表达。实测中,用户指着天龙功放按键问“这个怎么弄”,模型能结合画面、手势和视线方向判断指代。据称 OpenAI GPT Live 仍是音频全双工,SeedRealtime 做到了视频、音频、文本的全模态全双工。
当前结论
SeedRealtime 一个模型同时搞定看和听,你指着东西问它“这个怎么弄”,它能结合手势秒懂,比 GPT Live 多了视频全双工。
6 个信源53° AI 热度最后更新 2026/8/6 08:14:40
证据链
相关来源 1小互
查看原文相关来源 2IT之家
查看原文相关来源 3Gary Marcus
查看原文相关来源 4ChatGPT
查看原文相关来源 5pandaily
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。