13:55官方一手marktechpost@Michal Sutter精选字节跳动Seed团队发布SeedRealtime,一款原生音视频全双工大语言模型。该模型在统一架构中融合音频、视频与文本,可对连续多模态流进行实时交互,而非逐轮问答。官方宣称三项突破,包括联合音视频理解。Seed表示这是迈向全模态交互的一步。AI模型SeedRealtime字节跳动多模态3 个信源在谈事件专题推荐理由:SeedRealtime一个模型能看能听能说,实时双向对话不轮流,字节跳动Seed出品。原文稍后读已读值得跟进有用关注 SeedRealtime
17:13向阳乔木@vista8SeedRealtime 将声音、画面、时序与表达纳入同一个模型,听、看、理解、推理、说话全在一个模型内完成。相比主流多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音)或依赖外置 VAD 的半双工逻辑,SeedRealtime 在连续音视频流上同步进行感知、理解、决策与表达。实测中,用户指着天龙功放按键问“这个怎么弄”,模型能结合画面、手势和视线方向判断指代。据称 OpenAI GPT Live 仍是音频全双工,SeedRealtime 做到了视频、音频、文本的全模态全双工。AI模型SeedRealtimeOpenAI GPT Live多模态10 个信源在谈事件专题推荐理由:SeedRealtime 一个模型同时搞定看和听,你指着东西问它“这个怎么弄”,它能结合手势秒懂,比 GPT Live 多了视频全双工。原文稍后读已读值得跟进有用关注 SeedRealtime
18:53小互@imxiaohu82°OpenAI 复盘了 6 个月内构建 GPT-Live 语音系统的过程。GPT-Live 实现全双工对话,端到端延迟低于 1 秒。系统采用异步委托机制,快路径处理语音,慢路径调用 GPT-5.5 处理复杂逻辑。媒体前端从 Python 迁移到 Go 语言,降低了音频数据包延迟波动。自定义协议 WARP 基于 WebRTC 优化,将连接建立从 6 次网络往返缩减到 1 次。技巧GPT-LiveOpenAIWARP5 个信源在谈事件专题推荐理由:OpenAI 自己拆解了 GPT-Live 怎么做到 1 秒内全双工对话,还开源了 WARP 协议,想搞实时语音的可以看这套架构。原文稍后读已读值得跟进有用关注 GPT-Live
13:47宝玉@dotey76°OpenAI 今天发布 GPT-Live,采用全双工架构(full-duplex),允许模型一边听一边说,每秒多次交互决策。两个型号 GPT-Live-1 和 GPT-Live-1 mini 分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。GPT-Live 将语音交互层与推理层分离,日常对话自处理,复杂任务后台调用 GPT-5.5。用户端提供 Instant、Medium、High 三档推理强度,九个语音角色重新录制,并支持天气、股票等可视化卡片。上线首日用户反馈显示“mhmm”等自然回应词过于频繁让人反感,印地语实时翻译演示也被吐槽口音和措辞问题。AI模型GPT-LiveOpenAI全双工10 个信源在谈事件专题推荐理由:OpenAI 把 ChatGPT 语音升级成全双工了,能一边听你说话一边插嘴,同传演示挺惊艳。就是刚上线有人嫌它“嗯嗯”太吵,你可以试试调低推理强度或者换语音角色。原文稍后读已读值得跟进有用关注 GPT-Live
08:36berryxia@berryxia86°OpenAI 发布了 GPT-Live,一个基于全双工架构的语音模型,支持边听边说,无需等待用户说完再响应。该模型具备更好的时间感、实时翻译能力和更鲜明的对话人格,可在后台将复杂问题委托给前沿模型处理后自然带回对话。从演示看,对话流畅度和打断处理比之前有明显进步,目标是将语音从辅助输入推向主要交互界面。AI模型GPT-LiveOpenAI全双工10 个信源在谈事件专题推荐理由:OpenAI 新出的 GPT-Live 能边听边说,打断处理很自然,适合日常语音交互。原文稍后读已读值得跟进有用关注 GPT-Live
08:16orange.ai@oran_geGPT Live 发布,采用全双工架构实现同时听说能力。在同传翻译场景中,反应速度超越人类基准。该模型可用于实时语音对话和交互。AI模型GPT Live全双工实时对话推荐理由:GPT Live能一边听你说话一边回应,反应比人类还快,翻译对话都超自然。原文稍后读已读值得跟进有用关注 GPT Live
06:43IT之家(博客/媒体)74°OpenAI 发布 GPT-Live 系列全双工语音模型,包括 GPT-Live-1 和 GPT-Live-1 mini 两个版本。该模型可同时聆听与说话,每秒多次判断是否说话、打断或调用工具。复杂任务会委托给 GPT-5.5 系列后台执行。相比 Advanced Voice Mode,在 5-10 分钟对话中 GPT-Live-1 偏好得分更高。每周超 1.5 亿人使用 ChatGPT 语音交互。AI模型GPT-Live-1GPT-Live-1 miniOpenAI10 个信源在谈事件专题推荐理由:OpenAI 这次把语音交互做得更自然了,GPT-Live 系列能边听边说,还能打断和调用工具,比以前的 Advanced Voice Mode 流畅很多。原文稍后读已读值得跟进有用关注 GPT-Live-1
02:28The Rundown AI@therundownai88°OpenAI发布GPT-Live,采用全双工架构,能连续处理输入而非前代的轮次模型。演示显示对话流畅无中断,支持在后台调用其他模型协作。还展示了实时翻译能力,能同时听、处理、输出。ChatGPT的语音对话因此获得重大升级。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI新语音模型GPT-Live,对话超流畅,还能同时翻译,比老版本自然多了。原文稍后读已读值得跟进有用关注 GPT-Live
14:36小互@imxiaohu豆包实时语音模型3.0 API 正式上线,支持全双工模式,可同时听和说并随时插话。采用端到端语音进语音出,无需转录,响应更快更自然。模型能精准遵循指令,例如在多人聊天中设定规则后静待话题出现再参与。支持自定义工具调用,可在实时对话中完成预定日历、发邮件、总结文档等任务,向语音 Agent 迈进。AI模型豆包实时语音模型3.0全双工推荐理由:豆包出了3.0语音模型,能同时听说、随时插话,还能在对话里调工具办事情,比传统语音助手强一大截。原文稍后读已读值得跟进有用关注 豆包
12:44官方账号John Schulman@johnschulman2精选Thinky 团队分享了全双工多模态模型的研究成果,该模型支持实时、自然的交互,同时不牺牲智能水平。创始人 John Schulman 指出,人机协作能力在 AI 领域常被低估,因为其评估难度高于智能或自主性。他们认为未来每个 AI 系统都将以交互模型作为面向用户的外层,持续了解用户意图并保持信息同步。这项技术有望推动 AI 从单向输出转向双向对话式协作。AI模型全双工多模态模型实时交互推荐理由:全双工交互解决了 AI 对话中“你说我听”的延迟感,做实时语音/视频助手或协作工具的团队可以直接参考——Thinky 把自然交互和智能水平平衡好了。原文稍后读已读值得跟进有用关注 全双工
02:34rohanpaul_ai@rohanpaul_ai78°OpenBMB 发布 MiniCPM-o 4.5,一个 9B 参数的全双工多模态模型,能同时看、听、说。它基于 Omni-Flow 框架,将交互视为连续时间流,打破传统轮询式对话,实现实时感知与响应。该模型在语音生成质量上超越 Qwen3-Omni-30B-A3B,且支持 12GB RAM 边缘部署。这标志着 AI 交互层从“对讲机”模式迈向自然对话的关键一步。AI模型MiniCPM-o 4.5全双工多模态推荐理由:做多模态 AI 交互的开发者终于有了可部署的全双工开源方案——MiniCPM-o 4.5 把实时语音视频对话从概念变成 9B 模型,值得直接上手试。原文稍后读已读值得跟进有用关注 MiniCPM-o 4.5