01:15官方账号OpenAI@OpenAI78°OpenAI发布由Cerebras驱动的Ultrafast,生成速度最高达每秒750 tokens。该服务将OpenAI最先进的模型引入实时语音和客户支持等场景。还覆盖商务、编程、设计、金融研究和安全响应等企业工作流。官方称这种高速度能为企业带来可衡量的竞争优势。AI产品OpenAICerebrasUltrafast10 个信源在谈事件专题推荐理由:OpenAI新推Ultrafast,由Cerebras加速,每秒能生成750 tokens,主打实时语音和客服,速度快,试试看。原文稍后读已读值得跟进有用关注 OpenAI
18:53小互@imxiaohu82°OpenAI 复盘了 6 个月内构建 GPT-Live 语音系统的过程。GPT-Live 实现全双工对话,端到端延迟低于 1 秒。系统采用异步委托机制,快路径处理语音,慢路径调用 GPT-5.5 处理复杂逻辑。媒体前端从 Python 迁移到 Go 语言,降低了音频数据包延迟波动。自定义协议 WARP 基于 WebRTC 优化,将连接建立从 6 次网络往返缩减到 1 次。技巧GPT-LiveOpenAIWARP5 个信源在谈事件专题推荐理由:OpenAI 自己拆解了 GPT-Live 怎么做到 1 秒内全双工对话,还开源了 WARP 协议,想搞实时语音的可以看这套架构。原文稍后读已读值得跟进有用关注 GPT-Live
08:17IT之家(博客/媒体)微软正测试其首款原生实时语音模型MAI Realtime,采用全双工交互,可同步聆听和回应,不必等用户说完。该模型支持中文等16种语言,提供Victoria和Grant两种语音风格。测试在MAI Playground平台进行,尚未上线Microsoft Foundry。相比Copilot现有语音模式更自然,但定位仍是对话系统,不支持唱歌或音效。AI模型MAI Realtime微软全双工语音推荐理由:微软弄了个能边听边说的语音模型MAI Realtime,支持16种语言,还能中途换语言,比Copilot现在的语音更自然。原文稍后读已读值得跟进有用关注 MAI Realtime
04:30官方一手OpenAI Blog(博客/媒体)OpenAI用六个月构建了GPT-Live实时语音系统。GPT-Live采用无轮次语音模型,实现了连续语音交互。低延迟架构使得对话响应更迅速,更接近自然交流。OpenAI官方博客公开了这套系统的构建方法与技术细节。AI模型OpenAIGPT-Live语音交互10 个信源在谈事件专题推荐理由:OpenAI搞了个GPT-Live,能连续对话不用等你说完,延迟更低,比传统语音助手自然多了。原文稍后读已读值得跟进有用关注 OpenAI
10:42小互@imxiaohu72°OpenAI 为其编程助手 Codex 推送了实时语音功能,用户可像与 Siri 对话一样让 Codex 执行任务、修改代码或操控电脑。该功能已集成在 Codex 与 ChatGPT Work 中,但部分用户尚未找到入口。有用户反馈额度已耗尽,无法使用新功能。AI产品CodexOpenAI实时语音10 个信源在谈事件专题推荐理由:OpenAI 给 Codex 加上了实时语音,能像说话一样让它改代码、操作电脑,挺实用的。原文稍后读已读值得跟进有用关注 Codex
21:30官方一手歸藏(guizang.ai)@op7418Codex 开发团队核心成员 Tibo 预告即将到来的重要功能更新,重点提及实时语音模式。该模式与移动端刚更新的 ChatGPT 新实时语音模型类似。同时,Opus 5 可能在今晚发布,Codex 的更新被认为是对其的针对性举措。具体上线时间未公布,但已引发广泛关注。AI产品Codex实时语音ChatGPT9 个信源在谈事件专题推荐理由:Codex 马上要推实时语音模式了,跟 ChatGPT 新版语音很像,而且正好撞上 Opus 5 发布,摆明了要抢头条。原文稍后读已读值得跟进有用关注 Codex
20:58@koltregaskes@koltregaskes81°Codex (ChatGPT for Work) 今日推出实时语音模式。泄露的系统指令显示,协调器可动态创建 worker 线程并在任务中途引导它们。这意味着用户将能通过语音与 Codex 实时交互。AI产品CodexChatGPT for Work实时语音10 个信源在谈事件专题推荐理由:ChatGPT for Work 今天加实时语音了,还能动态调度子线程。想试试工作场景下语音交互的别错过。原文稍后读已读值得跟进有用关注 Codex
22:06小互@imxiaohu精选LiveKit 在其推理平台 LiveKit Inference 上推出针对 Google Gemma 4 31B 的优化服务。实时语音场景中,首字延迟低至192毫秒,比GPT-4.1的1006毫秒快5.2倍。成本降低约83%,约为GPT-4.1的六分之一。在酒店前台场景测试中,任务完成率达88%,超过GPT-4.1(73%)和Gemini 2.5 Flash(64%)。AI产品LiveKitGemma 4GPT-4.13 个信源在谈事件专题推荐理由:LiveKit 用 Gemma 4 31B 做实时语音,延迟比 GPT-4.1 低5倍,成本仅六分之一,酒店测试胜出,值得试试。原文稍后读已读值得跟进有用关注 LiveKit
12:27量子位@量子位的朋友们73°阿里发布Qwen-Audio-3.0-Realtime实时语音大模型,升级了实时语音识别、语音唤醒、语音合成、情绪识别四项核心功能。该模型在语音识别延迟上进一步降低,支持更自然的语音交互。相比上一代,Qwen-Audio-3.0-Realtime在唤醒准确率和合成自然度上有显著提升。AI模型Qwen-Audio-3.0-Realtime阿里实时语音推荐理由:阿里刚发的Qwen-Audio-3.0-Realtime,实时语音四项升级,又快又聪明,做语音交互项目的可以试试。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-Realtime
11:32IT之家(博客/媒体)76°阿里巴巴发布Qwen-Audio-3.0-Realtime实时语音交互对话模型,提供推理更强的Plus版本和速度更快的Flash版本。模型在S2S语音指令遵循公开基准VStyle上取得SOTA效果,并在Artificial Analysis子项综合排名第一,超越OpenAI GPT-Realtime-2。支持动态工具调用(如路线规划、信息查询)、音色克隆以及情感感知生成,能根据语境调整语气、节奏和情感。适用于智能客服、教育培训、娱乐互动等场景。AI模型阿里巴巴Qwen-Audio-3.0-Realtime实时语音10 个信源在谈事件专题推荐理由:阿里新模型Qwen-Audio-3.0-Realtime能实时语音对话、调用工具、感知情绪,语音指令和综合排名都超过了GPT-Realtime-2。原文稍后读已读值得跟进有用关注 阿里巴巴
23:23@koltregaskes@koltregaskes73°GPT-Live-1 实时语音模式于今日发布。官方将在2小时内进行直播演示。该模式支持实时语音对话,具体技术细节待直播揭晓。GPT-Live-1 是专注于语音交互的新模型。AI产品GPT-Live-1实时语音语音交互推荐理由:GPT-Live-1 今天发布实时语音模式,马上有直播,可以看看它怎么实现低延迟对话。原文稍后读已读值得跟进有用关注 GPT-Live-1
03:04@koltregaskes@koltregaskesGPT-Bidi(双向实时语音模式)已更名为 GPT-Live。新名称更为简洁。目前尚未公布发布时间表。这一改名表明 OpenAI 仍在推进实时语音功能的开发。AI产品GPT-BidiGPT-LiveOpenAI10 个信源在谈事件专题推荐理由:OpenAI 把 GPT 的实时语音模式改名叫 GPT-Live 了,虽然上线时间没定,但名字好记多了。原文稍后读已读值得跟进有用关注 GPT-Bidi
14:11官方账号xAI@xai精选73°xAI 在 Vercel AI Gateway 中集成了 Grok 的实时语音功能,提供三个模型:xai/grok-voice-think-fast-1.0(实时语音交互)、xai/grok-tts(文本转语音)、xai/grok-stt(语音转文本)。开发者可通过 AI SDK 7 调用这些 API,构建语音应用。该发布使得 Grok 的语音能力首次以 API 形式对外开放。AI产品xAIGrokVercel AI Gateway推荐理由:xAI 把 Grok 的实时语音做成 API 了,三个模型直接上 Vercel AI Gateway,AI SDK 7 就能调,做语音应用省大事了。原文稍后读已读值得跟进有用关注 xAI
13:54@koltregaskes@koltregaskesOpenAI的实时语音模式“Bidi 1”即将推出,目前已在UI中出现但处于隐藏状态。该功能预计在近期内开放给用户使用。消息来自X平台用户爆料。AI产品OpenAIBidi 1实时语音10 个信源在谈事件专题推荐理由:OpenAI马上要出实时语音模式“Bidi 1”了,界面里已经藏着一个彩蛋,很快就能用上。原文稍后读已读值得跟进有用关注 OpenAI
00:13Yangyi@YangyixxxxAnthropic 正在为 Claude 的语音模式准备重大升级,测试版已出现模型选择器和语言选择器。目前无论选择哪个模型,实际都使用 Claude Haiku 4.5,但新功能暗示未来可能支持非 TTS 语音模式。这一变化意味着 Claude 的实时语音交互将更加灵活,用户可自主选择底层模型。对于依赖语音交互的开发者与用户,这可能是提升体验的关键更新。AI产品Claude语音模式模型选择10 个信源在谈事件专题推荐理由:Anthropic 正在为 Claude 语音模式加入模型选择器,做语音交互应用或重度使用 Claude 语音的用户值得关注,未来可能告别单一 Haiku 限制。原文稍后读已读值得跟进有用关注 Claude
19:05AI Will@FinanceYF572°Greg Isenberg 分享了基于 GPT Realtime 2.0 的 17 个创业想法,这些想法只有在实时语音模型支持下才能实现。涵盖实时合同谈判、语音交易终端、多语言同传、医疗问诊、现场服务调度、编程助手、拍卖代理、律师证词准备、播客研究、销售教练、房产评估、智能婴儿监护等场景。核心特点是模型能在对话中并行查询多个数据源、理解专业术语、支持 128K 上下文,并可根据任务复杂度调整推理深度。这些想法展示了实时语音 AI 如何将传统需要多步骤、多工具的任务压缩到一次对话中完成。AI产品GPT Realtime 2.0实时语音创业点子1 个信源在谈事件专题推荐理由:实时语音 AI 终于有了具体可落地的商业场景,做创业或产品经理的可以直接从中找灵感,17 个方向覆盖了从法律到医疗的多个垂直领域,值得收藏研究。原文稍后读已读值得跟进有用关注 GPT Realtime 2.0
08:05shao__meng@shao__meng精选本文介绍了如何通过 Codex 快速安装 Agora Skills,并基于它搭建一个浏览器端的实时语音 AI Agent Demo。整个过程由 Codex 自动完成,从安装到运行仅需几分钟,无需手动编码。Demo 实现了流畅的实时语音对话,响应延迟接近人与人通话水平,RTC/RTM/Conversational AI 启动在 2-3 秒内,语音输出延迟约 1 秒。Agora Skills 集成了 RTC、RTM、Conversational AI 等能力,适合快速验证语音交互场景。AI产品Voice AgentAgora SkillsCodex推荐理由:做 Voice Agent 的开发者终于有了开箱即用的集成方案——Agora Skills 配合 Codex 几分钟就能跑通实时语音对话,延迟接近真人通话,建议做陪伴、交互类 Agent 的团队直接试。原文稍后读已读值得跟进有用关注 Voice Agent
10:48官方一手@OpenAIDevs@OpenAIDevsOpenAI 开发者账号宣布将于5月27日在旧金山举办实时语音演示会,邀请开发者展示使用最新语音模型构建的原型和产品。活动面向有趣、实用、有创意且技术上有雄心的项目,优胜者将有机会登台展示、赢取奖品,并被官方账号和社区投票推荐。这是展示实时语音技术应用的好机会,适合正在探索语音交互的开发者参与。AI产品实时语音OpenAI开发者活动10 个信源在谈事件专题推荐理由:做语音交互或实时对话应用的开发者,这是直接向 OpenAI 团队展示作品、获取曝光和反馈的绝佳机会,值得报名试试。原文稍后读已读值得跟进有用关注 实时语音
09:23官方账号Together AI@togethercomputeTogether AI 的语音转文本(STT)模型在 Artificial Analysis 排行榜上包揽了转写速度的前两名。其中 NVIDIA Parakeet TDT 0.6B V3 排名第一,每秒可处理 303 秒音频,速度最快。该模型每 1000 分钟音频仅需 1.50 美元,在三个真实数据集上的平均词错误率为 4.6%。对于构建实时语音助手的 AI 开发者来说,快速 STT 是核心基础设施,Together AI 的云服务能帮助团队降低转录、推理和响应的整体延迟。AI产品语音转文本Together AINVIDIA Parakeet推荐理由:实时语音助手开发者终于有了速度最快的 STT 模型——每秒处理 303 秒音频,成本还低,做语音交互的团队可以直接在 Together AI 上试试。原文稍后读已读值得跟进有用关注 语音转文本