8月20日
04:26
03:16
03:16官方账号ElevenLabs@elevenlabsio
Eleven v3对话模型(Eleven v3 Conversational)最新版已全面开放,支持实时语音交互。该模型提供70 + 种语言支持,开发者可通过音频标签实现精细控制。与旧版本相比,新版在多语言语音表现上更具优势。
推荐理由:Eleven发布的v3对话模型,能让开发者做多语言语音项目更灵活,比之前的版本支持的语言种类更多啦。
7月30日
03:44
03:44官方账号xAI@xai
xAI 发布 Grok Voice Think Fast 2.0,专为语音代理设计。该模型在嘈杂环境下能保持清晰听取。它能推理复杂工作流,并生成更自然的对话。相比前代,在实时交互中延迟更低、鲁棒性更强。
事件专题

推荐理由:xAI 出了个新语音模型,专门解决噪声环境下听不清的问题,还能处理复杂任务,适合做语音助手的开发者试试。
03:43
7月28日
7月27日
16:43
16:43官方账号ElevenLabs@elevenlabsio
ElevenLabs 宣布将于 10 月 6 日在印度班加罗尔举办首届峰会。会上将首次展示新语音模型,并深入探讨语音 AI 与智能体(Agent)的发展方向。活动还包括印度团队构建的语音优先 AI 产品的现场演示。这是 ElevenLabs 首次在亚洲举办大型技术峰会。
推荐理由:语音界大动作:ElevenLabs 要在班加罗尔开峰会,10 月 6 日首秀新模型,还有现场 Demo,搞语音和 Agent 的别错过。
7月23日
21:30
7月14日
06:21
06:21官方账号Greg Brockman@gdb
OpenAI推出GPT-Live语音模型,在Kevin Lee的测试中,它能在毫秒内响应,从不打断用户,提供比之前版本更流畅的对话体验。Lee在进行执行教练会话时认为效果惊人。该模型适用于语音交互场景。
事件专题

推荐理由:OpenAI的GPT-Live语音模型体验超棒,反应快且不打断,适合语音交互场景。
7月9日
23:46
23:46官方账号Greg Brockman@gdb
86°
OpenAI发布GPT-Live,一款新一代语音模型,专注于自然流畅的人机对话。该模型即日起在ChatGPT中逐步推出,用户可体验实时语音交互。开发者可通过申请成为设计合作伙伴,使用GPT-Live API创建新应用或集成到现有产品中。OpenAI表示期待该技术为开发者解锁更多创新可能。
事件专题

推荐理由:OpenAI刚刚放出了GPT-Live语音模型,现在就能在ChatGPT里体验,自然对话感很强,还能拿API做开发,语音交互的玩法会更多。
12:28
11:46
11:46AI Will@FinanceYF5
93°
OpenAI 推出 GPT-Live,一款专为语音交互优化的新模型。该模型从今天起在 ChatGPT 中分阶段上线,旨在提升对话的流畅度与自然度。用户可通过声音与模型直接对话,体验更接近真人交流的交互方式。
事件专题

推荐理由:OpenAI 出了个专门的语音模型 GPT-Live,今天开始在 ChatGPT 里逐步推送,聊天能更自然了,试试开声音。
06:44
06:44Aadit Sheth@aaditsh
76°
OpenAI 推出 GPT-Live,一种支持全双工语音交互的模型。在复杂问题上,它会自动委派给 GPT-5.5 处理。OpenAI 内部网络研究基准测试成绩从 0.7% 跃升至 75.2%。有用户接到餐厅确认电话时发现是 AI 并提问测试,AI 直接挂断,表明体验仍有瑕疵。
事件专题

推荐理由:OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
03:28
03:28官方账号OpenAI@OpenAI
OpenAI发布GPT-Live,基于全双工架构设计,支持同时进行语音输入和输出。该模型改变了传统语音助手轮流对话的模式,实现实时自然交互。目前尚未公开具体参数和基准测试结果。
事件专题

推荐理由:GPT-Live能一边听你说话一边回应,聊天不再有等待感,就像和真人对话一样流畅。
02:57
02:57官方一手@OpenAIDevs@OpenAIDevs
83°
OpenAI 宣布 GPT-Live-1 及其轻量版 GPT-Live-1 mini 即将通过 API 向开发者和企业开放。该模型具备实时对话能力,官方称其为当前最智能的语音模型。开发者可通过指定表单注册通知。
事件专题

推荐理由:OpenAI 要把实时语音模型 GPT-Live-1 做成 API 了,开发者和企业能直接集成,不用自己训练。
02:25
02:18
02:18官方账号OpenAI@OpenAI (@OpenAI)
73°
OpenAI 推出 GPT-Live 语音模型,专为提升人机交互自然度而设计。该模型即日起在 ChatGPT 中逐步上线,支持更流畅的对话体验。官方演示视频展示了其逼真的语音响应和情感表达能力。推文获得超 5200 次点赞和 34 万次观看。
事件专题

推荐理由:OpenAI 出了个新语音模型 GPT-Live,今天就能在 ChatGPT 里用,说话更自然更像真人,快去试试吧
02:16
02:16官方一手marktechpost@Michal Sutter
73°
OpenAI 推出新一代语音模型 GPT-Live 和 GPT-Live-1 mini,用于 ChatGPT Voice。GPT-Live 采用全双工架构,能够同时听和说。该模型将搜索与推理任务委托给 GPT-5.5 处理。GPT-Live-1 mini 是轻量版本。
事件专题

推荐理由:OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。
01:04
6月23日
10:35
10:35官方账号arXiv cs.LG@Talia Sternberg, Gallil Maimon, Yossi Adi
该论文分析了来自不同模型族和规模的交错语音文本语言模型,发现它们会在中间层隐式转录语音对应的文本词,其中77%的数据中该文本词出现在Top候选词中。随后模型在文本空间预测下一个词,再转回语音域。研究还表明,交错训练数据和文本LM初始化是诱发该行为的关键,且该行为与口语知识能力相关。
推荐理由:这篇论文让你搞懂语音语言模型内部是怎么偷偷把语音转成文本再推理的,分析得很透彻,适合想深入理解多模态模型原理的人。
6月19日
18:35
18:35官方账号Together AI@togethercompute
Together AI 上线了 Cartesia Sonic 3.5 语音模型,为开发者提供超过150种语音。通过语音查找器,开发者可以试听和比较这些语音,为实时智能体挑选最合适的角色。选定后可直接在 Together AI 平台部署,简化开发流程。

推荐理由:Together AI 集成了 Cartesia Sonic 3.5,有150多种语音可选,做实时语音智能体可以试试这个新库。
6月17日
03:40