04:26Fish Audio@FishAudioS2.1 Pro Free成为OpenRouter平台上语音模型第一,上周请求达104万次,较一周前增长413%,领先谷歌、微软等多家公司模型。AI模型S2.1 Pro FreeOpenRouter语音模型推荐理由:鱼音频发布了S2.1 Pro Free,成了OpenRouter上语音模型第一,比谷歌等公司模型都强。原文稍后读已读值得跟进有用关注 S2.1 Pro Free
03:16官方账号ElevenLabs@elevenlabsioEleven v3对话模型(Eleven v3 Conversational)最新版已全面开放,支持实时语音交互。该模型提供70 + 种语言支持,开发者可通过音频标签实现精细控制。与旧版本相比,新版在多语言语音表现上更具优势。AI产品Eleven v3Conversational多语言语音推荐理由:Eleven发布的v3对话模型,能让开发者做多语言语音项目更灵活,比之前的版本支持的语言种类更多啦。原文稍后读已读值得跟进有用关注 Eleven v3
05:13Lenny Rachitsky@lennysan精选Wispr Flow 完成 2.8 亿美元 B 轮融资,估值达 20 亿美元,由 Menlo Ventures 领投。公司同步预览首个自研语音模型 Canto,该模型为 2B 参数,针对嘈杂房间、刮风街道等真实场景训练。Canto 将用于改进 Flow 的听写功能,后续迭代版本也会陆续推出。这笔资金将投向产品、实验室、模型和团队建设,加速语音交互落地。行业Wispr FlowCantoMenlo Ventures推荐理由:Wispr Flow 融了 2.8 亿美元,还放出自研语音模型 Canto,专门对付嘈杂环境,听写会更准,Flow 用户值得关注。原文稍后读已读值得跟进有用关注 Wispr Flow
21:32IT之家(博客/媒体)据虎嗅8月5日消息,阶跃星辰内部确立两条战略线:一条以大模型为核心,另一条以智能体终端为核心。手机业务被放入一家新公司独立运营,目前仅为初步探索。阶跃正搭建海外商业化团队,计划以语音模型为主销售大模型API,并同时推进大模型和手机进入海外市场。7月13日,阶跃发布终端品牌STEPX,首款智能体手机STEPX Neo搭载Step AOS系统,首批生态伙伴包括美团、WPS、剪映、携程等。行业阶跃星辰STEPXSTEPX Neo推荐理由:阶跃星辰把手机业务拆出来独立运营,还要用语音模型API打海外市场,STEPX Neo手机同步出海,两条线一起走。原文稍后读已读值得跟进有用关注 阶跃星辰
22:50techcrunch@Marina TemkinSmallest.ai 宣布完成1300万美元融资。该公司正在研发超低延迟的语音模型,目标是让AI打电话时听起来像真人。其技术试图让AI语音通过图灵测试,即人类无法分辨对话对象是机器。这笔资金将用于扩大团队并加速语音模型的迭代。行业Smallest.ai语音模型图灵测试推荐理由:Smallest.ai拿了1300万美元做超快语音AI,目标是让AI打电话像真人一样,连图灵测试都要过,挺有意思。原文稍后读已读值得跟进有用关注 Smallest.ai
09:40IT之家(博客/媒体)Sarvam AI 在首届 Sarvam Epoch 会议上宣布将开发万亿参数级模型,预计未来六个月内完成。该公司现有 105B 模型表现不错,语音模型据称性价比优于全球竞争者。Sarvam AI 还发布 Bulbul V4 文本转语音模型和 Saaras V4 多说话人语音识别模型,并计划在美国设办事处吸引印度裔 AI 人才。新模型将面向编程、网络安全、科学研究等领域与领先模型竞争。AI模型Sarvam AIBulbul V4Saaras V4推荐理由:Sarvam AI 要搞万亿参数模型,还发布了两个语音新模型,目标对标编程和科研领域。原文稍后读已读值得跟进有用关注 Sarvam AI
13:59IT之家(博客/媒体)72°SpaceXAI发布Grok Voice Think Fast 2.0语音模型,每分钟音频费用0.08美元。该模型在AA Speech-to-Speech Quality Index达82.9%,较1.0版提升7.2个百分点。xAI内部评估显示,转录表现较Deepgram Nova 3和ElevenLabs Scribe v2提升1.5-2.0倍,较1.0版提升1.4倍。在背景噪声场景下,与专用语音转文字模型的差距可扩大至约10倍。模型支持24种语言,可在说话时同步完成推理。AI模型Grok Voice Think Fast 2.0SpaceXAIDeepgram Nova 31 个信源在谈事件专题推荐理由:SpaceXAI刚发的Grok Voice Think Fast 2.0,语音转语音又快又准,一分钟才8分钱,比上一代强了一大截,还支持24种语言,适合做语音助手。原文稍后读已读值得跟进有用关注 Grok Voice Think Fast 2.0
03:44官方账号xAI@xaixAI 发布 Grok Voice Think Fast 2.0,专为语音代理设计。该模型在嘈杂环境下能保持清晰听取。它能推理复杂工作流,并生成更自然的对话。相比前代,在实时交互中延迟更低、鲁棒性更强。AI模型Grok VoicexAI语音模型1 个信源在谈事件专题推荐理由:xAI 出了个新语音模型,专门解决噪声环境下听不清的问题,还能处理复杂任务,适合做语音助手的开发者试试。原文稍后读已读值得跟进有用关注 Grok Voice
03:43官方账号xAI@xai75°xAI发布了Grok Voice Think Fast 2.0语音模型,这是其下一代语音模型。该模型在智能水平、转录准确性和对话能力上均有提升。它专为更自然的人机语音交互设计。AI模型语音模型xAIGrok Voice Think Fast 2.01 个信源在谈事件专题推荐理由:xAI新版语音模型,对话更聪明、转写更准,适合语音交互场景。原文稍后读已读值得跟进有用关注 语音模型
02:14官方账号OpenAI@OpenAI81°OpenAI 发布了 GPT-Live 新型语音模型,旨在实现更自然的人机语音交互。即日起,ChatGPT 的教育版(Edu)、企业版(Enterprise)和商业版(Business)用户可在全球范围使用该功能。GPT-Live 能够实时响应用户语音,支持多轮对话,并优化了情感表达和语调自然度。AI产品GPT-LiveChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI 把 GPT-Live 语音模型推给教育、企业、商业用户了,对话更自然,跟真人聊天差不多,赶紧试试。原文稍后读已读值得跟进有用关注 GPT-Live
16:43官方账号ElevenLabs@elevenlabsioElevenLabs 宣布将于 10 月 6 日在印度班加罗尔举办首届峰会。会上将首次展示新语音模型,并深入探讨语音 AI 与智能体(Agent)的发展方向。活动还包括印度团队构建的语音优先 AI 产品的现场演示。这是 ElevenLabs 首次在亚洲举办大型技术峰会。AI模型ElevenLabs语音模型智能体推荐理由:语音界大动作:ElevenLabs 要在班加罗尔开峰会,10 月 6 日首秀新模型,还有现场 Demo,搞语音和 Agent 的别错过。原文稍后读已读值得跟进有用关注 ElevenLabs
08:03IT之家(博客/媒体)82°微软7月23日推出两款自研模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,进入公开预览。MAI-Image-2.5-Pro是微软精度最高的图像模型,文本输入每百万tokens 5美元,图像输出每百万tokens 106美元。MAI-Voice-2-Flash速度比MAI-Voice-2提升2倍,成本降低32%,定价每百万字符15美元。两款模型已用于Bing Image Creator、PowerPoint和OneDrive,其中MAI-Image-2.5相比GPT-Image-2降低GPU成本84%。MAI-Voice-2-Flash已接入Dynamics 365 Contact Center,可降低GPU成本89%。AI模型MAI-Image-2.5-ProMAI-Voice-2-Flash微软2 个信源在谈事件专题推荐理由:微软自己训练的新图像和语音模型,不用别人蒸馏,已经在Bing和PPT里用了,GPU成本降了八成多,价格也公开了。原文稍后读已读值得跟进有用关注 MAI-Image-2.5-Pro
01:20Mustafa Suleyman@mustafasuleyman72°微软发布MAI-Voice-2-Flash,相比MAI-Voice-2推理速度快2倍。定价为每100万字符15美元,成本降低32%。该模型已集成到Dynamics 365 Contact Center,可为呼叫中心减少高达89%的GPU成本。目前处于公开预览阶段。AI模型MAI-Voice-2-FlashMicrosoftDynamics 365推荐理由:微软新语音模型MAI-Voice-2-Flash,跑得快还便宜32%,支撑企业呼叫中心,GPU成本能砍89%。原文稍后读已读值得跟进有用关注 MAI-Voice-2-Flash
21:30官方一手歸藏(guizang.ai)@op7418Codex 开发团队核心成员 Tibo 预告即将到来的重要功能更新,重点提及实时语音模式。该模式与移动端刚更新的 ChatGPT 新实时语音模型类似。同时,Opus 5 可能在今晚发布,Codex 的更新被认为是对其的针对性举措。具体上线时间未公布,但已引发广泛关注。AI产品Codex实时语音ChatGPT9 个信源在谈事件专题推荐理由:Codex 马上要推实时语音模式了,跟 ChatGPT 新版语音很像,而且正好撞上 Opus 5 发布,摆明了要抢头条。原文稍后读已读值得跟进有用关注 Codex
06:22官方账号Sam Altman@samaOpenAI CEO Sam Altman在X平台发推表示,他目前与ChatGPT语音对话的频率已超过打字输入,认为新语音模型“真正跨过了一个门槛”。该推文获得987条评论、4823个点赞和25.6万次阅读,显示用户对语音交互体验的强烈关注。OpenAI此前在ChatGPT中推出了Advanced Voice Mode,支持更自然的对话、识别语气和情绪。Altman的发言暗示语音模型的延迟、自然度和可用性已达到质变点。AI产品ChatGPTOpenAI语音模型10 个信源在谈事件专题推荐理由:Sam Altman自己都说跟ChatGPT说话比打字多了,说明语音模型真的变好用了,你可以试试看。原文稍后读已读值得跟进有用关注 ChatGPT
06:21官方账号Greg Brockman@gdbOpenAI推出GPT-Live语音模型,在Kevin Lee的测试中,它能在毫秒内响应,从不打断用户,提供比之前版本更流畅的对话体验。Lee在进行执行教练会话时认为效果惊人。该模型适用于语音交互场景。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI的GPT-Live语音模型体验超棒,反应快且不打断,适合语音交互场景。原文稍后读已读值得跟进有用关注 GPT-Live
23:46官方账号Greg Brockman@gdb86°OpenAI发布GPT-Live,一款新一代语音模型,专注于自然流畅的人机对话。该模型即日起在ChatGPT中逐步推出,用户可体验实时语音交互。开发者可通过申请成为设计合作伙伴,使用GPT-Live API创建新应用或集成到现有产品中。OpenAI表示期待该技术为开发者解锁更多创新可能。AI模型GPT-LiveOpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI刚刚放出了GPT-Live语音模型,现在就能在ChatGPT里体验,自然对话感很强,还能拿API做开发,语音交互的玩法会更多。原文稍后读已读值得跟进有用关注 GPT-Live
23:02小互@imxiaohu78°OpenAI发布GPT-Live语音模型,采用全双工架构实现边听边说的自然对话。遇到复杂任务时可实时切换至后台GPT-5.5推理模型,对话不中断。在人工评测中,GPT-Live-1和mini均优于Advanced Voice Mode,并在GPQA、BrowseComp、τ³-Voice Telecom三项基准上超越后者。新增天气/股票/体育等可视卡片及可调推理强度(Instant/Medium/High)。针对语音场景加强了自伤、情感依赖等安全防护。AI模型GPT-LiveGPT-5.5OpenAI10 个信源在谈事件专题推荐理由:OpenAI出了个GPT-Live,能边听边说实时纠正语法,还能调后台GPT-5.5推理,比Siri强多了。原文稍后读已读值得跟进有用关注 GPT-Live
13:47宝玉@dotey76°OpenAI 今天发布 GPT-Live,采用全双工架构(full-duplex),允许模型一边听一边说,每秒多次交互决策。两个型号 GPT-Live-1 和 GPT-Live-1 mini 分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。GPT-Live 将语音交互层与推理层分离,日常对话自处理,复杂任务后台调用 GPT-5.5。用户端提供 Instant、Medium、High 三档推理强度,九个语音角色重新录制,并支持天气、股票等可视化卡片。上线首日用户反馈显示“mhmm”等自然回应词过于频繁让人反感,印地语实时翻译演示也被吐槽口音和措辞问题。AI模型GPT-LiveOpenAI全双工10 个信源在谈事件专题推荐理由:OpenAI 把 ChatGPT 语音升级成全双工了,能一边听你说话一边插嘴,同传演示挺惊艳。就是刚上线有人嫌它“嗯嗯”太吵,你可以试试调低推理强度或者换语音角色。原文稍后读已读值得跟进有用关注 GPT-Live
12:28官方账号Sam Altman@sama87°OpenAI发布GPT-Live,新一代语音模型,专注于自然的人机语音交互。该模型于今天开始在ChatGPT中逐步推出,用户可在ChatGPT中体验更流畅的对话式语音交流。目前尚未公布具体的性能基准数据或支持的语种范围。AI模型GPT-LiveOpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI今天上线了GPT-Live语音模型,在ChatGPT里就能直接用,对话更自然了。原文稍后读已读值得跟进有用关注 GPT-Live
11:46AI Will@FinanceYF593°OpenAI 推出 GPT-Live,一款专为语音交互优化的新模型。该模型从今天起在 ChatGPT 中分阶段上线,旨在提升对话的流畅度与自然度。用户可通过声音与模型直接对话,体验更接近真人交流的交互方式。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI 出了个专门的语音模型 GPT-Live,今天开始在 ChatGPT 里逐步推送,聊天能更自然了,试试开声音。原文稍后读已读值得跟进有用关注 GPT-Live
11:09小互@imxiaohu83°GPT-Live 采用全双工架构,能在生成语音的同时持续处理输入,实现边听边说的自然对话。遇到需要联网搜索或深度推理的复杂任务时,GPT-Live 会实时将问题交给后台的 GPT-5.5 处理,对话不中断。在人工头对头评测中,GPT-Live-1 和 mini 明显比 Advanced Voice Mode 更受偏好。GPQA、BrowseComp、τ³-Voice Telecom 三项测评上 GPT-Live 也超过后者。语音新增天气/股票/体育等可视卡片,支持 Instant/Medium/High 三档推理强度。AI模型GPT-LiveGPT-5.5OpenAI10 个信源在谈事件专题推荐理由:OpenAI 出了 GPT-Live,能边听边和你对话,遇到难题自动调 GPT-5.5,还能实时显示卡片,比 Siri 强多了。原文稍后读已读值得跟进有用关注 GPT-Live
06:44Aadit Sheth@aaditsh76°OpenAI 推出 GPT-Live,一种支持全双工语音交互的模型。在复杂问题上,它会自动委派给 GPT-5.5 处理。OpenAI 内部网络研究基准测试成绩从 0.7% 跃升至 75.2%。有用户接到餐厅确认电话时发现是 AI 并提问测试,AI 直接挂断,表明体验仍有瑕疵。AI模型GPT-LiveOpenAIGPT-5.510 个信源在谈事件专题推荐理由:OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。原文稍后读已读值得跟进有用关注 GPT-Live
03:28官方账号OpenAI@OpenAIOpenAI发布GPT-Live,基于全双工架构设计,支持同时进行语音输入和输出。该模型改变了传统语音助手轮流对话的模式,实现实时自然交互。目前尚未公开具体参数和基准测试结果。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:GPT-Live能一边听你说话一边回应,聊天不再有等待感,就像和真人对话一样流畅。原文稍后读已读值得跟进有用关注 GPT-Live
02:57官方一手@OpenAIDevs@OpenAIDevs83°OpenAI 宣布 GPT-Live-1 及其轻量版 GPT-Live-1 mini 即将通过 API 向开发者和企业开放。该模型具备实时对话能力,官方称其为当前最智能的语音模型。开发者可通过指定表单注册通知。AI模型GPT-Live-1GPT-Live-1 miniOpenAI10 个信源在谈事件专题推荐理由:OpenAI 要把实时语音模型 GPT-Live-1 做成 API 了,开发者和企业能直接集成,不用自己训练。原文稍后读已读值得跟进有用关注 GPT-Live-1
02:28The Rundown AI@therundownai88°OpenAI发布GPT-Live,采用全双工架构,能连续处理输入而非前代的轮次模型。演示显示对话流畅无中断,支持在后台调用其他模型协作。还展示了实时翻译能力,能同时听、处理、输出。ChatGPT的语音对话因此获得重大升级。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI新语音模型GPT-Live,对话超流畅,还能同时翻译,比老版本自然多了。原文稍后读已读值得跟进有用关注 GPT-Live
02:25官方账号OpenAI@OpenAI73°OpenAI 推出 GPT-Live,一款新的语音模型,声称能实现像真人一样的实时对话。OpenAI 称其为目前最智能的语音模型。该模型专注于提升语音交互的流畅度和自然度。AI模型GPT-LiveOpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI 出了个 GPT-Live,能像真人一样和你实时聊天,反应很快还很聪明。原文稍后读已读值得跟进有用关注 GPT-Live
02:18官方账号OpenAI@OpenAI (@OpenAI)73°OpenAI 推出 GPT-Live 语音模型,专为提升人机交互自然度而设计。该模型即日起在 ChatGPT 中逐步上线,支持更流畅的对话体验。官方演示视频展示了其逼真的语音响应和情感表达能力。推文获得超 5200 次点赞和 34 万次观看。AI模型GPT-LiveOpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI 出了个新语音模型 GPT-Live,今天就能在 ChatGPT 里用,说话更自然更像真人,快去试试吧原文稍后读已读值得跟进有用关注 GPT-Live
02:16官方一手marktechpost@Michal Sutter73°OpenAI 推出新一代语音模型 GPT-Live 和 GPT-Live-1 mini,用于 ChatGPT Voice。GPT-Live 采用全双工架构,能够同时听和说。该模型将搜索与推理任务委托给 GPT-5.5 处理。GPT-Live-1 mini 是轻量版本。AI模型GPT-LiveGPT-Live-1 miniGPT-5.510 个信源在谈事件专题推荐理由:OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。原文稍后读已读值得跟进有用关注 GPT-Live
01:37techcrunch@Ivan Mehta77°OpenAI 发布了新的语音模型,支持同时说话和聆听,这一能力对实时翻译至关重要。新模型在延迟和自然度上有所优化,可实现更流畅的实时对话体验。该功能将首先在 ChatGPT 中推出,并计划后续开放给开发者。AI产品OpenAI语音模型实时翻译10 个信源在谈事件专题推荐理由:OpenAI 出了新语音模型,能同时说话和听,实时翻译场景下体验会好很多。原文稍后读已读值得跟进有用关注 OpenAI
01:04官方一手OpenAI Blog(博客/媒体)73°OpenAI 发布了新一代语音模型 GPT-Live。该模型专门用于自然的人机语音交互。目前 GPT-Live 已应用于 ChatGPT Voice。它提升了语音对话的流畅度和响应速度。AI模型GPT-LiveOpenAIChatGPT Voice10 个信源在谈事件专题推荐理由:OpenAI 出了新语音模型 GPT-Live,ChatGPT 语音对话更自然了,赶紧试试吧。原文稍后读已读值得跟进有用关注 GPT-Live
14:28IT之家(博客/媒体)精选73°OpenAI 推出 gpt-realtime-2.1 和 gpt-realtime-2.1-mini 两款模型,专为低延迟语音智能体与多模态交互设计。官方表示通过优化缓存机制,p95 延迟至少下降 25%。gpt-realtime-2.1-mini 支持实时音频、文本输入、工具调用与函数调用,并可配置推理强度(minimal、low、medium、high、xhigh 五档)。gpt-realtime-2.1 增强字母数字识别、静音与噪声处理、中断处理等能力。定价方面,gpt-realtime-2.1 文本输入每百万 Tokens 4 美元,音频输入 32 美元;mini 版文本输入仅 0.6 美元。AI模型OpenAIgpt-realtime-2.1gpt-realtime-2.1-mini10 个信源在谈事件专题推荐理由:OpenAI 的 Realtime 2.1 延迟更低,价格也更友好,做语音代理的直接换这个,体验提升明显。原文稍后读已读值得跟进有用关注 OpenAI
11:35AI Will@FinanceYF591°OpenAI 新语音模型 Bidi 1 首次曝光,支持双向语音交互:用户说话时模型同时监听,中途打断可立刻切换任务。实时翻译能力与上下文记忆均优于现有 Advanced Voice(高级语音模式)。该模型已小范围推送,ChatGPT 设置中可选,气泡变黄色即为 Bidi 1。后续将推出 Codex 版本。AI模型Bidi 1OpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI 出了新语音模型 Bidi 1,你说它听,还能打断换话题,实时翻译也更强,快去 ChatGPT 设置里试试。原文稍后读已读值得跟进有用关注 Bidi 1
11:34AI Will@FinanceYF576°据TestingCatalog爆料,OpenAI正在测试名为Bidi 1的双向语音模型。该模型支持用户在说话时同时说话并继续监听,可在句子中间来回切换任务。Bidi 1能更好地处理打断和停顿,并保持对话上下文记忆。模型有持续时间上限,但可连续计数到23不暂停。Bidi 1尚未可用,但预计很快登陆ChatGPT和Codex。AI模型Bidi 1OpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI的新语音模型Bidi 1能边听边插话,还能中途换任务,比现在强多了。原文稍后读已读值得跟进有用关注 Bidi 1
12:40IT之家(博客/媒体)OpenAI 正在 ChatGPT 网页版和 App 中测试双向语音模型 Bidi 1。该模型位于设置中的模型选择器,与标准语音和高级语音并列。Bidi 1 支持双向并行对话:用户可在模型说话时继续说话或打断,模型会立即响应新指令。测试案例中,用户让模型从 1 数到 10,中途打断要求倒数,模型立即执行。AI模型OpenAIChatGPTBidi 110 个信源在谈事件专题推荐理由:ChatGPT 新语音模型 Bidi 1 能边听边回应,你说话时可以随时打断它,反应超快,去试试吧。原文稍后读已读值得跟进有用关注 OpenAI
01:31Gary Marcus@GaryMarcus据传闻,GPT-5.6原定本周发布已推迟,新目标约7月中旬。DeepMind对3.5 Pro当前状态不满意,本月不再发布。OpenAI的Bidi语音模型可能在ChatGPT中本周上线。Claude Sonnet 5已向部分企业客户开放Early Access,被视为过渡方案。行业GPT-5.6DeepMindClaude Sonnet 510 个信源在谈事件专题推荐理由:听说GPT-5.6要延迟到7月了,但OpenAI的Bidi语音模型本周可能就能用,Claude Sonnet 5也开始了企业内测。原文稍后读已读值得跟进有用关注 GPT-5.6
12:55AI Breakfast@AiBreakfastBland AI 宣布完成1亿美元C轮融资,用于继续训练其语音AI模型,使其能够处理长达45分钟的高风险企业电话对话。该模型旨在应对紧急、高风险的电话场景,而非仅仅优化短时客服通话。Bland AI 声称在这一领域处于领先地位。行业Bland企业级语音AI融资推荐理由:Bland AI 刚融了1亿美元,专门训练模型搞定45分钟高难度企业电话,不是那种两分钟客服小把戏。原文稍后读已读值得跟进有用关注 Bland
10:35官方账号arXiv cs.LG@Talia Sternberg, Gallil Maimon, Yossi Adi该论文分析了来自不同模型族和规模的交错语音文本语言模型,发现它们会在中间层隐式转录语音对应的文本词,其中77%的数据中该文本词出现在Top候选词中。随后模型在文本空间预测下一个词,再转回语音域。研究还表明,交错训练数据和文本LM初始化是诱发该行为的关键,且该行为与口语知识能力相关。论文Speech Language Models交错训练语音模型推荐理由:这篇论文让你搞懂语音语言模型内部是怎么偷偷把语音转成文本再推理的,分析得很透彻,适合想深入理解多模态模型原理的人。原文稍后读已读值得跟进有用关注 Speech Language Models
18:35官方账号Together AI@togethercomputeTogether AI 上线了 Cartesia Sonic 3.5 语音模型,为开发者提供超过150种语音。通过语音查找器,开发者可以试听和比较这些语音,为实时智能体挑选最合适的角色。选定后可直接在 Together AI 平台部署,简化开发流程。AI模型Cartesia Sonic 3.5Together AI语音模型推荐理由:Together AI 集成了 Cartesia Sonic 3.5,有150多种语音可选,做实时语音智能体可以试试这个新库。原文稍后读已读值得跟进有用关注 Cartesia Sonic 3.5
03:40@koltregaskes@koltregaskesOpenAI即将推出新语音模型GPT-Bidi-1(代号可能变更)。该模型专为生成更自然的语音交互设计。消息最早由Dev Mode服务器报道,目前无具体发布日期。AI模型GPT-Bidi-1OpenAI语音模型10 个信源在谈事件专题推荐理由:OpenAI要发新语音模型GPT-Bidi-1,听说声音超级自然,比现在的好不少!原文稍后读已读值得跟进有用关注 GPT-Bidi-1