Google 把语音助手那套转写接力砍掉了,Gemini 3.8 Live 一个模型直接听直接答,还便宜到每小时 0.84 美元。
#语音模型
共 66 条 · 7 天 1 条 · 30 天 11 条
信息流里打上「语音模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
Google 发布 Gemini 3.8 Live 语音模型,端到端响应省去转写中转
10月2日
9月29日
9月24日
Meta Connect 发布会前瞻:新模型、Muse 开源与视频生成
Meta Connect 快开了,传闻要开源 Muse Spark、上 Muse Video API,还有 Meta Glasses 版 Muse,消息量不小。
9月21日
9月17日
SpaceXAI 推出 Grok Voice,在 fal 平台实现 0.70 秒语音响应
SpaceXAI 新出的 Grok Voice 语音模型,在 fal 平台能用 0.70 秒就回话,比很多同类产品快,适合做低延迟的客服智能体。
9月16日
vivo 发布四款蓝心大模型,推出系统级蓝心 Harness
vivo发布了四款蓝心大模型,包括RealTime语音大模型、Nano端侧大模型、Flash/Pro云侧大模型,以及系统级蓝心Harness,这些新功能能让手机更好地理解用户意图并执行任务。
IT之家原文
9月14日
9月13日
8月20日
8月18日
8月5日
7月31日
7月30日
SpaceXAI发布Grok Voice Think Fast 2.0语音模型,定价每分钟0.08美元
SpaceXAI刚发的Grok Voice Think Fast 2.0,语音转语音又快又准,一分钟才8分钱,比上一代强了一大截,还支持24种语言,适合做语音助手。
7月28日
7月27日
模型16:43
ElevenLabs 峰会 10 月 6 日登陆班加罗尔,将首秀新模型语音界大动作:ElevenLabs 要在班加罗尔开峰会,10 月 6 日首秀新模型,还有现场 Demo,搞语音和 Agent 的别错过。
7月24日
微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash模型,已落地Bing和PowerPoint
微软自己训练的新图像和语音模型,不用别人蒸馏,已经在Bing和PPT里用了,GPU成本降了八成多,价格也公开了。
7月23日
7月17日
7月14日
7月9日
OpenAI 发布 GPT-Live 全双工语音模型,取代 ChatGPT 旧语音模式
OpenAI 把 ChatGPT 语音升级成全双工了,能一边听你说话一边插嘴,同传演示挺惊艳。就是刚上线有人嫌它“嗯嗯”太吵,你可以试试调低推理强度或者换语音角色。
OpenAI 发布 GPT-Live 全双工语音模型,可调用 GPT-5.5 并生成实时 UI
OpenAI 出了 GPT-Live,能边听边和你对话,遇到难题自动调 GPT-5.5,还能实时显示卡片,比 Siri 强多了。
OpenAI 发布 GPT-Live,全双工语音并委派难题给 GPT-5.5
OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
OpenAI 发布 GPT-Live 和 GPT-Live-1 mini 全双工语音模型,可委托 GPT-5.5 进行深度推理
OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。