Soul 出了个 AI 硬件 B Soul,能随身带、能对话,8 月就能买到,比单纯手机里的 AI 更有陪伴感。
#语音交互
OpenAI 推出了 GPT-Live,一个全新的语音模型,可以跟 ChatGPT 更自然地对话了,目前 Plus 和 Pro 用户都能直接用。
OpenAI 这次把语音交互做得更自然了,GPT-Live 系列能边听边说,还能打断和调用工具,比以前的 Advanced Voice Mode 流畅很多。
OpenAI 让 ChatGPT 能同时听和说了,复杂问题自动转给 GPT-5.5 处理,对话更自然。付费用户现在就能体验。
想让你写的LangGraph agent开口说话?这篇17分钟教程直接用pipecat_ai搞定,还顺带教你怎么用LangSmith看语音回放。
Murati 点破了当前 AI 交互的硬伤——思考时无法感知用户,做语音助手或实时协作产品的团队值得关注这个方向,它直接决定了下一代交互体验的边界。
想做本地 AI 桌宠或 VTuber Agent 原型的开发者,这个项目把 LLM、语音和 Live2D 串成一条龙,还支持可打断对话,值得直接 fork 折腾。
荣耀用户终于可以动嘴不动手操作微信了,经常开车、做饭或手被占用的场景下非常实用,建议更新 YOYO 和微信后立刻试试。
语音交互+智能体操作手机,这个方向对移动端开发者、语音产品团队和智能体应用开发者都很有启发,值得关注其后续开源或产品化进展。
这个 demo 展示了 AI 助理的终极形态——手机界面由 AI 实时生成,不再依赖传统 app,做产品经理或移动端开发的建议点开看看,这可能是下一代交互范式的雏形。
这个项目展示了Vibe Coding在游戏原型开发中的实际落地,做实时语音交互或3D小游戏的开发者可以看看两周能做出什么。
基础设施规划团队终于有了专属的 AI 协作工具——Wagner 让多智能体在虚拟会议室中实时参与讨论,做工程规划或项目管理的团队可以直接体验,提升方案评审效率。
这是 AI 从工具走向操作系统的关键一步,做移动端产品、语音交互或智能体开发的团队值得关注——语音优先的 OS 可能重新定义手机使用方式。
经常需要手动填表或处理表单的办公人员、行政人员,现在可以用 ChatGPT 语音或文字指令自动完成,省去逐项录入的麻烦,建议试试这个新技能。
Google 把 Gemini 的语音交互塞进 YouTube 和 Docs,做内容搜索和文档整理的效率会明显提升,视频创作者和重度文档用户值得关注。
谷歌把办公套件全面语音化,Gmail Live 和 Docs Live 让日常邮件检索和文档起草效率大幅提升,经常处理大量邮件和文档的办公人员可以直接用语音完成操作,值得一试。
国产 GPU 终于落地家庭场景,做智能家居或手游开发的团队可以关注这个端侧安卓生态的突破,直接体验语音交互和游戏性能。
做会议工具或语音交互产品的开发者可以直接参考这个官方示例,快速理解 Realtime API 在任务管理场景的落地方式,建议点开仓库看看实现细节。
做语音交互智能体的团队,高并发下消息链路容易成为瓶颈,RocketMQ LiteTopic 的方案值得参考,能直接提升稳定性。