字节跳动发布原生音视频全双工模型SeedRealtime

字节跳动发布 原生音视频全双工模型 SeedRealtime 对标 GPT Live,跟豆包可以进行实时语音视频聊天 你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回...

精选理由

字节发了SeedRealtime,能一边看你手机摄像头画面一边听你说话一边回你,豆包里直接用,跟GPT Live一个路子。

AI 摘要

字节跳动推出原生音视频全双工模型SeedRealtime,对标OpenAI的GPT Live。该模型支持同时处理摄像头画面、语音输入和语音输出,实现实时视频对话。在四人聚餐场景中,模型能识别用户逐一介绍的人物,并在多人讨论中持续区分说话者身份。目前该能力已集成到豆包应用,用户可直接体验实时语音视频聊天。

图片来源 · 小互
原文 · 小互

字节跳动发布 原生音视频全双工模型 SeedRealtime 对标 GPT Live,跟豆包可以进行实时语音视频聊天 你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回...

字节跳动发布 原生音视频全双工模型 SeedRealtime 对标 GPT Live,跟豆包可以进行实时语音视频聊天 你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回应,三件事同时干。 四人聚餐场景:用户逐一介绍在场的人,模型把名字和人对上,之后在七嘴八舌的讨论里始终分得清谁是谁。 Your browser does not support the video tag. 🔗 View on Twitter 💬 3 🔄 0 ❤️ 5 👀 1173 📊 4 ⚡