实时(real-time)技术指系统在极短时间内(通常毫秒级)完成数据采集、处理与响应,在AI领域,实时语音、视频和翻译模型正成为各大厂商竞争的核心方向。近期,OpenAI、阿里巴巴和开源社区密集发布了多款低延迟多模态模型,将实时交互能力推向新高度。
实时语音与视频模型近期进展
2026年7月,阿里发布Qwen-Audio-3.0-Realtime,升级了四项实时语音功能,声称在理解准确性和响应速度上显著提升(量子位);同月,阿里还升级了Fun-ASR-Realtime,单模型支持30种语言和16种方言(IT之家)。
OpenAI在7月推出Realtime 2.1系列,包括GPT-Realtime-2.1和GPT-Realtime-2.1-mini,p95延迟降低至少25%,并支持推理与工具调用(IT之家;@OpenAIDevs)。
开源方面,OpenMOSS发布了MOSS-VL-Realtime,这是一个实时视频流多模态模型,可在视频帧流中实现低延迟交互(@berryxia)。
当前焦点与观察点
当前实时AI模型的焦点集中在三方面:一是延迟优化,如OpenAI将p95延迟降低25%,阿里通过模型架构改进实现更快的语音响应;二是多模态融合,从纯语音扩展到视频流和推理能力,如MOSS-VL-Realtime;三是语言覆盖与翻译精度,Gradium发布的实时翻译模型(stt-translate和s2s-translate)声称在准确率和延迟上超越GPT实时翻译(marktechpost)。
争议点在于:开源模型与商业API的差距在缩小,但实时场景下的稳定性和成本仍是挑战。此外,实时交互的隐私与安全规范尚未成熟,如何平衡用户体验与数据保护是未来关键。