BrainJanus 实现脑视觉语言统一:研究团队发布 BrainJanus 模型,将脑信号、视觉与语言处理统一在单一架构中,支持跨模态的理解与生成,展示了 Omni 在认知科学领域的潜力。 BrainJanus:脑、视觉与语言统一模型用于理解与生成
当前焦点与观察点
Omni 相关研究今年呈现出几个关键趋势:一是多模态统一从单纯的理解向实时交互与生成演进,例如 Gemini Omni Flash 支持长视频输出,京东的 JoyAI-VL-Interaction 实现全栈开源实时视频交互;二是服务优化成为落地重点,vLLM-Omni 和 SGLang-Omni 等工作聚焦于降低推理延迟、提升模型部署效率;三是开源生态加速形成,多个 Omni 工具包(如 M* 统一运行时)实现了最高 12.5 倍的性能提升,降低了开发门槛。同时,部分评论指出当前实时语音 AI 虽能“听见”但缺乏深度“倾听”,暗示 Omni 系统在人机对话的语义理解方面仍需突破。总体而言,Omni 正从概念走向产品,但其在通用性、实时性与成本之间的平衡仍是业界持续关注的焦点。