Reka 发布 Rho-1:全模态推理模型,延迟从 13.8 秒降到 7.0 秒
DeepMind 前员工做的单一模型,画图改视频控制机械臂全包,延迟砍半,不用再等十来秒了。
Reka 发布了全模态推理模型 Rho-1,把语言、视觉与物理动作整合进单一神经网络,替代主流系统外挂多个专用模型的拼装架构。生成延迟从 13.8 秒压缩到 7.0 秒,蒸馏版本能在 1.15 秒内完成端到端视频修改。该模型支持连续对话操控,可画图、框选主体、运镜生成视频并改成暴风雪天气,凭同一记忆上下文保持连贯。它还能向机械臂输出 7 个通道的执行指令。Reka 创始人多数来自 DeepMind。
Reka发布Rho-1:全模态推理模型(Omni-Reasoning Model)
当前主流多模态系统大多靠中央模型外挂多个专用模型拼装而成,多重中转不仅让延迟飙升到十几秒,各环节更因信息割裂而频现理解断层。Rho-1将语言、视觉与物理动作整合进单一神经网络,把生成延迟从13.8秒直接压缩到7.0秒,蒸馏版本甚至能在1.15秒内完成端到端视频修改,彻底终结了缝合怪式的串联架构。
现在你可以通过连续对话直接操控一个具备时空记忆的世界状态。你可以让它画一张灯塔图,用框选指令精准圈出主体,要求它平滑运镜生成视频,再一句话把它改成暴风雪天气,最后追问两段画面的细节差异。整个过程无需反复给AI描述背景,它凭借同一个记忆上下文就能连贯推演、甚至直接向机械臂输出7个通道的执行指令。
Reka的创始人多数来自DeepMind,也继承了Gemini的多模态能力,Rho-1就是Gemini Omni Flash的完整形态。
官方介绍:https://t.co/WdBaIK00jr