15:31官方一手marktechpost@Asif Razzaq精选Mistral AI发布了Robostral Navigate,一个8B参数具身导航模型。该模型仅用单RGB摄像头即可根据自然语言指令引导机器人,无需LiDAR或深度传感器。在R2R-CE验证集未见过场景上,借助pointing方法、prefix-caching训练和CISPO在线强化学习,成功率达到了76.6%。AI模型Mistral AIRobostral Navigate8B推荐理由:Mistral AI这个8B模型Robostral Navigate挺有意思,只用普通摄像头就能让机器人听懂指令找路,R2R-CE上76.6%成功率,省了激光雷达的钱。原文稍后读已读值得跟进有用关注 Mistral AI
09:42官方一手arXiv: OpenAI@Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li该论文提出 Cognitive-structured Multimodal Agent (CMA),通过外化视觉信息至 Episodic Visual Memory 并在推理时选择性激活相关片段,解决统一多模态模型在长时对话中视觉 token 爆炸和跨轮引用不可靠的问题。CMA 由 Perceptual Abstraction Engine、Cognitive Retrieval Engine 和 Multimodal Executive Controller 组成。利用 Unified Scenario Engine 生成带细粒度检索标注的结构化多轮对话,并通过强化学习优化策略。在自主构建的长程视觉对话基准上,8B 参数的 CMA 在 20 轮会话中达到 91.4% 检索准确率,比 32B 基线高 8.2%,每轮推理时间从 23.1 秒降至 12.7 秒。AI模型Cognitive-structured Multimodal AgentEpisodic Visual Memory多模态推荐理由:他们搞了个带记忆的 8B 多模态智能体,20 轮对话检索准确率 91.4%,比 32B 模型还快一半。代码和 demo 都开源了,值得看。原文稍后读已读值得跟进有用关注 Cognitive-structured Multimodal Agent