10:57官方账号arXiv cs.AI@Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen精选ReWorld通过分离训练和推理过程中的控制与记忆需求,实现了对用户动作的跟随和实时记忆。采用混合注意力窗口和随机头路由,结合随机块丢弃,模型在推理时使用固定预算的KV缓存和地标银行。数据引擎将不同来源的视频统一到同一物理动作尺度,并使用回文轨迹提供记忆训练所需的证据。在三个轴向上的协议测试中,ReWorld在控制精度和生成质量方面均优于六个最近的交互式世界模型。论文ReWorld交互式世界模型长时记忆推荐理由:ReWorld通过独特的长时记忆机制,在交互式世界模型领域取得了显著进展,其控制精度和生成质量均优于同类模型,值得关注。原文稍后读已读值得跟进有用关注 ReWorld
10:23官方账号arXiv cs.AI@Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu YinDiaLLM 在 International Corpus of English 上持续预训练三种开源模型家族(LLaMA、Mistral、Gemma),并应用隐式和显式后训练范式各搭配三种对齐策略,首次在澳大利亚、印度和北英格兰方言上对比这些组件。结果显示鲁棒性和生成能力分离:基准测试由持续预训练和 SFT 主导,而对齐显著重塑生成但基准测试无法捕捉。显式方言适配生成被人类评估者可靠识别为方言,但最激进优化方言奖励的方法反而得不到人类偏好。独立语言学分析在两个模型家族上验证了该奖励-质量差距,且没有单一对齐方法占优。论文DialLM方言适应鲁棒性推荐理由:这篇论文挖出了LLM理解方言但生成不了方言的深层矛盾,还对比了多种对齐方法,结果很反直觉。原文稍后读已读值得跟进有用关注 DialLM