09:32官方账号arXiv cs.AI@Elizaveta Shevtsova, Inna Glebkina, Mark Baushenko, Pavel Gulyaev, Alena FenogenovaRUMBA是一个面向长对话记忆的基准,包含时间戳用户-助手对话和QA对(检索、组合、跨会话推理)。基准提供细粒度分类,覆盖语义类型、会话范围、时间推理和表达显式性。评估了当代记忆系统和长上下文模型(如GPT-4、Claude),识别出不同机制在时间线索跨会话聚合上的失败模式。同时提供英语对齐子集用于跨语言比较。AI模型RUMBA俄语基准长对话记忆推荐理由:想测LLM的长对话记忆力?RUMBA这个俄语基准能细粒度诊断模型在时间推理上的强项和短板。原文稍后读已读值得跟进有用关注 RUMBA