12:37官方账号arXiv cs.LG@Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong论文提出MIST基准,将每道推理题置于干净、误导、正确上下文、无关上下文四种条件下。配套SC2W指标衡量误导信号使原本正确答案变错的频率。作者发现该脆弱性在多种开源模型上普遍存在。提出的SCOPE方法通过匹配偏好对优化DPO目标,在保持干净上下文准确率的同时显著降低SC2W。论文MISTSC2WSCOPE推荐理由:这篇论文把“信不信上下文”当成独立问题来训练,用MIST测出模型容易被一条错误信息带偏,SCOPE能减少这种翻车还不影响正常表现。原文稍后读已读值得跟进有用关注 MIST
12:01官方账号arXiv cs.AI@Yunhao Liang, Xianqi Cao, Pujun Zhang, Yuan Qu, Yongzhi Qi, Ningxuan Kang, Max Z. J. Shen供应链补货计划中的品类选择、货源分配、补货频率和配送路线相互关联,传统分部门独立优化易导致缺货和运输浪费。SCOPE将供应链实体表示为token,通过共享运营表示和决策接口实现跨环节耦合规划。在城市生鲜补货场景中,SCOPE在叮咚买菜和京东两个不同梯级的真实运营数据上进行了评估。相比分阶段优化基线,SCOPE在两个数据集上均取得更优的端到端运营效果。论文SCOPEDingdongJD.com推荐理由:SCOPE把供应链各环节的决策打通了,在叮咚和京东的真实数据上验证过,比各自单独优化效果更好,做供应链的可以看看。原文稍后读已读值得跟进有用关注 SCOPE
10:53官方账号arXiv cs.AI@Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting ZhuangSCOPE 提出一种自适应的符号规划框架,由 Symbolic Execution Simulator(SESim)和 Self-Adaptive Symbolic Memory(SASMem)两个模块协同工作。SESim 通过符号验证和实际执行反馈来 refine 行动计划和进化符号世界;SASMem 则将反馈蒸馏为可演化的符号知识。在开放环境实验中,SCOPE 使符号世界完整性提升,在环境扰动下计划成功率提高,并增强了跨任务泛化能力。AI模型SCOPE符号规划视觉语言模型推荐理由:搞机器人规划的朋友可以看看 SCOPE,它用符号执行加记忆更新解决开放世界符号不完整的老问题。原文稍后读已读值得跟进有用关注 SCOPE