15:41官方账号arXiv cs.AI@Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha该研究提出一种神经符号智能体,将长时程家务任务分解为任务导向的视觉探索和受限符号规划。第一阶段,视觉语言模型和探索机制从第一视角观察中获取目标相关谓词和实例绑定,生成符号初始状态。第二阶段,PDDL转移模型限制解码,蒙特卡洛树搜索评估可执行延续。在VirtualHome和ALFWorld上,4B-27B模型成功率超90%,最小智能体显著优于27B直接视觉策略。约束与搜索互补,组合解决超95%任务,且生成token更少。论文神经符号具身智能PDDL推荐理由:这个研究把视觉探索和符号规划结合起来,让模型在虚拟环境里干活成功率超90%,比直接让大模型操作强多了,而且不用专门训练。原文稍后读已读值得跟进有用关注 神经符号
11:02官方账号arXiv cs.AI@Jakub Kowalski, Adam Ciężkowski, Artur Krzyżyński, Mark H. M. Winands该论文针对高不确定性对抗游戏(如Jaipur、Lost Cities、Splendor)中的蒙特卡洛树搜索(MCTS)进行改进,提出两种动态资源分配方法:Dynamic Number of Determinizations根据搜索表现动态调整当前使用的determinization树数量;Dynamic Simulation Allocation根据模拟间决策非均匀分配模拟预算到不同树中。在迭代和时间限制测试下,特定配置相比基线算法在统计上显著提升了强度(p<0.05)。实验基于三个流行桌面游戏,展示了方法在随机和隐藏信息环境中的有效性。论文MCTS蒙特卡洛树搜索游戏AI推荐理由:这篇论文给做游戏AI的同行提供了一个很实用的优化思路:不用固定分配计算资源,而是根据搜索情况动态调整,实测对三个桌游都有明显提升。原文稍后读已读值得跟进有用关注 MCTS
11:37官方账号arXiv cs.AI@Andrew Kang, Priya Narasimhan精选该研究将足球传球评估重新定义为蒙特卡洛树搜索(MCTS)问题,利用已有的价值模型、世界模型和反事实动作策略。基于德甲首个公开高保真3D球轨迹数据集,提出Monte Carlo Pass Search(MCPS),为每个观察到的传球推断踢球参数,采样执行变体和选项变体,用球条件世界模型滚动预测至下一次触球,并通过学习到的价值模型评分获得价值分布。该分布支持两种互补的执行盈余分数(基于均值和百分位数)用于分析和排名。为在有限公开数据下提高世界模型样本效率,改编了自动驾驶领域的离散令牌自回归轨迹生成器(SMART),在最佳20次预测准确率上优于基线,并支持完全假设性滚动用于下游评估。已发布模型检查点和代码。论文蒙特卡洛树搜索足球分析3D轨迹推荐理由:足球数据分析团队终于有了可落地的3D传球评估工具——MCPS用MCTS框架量化每次传球的执行盈余,做战术分析或球员评估的可以直接用开源代码和模型。原文稍后读已读值得跟进有用关注 蒙特卡洛树搜索
10:02官方账号arXiv cs.LG@Matthias Cosler, Cas Cremers, Bernd Finkbeiner, Mohamed Ghanem, Niklas Medinger本文提出一个基于强化学习的框架,借鉴AlphaZero和AlphaProof的思路,为安全协议分析工具Tamarin实现新的证明搜索方式。该框架通过无状态API将Tamarin转化为经典RL环境,并用蒙特卡洛树搜索结合神经网络启发式,从已完成子证明中学习。在16个案例研究中,该方法比Tamarin标准搜索找到更多自动证明,且生成的证明比标准及人工设计的启发式更短。该框架可直接用于辅助Tamarin用户,减少人工工作量,展示了RL方法在协议验证领域的潜力。论文强化学习安全协议验证Tamarin推荐理由:做安全协议验证的团队终于有了减少人工的利器——RL框架自动生成更短证明,Tamarin用户可以直接集成到现有工作流中,值得一试。原文稍后读已读值得跟进有用关注 强化学习