事件专题 ·多源确认

Coding Agents 在广义任务与运动规划上超越手工规划器

论文测试 Claude Code(Opus 5)和 Codex(GPT-5.6 Sol、GPT-6 Astra)能否自动合成可跨实例泛化的任务与运动规划(TAMP)程序。评估覆盖 KinDER 和 PDDLStream 的 28 个模拟环境,共 980 个程序、98,000 个评估回合。在 16 个有规划器可用的环境中,三种编码智能体配置平均成功率达 56% 到 95%,高于手工规划器的 47%。随着物体数量增加,智能体程序保持更高成功率,每个实例平均计算量低一个数量级。论文已公开全部代码和提示词。

当前结论

有人拿 Claude Code 和 Codex 写规划程序,成功率达 95%,比手工规划器高还省十倍算力,代码和提示词全开源了。

11 个信源58° AI 热度最后更新 2026/9/24 17:53:35

证据链

11 个信源
相关来源 7Artificial Analysis
查看原文
相关来源 9Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。