09:30官方账号arXiv cs.AI@Ishaan Bhola, Adithyan Krishnan, Mukunda NSSuperScout 先用 7B 的 SuperScout-7B 搜索代码仓库,生成经过沙箱验证的交接报告,再由路由器把任务分给四个前沿修复模型。在 SWE-bench Pro 的 Python 切片(266 个任务)官方预算档下,SuperScout 解决 159 个,最佳单模型解决 158 个,单次解决总成本约为后者的五分之一。在同一个 266 任务的 SWE-bench Pro 上,去掉路由器、只用最便宜修复模型加交接报告,成绩与路由系统并列,说明交接报告而非路由决策带来了成绩。配对校准研究(N=99)显示,交接报告让三个较便宜修复模型提升、最强模型略降,但各修复模型效应仅有方向性;搜索器的隐藏状态改善了成本路由,而交接报告文本本身没有。SuperScout-7B 的搜索计算在每个任务上只增加不到半美分 GPU 时间。论文SuperScoutSWE-bench Pro代码智能体推荐理由:7B搜索器先看仓库再路由,SWE-bench Pro追平最强模型,成本降五分之一,换新修复模型不用重训。原文稍后读已读值得跟进有用关注 SuperScout