主要来源arXiv cs.LG
查看原文事件专题 · 多源确认
SWE-Interact:重新定义SWE基准为用户驱动的长程编码会话
SWE-Interact是一个新测试平台,用于评估编码代理在多轮交互、用户驱动的软件工程任务中的表现。现有SWE基准(如SWE-bench)通常预先提供完整需求,而SWE-Interact通过用户模拟器逐步揭示需求、提供反馈和约束。在单轮任务中,最强模型(如Opus 4.8和GPT 5.5)解决率约50%,但在SWE-Interact多轮任务中仅解决约25%。该基准测量了模型在交互目标发现和迭代细化中的正交能力。
当前结论
想知道编程智能体在真实对话开发中能撑多久吗?SWE-Interact测试了Opus 4.8和GPT 5.5在模糊需求下逐步迭代的能力,结果比单轮任务差一半。
10 个信源63° AI 热度最后更新 2026/6/29 17:17:45
证据链
相关来源 1orange.ai
查看原文相关来源 2Ethan Mollick
查看原文相关来源 3Cognition
查看原文相关来源 4marktechpost
查看原文相关来源 5歸藏(guizang.ai)
查看原文相关来源 6Decoder
查看原文相关来源 7小互
查看原文相关来源 8Anthropic
查看原文相关来源 9@koltregaskes
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。