事件专题 · 多源确认

SWE-Interact:重新定义SWE基准为用户驱动的长程编码会话

SWE-Interact是一个新测试平台,用于评估编码代理在多轮交互、用户驱动的软件工程任务中的表现。现有SWE基准(如SWE-bench)通常预先提供完整需求,而SWE-Interact通过用户模拟器逐步揭示需求、提供反馈和约束。在单轮任务中,最强模型(如Opus 4.8和GPT 5.5)解决率约50%,但在SWE-Interact多轮任务中仅解决约25%。该基准测量了模型在交互目标发现和迭代细化中的正交能力。

当前结论

想知道编程智能体在真实对话开发中能撑多久吗?SWE-Interact测试了Opus 4.8和GPT 5.5在模糊需求下逐步迭代的能力,结果比单轮任务差一半。

10 个信源63° AI 热度最后更新 2026/6/29 17:17:45

证据链

相关来源 5歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情