事件专题 ·多源确认

Agent Arena 分析 20840 条轨迹:编码智能体差评首因是代码跑不通

Arena 团队分析了 Agent Arena: Code 平台上 29 个模型的 20840 条用户反馈轨迹,用直接的正负评价来衡量编码智能体的实际表现。投诉中 69.1% 指向代码无法运行,其后是输出不完整(27.1%)、收尾与可用性差(27.1%)和忽视指令(20.3%)。Fable 5.1 的“slop”与设计类投诉占 3.9%,低于 Astra 的 5.7%,“flaky”类投诉占 3.1%,也低于 Astra 的 5.0%。29 个模型的数据还显示,各实验室的新一代前沿模型获得的正反馈占比普遍更高。

当前结论

Arena 拆了 20840 条编码智能体反馈:69% 差评是代码跑不通,Fable 5.1 比 Astra 更少被吐槽。

5 个信源58° AI 热度最后更新 2026/9/21 15:38:58

证据链

5 个信源
相关来源 2eric zakariasson
查看原文
相关来源 4歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。