事件专题 · 多源确认

GPT 5.5 称霸 SWE 基准,但 Opus 4.8 仍是 Vibe Coding 之王

尽管 GPT 5.5 在 SWE 基准测试中表现最佳,但 Opus 4.8 在端到端应用创建任务上仍保持价格与性能的双重优势。为此,团队推出了 ViBench——首个基于真实世界任务的应用创建基准测试。该基准旨在更准确地评估模型在实际开发场景中的表现,而非仅关注代码修复或补全。结果显示,Opus 4.8 在 Vibe Coding 场景下依然是最优选择。

当前结论

ViBench 填补了现有基准只测代码修复、不测完整应用创建的空白,做全栈原型或快速验证想法的开发者值得关注——Opus 4.8 可能才是你的性价比之选。

3 个信源78° AI 热度最后更新 2026/6/3 17:33:23

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情