主要来源Anthropic: Engineering
查看原文事件专题 · 官方一手
Claude 3.5 Sonnet 在 SWE-bench Verified 上刷新纪录
Anthropic 宣布其 Claude 3.5 Sonnet 模型在 SWE-bench Verified 基准测试中取得了 49.7% 的通过率,较此前最佳成绩提升了约 10 个百分点。该测试评估 AI 模型解决真实 GitHub 问题的能力,包括代码修复、功能实现等。Claude 3.5 Sonnet 在多个类别中表现优异,尤其在需要多步推理和上下文理解的复杂任务上。这一进展表明 AI 在软件工程自动化领域正快速接近人类水平。
当前结论
Claude 3.5 Sonnet 在 SWE-bench 上的突破意味着 AI 编程助手离真正解决复杂工程问题更近了一步,做软件开发的团队可以关注这一能力提升对日常代码修复和功能开发的潜在影响。
11 个信源75° AI 热度最后更新 2026/5/12 22:33:23
证据链
相关来源 1Claude: Blog
查看原文相关来源 2arXiv: OpenAI
查看原文相关来源 3宝玉
查看原文相关来源 4elvis
查看原文相关来源 5向阳乔木
查看原文相关来源 6AI Will
查看原文相关来源 7Ethan Mollick
查看原文相关来源 8Dario Amodei Blog
查看原文相关来源 9The Rundown AI
查看原文相关来源 10IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。