#基准测试

共 630 条 · 7 天 33 条 · 30 天 147 条
5月19日
论文中美对照多源确认精选10:26
Mythos漏洞复现基准测试:GPT-5.5仅5/18成功

这个实验戳破了AI漏洞发现能力的泡沫——即使给定了目标文件,顶级模型复现已知漏洞的成功率也极低。做AI安全评估或漏洞研究的团队,看完会重新审视benchmark的可靠性。

事件专题
arXiv: Anthropic@Isaac David, Arthur Gervais11 个信源在谈原文
论文精选09:56
延迟感知深度学习基准:实时分类逆变器主导电网的物理故障与网络攻击

电力系统安全研究者终于有了一个可复现的延迟感知基准——它揭示了AI模型在逆变器主导电网中实时分类故障与攻击时的实际性能瓶颈。做电力系统保护或AI部署的团队可以直接参考这些数据来优化模型和硬件选择。

arXiv cs.AI@Emad Abukhousa 等 3 人原文
5月16日
产品Agent 与开发者官方一手08:36
Databricks 将 GPT-5.5 引入企业智能体工作流

企业 AI 团队终于有了一个经过基准验证的强模型来驱动智能体工作流——GPT-5.5 在 OfficeQA Pro 上的 SOTA 表现意味着办公自动化场景的准确率有望大幅提升,做企业级 AI 应用开发的团队值得关注。

事件专题
官方一手OpenAI Blog6 个信源在谈原文
5月15日
5月14日
5月13日
模型Agent 与开发者官方一手75°21:35
Claude 3.5 Sonnet 在 SWE-bench Verified 上刷新纪录

Claude 3.5 Sonnet 在 SWE-bench 上的突破意味着 AI 编程助手离真正解决复杂工程问题更近了一步,做软件开发的团队可以关注这一能力提升对日常代码修复和功能开发的潜在影响。

事件专题
官方一手Anthropic: Engineering11 个信源在谈原文
5月12日
5月11日