#基准测试

共 631 条 · 7 天 31 条 · 30 天 142 条
6月12日
论文多源确认10:15
EpiBench:AI智能体在表观基因组学分析中的可验证基准

做基因组学分析的团队终于有了一个可复现的AI能力评估标准——EpiBench揭示了当前最强模型在专业科学判断上的天花板,做生物信息学工具开发或AI+生命科学研究的建议点开看看差距在哪。

事件专题
arXiv cs.AI@Harihara Muralidharan 等 5 人11 个信源在谈原文
6月11日
Claw-SWE-Bench:评估OpenClaw风格智能体编程能力的基准

做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。

事件专题
arXiv cs.LG@Mengyu Zheng 等 16 人2 个信源在谈原文
论文精选10:53
Natural-Language Temporal Grounding 在小时级视频中本质是搜索问题:ExtremeWhenBench 基准与实证分解

做长视频理解或视频检索的开发者会发现,当前 Video-LLM 在小时级视频上几乎不可用,而简单的检索基线反而更有效——这个反直觉结论值得点开看看,或许能帮你重新设计系统架构。

arXiv cs.AI@Sukmin Seo, Geewook Kim原文
6月10日
模型中美对照多源确认精选11:10
Claude Fable 5 在文档理解上表现平平,自曝“懒惰”

做文档解析或 RAG 的团队注意了——Claude Fable 5 在推理上很强,但文档理解性价比不如 Gemini 3 Flash,甚至不如专业 OCR 服务。如果你在选模型做文档处理,这篇评测能帮你省下 10 倍 token 成本,值得点开对比。

事件专题
Jerry Liu@jerryjliu011 个信源在谈原文
论文10:32
Transformer 真的提升入侵检测?CIC-IDS2017 时序评估揭示 padding 才是关键

这篇论文戳破了 Transformer 在入侵检测中“近乎完美”的假象——做网络安全 AI 研究的团队,尤其是依赖 CIC-IDS2017 基准的,建议仔细看 padding 和分割协议的影响,否则你的模型评估可能虚高 0.24 macro-F1。

arXiv cs.LG@Zach Moczkodan, Hany Ragab原文
论文多源确认72°10:30
ABC-Bench:评估LLM智能体的生物安全能力基准

这是首个系统评估LLM智能体在生物安全关键任务上能力的基准,做AI安全或生物计算的研究者值得关注——它揭示了当前模型在复制已知协议时很强,但在创新推理上仍有短板。

事件专题
arXiv: OpenAI@Andrew Bo Liu 等 6 人8 个信源在谈原文
论文官方一手04:32
语音代理能处理双语用户吗?前沿ASR在代码切换语音上的基准测试

做语音助手或客服系统的团队会发现,当前ASR模型在双语用户面前漏洞百出——代码切换场景的错误率远高于单语言,这个基准测试直接暴露了痛点,建议点开看看你的模型能否过关。

事件专题
官方一手Hugging Face: Blog2 个信源在谈原文
6月9日
产品中美对照多源确认72°20:32
FrontierCode 基准测试:Claude Opus 4.8 仅 13.4%,AI 代码离可合并还很远

FrontierCode 把 AI 编程评测从「能跑就行」升级到「能合并才算数」,做代码质量评估或 AI 编程工具的团队值得关注——它暴露了当前模型在真实代码审查中的致命短板。

事件专题
rohanpaul_ai@rohanpaul_ai4 个信源在谈原文