#基准测试

共 630 条 · 7 天 33 条 · 30 天 142 条
6月8日
6月7日
6月6日
6月5日
6月4日
6月3日
6月2日
论文12:05
K-BrowseComp:首个韩语网页浏览智能体基准测试

做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。

事件专题
arXiv: DeepSeek@Nahyun Lee 等 15 人2 个信源在谈原文
论文精选72°12:01
Moment-Video 基准测试:视频 MLLM 在瞬间视觉事件上的时间保真度诊断

视频 MLLM 开发者终于有了专门诊断时间保真度的基准——Moment-Video 直击模型在瞬间事件上的致命短板,做视频理解或模型评估的团队值得用它来检验自家模型。

arXiv cs.AI@Xiaolin Liu 等 12 人原文
5月31日
5月30日