论文12:05K-BrowseComp:首个韩语网页浏览智能体基准测试做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。#智能体#基准测试#韩语#网页浏览1 个信源在谈事件专题aarXiv: DeepSeek@Nahyun Lee 等 15 人2 个信源在谈原文稍后读已读值得跟进有用关注 智能体