8月14日
12:19
12:19官方账号arXiv cs.AI@Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi
HumanTracker 基准包含约153小时专业表演者的光学运动轨迹,覆盖四类运动族并带有文本标签。HumanScore 指标基于12K运动对(共24K运动)训练,用于对齐人类偏好。在代表性 SOTA 跟踪器上,HumanScore 能比运动学指标更准确地预测人类偏好,揭示脚部滑动和触地时机等接触稳定性问题。
推荐理由:想评估人形机器人运动跟踪效果?HumanTracker 提供了153小时专业动作数据和更符合人眼判断的 HumanScore,能发现脚滑、触地不准这类关键问题。
8月5日
7月28日
02:52
6月30日
17:11
6月27日
12:53
6月5日
12:05
12:05官方账号arXiv cs.AI@Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue
精选
论文提出 Benchmark Agent,一个全自动构建 LLM/MLLM 评测基准的智能体系统。它从用户需求分析、子任务设计到数据标注和质量控制,全流程自动化。作者用它生成了 15 个覆盖文本理解、多模态理解和领域推理的基准,经人类评估和 LLM 评判验证,质量高且无需人工参与。该系统解决了传统基准构建劳动密集、易饱和的问题,能持续生成新基准以区分顶尖模型。代码和预览已公开。
推荐理由:做 LLM 评测的团队终于有了自动化工具——Benchmark Agent 能持续生成新基准,避免模型性能饱和,建议做模型评估的开发者直接试试。