8月5日
01:34
01:34AK@_akhaliq
精选
LongHorizon-Harness 是一个面向长时程智能体的新评估框架。论文编号 2608.01 已在 Hugging Face 上公开。LongHorizon-Harness 用于评测智能体在真实世界多步骤任务中的表现。现有基准多偏短时程,LongHorizon-Harness 试图弥补这一缺口。
推荐理由:有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。
7月21日
01:31
7月7日
11:30
11:30官方账号arXiv cs.AI@Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez
SPEARBench基于Seamless Interaction语料库构建对话提示,评估多个当代语音到语音模型在响应延迟、中断、语音质量、ASR鲁棒性、语言与方言一致性、情感自然度、人际关系立场等8个维度上的表现。与人类对话相比,当前模型在延迟、重叠、方言保留、情感适应和立场动态方面仍有差距。基准包含原始人类回答作为参考条件。
推荐理由:想测语音AI聊天有多自然?SPEARBench从8个维度对比人类,告诉你现有模型的短板具体在哪。
7月1日
10:44
10:44官方账号arXiv cs.AI@Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge
QVal是一个无训练测试床,直接评估密集监督信号的质量。它通过Q对齐指标衡量信号是否按强化学习参考策略的Q值排序动作。在四个环境、七个方法家族中基准测试21种密集监督方法,涉及1200+次评估实验和六个开源模型。结果发现简单提示基线持续优于近年提出的密集监督方法,且性能按方法家族聚类。
推荐理由:这篇论文提出了一个高效的评估框架,帮你省去昂贵的训练代价来判断哪种监督信号对长程智能体更有效,结论很实用。
6月30日
12:46
12:46官方账号arXiv cs.AI@Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh
该论文提出人类创造力基准(HCB), 收集15000个专业判断覆盖5个创意领域和3个工作流阶段(构思/模型/细化)。HCB将评价分为收敛(如技术正确性)和发散(如美学方向), 发现专业分歧代表真实品味差异而非测量误差。单一质量指标会丢失关键信息: 模型在哪些维度必须正确、哪些维度应保持可操控性。
推荐理由:这篇论文用15000个专家评价告诉你, 测AI创意能力不能只看平均分, 分歧本身才是宝藏。
6月17日
01:59
6月10日
5月20日