AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:AI智能体评估×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月20日
10:13
10:13arXiv cs.AI@Yuxuan Gao, Megan Wang, Yi Ling Yu
精选
该研究将分裂共形预测和自适应共形推断(ACI)应用于连续AI智能体评估,提供无分布假设的覆盖保证。在24小时预测窗口内,共形区间在所有名义水平上的校准误差低于0.02,ACI在智能体发布后正确将区间扩大35%后重新收敛。研究还开发了多智能体管道的组合不确定性界限、成对排名的共形弃权规则(控制假排名率)以及排行榜级多重检验的FDR校正弃权。通过每小时收集18个实时信号评估50个智能体,发现每个智能体的条件覆盖集中在名义水平附近(均值80.4%,90%的智能体在[72%,90%]内),跨来源情感分歧可预测排名不稳定性(r=0.64, p<0.01)。代码和数据已以CC BY 4.0协议发布。
论文AI智能体评估不确定性量化共形预测排行榜统计方法

推荐理由:做AI智能体评估或排行榜的团队终于有了统计严谨的不确定性量化工具——无需分布假设即可保证覆盖,还能处理多智能体管道和排名稳定性问题,建议做评估基准的开发者直接看论文和代码。
原文
精选全部日报登录