论文09:32计算机使用智能体的不确定性量化:跨VLM和GUI定位数据的基准这篇论文搞了个Argus基准,比较了27种不确定性方法在4个VLM模型和4个GUI数据集上的表现。结论很实在:方法排名换模型就不灵了,闭源还得单独测。做智能体部署的可以看看。#Argus#VLM#GUI定位#不确定性量化aarXiv cs.AI@Divake Kumar 等 8 人原文稍后读已读值得跟进有用关注 Argus