论文12:23
Argus:面向长时程推理的通用智能体运行时Argus 这个智能体运行时,SWE-Bench Pro 拿到 78%,比 Direct Copilot 高 19 个点,还会自我进化省 token,挺新鲜。
Argus 这个智能体运行时,SWE-Bench Pro 拿到 78%,比 Direct Copilot 高 19 个点,还会自我进化省 token,挺新鲜。
这篇论文搞了个Argus基准,比较了27种不确定性方法在4个VLM模型和4个GUI数据集上的表现。结论很实在:方法排名换模型就不灵了,闭源还得单独测。做智能体部署的可以看看。