8月6日
12:23
12:23官方账号arXiv cs.AI@Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng
Argus 是一个自进化的智能体运行时,由 Manager、Planner、Engineer、Reviewer 四个角色在持久项目状态上执行任务。在 SWE-Bench Pro 上达到约 78% 的通过率,高于 Direct Copilot 的 59%,但 token 消耗为后者的 1.41 倍。经过验证门控自进化后,成熟阶段的求解 token 比启动阶段少 21%,活动时间少 15%,并记录了 34 次验证器恢复和 22 次审查循环救援。在 AARRI-Bench 上取得 76.8%,数学数据合成差距为 28 分;优化后的 RWKV6 内核已合并到上游。
推荐理由:Argus 这个智能体运行时,SWE-Bench Pro 拿到 78%,比 Direct Copilot 高 19 个点,还会自我进化省 token,挺新鲜。
6月25日
09:32
09:32官方账号arXiv cs.AI@Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Argus基准系统评估了4个VLM智能体和4个数据集上27种开箱不确定性量化方法,以及3个闭源供应商的8种方法。主要发现是UQ排名在固定模型下跨数据集稳定(Spearman rho最高0.969),但跨模型类和接口时衰减。隐状态和密度法在开箱族中最稳定,而CoCoA-1MCA、Focus等方法在特定场景胜出。闭源UQ需在目标上重新排序,平均转移相关性仅+0.08。校准后局部加权盘半径缩小40-60%,但校准-测试不匹配时覆盖度下降。
推荐理由:这篇论文搞了个Argus基准,比较了27种不确定性方法在4个VLM模型和4个GUI数据集上的表现。结论很实在:方法排名换模型就不灵了,闭源还得单独测。做智能体部署的可以看看。