8月31日
09:37
09:37官方账号arXiv cs.AI@Raghul Sugumar, Amrit Gopinath
COVER方法引入评估契约,固定公共信息边界和下游堆栈。在MuSiQue-12基准上,预指定特权对照组将遗憾值从0.532降至0.402。在HotpotQA-4上,公共直接评分器将遗憾值从0.313降至0.110。ToolSandbox变体验证显示,声明家族达到0.768安全证据完成率。
推荐理由:COVER方法评估多智能体系统路由效果,通过固定边界和堆栈,在多个基准上验证了评估有效性。