11:42官方账号arXiv cs.AI@Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai该论文提出在机器人规划与执行之间加入LLM驱动的验证层,评估动作的可行性。采用LLM-as-a-Judge集成,结合多模型链式推理与专家输出合成,类似专家混合与自一致性方法。该层作为中间件,在计划到达MCP服务器前进行门控,支持批准、拒绝或升级人工审查。系统在批准/升级/拒绝类别上达到近85%的精确度,对对抗性攻击的遏制率达97%。错误主要出现在升级边界,接受与拒绝任务间的误差可忽略。论文Agentic HarnessesLLM-as-a-Judge机器人自主性推荐理由:这篇论文给机器人规划加了个AI裁判,能拦下不安全或不合规的动作,对抗攻击遏制率97%,做机器人安全的值得看看。原文稍后读已读值得跟进有用关注 Agentic Harnesses