论文精选73°19:37LLM智能体安全状态跨迭代持久化研究MIT学者发现LLM智能体安全漏洞,提出LoopHarness解决跨迭代攻击问题,安全性能显著提升。#LLM Agents#Agent-SafetyBench#LoopHarness#智能体aarXiv cs.AI@Chenhao Wu 等 14 人原文稍后读已读值得跟进有用关注 LLM Agents
论文11:48SHE框架:通过轨迹驱动进化LLM智能体安全边界SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。#SHE#LLM智能体#AI安全#Agent-SafetyBenchaarXiv cs.AI@Wanying Qu 等 15 人原文稍后读已读值得跟进有用关注 SHE
论文11:30NiyamAI:基于零知识证明的可验证AI Agent安全护栏NiyamAI给AI Agent装上了密码学护栏,每个危险操作都能被证明拦住了,比传统过滤靠谱。#NiyamAI#Agent-SafetyBench#零知识证明#AI安全aarXiv: OpenAI@Aditya Katkar 等 5 人原文稍后读已读值得跟进有用关注 NiyamAI