7月28日
7月8日
12:12
12:12官方账号arXiv cs.AI@Kai Ruan, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun
该论文利用LLM Agent每轮隐藏状态的探针(probe),在任务早期预测最终失败。在TextCraft基准上,Recall-Controlled Probe Cascade以90%召回率目标为Qwen-2.5-7B节省47.1%推理计算,为Llama-3.2-3B节省37.2%。相比仅基于行为的方法,节省量高出1.6-1.7倍。论文还推导了保证高召回率所需的样本复杂度。
推荐理由:这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。
6月9日
6月2日
11:12
11:12官方账号arXiv cs.AI@Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai
SafeMCP 是一个服务器端防御插件,针对 LLM Agent 使用 MCP 协议时因动作空间扩大带来的安全风险。它通过内部世界模型进行前瞻推理,实现两层防御:主动工具过滤限制危险权限扩展,以及即时干预作为故障安全机制。训练采用三阶段流程:环境动态基础、安全策略初始化和带双重可验证奖励的强化学习。在 PowerSeeking Bench、ToolEmu 和 AgentHarm 上的实验表明,SafeMCP 能在降低风险的同时保持 Agent 的实用性。
推荐理由:做 LLM Agent 安全防护的团队终于有了一个可落地的方案——SafeMCP 在服务器端用前瞻推理主动过滤危险工具调用,比事后审计更有效,建议关注其开源实现。
5月20日
10:09
10:09官方账号arXiv cs.AI@Dmitry Redko, Albert Fazlyev, Konstantin Sozykin, Maria Ivanova, Evgeny Burnaev, Egor Shvetsov
精选
该研究通过三个受控实验,系统评估了 LLM Agent 在硬件感知代码优化中的表现。研究发现,LLM 在纯黑盒优化中表现为贪婪优化器;在零样本内核生成中,提供显式输入大小信息没有可测量的效果,模型会收敛到相同的内核参数;在反馈循环优化中,CUDA 在迭代反馈下单调改进,而 TVM IR 则主动退化。结论表明,LLM 在代码优化任务中高度依赖预训练先验知识,而非提供的反馈或智能体结构。
推荐理由:做 AI 编译器或硬件优化的开发者会关心——LLM Agent 的搜索能力被高估了,实际表现受限于预训练数据分布,直接套用反馈循环可能适得其反,建议先看实验设计再决定是否采用。