#LLM Agent
Google 在 COLM 2026 现场演示 EnvHarness,一个给 Agent 环境做动态改造的插件架构,做强化学习的可以看看思路。
跑 Agent 最怕 token 预算失控,这篇论文的 TokenCast 能边执行边预测消耗,实测省 21.3% 的 token,做 agent 的都该看看。
这篇论文用大量实验告诉你,给Agent加技能可能适得其反。它揭示了三个具体原因,并指出减少回归比堆砌技能更重要,值得每个开发者读一读。
这篇论文把LLM智能体在狼人杀中的信念和行为拆开审计,发现加信念能让好人胜率从20%提到39%,但行动和信念不太一致,框架本身是个好工具。
这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。
做LLM Agent服务部署和优化的团队,终于有了一个低成本、高精度的模拟工具来测试调度和缓存策略,不用再烧GPU时间试错,建议直接看论文细节。
做 LLM Agent 开发的团队终于有了一个系统化的技能进化方法,不用再靠试错和启发式反思——Bayesian-Agent 用后验概率指导优化,效果显著且可审计,建议直接看论文和代码。
做时间序列预测的团队终于有了一个能处理业务上下文的实用方案——LLM Agent 自动整合节假日、活动等非结构化信息,让统计预测直接变成决策可用的结果,值得做预测的开发者点开看看。
做 LLM Agent 安全防护的团队终于有了一个可落地的方案——SafeMCP 在服务器端用前瞻推理主动过滤危险工具调用,比事后审计更有效,建议关注其开源实现。
做 LLM Agent 开发的团队终于有了实证依据:给智能体塞技能文档比纠结怎么写更管用。建议直接参考这个实验设计来优化自己的 RAG 或工具调用策略。
做 AI 编译器或硬件优化的开发者会关心——LLM Agent 的搜索能力被高估了,实际表现受限于预训练数据分布,直接套用反馈循环可能适得其反,建议先看实验设计再决定是否采用。
高能物理研究者终于可以用自然语言做 Root 分析了——RooAgent 把复杂的 PyRoot 操作封装成 LLM 可调用的工具,做粒子物理数据分析的团队可以直接试,省去手写大量脚本的麻烦。
这篇论文直击 LLM Agent 在陌生环境中的核心短板——过早行动,做智能体开发或强化学习的研究者值得一读,提出的探索-执行范式可以直接启发你的训练策略。
LLM Agent 的故障排查和修复一直是运维痛点,这个方案让做 Agent 部署和运维的团队能像用 Dependabot 一样自动化处理问题,值得关注后续进展。