#LLM智能体
Apple 的论文,讲怎么在多个交互环境里同时训练一个 LLM 智能体,用 rubric 评分挑数据,全对全错的样本也能靠自蒸馏利用起来。
这篇论文测试了让智能体自己动手省钱:让 Opus 5 等模型把任务封装成小程序或小模型,成本能降 657 倍但多数尝试会翻车,结果挺有意思。
Agent 批准了改数据库,结果顺带发了条没人要的通知,现有护栏根本拦不住。这篇论文的 EffectMatch 在提交前比对实际持久化结果,206 个任务上全拦住了错误提交。
一篇很新颖的智能体论文:不模拟工具输出,而是让模型直接修改任务状态,Action Judge 拿了 70.5% F1,做 Agent 的值得看看思路。
把 LLM 当遗传算法的调参师用,8 个控制案例全部跑通,成本才 $0.002 一次,做控制或自动化的朋友可以看看这套架构。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
Task-CoEvolve通过自适应任务选择优化LLM智能体,比传统方法更高效,值得一看。
做长期记忆的智能体开发者可以看看,SodaMem用图结构加证据链,在LongMemEval-S上准确率92.8%,成本还低,比普通RAG日记靠谱。
想提升LLM智能体调用工具的准确率?这篇论文的HYSET方法把工具集当成整体打分,比单个检索靠谱,ToolBench上全面领先。
这篇论文用LLM智能体模拟政党结盟谈判,设计了MILT和CIS两个新指标来追踪条款来源和影响力,在比利时选举数据上验证了有效性,对政治学和AI研究都很有参考价值。
AgenticSTS用Slay the Spire 2游戏测试LLM智能体记忆:无记忆胜率3/10,加技能6/10,人类16%。做长时域智能体研究可以参考这个方法论。
一篇很扎实的综述,把LLM智能体“一直在线”带来的状态管理问题系统化了。有435篇论文支撑,还提出了自己的评估协议AOEP-v0,适合想深入理解智能体持久化设计的读者。
想降低LLM智能体长会话的推理成本?看看TokenPilot,它通过智能管理上下文缓存,在三个基准上省了61%-87%的费用,性能还不掉队。
做 LLM 智能体训练的团队终于有了一个无需外部环境反馈的自我进化方案——Role-Agent 让模型自己当裁判和教练,平均提效 4%+,值得在复杂任务场景中试试。
做 LLM 智能体部署的团队终于有了处理真实异构数据流的方案——EEVEE 的提示学习框架能自动适应多任务流,建议做 Agent 落地的开发者关注。
这是首个系统评估LLM智能体在生物安全关键任务上能力的基准,做AI安全或生物计算的研究者值得关注——它揭示了当前模型在复制已知协议时很强,但在创新推理上仍有短板。
Trellis 解决了自动形式化中可靠性与成本之间的平衡问题,做定理证明或形式化验证的开发者可以直接用这个工作流来生成 Lean 证明,值得关注其开源实现。
做LLM智能体长期部署和持续学习的团队可以关注——MemoPilot用强化学习自动优化记忆策略,比手工调提示更系统,在博弈场景中效果显著,值得在类似任务中尝试。
做AI智能体开发的团队会立刻警觉——你精心设计的记忆系统可能在悄悄退化。这篇论文用实验数据戳破了「自动总结记忆」的幻觉,建议所有用LLM做长期任务的开发者点开看看,别让记忆成为瓶颈。