8月21日
10:56
10:56官方账号arXiv cs.LG@Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki
Task-CoEvolve通过自适应验证任务选择,实现高效LLM智能体 Harness 优化,降低评估成本,提高性能。在在线文本分类和Terminal-Bench 2.1实验中,Task-CoEvolve比固定子集基线表现更优,且优化过程中评估次数减少80%。代码将在GitHub发布。
推荐理由:Task-CoEvolve通过自适应任务选择优化LLM智能体,比传统方法更高效,值得一看。
10:35
10:35官方一手arXiv: DeepSeek@Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song
研究提出ReguSim和ReguBench,用于评估金融市场中LLM智能体在规则归因方面的表现。DeepSeek V4 Pro和Gemini 3.5 Flash在规则指导下减少了违规行为,但未完全消除。激励或角色框架可改变行为。研究表明,除非展示执行证据,否则交易者的理由可能误导独立监控者。在监控中,简单的结构化基线与仅提示的LLM相当或更优。结果将金融合规评估视为对规则归因行动和证据使用的审计,而非单一合规评分。
推荐理由:这篇论文提出了一个评估LLM智能体在金融合规中规则归因的新方法,值得一读。它通过实验展示了规则指导如何减少违规行为,并强调了监控的重要性。
10:32
10:32官方账号arXiv cs.LG@Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na
AI4AI-Bench发布,包含10个训练算法家族的10个研究仓库。测试中,智能体在4小时内重写训练算法,然后重新运行并评分。平均得分0.166,最佳系统达到0.250。测试显示,大多数智能体未改变模型学习方式,而改变模型学习的少数智能体平均得分为0.226。
推荐理由:AI4AI-Bench为LLM智能体算法设计提供了一个基准测试,展示了智能体在改进训练算法方面的潜力,值得研究者和开发者关注。
8月11日
11:48
11:48官方账号arXiv cs.AI@Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu
SHE框架将智能体安全机制分解为系统提示、规则库、安全记忆和工具策略四个组件,每个组件有明确的安全职责。该框架通过归因引导的进化循环,将轨迹失败转化为结构化诊断,并学习组件特定的边界优化。在Agent-SafetyBench上,SHE相比静态SafeHarness将攻击成功率降低3.1倍,同时提升良性效用。进化后的安全机制在AgentHarm基准上泛化到未见风险,并无需额外进化即可跨智能体模型迁移。
推荐理由:SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。
7月3日
09:59
09:59官方账号arXiv cs.AI@Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang
AgenticSTS提出了一种有界记忆合同,通过类型化检索为每个决策组装新提示,避免跨决策原始记录累计。在Slay the Spire 2游戏中,前沿LLM在不同配置下最低难度胜率为0%,而人类开发者报告胜率为16%。固定A0消融实验中,无记忆基线获胜3/10局,添加策略技能层后获胜6/10局,但差异统计不显著(Fisher精确p≈0.37)。研究发布了298条完整轨迹、冻结记忆/技能快照、提示记录和分析脚本的可重复测试平台。
推荐理由:AgenticSTS用Slay the Spire 2游戏测试LLM智能体记忆:无记忆胜率3/10,加技能6/10,人类16%。做长时域智能体研究可以参考这个方法论。
6月17日
10:46
10:46官方账号arXiv cs.AI@Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar
ReproRepo是一个可扩展的框架,利用GitHub Issues作为监督信号来评估LLM在可重复性审计中的能力。研究基于1149篇近期机器学习论文,测试了四种前沿智能体配置。最佳配置Codex with GPT-5.5能识别约90%论文的至少一个语义相关的真实可重复性问题。分析表明智能体擅长发现表面故障和语义区域,但精确定位仍不足。代码已开源。
推荐理由:这篇论文提出了一个可扩展的框架,用GitHub Issues来测试LLM智能体找论文代码的复现问题,比现有手动基准好很多,值得看。
6月16日
12:18
12:18官方账号arXiv cs.LG@Buqiang Xu, Zirui Xue, Dianmou Chen, Chenyang Fu, Chiyu Wu, Caiying Huang, Chen Jiang, Jizhan Fang, Xinle Deng, Yijun Chen, Yunzhi Yao, Xuehai Wang, Jin Shang, Gong Yu, Ningyu Zhang
TokenPilot提出了一种双粒度上下文管理框架,通过Ingestion-Aware Compaction稳定提示前缀并消除环境噪声,以及Lifecycle-Aware Eviction监控上下文段残余效用。在PinchBench和Claw-Eval基准测试中,TokenPilot在孤立模式下分别降低61%和56%的成本,连续模式下降低61%和87%,同时保持与先前系统相当的性能。该框架已集成到LightMem2中,可访问https://github.com/zjunlp/LightMem2。
推荐理由:想降低LLM智能体长会话的推理成本?看看TokenPilot,它通过智能管理上下文缓存,在三个基准上省了61%-87%的费用,性能还不掉队。
6月12日
6月10日
6月9日
6月4日
10:56
10:56官方账号arXiv cs.AI@Linyao Chen, Qinlao Zhao, Zechen Li, Mingming Li, Likun Ni, Jinyu Chen, Yuhao Yao, Xuan Song, Noboru Koshizuka, Hiroki Kobayashi
AgentMob 提出了一种无需训练的 LLM 驱动智能体框架,用于个体级移动预测。它通过快速路径处理常规出行,对模糊情况则触发迭代工具调用,结合历史轨迹、停留概率和地理证据进行决策。在三个数据集上,AgentMob 在无需训练的 LLM 方法中表现最佳,GPT-5.4 在 BW 数据集上达到 71.42% 的 Acc@1。该方法显著提升了模糊预测的准确性,并提供了决策透明度。代码已开源。
推荐理由:做城市模拟、交通规划或政策分析的团队,终于有了一个无需训练就能解释预测结果的方案——AgentMob 在模糊场景下准确率提升 18%,建议直接试一下开源代码。
6月2日
5月29日
5月28日
11:28
11:28官方账号arXiv cs.AI@Jizhan Fang, Buqiang Xu, Zhixian Wang, Haoliang Cao, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Ying Wei, Guozhou Zheng, Feiyu Xiong, Haofen Wang, Huajun Chen, Ningyu Zhang
精选72°
现有记忆增强型LLM智能体通常将记忆视为静态仓库,在动态环境中表现脆弱。为此,研究者提出FluxMem框架,将记忆建模为异构图,并通过初始连接形成、反馈驱动精炼和长期巩固三个阶段逐步优化拓扑结构。在执行过程中,FluxMem能自动修复缺失链接、剪枝干扰、对齐抽象粒度,并将成功轨迹蒸馏为可复用的程序化回路。在LoCoMo、Mind2Web和GAIA三个基准测试中,FluxMem均取得最先进性能,展现出强大的适应性和泛化能力。代码已开源。
事件专题

推荐理由:FluxMem解决了LLM智能体在动态环境中记忆僵化的痛点,做复杂任务自动化的开发者可以直接参考其开源实现,提升智能体的长期记忆和适应能力。
5月22日
11:12
11:12官方账号arXiv cs.AI@Girish Narayanswamy, Maxwell A. Xu, A. Ali Heydari, Samy Abdel-Ghaffar, Marius Guerard, Kara Vaillancourt, Zhihan Zhang, Jake Garrison, Levi Albuquerque, Dimitris Spathis, Hong Yu, Hamid Palangi, Xuhai "Orson" Xu, David G. T. Barrett, Joseph Breda, Jed McGiffin, Yubin Kim, Yuwei Zhang, Naghmeh Rezaei, Samuel Solomon, Karan Ahuja, Tim Althoff, Jake Sunshine, Ming-Zher Poh, Benjamin Yetton, Ari Winbush, Nicholas B. Allen, James M. Rehg, Isaac Galatzer-Levy, Yun Liu, John Hernandez, Anupam Pathak, Conor Heneghan, Yuzhe Yang, Ahmed A. Metwally, Pushmeet Kohli, Mark Malhotra, Shwetak Patel, Xin Liu, Daniel McDuff
精选72°
研究人员提出了一种面向可穿戴健康数据的基础模型,该模型在来自500万参与者的超过1万亿分钟未标记传感器信号上进行了预训练。通过联合扩展模型容量和预训练数据量,该模型在35项健康预测任务上(涵盖心血管、代谢、睡眠、心理健康及生活方式等)表现出系统性性能提升。该模型支持少样本学习和生成能力,可稳健估计日常健康指标。研究还部署了一组LLM智能体来自动搜索基于模型嵌入的下游预测头,并展示了性能随LLM能力提升而增强。最后,将下游预测器集成到个人健康代理中,经1860次临床医生评分验证,模型响应更相关、更具上下文意识且更安全。
推荐理由:这项研究解决了可穿戴数据标注稀缺和个体差异大的核心难题,做健康AI或可穿戴设备开发的团队可以直接参考其预训练方法和少样本学习策略,值得关注。
5月21日
5月19日