论文Agent 与开发者10:19评估LLM智能体在知识冲突中的认知谦逊这篇论文揭示了AI智能体在知识冲突中的行为模式,对构建更可靠的AI系统有重要参考价值。#LLM Agents#Epistemic Humility#知识冲突#智能体评估aarXiv cs.AI@Kaiser Sun 等 7 人原文稍后读已读值得跟进有用关注 LLM Agents
论文Agent 与开发者09:29Caddie方法训练LLM智能体顾问Caddie让智能体能实时决定何时寻求批评建议,基于结果训练的顾问能跨模型和任务领域迁移。#Caddie#LLM Agents#Qwen3-4B#智能体aarXiv cs.AI@Sergei Polezhaev 等 4 人原文稍后读已读值得跟进有用关注 Caddie
论文Agent 与开发者10:32Rep2Skill:基于表征的智能体技能自我进化框架Rep2Skill让LLM智能体通过分析自身内部表征来进化技能,比传统文本方法更有效。#Rep2Skill#LLM Agents#表征学习#技能进化aarXiv cs.AI@Kaixing Zhang 等 8 人原文稍后读已读值得跟进有用关注 Rep2Skill
论文Agent 与开发者10:25LLM代理执行计划声明研究研究发现LLM代理常无法执行已声明的计划,提出规划即路由方法,显著提升任务成功率。#LLM Agents#Planning-as-Routing#ALFWorld#SWE-benchaarXiv cs.LG@Subba Reddy Oota 等 5 人原文稍后读已读值得跟进有用关注 LLM Agents
论文Agent 与开发者精选73°12:16程序图:LLM智能体的自进化执行结构斯坦福团队提出程序图,让LLM智能体像知识图谱一样组织行动知识,能自动优化决策流程。#Procedural Graph#LLM Agents#程序图#智能体aarXiv cs.AI@Yuxing Lu 等 4 人原文稍后读已读值得跟进有用关注 Procedural Graph
论文Agent 与开发者精选73°12:13MeClear:基于合作博弈归因的LLM智能体记忆清理MeClear解决了LLM智能体长交互中的记忆污染问题,通过智能清理冲突记忆,显著提升任务完成率。#MeClear#LLM Agents#Shapley#记忆清理aarXiv cs.AI@Boyu Yang 等 6 人原文稍后读已读值得跟进有用关注 MeClear
模型Agent 与开发者精选73°11:15PlannerForge:自动驾驶运动规划测试的LLM智能体框架PlannerForge用LLM智能体整合了自动驾驶测试全流程,开源模型表现接近商业API,成本调优将规划成功率提升20%。#PlannerForge#LLM Agents#自动驾驶#Qwen3.6:35BaarXiv cs.AI@Yuan Gao 等 8 人原文稍后读已读值得跟进有用关注 PlannerForge
论文Agent 与开发者精选73°09:37Trace2Tower:LLM智能体技能层次框架研究人员推出Trace2Tower框架,能将LLM智能体行为转化为技能层次,在两个基准测试中大幅超越现有方法。#Trace2Tower#EigenTrace#LLM Agents#技能层次aarXiv cs.AI@Jiazheng Sun 等 5 人原文稍后读已读值得跟进有用关注 Trace2Tower
论文Agent 与开发者精选73°09:22ERPBench评测大模型企业决策能力ERPBench首次测试大模型企业决策能力在不同竞争市场环境下的迁移性,发现不同环境下最佳模型不同。#ERPBench#LLM Agents#企业决策#GeminiaarXiv: DeepSeek@Xinran Zhang 等 4 人原文稍后读已读值得跟进有用关注 ERPBench
论文多源确认精选73°11:13KC-Bench:评估LLM智能体知识冲突的动态基准研究人员发布了KC-Bench基准,专门测试AI智能体如何处理知识冲突,九个主流模型测试结果都不理想。#KC-Bench#LLM Agents#知识冲突#基准测试4 个信源在谈事件专题aarXiv: DeepSeek@Yaxing Lyu 等 5 人5 个信源在谈原文稍后读已读值得跟进有用关注 KC-Bench
论文政策与合规精选73°20:02LLM智能体因虚假证据过度自信Calibrated Enough论文揭示LLM智能体如何被虚假证据误导,以及如何通过微调修复这一缺陷。#LLM Agents#智能体#AI安全#微调aarXiv cs.AI@Pranav Aggarwal原文稍后读已读值得跟进有用关注 LLM Agents
论文精选73°19:37LLM智能体安全状态跨迭代持久化研究MIT学者发现LLM智能体安全漏洞,提出LoopHarness解决跨迭代攻击问题,安全性能显著提升。#LLM Agents#Agent-SafetyBench#LoopHarness#智能体aarXiv cs.AI@Chenhao Wu 等 14 人原文稍后读已读值得跟进有用关注 LLM Agents
论文17:59人格-执行分离:LLM智能体的审计架构模式这篇论文提出PES架构,解决LLM智能体在监管环境下的核心矛盾,人格可自由演变而执行可追溯。#LLM Agents#PES#智能体#审计架构aarXiv cs.AI@Yisen Xi原文稍后读已读值得跟进有用关注 LLM Agents
论文10:44QVal: 廉价评估长程LLM智能体的密集监督信号这篇论文提出了一个高效的评估框架,帮你省去昂贵的训练代价来判断哪种监督信号对长程智能体更有效,结论很实用。#QVal#LLM Agents#密集监督#Q对齐aarXiv cs.AI@Sergio Hernández-Gutiérrez 等 6 人原文稍后读已读值得跟进有用关注 QVal