#智能体
共 6562 条 · 7 天 620 条 · 30 天 1785 条 · 话题观测 →
9月29日
arXiv 论文:可再推导性决定多级智能体流水线故障后的恢复能力
这篇论文用 gsm_hard 上的 120 题实验算清了一笔账:流水线出错后,把原题重新喂给第一个下游阶段就能挽回 0.394,每题只多花 59.8 个 token,后面的阶段白搭。
Amazon AGI 提出AutoGym:自动为智能体生成RL训练环境
Amazon AGI 这篇 AutoGym 论文挺有意思:一句话就能自动生成训练环境和验证器,做智能体强化学习的人可以省掉大量手工搭环境的活。
UOPD:用不确定性感知干预改进多轮智能体的在线蒸馏
这篇论文给多轮智能体蒸馏提了个新思路:只在学生拿不准的步骤让老师出手纠正,WebShop 分数最多提升 15.8%。做 Agent 训练的可以看看干预时机的选择。
DSSR:用读者损失训练 LLM 智能体的状态写入器
Long-context 智能体靠摘要记事,写漏一步就全完。这篇论文把摘要器的损失量化拆解,还给出了直接用读者损失训练写入器的 DSSR 方法,做 agent 记忆的值得细看。
集邦咨询:AI 智能体推动全球服务器 CPU 交付周期拉长至 25~30 周
Meta 的 Muse 每个用户要独占一台虚拟机,直接把服务器 CPU 交付周期从 20 周拖到 30 周,DRAM 也跟着紧张,算力紧缺又添新证据。
IT之家原文
PEARL:面向智能体强化学习的自适应 Prefill-Decode 弹性执行系统
训练智能体 RL 的人可以看看:PEARL 动态调 prefill-decode 配置还能借闲置 GPU,吞吐比 RLBoost+ 最高多 36.3%。
Analog Design Bench 发布:50 个模拟电路任务测试智能体长时程设计能力
模拟电路版 SWE-bench 来了:50 个真实设计任务,15 种智能体跑 2250 次实验,DeepSeek V4 Pro 靠参考拓扑涨了 18.7 个点。
Notion 内部判断:三年内大部分知识将由 Agent 之间产生
Notion 内部觉得三年后知识主要是 Agent 之间互相生产的,连怎么让 Agent 注册产品都开始认真设计了,这段视频值得看看。