论文多源确认精选78°

Nvidia 团队新论文:AI 自动优化框架节省一半 token

SoL-Pi:让 AI 自动研究怎么给 AI 省钱,结果省了一半 token 来自 Nvidia 团队最新论文,团队发现 coding agents 正走向无人值守的 7×24 自主运行,单任务动辄...

精选理由

Nvidia 团队的新论文,用 AI 自动优化框架,让 AI 自己研究怎么省钱,结果真的省了一半 token,比直接用 Codex 或 Claude Code 每小时省 8.75 到 13.50 美元。

Nvidia 团队的新论文 SoL-Pi 发现,AI 编码代理在 7×24 小时自主运行时,token 消耗是第一瓶颈。他们通过自动化研究流水线,在 3000+ 次运行中筛选出 4 个机制,包括 Action Fusion、Context Compact 等,使 EdgeBench 51 个任务 token 流量减少近一半(-49%)。

原文 · shao__meng

SoL-Pi:让 AI 自动研究怎么给 AI 省钱,结果省了一半 token 来自 Nvidia 团队最新论文,团队发现 coding agents 正走向无人值守的 7×24 自主运行,单任务动辄...

SoL-Pi:让 AI 自动研究怎么给 AI 省钱,结果省了一半 token 来自 Nvidia 团队最新论文,团队发现 coding agents 正走向无人值守的 7×24 自主运行,单任务动辄 2–12 小时,token 消耗成为规模化的第一瓶颈,做递归自我改进(RSI)时成本更是指数级放大。 SoL-Pi 的核心命题:优化 harness 层,非模型层。模型权重动不了,而框架每个环节的“过程性浪费”与任务无关,一旦优化,收益可迁移到所有任务。 论文地址: arxiv.org/abs/2609.20519 # 方法:一个自动化的研究流水线 用 AI 研究流程自动发现了这四个技巧,整个搜索规模: · 152 个研究方向,分六大家族(上下文、进度、工具、委派、提示策略、评估方法) · 535 个可执行训练环境(495 个从 GitHub issue–PR 对挖掘,40 个由验证器反向构造) · 3000+ 次运行、60,000+ 次智能体-环境交互 · 最终只有 4 个机制存活,约 40 选 1 的淘汰率 三个方法论设计: 1. 独立验证:留出集(EdgeBench 51 个任务中的 11 个)只在候选机制冻结后评估一次,评估结果永不回流到搜索过程,这是防止“进化过拟合”的关键。 2. 先冻结、后评估的验收门:能力指标和容差在搜索开始前就固定死,候选方案必须在所有能力指标上不越界、且至少改进一个效率指标。“少干活省下的钱”一律不收。 3. 一次性技能循环:每个实验实例化一份独立模板、用完即弃,避免候选方案之间的失败耦合。 # 存活下来的四个机制 每个机制都针对一种具体的、可测量的 token 浪费模式: 1. Action Fusion:编辑+测试合并为一次调用,砍掉一轮模型往返 2. Context Compact:子任务完成时才压缩,且先算清“省的是否够付缓存重写” 3. ObservationPack:大输出本地归档,只给模型句柄+头尾摘录,按需取回 4. Evidence Reducer:日志交给便宜模型提炼,但每句引用都验证,不符即回退 # 实验结果:省钱不省事 EdgeBench 51 个长时程任务:SoL-Pi 保留约 94% 的分数,token 流量砍近一半(−49%),API 成本降约三分之一。跨到 Opus 5 零适配,收益几乎不打折(省 44.7%),证明优化的是“浪费模式”而非模型习惯。 最有说服力的两点:一是缓存账算得诚实,压缩破坏缓存前缀,cache 写流量翻倍,但总成本仍下降;二是用“每单位分数成本”衡量,$0.417 vs Pi 的 $0.586,省 token 不掉分才是真效率。 外推到持续运行:比原生 Codex/Claude Code 每小时省 $8.75–$13.50。 elvis @omarsar0 Build your own harness, folks. This is absolute banger paper from NVIDIA on self-evolving agent harnesses. (bookmark it) They introduce SoL-Pi which cuts token traffic by nearly half. And it matches its baseline harness on GPT-5.6 Sol and Opus 5. More details below: Instead of tuning a harness by hand, they run auto-research loops at the harness layer across many repository-derived and verifier-driven environments, keeping only the mechanisms that survive selection. Four mechanisms survived: > Action Fusion changes how actions execute > Online Context Compact handles compaction during a run > ObservationPack reshapes observation handling > Evidence-Preserving Reducer covers delegated reading On the 51-task EdgeBench evaluation, the savings translate to about a third off API cost. In dollars that is an estimated $8.75 to $13.50 per hour against native Codex and Claude Code harnesses, and $4.36 to $5.71 against the baseline harness. Because the search runs across many environments rather than one, the retained mechanisms keep working outside the setting that produced them. Code is on GitHub under NVlabs. Paper: arxiv.org/abs/2609.20519 Chat with Paper: academy.dair.ai/papers/sol-pi-… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 189 📊 1 ⚡