主要来源arXiv: DeepSeek
查看原文事件专题 · 官方一手
递归合成框架RST:低成本生成长时程终端任务
RST是一种递归验证的合成框架,能从已验证种子任务出发扩展参考解、重对齐验证器与指令,并在新沙盒中验证。经过15轮递归,RST以约0.05美元/任务的成本生成了37,484个终端任务,中位参考解从67行增至374行,执行的命令数从40增至244。DeepSeek-V4-Pro的pass@4从第1轮的90%降至第15轮的2.5%,任务难度持续攀升。用Qwen3.5轨迹微调,Qwen3.5-27B在Terminal-Bench 2、Hard和Long-Horizon上最多提升10分;PPO训练后相对增益为20.0%、41.2%和21.9%。15轮后合成产率和验证率保持稳定,表明流程可继续扩展。
当前结论
想低成本造高质量长任务数据?RST用递归验证把成本压到5分钱一个,还让模型成绩涨了10分,值得看看。
5 个信源58° AI 热度最后更新 2026/8/5 23:24:26
证据链
相关来源 1lmarena.ai
查看原文相关来源 2OpenRouter
查看原文相关来源 3orange.ai
查看原文相关来源 4IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。