论文Agent 与开发者10:36研究提出 selective long-horizon refinement,提升终端智能体训练效率与可靠性训练终端智能体的朋友看这篇:监督窗口选 12K 反而比 16K 好,还能省 30% 训练时间,作者给的选择性精调方法直接可用。#Terminal-Bench#terminal agent#智能体#模型训练aarXiv cs.AI@Cuong Dang 等 3 人原文稍后读已读值得跟进有用关注 Terminal-Bench
模型精选07:07Tmax:开源RL终端智能体模型,数据权重全开源Tmax把终端智能体的RL训练配方全开源了,65k token里就跑赢之前的工作,想自己训智能体的可以抄作业。#Tmax#RL#terminal agent#开源模型Suhail@Suhail原文稍后读已读值得跟进有用关注 Tmax