论文Agent 与开发者精选09:09Trains but Doesn't Learn:面向 LLM 智能体交付能力的 Post-Training 基准这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。#Post-Training#LLM智能体#benchmark#微调aarXiv: DeepSeek@Weihang Ding, Junfei Zhan原文稍后读已读值得跟进有用关注 Post-Training