#微调

共 235 条 · 7 天 26 条 · 30 天 94 条 · 话题观测 →
9月29日
9月28日
9月27日
9月26日
9月25日
9月24日
9月23日
Trains but Doesn't Learn:面向 LLM 智能体交付能力的 Post-Training 基准

这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。

arXiv: DeepSeek@Weihang Ding, Junfei Zhan原文
9月22日