02:38elvis@omarsar0Intology的自动化研究系统Locus对Qwen3基础模型进行后训练,在PostTrainBench上达到SOTA。其训练出的模型超越官方人类调优的Qwen3 1.7B Instruct版本。PostTrainBench用10个H100小时评估代理后训练能力,扩展版PostTrainBench+将预算提升至数千H100小时。在此预算下,Locus后训练的模型集体优于官方Qwen3 1.7B。此外,Locus在Kaggle所有活跃奖金竞赛运行16天后,平均排名第4。AI模型LocusQwen3PostTrainBench推荐理由:Locus这个自动化系统后训练的模型居然干过了人类调的Qwen3 1.7B,在PostTrainBench上拿了第一,还上了Kaggle奖金赛前排。原文稍后读已读值得跟进有用关注 Locus
09:30官方一手arXiv: DeepSeek@Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping ZhangAutoTrainess是一个基于大语言模型的智能体,通过暴露规划、数据准备、训练、评估和日志等操作作为代理-计算机接口,自动化语言模型的后训练流程。在PostTrainBench基准上,AutoTrainess搭配GPT-5.4(Codex)取得平均26.94分,超过CLI-only基线的23.21分。它还能跨模型泛化,将DeepSeek-V4-Flash(OpenCode)的得分从12.13提升至19.58。该研究提出将人工经验外部化为显式工作流和约束,引导智能体更有效且可靠地执行训练任务。论文AutoTrainessPostTrainBenchGPT-5.42 个信源在谈事件专题推荐理由:这篇论文提出一个叫AutoTrainess的智能体,能自己跑模型训练流程,不用人盯着。在PostTrainBench上比纯命令行强,还能帮DeepSeek-V4涨分。原文稍后读已读值得跟进有用关注 AutoTrainess