11:28官方账号arXiv cs.LG@Tiangang Li, Xiangbo TianSFT虽能让LLM掌握HPC领域知识,但在数据竞争检测与基准问答上行为不精准,88.65%的分类正确率下仍有65.9%的MLPerf回答超40字符。HPC任务异构性显著,答案长度差异达58倍,覆盖三种奖励分布。HARGO通过置信度调制的优势加权,无需任务类型标签即可适配。在四个HPC任务和九种方法的对比中,HARGO在WinRate 54.62%、Data Race F1 91.30%和PLP Similarity 0.8558上均取得最佳。AI模型HARGOHPCRL后训练推荐理由:HARGO给HPC任务的RL后训练提了个新思路,不用标签就能按难度加权,四个任务上全面超过GRPO。原文稍后读已读值得跟进有用关注 HARGO