模型11:28HARGO:异构感知奖励引导优化用于LLM的HPC任务后训练HARGO给HPC任务的RL后训练提了个新思路,不用标签就能按难度加权,四个任务上全面超过GRPO。#HARGO#HPC#RL后训练#GRPOaarXiv cs.LG@Tiangang Li, Xiangbo Tian原文稍后读已读值得跟进有用关注 HARGO