模型中美对照72°17:28华为昇腾支持RL训推一致性,实测最高60%性能收益华为昇腾把RL训推一致做出来了,Qwen3-30B上Logdiff归零,还能提速20%-60%,搞强化学习训练可以看看。#昇腾#Ascend C#Qwen3-30B#强化学习1 个信源在谈事件专题IIT之家2 个信源在谈原文稍后读已读值得跟进有用关注 昇腾