模型中美对照72°17:28华为昇腾支持RL训推一致性,实测最高60%性能收益华为昇腾把RL训推一致做出来了,Qwen3-30B上Logdiff归零,还能提速20%-60%,搞强化学习训练可以看看。#昇腾#Ascend C#Qwen3-30B#强化学习1 个信源在谈事件专题IIT之家2 个信源在谈原文稍后读已读值得跟进有用关注 昇腾
模型11:12AudioDER:面向音频大语言模型后训练的推理增强去重数据集去重+CoT,提升音频模型推理能力#AudioDER#Qwen3-30B#Qwen2-Audio-7B-Instruct#音频推理aarXiv cs.AI@Hui Geng 等 10 人原文稍后读已读值得跟进有用关注 AudioDER