模型Agent 与开发者79°16:18Meta RAM 团队提出 RL-XAR:用专家对齐评分标准做写作 RLMeta 把 RL 那套可验证奖励搬进了写作:先让 Kimi-K2.6 自动生成能区分专家和 AI 的评分标准,再用它训练 Qwen3.5-27B,盲评 95% 胜率打赢人类专家文本。#RL-XAR#Meta#Qwen3.5-27B#GRPOshao__meng@shao__meng原文稍后读已读值得跟进有用关注 RL-XAR