论文10:12Agon: 竞争性跨模型强化学习的隐式对手评分推理Agon让两个模型互相打分比赛,推理能力直接翻倍,比GRPO强一倍,而且完全不需要人工标注过程标签。#Agon#Qwen3#Gemma 4#推理模型aarXiv cs.LG@Vladislav Beliaev原文稍后读已读值得跟进有用关注 Agon