论文精选12:12MADA-RL: 面向紧凑模型高效推理的多智能体辩论强化学习小模型也能提升推理?MADA-RL用LoRA微调1/16参数,让1.5B模型准确率涨2个点,评论家专挑生成器错误来纠正。#MADA-RL#DeepSeek-R1-Distill-Qwen-1.5B#LoRA#多智能体aarXiv: DeepSeek@Martino M. L. Pulici 等 6 人原文稍后读已读值得跟进有用关注 MADA-RL