论文Agent 与开发者09:50T-Router:基于参数高效强化学习的推理路由方法T-Router用不到0.5%的参数就让大模型推理能力提升近10个点,比LoRA和全参数训练都强。#T-Router#参数高效强化学习#推理模型#GSM8KaarXiv cs.AI@Liuxian Ma 等 4 人原文稍后读已读值得跟进有用关注 T-Router