论文Agent 与开发者12:15Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails研究解决了小模型模仿专家时的性能下降问题,提出了新的在线策略修正方法,让小模型在特定任务中更接近大模型表现。#智能体#系统提示#Qwen3-Coder#Gemma 4aarXiv cs.AI@Zhou Yu 等 11 人原文稍后读已读值得跟进有用关注 智能体