Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
研究解决了小模型模仿专家时的性能下降问题,提出了新的在线策略修正方法,让小模型在特定任务中更接近大模型表现。
研究解决了小模型模仿专家时的性能下降问题,提出了新的在线策略修正方法,让小模型在特定任务中更接近大模型表现。
Simon Willison 挖到 Claude Opus 5 系统提示里居然写了 Fable 出口管制这事,怕模型答不上来。挺有意思的。
Anthropic发现Claude Code的新模型Fable 5太聪明,系统提示反而碍事,直接砍掉80%。