论文Agent 与开发者精选09:25无标签引导压缩测试时强化学习至仅偏置子空间朋友A发现一个新技巧,用label-free的方法在测试时只改偏置参数就能提升模型性能,而且比全参数优化快得多。#label-free steering#test-time reinforcement learning#TTRL#推理模型aarXiv cs.AI@Naveen Vakada 等 3 人原文稍后读已读值得跟进有用关注 label-free steering
论文Agent 与开发者精选73°13:26代码生成中的熵正则化排序掩码策略优化这篇论文提出ERPO方法,解决了代码生成中TTRL的奖励信号问题,在编程基准测试中大幅提升性能。#代码生成#TTRL#ERPO#编程基准aarXiv cs.LG@Jiacheng Xu 等 4 人原文稍后读已读值得跟进有用关注 代码生成
论文09:29概率校准能否减轻LLM智能体反馈循环中的偏好耦合?这篇论文实验发现,对评估器做概率校准能把偏好耦合降低20-49%,效果显著,推荐给做LLM评估管线的朋友。#DeepSeek-V4-Pro#GLM5.2#TTRL#偏好耦合aarXiv: DeepSeek@Zewen Liu原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro