00:05elvis@omarsar0精选该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。论文智能体后训练GSM8K1 个信源在谈事件专题推荐理由:这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。原文稍后读已读值得跟进有用关注 智能体
10:12官方账号arXiv cs.LG@Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin针对大型语言模型(LLM)后训练,研究发现其训练策略常锁定初始选择;分析公开数据后发现,训练预算多用于局部调整而非策略修订;干预实验显示,增加经验或指导仅提升执行效果,未改变策略;不同任务上的计算投入效果存在明显差异。论文LLMGSM8KHumanEval1 个信源在谈事件专题推荐理由:OpenAI做了关于大模型后训练的研究,能分析训练策略问题,和以前方法比效果不一样。原文稍后读已读值得跟进有用关注 LLM
08:20elvis@omarsar0精选IBM发布BenchDrift研究,生成基准问题的语义等价变体来测试模型鲁棒性。结果显示,弱模型从改写中获益多于损失,而强模型损失远大于获益。在GSM8K、MMLU和MATH-Hard上测试的8个模型中,措辞敏感性随模型增强不降反增。该研究表明,顶尖模型的基准分数高度依赖题目措辞,而非纯粹能力。论文已发布于arxiv.org/abs/2608.11694。论文BenchDriftIBMGSM8K推荐理由:IBM这篇研究说明,看榜单选模型可能被题目措辞骗了,强模型反而更怕改写。原文稍后读已读值得跟进有用关注 BenchDrift
09:20官方账号arXiv cs.LG@Jiaming Cheng, Subhransu Das, Rajiv Ramnath多智能体LLM系统中,智能体间通过中继KV缓存而非文本交换信息。论文用错配缓存、清零缓存和矩匹配随机缓存做因果审计,覆盖LatentMAS、KVComm、C2C等系统。在接收方需要发送方私有信息时,主骨干上的相关中继达到100%,无关中继仅23%-25%。在不需要私有信息时,预注册五种子协议在GSM8K、ARC-Challenge、MedQA上显示等效性差异在2.8个点以内。清零中继造成14.7个点下降,而错配缓存仅0.4个点,说明缓存效应不一定来自示例配对。论文KV Cache多智能体Qwen3推荐理由:这篇论文给出了一套错配缓存审计法,对比LatentMAS、KVComm、C2C后发现,基准涨分不等于真在传潜在思维。原文稍后读已读值得跟进有用关注 KV Cache
09:40官方账号arXiv cs.AI@Yuzhou Liu, Xiyang HuCloud-ScPO 提出从大模型内部表征的几何结构中挖掘偏好信号,无需外部奖励模型。它利用少量标注样本构建正确与错误的参考云,将每条推理轨迹映射为平均池化隐藏状态,并用组件级软k近邻打分。在GSM8K和MATH-Numeric数据集上,Cloud-ScPO相较ScPO最高提升4.49%和4.19%。对配对轨迹的分析显示,该方法在保持正确率的同时,能更有效筛选出高质量的正确轨迹。论文Cloud-ScPOScPOGSM8K推荐理由:这篇论文教模型用自己脑内的几何结构来挑正确答案,不用额外奖励模型,在GSM8K和MATH上比原版ScPO高出4个多点。原文稍后读已读值得跟进有用关注 Cloud-ScPO
10:08官方账号arXiv cs.AI@Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl论文提出掩码感知策略梯度方法,解决强化学习应用于掩码扩散语言模型(MDLM)时对数似然估计难的问题。方法将MDLM生成建模为两阶段动作MDP,策略梯度分解为token项和掩码项。联合优化两项后,模型在GSM8K上达87.1%准确率,在MBPP上达53.4%得分,均达到当前最优。论文MDLM扩散语言模型策略梯度推荐理由:这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。原文稍后读已读值得跟进有用关注 MDLM
11:21官方一手arXiv: DeepSeek@El Hassane Ettifouri, Ayoub Belfatmi, Mahaman Sanoussi Yahaya Alassan, Walid Dahhane论文指出低比特量化使得小推理模型如DeepSeek-R1-Distill-Qwen-1.5B成本降低但可能削弱推理链,传统使用token对数概率增量作为解码监控指标是无效的,因其在模型自身采样下是均值为零的鞅,无法反映轨迹健康度。作者提出一种训练无关的解码控制器,结合退化感知报警分数和校准的e-process时序检测器。在GSM8K上测试FP16和INT4版本,原始监控触发93-95%生成,校准后变成选择性检测失败轨迹(φ≈0.3,精度约0.6,基准0.38)。INT4准确率从63%提升至69%(配对McNemar p=0.18,n=100),代价为28% token预算。论文DeepSeek-R1-Distill-Qwen-1.5BGSM8K量化推理模型推荐理由:这篇论文告诉你为什么监控量化的DeepSeek小模型不能用token概率,还给出了一个更靠谱的校准方法,真正提升了准确率。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B
12:36官方一手marktechpost@Sana Hassan精选该教程展示了如何用Tunix框架和GRPO算法微调Gemma-3模型在GSM8K数学数据集上。首先配置环境并通过Hugging Face加载Gemma-3,将样本包装为推理加答案格式。定义格式正确性和数值正确性的奖励函数,并附加LoRA适配器以降低训练成本。最终通过GRPO分组采样改进策略,并导出合并后的模型。技巧Gemma-3GSM8KGRPO1 个信源在谈事件专题推荐理由:手把手教你用Tunix GRPO和LoRA微调Gemma-3做GSM8K数学题,奖励函数设计得很清楚。原文稍后读已读值得跟进有用关注 Gemma-3
09:22官方一手arXiv: DeepSeek@Zhe Dong, Fang Qin, Manish Shah精选论文提出LearnStop方法,在固定预算检查点从推理前缀预测正确性,使用答案置信度、熵、前缀投票份额等特征。在GSM8K、MATH-500、MMLU-Pro、AIME-90、GPQA等18个任务-模型设置上评估,涉及Qwen3和DeepSeek-R1蒸馏模型。在GSM8K上使用Qwen3-32B时,后验峰值自适应增益达+0.157,验证选择操作点保持正增益。在多项选择和极难设置上,标量置信度、熵或稳定性规则更具竞争力。结论:学习停止的价值取决于轨迹结构,当许多问题在预算结束前变正确但缺乏可靠标量停止信号时有用。论文LearnStop推理模型GSM8K推荐理由:这篇论文分析了推理模型什么时候该提前停止计算。LearnStop在数学题上比简单规则好,但难题还是用置信度更靠谱。原文稍后读已读值得跟进有用关注 LearnStop
13:53官方账号arXiv cs.AI@Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary论文在Qwen3-14B策略上采用DPO,设置三个保守度β(低、中、高),并在在线适应中使用3×Qwen3-1.7B奖励集成。在GSM8K基准上测量准确率,发现更高保守度单调增加奖励黑客损伤,Goodhart gap及其曲线下面积AUGC的Spearman ρ=1.0。机制分析表明,高β DPO压缩策略熵,导致响应多样性降低,但集成分歧增加且被更快利用。论文进一步拟合幂律曲线,确定了平衡对齐保真度和漏洞的最优保守度β*。论文Qwen3-14BDPOGSM8K推荐理由:这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。原文稍后读已读值得跟进有用关注 Qwen3-14B
11:42官方账号arXiv cs.LG@Kanishk Awadhiya该论文提出一种受物理启发的推理机制,将大语言模型视为高维密集联想记忆体。作者通过吉布斯权重对多个推理路径进行加权(P∝e^{-βE}),使模型收敛到更稳定的吸引子盆地。实验表明,该方法在GSM8K上将微软Phi-3.5的准确率从84.7%提升至90.1%,提升5.38%。这揭示了推理过程更像动态松弛而非贪婪词预测。论文Phi-3.5GSM8K吸引子动力学2 个信源在谈事件专题推荐理由:这篇论文用物理能量模型解释推理,让Phi-3.5在GSM8K上提了5.38%,思路挺新。原文稍后读已读值得跟进有用关注 Phi-3.5
10:33官方一手arXiv: DeepSeek@Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo研究者提出了一种自动算法,通过生成数值重映射攻击来测试大语言模型在算术推理中的泛化能力。该方法自动推导问题的符号表示,生成约束数值映射并重新计算答案,通过确定性编辑实现问题变换。在GSM8K、MAWPS和MultiArith数据集上测试DeepSeek-R1、Gemma4和GPT-OSS模型,发现GSM8K上条件准确率下降12.16至25.82个百分点,而MAWPS和MultiArith更稳定。结果表明数值重映射鲁棒性强烈依赖于数据集结构,GSM8K即使保留推理程序仍敏感,而较短更规则的数据集更鲁棒。论文LLM算术推理鲁棒性1 个信源在谈事件专题推荐理由:做LLM评估和推理优化的团队会关心——GSM8K的脆弱性说明基准测试可能高估了模型的真实推理能力,建议关注数值变化对模型泛化的影响。原文稍后读已读值得跟进有用关注 LLM