11:01官方账号arXiv cs.LG@Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng论文提出ReAlloc,一个用于多通道预算分配的快速-慢速因果框架。它通过正交教师从短期日志提取无偏局部梯度,再由解释引导学生蒸馏为长期边际收益场。在淘宝平台的大规模在线A/B测试中,ReAlloc同时提升了支付订单数和收入。与标准预测-优化方法相比,该方法能处理跨渠道替代效应并避免外推。论文ReAllocUplift模型因果推断推荐理由:这篇论文教电商平台怎么在多个营销渠道间分钱,用ReAlloc框架在淘宝实测同时涨订单和收入,比传统预测-优化方法更稳。原文稍后读已读值得跟进有用关注 ReAlloc
10:10官方账号arXiv cs.LG@Rüdiger Kempf该论文提出两阶段采样框架,离线核回归算子从N个输入-输出对学习算子的离散表示,在线核重构算子从预测观测恢复输出函数。理论贡献是推导了预算分配条件,要求训练对数量N、输入观测数n和输出分辨率m满足耦合关系以保证收敛。总误差分解为重构误差和学习误差,可独立分析,并得到定量缩放律。此外,引入物理信息扩展,在线重构时通过惩罚PDE残差增强约束,无需重新训练。数值实验验证了理论扩展的有效性。论文Kernel-based Operator Learning算子学习误差分析推荐理由:论文把算子学习的误差分解讲得很清楚,还给出了N、n、m的预算分配条件,物理信息扩展省去重新训练,做相关研究值得细读。原文稍后读已读值得跟进有用关注 Kernel-based Operator Learning
10:37官方账号arXiv cs.LG@Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang JiTRACE 提出了一种针对多轮智能体强化学习(RLVR)的 rollout 预算分配框架,解决了因奖励对比不足导致的策略优化效率低问题。传统方法仅在 prompt 层面分配资源,忽略了同一 rollout 中不同回合(turn)前缀的信息量差异。TRACE 将每个 ReAct 风格的思考-行动-观察回合建模为语义节点,形成树状结构,并动态分配预算到最可能产生混合奖励的 prompt 根节点和中间前缀。实验表明,在相同采样成本下,TRACE 在 Multi-Hop QA 等基准上将 Qwen3-14B 的平均准确率提升了 2.8 个百分点。该框架通过增强奖励对比,显著提升了多轮智能体任务的训练效率。论文强化学习智能体预算分配推荐理由:做智能体强化学习或 RLVR 的团队,TRACE 解决了多轮 rollout 中奖励信号稀疏的痛点,直接用树状分配提升采样效率,值得在自家 agent 训练流程中试试。原文稍后读已读值得跟进有用关注 强化学习
10:10官方一手arXiv: DeepSeek@Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang, Mengzhe Ruan, Hanxu Hou, Peisong Wang, Linqi Song, Shuang Qiu精选ReasonAlloc 是一种无需训练的框架,针对大语言模型推理中长思维链(CoT)导致的KV缓存快速增长问题,提出分层预算分配方案。它通过离线层间预分配捕捉架构驱动的“推理波”模式,并结合在线头间实时重分配,将资源导向信息丰富的注意力头。在数学推理基准(MATH-500、AIME 2024)上,使用DeepSeek-R1-Distill-Llama-8B等模型测试,ReasonAlloc在低预算(128-512 tokens)下显著优于均匀预算方法(如R-KV、SnapKV)。该框架可即插即用于现有token驱逐策略,且推理开销极小。论文KV缓存压缩推理模型预算分配推荐理由:推理模型的长CoT导致KV缓存爆炸,做推理优化的开发者可以直接用ReasonAlloc替代均匀预算方案,在低预算下获得显著性能提升。原文稍后读已读值得跟进有用关注 KV缓存压缩