11:43官方账号arXiv cs.AI@Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li研究人员提出了一种基于图的在线难度估计器,用于优化强化学习可验证奖励(RLVR)的调度效率。该框架通过构建语义和推理相似性的样本图,使用Potts先验和Beta-Binomial模型聚合rollout结果。实验表明,该方法在多个基础模型、RL调度器和基准测试中实现了更好的性能,无需专门的探测即可缓解冷启动和反馈过时问题。论文RLVR强化学习图结构推荐理由:论文提出了一种即插即用的图结构难度估计器,能智能分配探索资源,让RLVR更高效。原文稍后读已读值得跟进有用关注 RLVR
11:35官方账号arXiv cs.LG@Georgy Noarov, Aaron RothDefensive Booster是面向在线二元结果概率预测的新算法。它在每条对抗序列上与H的跨度最佳预测竞争Brier分数,速率与在线梯度提升相同;在平滑弱学习条件满足时,其随机分类误差速率与在线分类提升相同。该算法仅访问一个弱类学习器,而之前的方法需维护多个弱学习器集成。实验表明其预测性能强,运行时间快几个数量级。论文Defensive BoosterBoosting在线学习推荐理由:Defensive Booster这新算法,用单个弱学习器同时拿到在线梯度提升和分类提升的保证,跑得还快几个数量级。原文稍后读已读值得跟进有用关注 Defensive Booster
09:22官方账号arXiv cs.LG@Juwei Shen, Yujie Wu, Changwen Chen现有脉冲神经网络(SNN)在Garg-2022上下文学习基准上无法应对非平凡任务维度。DendriCL通过将单个树突区室作为计算基质,其顶端递归结构与leaky online Widrow-Hoff LMS在动力学上等价。该单层架构在超维Garg-2022任务上保持种子稳定性,而密集Transformer出现grokking式不稳定并失败。线性探针从顶端膜电位直接恢复参考online-LMS轨迹,R²达0.93,表明算法内嵌于动力学而非训练隐式发现。论文DendriCLSNN上下文学习推荐理由:这篇论文证明了单层脉冲神经网络就能实现上下文学习,比Transformer更稳定,在Garg-2022基准上表现亮眼。原文稍后读已读值得跟进有用关注 DendriCL
11:24官方账号arXiv cs.LG@Yousuf Moiz Ali, Jaroslaw E. Prilepsky, João Pedro, Sasipim Srivallapanondh, Antonio Napoli, Sergei K. Turitsyn, Pedro Freire该论文提出一种混合主动在线学习框架,针对光网络故障检测中的概念漂移问题。采用基于边界的选择性标注策略,仅需查询3.4%的流式样本即可达到接近上限的准确率和AUC分数。相比于静态推理,该方法延迟开销可忽略不计。实验验证了该框架在标签高效场景下的有效性。论文概念漂移主动学习在线学习推荐理由:这篇论文只用3.4%的标注数据就搞定了光网络故障检测中的概念漂移,效率高延迟低,做在线学习和故障检测的朋友可以看看。原文稍后读已读值得跟进有用关注 概念漂移
12:40官方账号arXiv cs.LG@Udvas Das, Waris Radji, Debabrota Basu, Odalric-Ambrym Maillard精选本文提出了一种名为 Dri-MED 的算法,用于解决线性上下文随机多臂赌博机问题,其中学习者需为具有个性化偏好的用户群体提供推荐,且上下文分布随时间漂移。在实用假设下,该问题被简化为具有异方差非平稳噪声的平稳均值线性赌博机。算法还确保每次决策的平均奖励不低于基线策略,实现了与约束感知次优间隙相关的实例相关遗憾界,并具有理论保证的约束违反次数。数值实验表明,Dri-MED 显著优于忽略漂移和偏好结构的保守基线方法。论文在线学习上下文赌博机非平稳环境推荐理由:在线推荐系统常面临用户偏好漂移和基线约束的挑战,Dri-MED 为这类问题提供了理论扎实且效果显著的解决方案,做推荐系统或在线学习的团队值得关注其算法设计。原文稍后读已读值得跟进有用关注 在线学习
09:22官方账号arXiv cs.AI@Alexandre Belloni, Yan Chen, Yehua Wei该论文提出了一种在线上下文潘多拉魔盒模型,用于自适应查询和选择LLM API。决策者在每个周期观察请求上下文,面临两阶段决策:查询阶段顺序调用API并产生输出相关成本,选择阶段从生成的输出中选一个部署并观察下游奖励。与经典模型不同,该模型输出反馈结构不直接揭示奖励。研究者直接建模保留索引,结合广义矩估计和UCB置信界,实现了维度相关的√T累积遗憾。论文LLM API自适应查询潘多拉魔盒模型推荐理由:LLM API调用成本高、选择困难,这篇论文为开发者提供了理论驱动的自适应查询策略,做模型编排或API调度的团队可以直接参考其方法优化成本与效果。原文稍后读已读值得跟进有用关注 LLM API
19:11官方一手arXiv: DeepSeek@Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia论文研究了连续潜在上下文(continuous latent context)如何帮助Transformer模型实现在线决策与学习。研究者构造了恒定深度的Transformer,通过少量潜在上下文令牌存储算法状态,成功实现了加权多数算法和Q-learning两种在线决策过程。实验表明,使用多课程目标训练的小型GPT-2风格模型,在长合成在线预测序列上表现优于Qwen-3-14B和DeepSeek-V3等更大更复杂的LLM。该工作为Transformer在需要长期自适应交互的场景中提供了一种简单有效的持续状态机制。论文在线学习Transformer潜在上下文推荐理由:该工作通过理论构造和实验验证,说明了连续潜在上下文可作为Transformer在线学习的通用状态载体,为构建能长期自适应交互的轻量级AI系统提供了新思路。原文稍后读已读值得跟进有用关注 在线学习