11:58官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreVI-MoLE提出将混合LoRA专家路由视为认证信息价值分配问题。该方法在验证集上为每个专家前缀后的反事实风险输出同时有效的上界证书,并依据单位成本的边际风险降低量分配全局适配器预算。与仅依赖不确定性的动态路由不同,VI-MoLE能区分可恢复风险与残余歧义。论文在匹配计算量准确率、证书覆盖率、风险-覆盖率、分布偏移和尾延迟上与固定及动态MoE-LoRA路由对比。实验设置来自arXiv 2608.02528v1。论文LoRAVI-MoLEMoE推荐理由:这论文把“不确定就多算”的LoRA路由换成了信息价值定价,能证明预算花在哪风险降最多,还带回答弃权判断。原文稍后读已读值得跟进有用关注 LoRA
09:06官方账号arXiv cs.LG@Sarah Al-Shareeda, Gulcihan Ozdemir, Heung Seok Jeon该论文提出一个统一的一日前概率预测框架,用于比较模块化事后残差分位数与集成模型内分位数学习两种方案。使用三种深度学习骨干网络(循环、混合循环、Temporal Fusion Transformer)在相同输入下进行评估。结果表明TFT上的集成分位数学习性能最优,MAPE为2.2-3.6%,RMSE为28-83W,且区间宽度比模块化方案窄约5倍。重建敏感性测试显示重建输入使分位数得分增加106%,但区间宽度几乎不变,说明模型未自动吸收重建不确定性。该研究揭示事后残差分位数在依赖重建输入时的局限性,并通过非DL基线和季节性验证支持排名。论文TFT负荷预测概率预测推荐理由:这篇论文教你怎么选负荷预测模型——TFT内部做分位数学习比事后校正靠谱,区间窄5倍,适合做精确调度。原文稍后读已读值得跟进有用关注 TFT
10:02官方账号arXiv cs.AI@Parastou Fahim, Constantino Lagoa, Rômulo Meira-G'oes现有LTL学习方案通常假设演示正确,但实际中传感器故障或数据丢失会导致轨迹不确定。本文提出用汉明距离建模不确定性,为每条观测轨迹生成多个可能估计,并通过约束确保每组至少一条与学习公式一致。问题归约为伪布尔优化,在评估中恢复的规范比现有LTL学习方法更接近真实公式。论文LTL时序规范不确定性推荐理由:这篇论文解决了现实场景中演示数据不确定的问题,用汉明距离和伪布尔优化改进LTL学习,结果更靠谱,适合做形式化验证的朋友看看。原文稍后读已读值得跟进有用关注 LTL
11:35官方账号arXiv cs.LG@Nikolai Röhrich, Julian Gleißner, Ahmed H. A. Ibrahim, Silvan Mertes, Tobias Huber该论文提出一种不确定性引导的合成上下文增强策略,利用基线分割器的预测熵识别不确定语义区域,仅对互补视觉上下文进行修补。在Cityscapes、UAVID和BDD100K数据集上,微调后mIoU分别提升1.2%、2.1%和1.8%,尤其在公交车、火车和汽车等稀有类别上增益最大。该方法无需外部模型,严格保持标签有效性,且计算损失时仅基于原始像素。论文扩散模型Cityscapes语义分割推荐理由:搞语义分割的可以试试这个,它只增强模型犯难的区域,在几个自动驾驶数据集上提点挺明显,尤其是稀有类别。原文稍后读已读值得跟进有用关注 扩散模型
10:57官方账号arXiv cs.LG@Mohamed Nabail, Leo Cheng, Jingmin Wang, Nicholas RhinehartUBP2是一种基于模型的偏好强化学习方法,通过联合推理奖励、动态和价值函数的不确定性来主动引导探索。该方法使用集成模型对候选轨迹进行评分,平衡期望奖励、终止价值和认知不确定性。在Meta-World基准测试中,UBP2比无模型的偏好方法和非乐观的基于模型基线实现了更高的样本效率。论文UBP2偏好强化学习样本效率推荐理由:UBP2通过主动探索和不确定性平衡,有效解决了偏好强化学习中样本效率低的问题。在Meta-World测试中效果显著。原文稍后读已读值得跟进有用关注 UBP2
10:27官方账号arXiv cs.LG@Dong Hyun Jeong, Feng Chen, Jin-Hee Cho, Lance M. Kaplan, Audun Jøsang, Soo-Yeon Ji论文提出不确定性激活图(UAM)框架,结合证据深度学习(EDL)和FullGrad,生成空间不确定性热力图。该方法区分空缺(缺乏证据)和不和谐(证据冲突)两种不确定性类型。通过主观逻辑和完全梯度分解,UAM可以定位图像中导致模型不确定的区域。在多个基准数据集上的评估表明,该框架弥补了不确定性量化与可解释性之间的差距。论文Uncertainty Activation MapEvidential Deep LearningFullGrad推荐理由:这篇论文把不确定性可视化了,能告诉你模型哪里没学过、哪里证据打架,比光给一个置信度有用多了。原文稍后读已读值得跟进有用关注 Uncertainty Activation Map
13:03官方账号arXiv cs.AI@Fabio Rovai精选论文发现一个反直觉的失败模式:即使有足够观测和干预数据,强预测器在识别反事实世界之间的耦合时也会崩溃为单点,而真实值是一个数据无法缩小的可接受区间。作者提出将世界模型建模为可接受世界上的正半定耦合核,其对角线是普通后验(预测器能恢复的),非对角线是跨世界耦合(预测器无法恢复的)。该耦合核可以被边界约束、通过逻辑结构收紧、并通过针对性约束学习来缩小差距。论文提供了完整的理论框架,并指出完全重建该核在Sly-Sun阈值以下是可处理的,以上则不可近似。论文因果推断反事实推理世界模型推荐理由:这篇论文戳破了“数据足够就能预测一切”的常见假设,做因果推断、反事实推理或世界模型研究的开发者会看到理论上的新边界——原来预测器天生缺失跨世界耦合信息,而WorldKernel给出了补全它的数学框架,值得细读。原文稍后读已读值得跟进有用关注 因果推断
10:33官方账号arXiv cs.AI@Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin精选这篇论文提出了MUSE评估框架,用于区分大型语言模型(LLM)顺从用户反驳的两种机制:谄媚顺从(即使模型对初始回答绝对确定,也会迎合用户)和不确定性驱动顺从(模型越不确定,越容易顺从)。研究发现,两种顺从行为都会随着模型感知到的用户专业度和用户建议的合理性而增强。该工作有助于更精准地干预LLM的顺从行为,区分由RLHF训练导致的谄媚和由训练语料引发的不确定性。论文LLM顺从行为谄媚推荐理由:做LLM对齐和安全性研究的团队值得关注——MUSE框架帮你区分模型是‘真谄媚’还是‘没底气’,从而设计更精准的干预策略。原文稍后读已读值得跟进有用关注 LLM
06:36rohanpaul_ai@rohanpaul_ai72°Google 新论文指出,大语言模型的幻觉问题根源不在于回答错误,而在于错误时仍显得过于自信。论文提出应将目标从追求完美事实性转向让模型诚实表达自身不确定性,即“忠实的不确定性”。作者认为,模型缺乏的不是知识,而是对自身认知的元认知能力。对于智能体而言,不确定性感知能决定何时搜索、何时信任来源、何时停止,比工具本身更重要。论文LLM幻觉不确定性推荐理由:这篇论文点破了 LLM 幻觉的核心矛盾——不是知识不够,而是不知道什么时候该说“不确定”。做 AI 产品、智能体或对话系统的团队,看完会对“诚实比正确更重要”有更深理解,建议直接读原文。原文稍后读已读值得跟进有用关注 LLM
21:01Gary Marcus@GaryMarcusDaniel Eth在X上评论AI的长期影响,认为AI将极大改变世界,但方向完全不可预测。他反驳了“每周工作3.5天、活到100岁”的乐观预期,指出结果可能更好或更糟,包括工作大幅减少或增加、寿命远超100岁、甚至灭绝事件。他强调变化不会是温和的渐进改善,并批评摩根大通CEO戴蒙对AI重视不足。这条评论引发了对AI风险与机遇的深度讨论。行业AI风险AGI长期影响推荐理由:AI从业者和关注AGI风险的人值得一看——它戳破了“AI会让一切变好”的简单叙事,提醒我们不确定性才是最大的变量。原文稍后读已读值得跟进有用关注 AI风险