#不确定性量化
用 conformal prediction 做不确定性估计的朋友看看,这篇论文证明了预测集变小就等于获得了信息,还给了 11 个实验验证。
做回归或不确定性量化的人可以看看:标准 GP 一旦 kernel 选错就崩,PrO-GPs 直接优化预测校准,实验显示误设下表现更稳。
做图神经网络的可以看看:一个表示同时搞定校准、OOD 检测和分布偏移,14 个基准 Brier score 最低,不用再各训练一个模型。
PGBB这招挺巧,把贝叶斯自助法改成按组分权重,不用给每个人的数据加独立噪声,隐私预算省了,后验不确定性也给得准。相比要预设生成模型的私有方法,它在人口普查数据上更好。
这篇论文提出了iPANN和fPANN,用区间和模糊集处理本构建模中的不确定性,能包围噪声观测,还能把不确定性传到有限元仿真里。
这篇论文发现直接用余弦相似度搞局部共形预测效果一般,但换个非线性变换后,预测集变小了,值得做VLM不确定性量化的看看。
这篇论文搞了个Argus基准,比较了27种不确定性方法在4个VLM模型和4个GUI数据集上的表现。结论很实在:方法排名换模型就不灵了,闭源还得单独测。做智能体部署的可以看看。
这篇论文用生成模型替换传统固定形状的不确定性集,给出了五个可操作的评估标准,生产规划实验数据扎实,搞鲁棒优化或不确定性量化的值得看看。
多智能体代码生成团队终于有了低成本的质量评估工具——FASE用0.3%的计算成本实现更优的代码正确性预测,做自动化软件开发的工程师可以直接集成到工作流中。
城市气候监测和热风险分析团队终于有了一个兼顾传感器预算和布局约束的实用方案——GNN在稀疏数据下比传统插值法更准,做城市热岛效应或极端高温预警的可以直接参考。
这篇论文解决了LLM错误预测中一个被忽视的关键问题——输入模糊性会干扰UQ指标的有效性。做模型可靠性评估或安全部署的团队,建议看看他们如何用模糊性标签提升预测精度,直接可用。
临床AI部署中,模型能否准确表达不确定性直接关系到患者安全——Reverse Probing让token级不确定性量化首次在临床摘要场景落地,做医疗NLP或AI安全的研究者值得关注。
做 CFD 逆设计或不确定性量化的研究者终于有了一个计算可行的方案——神经算子加速后,贝叶斯推断从小时级降到秒级,建议直接复现论文中的喷管案例。
做模型可解释性研究的团队终于有了可靠的置信度评估方法——bootstrap模式频率比传统log-prob校准误差低近5倍,建议做LLM内部机制分析的开发者直接参考论文代码。
做AI智能体评估或排行榜的团队终于有了统计严谨的不确定性量化工具——无需分布假设即可保证覆盖,还能处理多智能体管道和排名稳定性问题,建议做评估基准的开发者直接看论文和代码。
做时空序列预测的团队终于有了一个能同时处理空间相关性和误差时间累积的通用模块——Teger直接插入现有自回归模型就能提升长程预测可靠性,值得在电力、交通等场景试试。
做回归预测且需要不确定性量化的团队,这篇论文提供了一种能自适应数据偏态的新方法,比传统共形预测区间更高效,值得关注。