11:54官方账号arXiv cs.LG@Shreyas Pradeepkumar Khandale精选Ishida等人提出的软标签贝叶斯误差估计器β(z)=E[min(z,1-z)]在概率并非真实后验时会产生严重偏差。研究证明温度缩放会导致代理值与真实误差完全脱钩:固定分类器在CIFAR-10、Fashion-MNIST和SVHN的8个二分类任务上,0-1误差不变,代理值可变化56倍至980倍。理论推导表明温度与代理值之间存在连续双射,使同一分类器能报告(0,1/2)区间内的任意代理值。在Logits服从高斯分布时,作者给出了代理-温度曲线的闭式参数解,经验拟合误差小于0.018。校准温度(最小化ECE)与稳定的代理值没有对应关系。论文温度缩放贝叶斯误差代理校准推荐理由:这篇论文把校准里的一个坑讲透了:温度缩放能让同一个模型输出任意低的代理误差,但实际错误率根本没变,数值能差几百倍。做不确定性估计的一定要看。原文稍后读已读值得跟进有用关注 温度缩放
09:04官方一手arXiv: DeepSeek@Kabir Dev Paul Baghel, Radu Timofte, Dmitry Ignatov该论文提出一种源引导的候选生成协议,利用同族强源模型指导弱目标模型的神经网络修改,避免无效生成。在CIFAR-10上,源引导候选达到0.5049准确率,优于非源候选的0.2398,提升弱目标(原0.1254)0.2651;五轮检查后保持0.7686 vs 0.4839。在SVHN AlexNet上使用DeepSeek-Coder-6.7B,源引导迁移达0.7880 vs 0.2254,重复实验达0.8069 vs 0.2509。直接复制源配置仅得0.1959,表明LLM适应而非复制。家庭级分析显示AlexNet家族6/8胜,alt_nn1家族8/10胜。论文DeepSeek-Coder-6.7BCIFAR-10SVHN推荐理由:这篇论文告诉你LLM不仅能写代码,还能帮你自动改进神经网络架构,效果比瞎试好得多,尤其适合有相似模型族的情况。原文稍后读已读值得跟进有用关注 DeepSeek-Coder-6.7B