10:23官方账号arXiv cs.AI@Abhishek Shukla, Ankur Sinha, Faiz HamidLP-NAS提出用线性规划求解可微分架构搜索中的更新方向,利用验证损失梯度与训练损失Hessian信息。该方法在DARTS搜索空间上派生出S-LP-DARTS和R-LP-DARTS两个变体,早期搜索迭代中收敛更快、验证性能更高。在CIFAR-10和CIFAR-100上,LP-DARTS在搜索与评估阶段均优于标准DARTS。与P-DARTS、PC-DARTS、STO-DARTS在CIFAR-10上的对比也显示其有效性,并在ImageNet上验证了迁移性。论文LP-NASDARTSCIFAR-10推荐理由:LP-NAS用线性规划算更新方向,CIFAR-10/ImageNet上优于DARTS及其变体。原文稍后读已读值得跟进有用关注 LP-NAS
10:21官方账号arXiv cs.AI@Abhishek Shukla, Ankur Sinha, Faiz Hamid该论文提出一个通用的双层优化框架,用于在MLP、CNN、RNN和Transformer等架构中搜索紧凑网络。三种可扩展方法分别基于神经元门控(NAS-NG)、混合激活(NAS-MA)及两者结合(NAS-NGMA),将离散决策转化为连续松弛。在MNIST上,NAS-NGMA达到98.68%测试准确率,MLP参数为7.69M;NAS-NG以0.26M CNN参数取得99.63%准确率。在CIFAR-10上,所提方法始终优于vanilla DARTS。实验还显示NAS-NG能优化过度参数化架构,在提升准确率的同时减少参数。论文神经架构搜索Neuron GatingMixed Activation推荐理由:这篇论文用可微优化替代离散搜索,Neuron Gating和Mixed Activation找紧凑网络,MNIST上0.26M参数就达99.63%准确率,比DARTS表现更好。原文稍后读已读值得跟进有用关注 神经架构搜索
09:34官方账号arXiv cs.LG@Quentin Luquet de Saint-Germain, Massil Ait Abdeslam, Jean Pierre David该方法利用训练集上累积和的分布,在累加过程中提前预测最终符号。在VGG11应用于CIFAR-10时,最深层卷积可去除86.6%的累加项,精度仅下降0.37个百分点。同时作用于三个最深卷积时,减少全网络25%的算术操作,精度下降1.36个百分点。全程无需重新训练模型参数。论文二值神经网络VGG11CIFAR-10推荐理由:这篇论文提出一个后训练技巧,能在二值网络里提前跳过大量累加计算,VGG11在CIFAR-10上最多省86.6%运算,精度损失很小。原文稍后读已读值得跟进有用关注 二值神经网络
12:26官方账号arXiv cs.LG@Dmytro Knopov论文复现了无归一化层的WideResNet-28-10上的联合能量模型(JEM),两个独立运行达到92.88%测试精度和44.46的buffer-FID,而原基准为92.9%和38.40。研究记录了两种失败模式:后期训练中通过异常缓冲机制引发的发散,以及SVHN OOD检测行为的运行依赖性。在约130个训练轮次中,Predictor-Corrector(PC)采样器替换SGLD并未带来任何方法级优势:所有十个检查点-OOD对上的AUROC绝对差低于0.007,FID差低于0.5。分层种子-图像自助抽样给出宏平均AUROC差值的95%置信区间包含零,种子级等价检验无法建立正式等价。论文JEMCIFAR-10SGLD推荐理由:这篇论文复现JEM,对比PC和SGLD采样器,结果在CIFAR-10上几乎没差别,AUROC差小于0.007,还暴露了训练发散问题。搞能量模型的人可以看看。原文稍后读已读值得跟进有用关注 JEM
12:03官方账号arXiv cs.LG@Shengzhi Deng, Chenqi Ye, Yanze Guo扩散模型在有限精度硬件上使用的随机性由伪随机规则产生,轨道结构可能成为可学习输入。研究用小型多层感知机预测轨道下一值,并用扩散探针将真实图像替换为随机张量。在MNIST和CIFAR-10上,不同伪随机源产生明显不同的扩散损失和生成质量。归一化后,探针损失与真实数据扩散损失近似遵循经验幂律,两个数据集指数不同。论文扩散模型伪随机MNIST推荐理由:这篇论文发现伪随机数的选择会影响扩散模型的生成质量,不是随便什么随机源都行,看看它是怎么测的。原文稍后读已读值得跟进有用关注 扩散模型
11:54官方账号arXiv cs.LG@Shreyas Pradeepkumar Khandale精选Ishida等人提出的软标签贝叶斯误差估计器β(z)=E[min(z,1-z)]在概率并非真实后验时会产生严重偏差。研究证明温度缩放会导致代理值与真实误差完全脱钩:固定分类器在CIFAR-10、Fashion-MNIST和SVHN的8个二分类任务上,0-1误差不变,代理值可变化56倍至980倍。理论推导表明温度与代理值之间存在连续双射,使同一分类器能报告(0,1/2)区间内的任意代理值。在Logits服从高斯分布时,作者给出了代理-温度曲线的闭式参数解,经验拟合误差小于0.018。校准温度(最小化ECE)与稳定的代理值没有对应关系。论文温度缩放贝叶斯误差代理校准推荐理由:这篇论文把校准里的一个坑讲透了:温度缩放能让同一个模型输出任意低的代理误差,但实际错误率根本没变,数值能差几百倍。做不确定性估计的一定要看。原文稍后读已读值得跟进有用关注 温度缩放
14:42官方一手marktechpost@Asif Razzaq精选Sakana AI 提出 Error Diffusion 方法,可训练符合 Dale 原则的双流兴奋/抑制网络,无需依赖反向传播。在 MNIST 基准上达到 96.7% 准确率,在 CIFAR-10 上达到 61.7% 准确率。该方法通过模数误差路由将训练规则从 MNIST 扩展到 CIFAR-10 及强化学习场景。消融实验显示,不同任务所依赖的机制具有特定性。AI模型Sakana AIError DiffusionDale's principle1 个信源在谈事件专题推荐理由:Sakana AI 搞出了不用反向传播也能训练的网络,MNIST 和 CIFAR-10 成绩还不错,研究生物合理学习的人可以看看。原文稍后读已读值得跟进有用关注 Sakana AI
09:50官方账号arXiv cs.AI@Katie Everett该论文揭示了Transformer前馈块中跳接和归一化不仅控制幅度,还通过调整分支与跳接的比例来保留梯度的秩。实验表明Pre-Norm使秩趋于平稳,而Post-Norm导致秩崩溃。双矩阵结构的宽度扩展遵循Marchenko-Pastur律,在CIFAR-10上输入-输出雅可比矩阵的初始化秩可预测网络训练性能。论文Transformer秩崩溃初始化推荐理由:想搞懂Transformer为什么深了还能训练?这篇从秩角度拆解跳接、归一化、双矩阵的设计逻辑,比堆实验更透彻。原文稍后读已读值得跟进有用关注 Transformer
09:04官方一手arXiv: DeepSeek@Kabir Dev Paul Baghel, Radu Timofte, Dmitry Ignatov该论文提出一种源引导的候选生成协议,利用同族强源模型指导弱目标模型的神经网络修改,避免无效生成。在CIFAR-10上,源引导候选达到0.5049准确率,优于非源候选的0.2398,提升弱目标(原0.1254)0.2651;五轮检查后保持0.7686 vs 0.4839。在SVHN AlexNet上使用DeepSeek-Coder-6.7B,源引导迁移达0.7880 vs 0.2254,重复实验达0.8069 vs 0.2509。直接复制源配置仅得0.1959,表明LLM适应而非复制。家庭级分析显示AlexNet家族6/8胜,alt_nn1家族8/10胜。论文DeepSeek-Coder-6.7BCIFAR-10SVHN推荐理由:这篇论文告诉你LLM不仅能写代码,还能帮你自动改进神经网络架构,效果比瞎试好得多,尤其适合有相似模型族的情况。原文稍后读已读值得跟进有用关注 DeepSeek-Coder-6.7B
10:41官方账号arXiv cs.LG@Lei Li, Yuexiao Dong研究者提出用f-散度诱导的非线性变换替换扩散模型的标准MSE去噪损失,在CIFAR-10数据集30%污染条件下,负指数散度(NED)将FID从93.0(KL散度)降至77.5。该方法基于局部散度构造,利用DDPM高斯反向核结构将每步条件f-散度简化为去噪误差的一维函数。Hellinger散度产生显式指数权重,连接至稳健M估计框架。实验显示NED优于Huber损失和截断MSE等常见鲁棒损失。论文扩散模型f-散度CIFAR-10推荐理由:这篇论文改进了扩散模型的抗污染能力,用f-散度加权去噪在CIFAR-10上30%污染时FID从93降到77,比常用鲁棒损失好用。原文稍后读已读值得跟进有用关注 扩散模型
10:29官方账号arXiv cs.LG@Alexandre Lemire Paquin, Brahim Chaib-Draa, Philippe Giguère本文研究利用平滑损失函数对PAC-Bayes界进行去随机化,以获得确定性预测器的高概率泛化界。通过后验均值从Gibbs预测器到确定性预测器的代价由Jensen gap类的泛化差距给出,并通过Rademacher复杂度控制。得到的界涉及参数Jacobian和得分映射Hessian表示的平坦度量,适用于有界和无界平滑损失,并特例化为线性预测器和平滑神经网络。理论中的Jacobian和Hessian量启发了一个实用的正则化器,对BatchNorm网络在CIFAR-10上进行了不同批量大小下的实验。论文PAC-Bayes泛化界正则化器推荐理由:这篇论文从PAC-Bayes理论推导出一个基于Jacobian和Hessian的新正则化器,在CIFAR-10上验证有效,值得搞泛化理论的人看看。原文稍后读已读值得跟进有用关注 PAC-Bayes
09:51官方账号arXiv cs.LG@Zhenyu YuInstantForget是一种新的后门遗忘方法,无需更新模型参数即可在推理时移除恶意触发行为。在CIFAR-10 ResNet-18上,它针对BadNets、WaNet、Blended和SIG四种触发方式,将平均攻击成功率(ASR)降至0.071。该方法通过马氏距离标记异常特征并重置为中性表示,达到0.981的检测AUROC,并成功迁移至六种主干网络。论文还揭示了投影假设在WaNet等触发下的失效(ASR分别达0.683、0.888和0.941),并用logit-trilplet间隙预测失败。论文InstantForget后门攻击模型安全推荐理由:这篇论文提出InstantForget,不用重新训练就能清除模型后门,在CIFAR-10上把攻击成功率压到7%,还搞了个检测机制AUROC 98%,挺实用的。原文稍后读已读值得跟进有用关注 InstantForget
04:26官方一手marktechpost@Sana Hassan精选本教程使用NVIDIA FLARE构建联邦学习实验,在非IID CIFAR-10数据集上比较FedAvg和FedProx算法。客户端数据通过Dirichlet分布分割以模拟现实中的标签不平衡。利用NVFlare Job API定义和启动联邦任务。教程包含具体实现步骤和性能对比。技巧FedAvgFedProxNVIDIA FLARE推荐理由:手把手教你用NVIDIA FLARE做FedAvg和FedProx对比实验原文稍后读已读值得跟进有用关注 FedAvg