10:21官方账号arXiv cs.AI@Abhishek Shukla, Ankur Sinha, Faiz Hamid该论文提出一个通用的双层优化框架,用于在MLP、CNN、RNN和Transformer等架构中搜索紧凑网络。三种可扩展方法分别基于神经元门控(NAS-NG)、混合激活(NAS-MA)及两者结合(NAS-NGMA),将离散决策转化为连续松弛。在MNIST上,NAS-NGMA达到98.68%测试准确率,MLP参数为7.69M;NAS-NG以0.26M CNN参数取得99.63%准确率。在CIFAR-10上,所提方法始终优于vanilla DARTS。实验还显示NAS-NG能优化过度参数化架构,在提升准确率的同时减少参数。论文神经架构搜索Neuron GatingMixed Activation推荐理由:这篇论文用可微优化替代离散搜索,Neuron Gating和Mixed Activation找紧凑网络,MNIST上0.26M参数就达99.63%准确率,比DARTS表现更好。原文稍后读已读值得跟进有用关注 神经架构搜索
09:26官方账号arXiv cs.LG@Zonghuan Xu, Krishna Harish该论文通过过参数化线性回归模型分析渐进适应的训练时间分配。当任务数N增大且每任务训练时间为s_N时,若Ns_N趋近τ,学习进度收敛为连续曲线。进度在小τ时按Θ(τ)增长,大τ时按Θ(1/τ)下降,因此最优每任务训练时间缩放为s_N^*=Θ(1/N)。实验在逐渐旋转的MNIST和Yearbook时间偏移上验证了该结论。论文MNISTYearbook持续学习推荐理由:这篇论文发现:渐进适应时任务分得越细,每个任务训练时间反而要按1/N缩放。用MNIST和Yearbook验证了,做持续学习的朋友可以看看。原文稍后读已读值得跟进有用关注 MNIST
12:03官方账号arXiv cs.LG@Shengzhi Deng, Chenqi Ye, Yanze Guo扩散模型在有限精度硬件上使用的随机性由伪随机规则产生,轨道结构可能成为可学习输入。研究用小型多层感知机预测轨道下一值,并用扩散探针将真实图像替换为随机张量。在MNIST和CIFAR-10上,不同伪随机源产生明显不同的扩散损失和生成质量。归一化后,探针损失与真实数据扩散损失近似遵循经验幂律,两个数据集指数不同。论文扩散模型伪随机MNIST推荐理由:这篇论文发现伪随机数的选择会影响扩散模型的生成质量,不是随便什么随机源都行,看看它是怎么测的。原文稍后读已读值得跟进有用关注 扩散模型
10:32官方账号arXiv cs.LG@Ye Shi本文提出软约束优化方法以平衡VAE的编码容量与解纠缠。在dSprites数据集上,熵约束(EC)使聚合潜在变量激活得分提升43%-62%,FactorVAE得分达0.891(对比β-VAE变体的0.847),重建误差降低38%。在MNIST上,权重过滤将下游分类器所用潜在维度从10降至2,精度保持在90%以上且收敛轮次减少37%。研究发现,低熵离散因子倾向于合并到单个潜在变量,高熵连续因子则分散到多个变量中。论文Variational AutoencoderSoft-Constrained OptimizationdSprites推荐理由:想提升VAE解纠缠又不想牺牲重建质量?这篇论文用软约束同时搞定,dSprites上FactorVAE得分刷到0.891,值得看看。原文稍后读已读值得跟进有用关注 Variational Autoencoder
14:42官方一手marktechpost@Asif Razzaq精选Sakana AI 提出 Error Diffusion 方法,可训练符合 Dale 原则的双流兴奋/抑制网络,无需依赖反向传播。在 MNIST 基准上达到 96.7% 准确率,在 CIFAR-10 上达到 61.7% 准确率。该方法通过模数误差路由将训练规则从 MNIST 扩展到 CIFAR-10 及强化学习场景。消融实验显示,不同任务所依赖的机制具有特定性。AI模型Sakana AIError DiffusionDale's principle1 个信源在谈事件专题推荐理由:Sakana AI 搞出了不用反向传播也能训练的网络,MNIST 和 CIFAR-10 成绩还不错,研究生物合理学习的人可以看看。原文稍后读已读值得跟进有用关注 Sakana AI
11:51官方账号arXiv cs.LG@Subodh KaliaNeuronSoup是一种新型神经计算架构,用异步延迟介导的信号传播取代逐层同步处理,隐藏神经元在路径间共享。在10类MNIST数字分类任务中,使用冻结ResNet18特征输入,系统进化出204条活跃路径、266个隐藏神经元(156个共享,1个参与11条路径),10,000代后测试准确率85.9%,模型仅115KB。该架构无需可微计算图,每个样本自适应计算深度,并自动发现处理路径间的横向交互。AI模型NeuronSoup遗传算法共享神经元1 个信源在谈事件专题推荐理由:NeuronSoup用遗传算法进化共享神经元图,不依赖反向传播,在MNIST上达到85.9%准确率,模型只有115KB,适合探索非梯度训练的新路子。原文稍后读已读值得跟进有用关注 NeuronSoup
12:42官方账号arXiv cs.LG@Heloísa Dias Viotto, Cauê Samonek, Lucas Garcia Pedroso, Marcos Sunye, André Abed Grégio, Paulo Lisboa de Almeida本论文针对孪生验证网络(Siamese verification networks)中距离阈值的设定问题,提出了一种基于双峰分布假设的无监督方法。该方法通过识别距离分布两个模态之间的最低点来确定阈值,无需标注数据。在MNIST、CIFAR-10、LFW和PKLot四个数据集上的实验显示,平均验证准确率达到94%,与需要标注的等错误率(EER)方法性能相当。该工作使得验证阈值可直接在部署环境中更新,降低了人工标注成本。论文孪生网络验证无监督学习推荐理由:这篇论文教你怎么不用标数据就自动设好验证阈值,在四个数据集上测了准确率94%,跟用标数据的方法差不多,挺实用的。原文稍后读已读值得跟进有用关注 孪生网络
10:36官方账号arXiv cs.LG@Yu-Neng Wang, Sara Achour73°模拟硬件(如耦合振荡器)能耗比数字计算低两个数量级,但物理方程限制无法直接运行现代生成模型。该文提出Analog Interaction Systems(AIS)框架,利用时变分段参数和隐藏物理状态两种机制缩小表达差距,并采用Wasserstein GAN训练。在MNIST和Fashion-MNIST上,基于振荡器的AIS分别取得FID 27.6和80.8,比此前最优模拟硬件生成模型提升3-4倍。能量估算为每张生成图像23μJ,较数字基线降低约100倍。AI模型AIS模拟硬件生成模型推荐理由:模拟硬件跑生成模型能耗低两数量级,AIS框架在MNIST上FID仅27.6,比之前好3-4倍,适合低功耗场景。原文稍后读已读值得跟进有用关注 AIS
10:56官方账号arXiv cs.LG@Daniel Romero Schellhorn, Till Mossakowski, Björn GehrkeNeSyCat Torch 扩展了 ULLER 框架,通过强单子和真值聚合结构统一了经典、模糊、概率和神经语义。该实现使用分布单子进行参考语义和度量评估,并引入惰性对数张量单子实现数值稳定可微训练。在 MNIST 加法任务上,基于 HaskTorch、JAX 和 PyTorch 的实现比 LTN 和 DeepProbLog 更快且准确率更高,同时达到接近 DeepStochLog 的精度。该框架保持单子参数化,未来可扩展至连续概率(如 Giry 单子)。论文NeSyCat TorchULLER神经符号学习推荐理由:把神经符号学习统一到一个可微框架里,在 MNIST 加法上比 LTN 和 DeepProbLog 又快又准,还兼容 PyTorch。原文稍后读已读值得跟进有用关注 NeSyCat Torch
10:02官方账号arXiv cs.LG@Vincent C. Brockers, Roman D. Ventzke, Valentin Neuhaus, Belén Hidalgo-Ogalde, Viola Priesemann本文研究了神经网络中的“潜意识学习”现象,即学生模型通过教师模型在任务无关的输入-输出对上进行蒸馏,从而获得任务相关知识或偏差。先前研究认为这需要师生初始化高度匹配,但本文证明只需兼容的输出头即可实现。在MNIST数据集上,通过将输出分为辅助头(处理噪声)和分类头,即使在隐藏层随机初始化、增减层或改变架构(如MLP到CNN)的情况下,潜意识学习仍会发生。兼容的辅助头能传递可恢复的教师信号,使学生表征更接近教师。当分类头也兼容时,仅用噪声训练的学生模型可接近甚至匹配教师的任务性能。本文还建立了理论解释机制并推导了失效的上界,将潜意识学习从意外现象转化为可预测的机制。论文知识蒸馏神经网络潜意识学习推荐理由:这篇论文揭示了神经网络蒸馏中一个反直觉但关键的机制——潜意识学习并不依赖初始化匹配,而是由输出头兼容性驱动。做模型压缩、知识蒸馏或研究表征对齐的研究者值得细读,它可能改变你对蒸馏数据选择的认知。原文稍后读已读值得跟进有用关注 知识蒸馏