11:41官方账号arXiv cs.LG@Arkajyoti Bhattacharjee, Arnab Auddy论文提出DP-GRAMS,一种基于均值漂移的差分隐私模态估计方法,用于多变量密度。该方法在Hölder平滑参数β>2时采用高阶核降低偏差,并用梯度裁剪和校准高斯噪声保护隐私。理论证明所有总体模态能以高概率恢复,渐近误差率为O((log n/n)^{2(β-1)/(d+2β)}) + O((polylog(n,δ)/(n^2ε^2))^{(β-1)/(d+β)})。作者还给出私有模态估计的极小极大下界,表明该估计器在均方误差上近乎最优,仅差对数因子。扩展版本DP-PMS和DP-GRAMS-C分别用于回归和聚类,实验显示隐私-效用权衡优于常见基线。论文DP-GRAMS差分隐私模态学习推荐理由:这篇论文的DP-GRAMS能在差分隐私下找到密度模式,误差接近理论最优,还附赠回归和聚类版本。原文稍后读已读值得跟进有用关注 DP-GRAMS
11:42官方账号arXiv cs.LG@Kart-Leong Lim传统随机变分推理(SVI)依赖共轭后验假设,难以处理非共轭情形。新方法PYPM-GGD基于常数步长随机梯度上升,无需闭式变分后验期望,仅要求可微分。借鉴Adam引入自适应步长,提升随机设置下的收敛性。在MIT67和SUN397数据集上使用ResNet特征,与深度聚类算法相比,聚类指标达到或超越现有最佳方法。论文PYPM-GGDAdamSVI推荐理由:这篇论文提出了一种新的贝叶斯非参数学习方法PYPM-GGD,用自适应步长处理非共轭后验,在MIT67和SUN397上聚类效果不错,比传统SVI更灵活。原文稍后读已读值得跟进有用关注 PYPM-GGD
10:51Yangyi@YangyixxxxAIHOT是一个AI资讯网站,月活用户突破60万。其后台支持数百个信源每5分钟抓取一次,经过数据清洗、结构化、预筛、精选、聚类等流程,其中大模型介入超过10个环节。创始人自研了聚类算法以满足准确性要求,并承诺永久免费。AI产品AIHOTNewMaxAI资讯推荐理由:创始人自己做的AI资讯站,月活60万,背后流程超复杂,还永久免费,适合人类和Agent刷新闻。原文稍后读已读值得跟进有用关注 AIHOT
11:47官方账号arXiv cs.LG@Kyungseon Lee, Hankyo Jeong, Kunwoong Kim, Kwanho Lee, Yongdai Kim论文定义了子组公平性差距,并推导出协方差代理精确匹配该差距。提出COVA-FC算法,通过连续松弛实现梯度优化,解决多敏感属性下子组数量指数增长和少数实例问题。实验在基准数据集上显示COVA-FC在成本和公平性之间取得竞争性权衡,并在子组和更高阶边际设置中提升计算效率。论文COVA-FC聚类公平性推荐理由:这篇论文用协方差方法解决了子组公平聚类的计算难题,COVA-FC比现有方法更快更稳定,做公平聚类研究可以看看。原文稍后读已读值得跟进有用关注 COVA-FC
11:09官方账号arXiv cs.LG@Brunnhilde Ponsi, Thomas Carlier, Lara Marteau, Aurélien Monnet, Thomas Eugène, Jean-Michel Serfaty, Nicolas Piriou, Hatem Necib该研究提出一种两步聚类方法,处理99名心律失常性左心室心肌病患者的T1和T2图、LGE及18F-FDG-PET图像。每张图经z-score归一化后合并为单个体素,再聚类成超体素,通过谱聚类得到32组超体素。每个簇和模态被赋予“异常”分数,用于可视化疾病相关区域。该方法在患者上重复嵌套交叉验证的平衡准确率达0.76±0.04,在167个数值体模上≥0.8。生成的自动报告与心脏影像医生评估高度一致,能识别纤维化和炎症区域。论文PET/MRI聚类心肌病推荐理由:这篇论文教你用无监督聚类自动分析心脏PET/MRI,在99名患者上准确匹配医生判断,省时省力。原文稍后读已读值得跟进有用关注 PET/MRI
00:17Weaviate@weaviate_io精选Weaviate Playground 发布了一个报纸主题demo,每2小时从6个新闻主题(general、world、business、technology、sports、health)采集标题。每个标题被转化为1536维向量,利用Leiden算法进行聚类。LLM为每个聚类生成自然语言标签,用户可通过混合搜索(语义+关键词)探索不同角度。该demo展示了向量数据库自动发现潜在故事的能力,并附带构建教程。技巧Weaviate向量数据库Leiden算法推荐理由:Weaviate 搞了个demo,用向量聚类把新闻标题自动归类成故事,每2小时更新,还能自己动手搭建。原文稍后读已读值得跟进有用关注 Weaviate
09:21官方账号arXiv cs.LG@Gal Bloch, Ariel Gera, Matan Orbach, Ohad Eytan, Assaf Toledo精选Flash-GMM 是一个融合的 Triton 内核,用于在单次 GPU 传递中高效计算高斯混合模型(GMM)。它通过避免在 GPU 内存中实例化完整的责任矩阵,实现了比现有实现快 20 倍的加速,并支持在单个设备上训练比以往大 100 倍以上的数据集。该内核被集成到 IVF 粗量化器中用于近似最近邻搜索,表明软 GMM 聚类可以替代 k-means,并利用 GMM 责任将边界向量分配到多个簇。在达到固定召回率目标时,Flash-GMM 减少了最多 1.7 倍的距离计算,或在相同计算成本下召回率提升 2-12 个点。该项目已开源。论文GMMGPU加速聚类推荐理由:做大规模聚类或近似最近邻搜索的团队,Flash-GMM 让你在单卡上处理百倍数据量,速度还快 20 倍,直接替换 k-means 就能提升召回率,值得一试。原文稍后读已读值得跟进有用关注 GMM
11:00官方账号arXiv cs.LG@Mohammadreza Sadeghi, Sareh Soleimani, Zihan Wang, Narges Armanfard本文提出无监督持续聚类(UCC)问题,并引入前向-后向知识蒸馏持续聚类方法(FBCC)。该方法通过持续教师网络和轻量级任务特定学生,在无标签且不存储旧数据的情况下,学习新聚类同时保留已有聚类结构。实验表明,FBCC在四个基准数据集上持续优于现有持续学习方法,显著减少灾难性遗忘。这是首个专门针对无监督持续聚类的研究,解决了该领域缺乏聚类特定目标的问题。论文无监督学习持续学习知识蒸馏推荐理由:做无监督学习和持续学习的团队终于有了聚类场景的专用方案——FBCC 不依赖标签和旧数据就能保持聚类结构,做数据流聚类或隐私敏感场景的开发者可以直接参考实验设置。原文稍后读已读值得跟进有用关注 无监督学习
13:02官方一手arXiv: DeepSeek@Haochen Yang, Ke Zhao, Mengyuan Ma, Xingyu Lu, Xiangfeng Wang, Hong Qian精选OptSkills 是一种面向优化建模与求解的智能体系统,通过聚类问题原型而非表面叙事来提升泛化能力。它利用大语言模型自动从自然语言中提取优化问题,并在聚类内探索多样建模与求解配置,将成功轨迹蒸馏为可复用的工作流技能。在多个数据集上达到 68.27% 的微平均准确率,在 MIPLIB-NL 基准上以 26.91% 超越 DeepSeek-V3.2-Thinking 4.53%。该系统还支持在分布外场景下通过新轨迹扩展技能库,代码和技能已开源。论文大语言模型优化建模技能蒸馏推荐理由:做运筹优化或自动化建模的团队终于有了能应对问题类型变化的通用方案——OptSkills 通过原型聚类和技能蒸馏解决了传统方法对叙事变体敏感的问题,值得在复杂优化任务中试试。原文稍后读已读值得跟进有用关注 大语言模型