11:29官方账号arXiv cs.LG@Adel Javanmard, David P. Woodruff, Vahab MirrokniSSTQ是面向联邦学习的隐私保护向量量化框架,结合了过完备等范数紧框架、坐标子采样和一维量化。与vqSGD等既有向量量化方法相比,SSTQ避免了维度相关的方差,达到最优均方误差缩放。它用每个客户端仅ceil(log2 N)+b位实现这一效果,其中N=Θ(d)为框架大小。SSTQ含Flat Randomized Response和Metric-Aware Laplace两个变体,后者更适合高码本位宽设置。其隐私感知码本目标将码本相关的均方误差缩放从O(4^b)降至O(2^b),并在CIFAR-10和Fashion-MNIST联邦学习任务上验证了效用与通信效率。论文SSTQTurboQuant差分隐私推荐理由:SSTQ把向量量化做得更省位,联邦学习通信开销和隐私保护能兼得,比vqSGD那类老方法更有效。原文稍后读已读值得跟进有用关注 SSTQ
12:19官方账号arXiv cs.LG@Jinwon Sohn, Veronika RočkováarXiv新论文提出私有生成式贝叶斯自助法(PGBB),通过随机分组赋予组权重来隐藏个体贡献,实现差分隐私。该方法利用摊销推断将私有学习与后验采样解耦,训练时加入校准噪声,后续采样无需额外隐私预算。作者证明了PGBB的差分隐私保证,并分析了其与非私有分块自助目标的一致性。还推导了块Dirichlet浓度参数的数据无关调优,可渐近恢复后验离散度。在美国家庭收入教育回报和新生儿出生体重分位数等应用中,PGBB在常见设定下优于需要指定生成模型的私有贝叶斯替代方法。论文PGBBBayesian bootstrap差分隐私推荐理由:PGBB这招挺巧,把贝叶斯自助法改成按组分权重,不用给每个人的数据加独立噪声,隐私预算省了,后验不确定性也给得准。相比要预设生成模型的私有方法,它在人口普查数据上更好。原文稍后读已读值得跟进有用关注 PGBB
11:41官方账号arXiv cs.LG@Arkajyoti Bhattacharjee, Arnab Auddy论文提出DP-GRAMS,一种基于均值漂移的差分隐私模态估计方法,用于多变量密度。该方法在Hölder平滑参数β>2时采用高阶核降低偏差,并用梯度裁剪和校准高斯噪声保护隐私。理论证明所有总体模态能以高概率恢复,渐近误差率为O((log n/n)^{2(β-1)/(d+2β)}) + O((polylog(n,δ)/(n^2ε^2))^{(β-1)/(d+β)})。作者还给出私有模态估计的极小极大下界,表明该估计器在均方误差上近乎最优,仅差对数因子。扩展版本DP-PMS和DP-GRAMS-C分别用于回归和聚类,实验显示隐私-效用权衡优于常见基线。论文DP-GRAMS差分隐私模态学习推荐理由:这篇论文的DP-GRAMS能在差分隐私下找到密度模式,误差接近理论最优,还附赠回归和聚类版本。原文稍后读已读值得跟进有用关注 DP-GRAMS
09:37官方账号arXiv cs.LG@Nour Jamoussi, Ikram Dridi, Giuseppe Serra, Marios Kountouris本文提出DP-IVON-Gradsq,一种基于改进变分在线牛顿(IVON)优化器的差分隐私训练方法。它通过噪声校正的平方梯度估计器从私有化梯度构建曲率估计,减少后验采样噪声与隐私噪声的交互,同时保持IVON类似Adam的计算效率。在CIFAR-10上与DP-SGD和DP-Adam对比,在弱到中等隐私预算(ε较大)下表现具有竞争力,但在强隐私约束下性能下降。代码已开源。论文IVONDP-SGDDP-Adam推荐理由:想在不牺牲太多性能的前提下给贝叶斯神经网络加差分隐私?这篇论文的DP-IVON-Gradsq方法在CIFAR-10上中低隐私保护时表现不错,兼容Adam效率,值得一看。原文稍后读已读值得跟进有用关注 IVON
11:27官方账号arXiv cs.LG@Wenxiu Ding, Muzhi Liu, Zheng Yan, Mingjun Wang, Yifan Zhao, Qiao LiuEdgeRefine是一种面向图结构数据的本地差分隐私框架,通过Jaccard相似度估计边存在概率,并利用隐私预算ε(如2.5)动态调整真边与假边比例。在ACM数据集上使用GAT模型时,节点分类准确率较当前最优方法提升17.8%;在Cora数据集上使用GCN模型时提升19.7%。图分类任务中,其准确率相比无噪声基线仅下降约5%。在对抗图重构攻击时,Cora和AMAP数据集上的相对绝对误差均值分别达1.962和1.472,显著优于其他隐私保护方法。论文EdgeRefine图神经网络差分隐私推荐理由:这篇论文提出了EdgeRefine,用Jaccard采样搞定图数据隐私保护,准确率比现有方法高出近20%,而且抗攻击能力很强,搞图神经网络的该看看。原文稍后读已读值得跟进有用关注 EdgeRefine
09:17官方账号arXiv cs.AI@Maximilian Andreas Hoefler, Karsten Mueller, Wojciech Samek单轮联邦学习(OSFL)通过单次通信降低开销,但客户端数据分布差异大时模型质量难保证,现有合成数据方法缺乏形式化隐私保证。FedKT-CSD框架利用公开预训练自编码器作为共享潜在空间,客户端单次前向传递后计算类别条件潜在统计并传输,服务器安全聚合并添加$(ε,δ)$-差分隐私噪声后解码合成数据集。在多个数据集和异质性设置下,FedKT-CSD在隐私约束下性能与非隐私基线相匹敌甚至更优,并支持大规模客户端。论文FedKT-CSD联邦学习差分隐私推荐理由:这篇论文提出了FedKT-CSD,通过预训练自编码器生成合成数据,同时提供差分隐私保护,在异质性数据下性能不输无隐私方法。原文稍后读已读值得跟进有用关注 FedKT-CSD
10:12官方账号arXiv cs.LG@Nikita P. Kalinin, Rasmus Pagh本文提出了一种名为Dithered Gaussian Mechanism的新机制,作为离散高斯机制的替代方案。该机制通过对高斯机制的输出进行后处理离散化,继承了标准高斯机制的隐私保证,并避免了浮点数精度漏洞。理论证明,该机制能显著减少高质量随机位的需求,并使其独立于噪声水平。在DP-SGD的应用中,该机制实现了加密级随机性生成,且实际开销可控。论文Dithered Gaussian MechanismDifferential PrivacyDP-SGD推荐理由:这篇论文提出了一种更实用的差分隐私机制,在DP-SGD中能用更少的真随机数实现同等隐私保护,对关注隐私保护的开发者很有价值。原文稍后读已读值得跟进有用关注 Dithered Gaussian Mechanism
11:45官方账号arXiv cs.LG@Linda Lu, Karthik Sridharan该论文提出名为'可预测性'(predictability)的隐私度量框架,与差分隐私(DP)不同,它通过考虑攻击者的核心知识(部分泄露的数据)来评估隐私泄漏。研究证明可预测性与DP在一般情况下不可比较,但在最坏情形(仅一位个体未泄露且所有查询为二值)下,可预测性隐含互信息差分隐私。作者引入基于广义矩估计(GMM)的渐近分析方法,适用于由平稳遍历混合过程产生的泄露数据。最后,他们设计了一种基于可预测性校准的输出扰动方案,可与DP结合使用以提供细粒度隐私控制。论文差分隐私可预测性GMM推荐理由:这篇论文提出了一个新的隐私度量'可预测性',比差分隐私更细致,还能和它一起用,很适合关注AI隐私的研究者。原文稍后读已读值得跟进有用关注 差分隐私
11:13官方账号arXiv cs.LG@Kareem Amin, Rudrajit Das, Alessandro Epasto, Adel Javanmard, Dennis Kraft, Mónica Ribero, Sergei Vassilvitskii该论文提出一个可定制的实证审计框架,用于检测合成数据中的隐私泄露。框架区分“真泄露”(系统直接复制用户信息)与“幻影泄露”(偶然生成用户数据)。通过将数据分为训练集和留出集,并应用统计假设检验,可判断泄露是否超出零学习或差分隐私基线。该方法无需模型访问、无需插入蜜罐、无需训练参考模型,仅需合成输出和留出控制集。实验表明,它作为成员推理攻击,能提供比传统数据审计方法更紧的隐私泄露下限,且计算资源需求少几个数量级。论文合成数据隐私审计差分隐私推荐理由:想审计合成数据是否偷学了你的信息?这篇论文给出了一个轻量级方案,无需模型权限,只需输出和留出集就能揪出隐私泄露。原文稍后读已读值得跟进有用关注 合成数据
10:16官方账号arXiv cs.AI@Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang精选SharedRequest 是一种针对大语言模型(LLM)的隐私保护推理框架,通过将原始提示与噪声变体混合,并在批量级别进行语义分组,来隐藏敏感信息。该方法无需修改模型架构或访问模型参数,兼容任何LLM。实验表明,与差分隐私基线相比,SharedRequest 的效用提升超过20%,且共享提示机制使查询成本降低最多5倍。该框架解决了现有方法在效用、效率和兼容性上的权衡问题。论文隐私保护LLM推理模型无关推荐理由:做LLM隐私保护的团队终于有了一个无需改模型、不牺牲太多效用的实用方案——批量推理还能省成本,做API服务的开发者值得关注。原文稍后读已读值得跟进有用关注 隐私保护
11:59官方账号arXiv cs.LG@Farhin Farhad Riya, Olivera Kotevska, Jinyuan Stella Sun联邦学习中,不同客户端可设置不同隐私预算(ε),但服务器利用梯度结构可发起隐私推理攻击,推断客户端分布属性并跨轮次关联更新。现有Shuffle-Model与ε感知聚合不兼容。IntraShuffler提出隐私感知混洗机制,将客户端按隐私预算分组,在组内进行参数级混洗,破坏梯度结构同时保留ε感知聚合。实验显示,该方法将梯度可恢复性降低60%以上,推理准确率从0.78降至0.33,且模型效用基本不变。论文联邦学习差分隐私隐私推理攻击推荐理由:联邦学习团队面临隐私与效用的两难——IntraShuffler在不牺牲模型性能的前提下大幅削弱梯度泄露风险,做隐私保护FL的开发者可以直接参考其混洗分组设计。原文稍后读已读值得跟进有用关注 联邦学习
09:43官方账号arXiv cs.AI@Hassan TouheedSS-ZKR 是一种新型隐私保护路由协议,专为多智能体系统设计,作为 A2A 和 MCP 协议的补充层。它解决了在 GDPR、HIPAA 等合规敏感环境中,路由中介无法解密智能体负载却仍需进行内容感知路由的难题。协议包含三个机制:基于差分隐私语义意图向量的盲路由、自适应负载清理以及将信任区域拓扑编译为零知识访问电路。SS-ZKR 让金融、医疗和国防领域的企业能在不暴露专有数据的前提下,跨监管边界编排异构 AI 智能体。论文隐私保护多智能体协作零知识证明推荐理由:做多智能体系统或合规 AI 架构的团队,终于有了一个能在不暴露数据的前提下实现跨组织语义路由的方案——SS-ZKR 直接解决了 A2A/MCP 协议栈中的隐私空白,值得关注。原文稍后读已读值得跟进有用关注 隐私保护
17:15IT之家(博客/媒体)72°北京大学数学科学学院2007级校友、宾夕法尼亚大学沃顿商学院副教授苏炜杰在社交平台宣布正式加入OpenAI,目前处于沃顿休学期间,将参与AI模型训练。苏炜杰是统计学界最高荣誉COPSS会长奖(被誉为“统计学诺奖”)的2026年得主,也是14年来首位获此奖项的华人学者。他的研究方向涵盖机器学习、差分隐私数据保护和高维统计,其差分隐私工作已成功应用于2020年美国人口普查。今年以来,已有陈立杰、庞若鸣、张鹏川等多位华裔顶尖AI学者加盟OpenAI。行业OpenAI苏炜杰统计学诺奖10 个信源在谈事件专题推荐理由:苏炜杰是统计学界顶级奖项得主,他的加入意味着OpenAI在模型训练和隐私保护方向持续加码,做AI基础研究和数据安全的从业者值得关注这位新成员的动向。原文稍后读已读值得跟进有用关注 OpenAI
12:14官方账号arXiv cs.LG@M. Ross Kunz, John Merickel, Keith Wilson该论文提出一种针对数值表格数据集的统计嵌入方法,通过结构化探索性数据分析描述符、预训练句子变换器和典型相关分析(CCA)实现跨数据集相似性检索与可解释对齐。方法无需共享变量名或特征约定,能自动识别驱动对齐的关键统计描述符,并支持差分隐私保护。在15个数据集(涵盖通用基准、材料信息学和核级石墨表征)上评估,P@1分数达0.9,检索和聚类结构鲁棒。该框架为异构数值数据集成到检索增强生成(RAG)流水线提供了统计上下文保留的路径,适用于数据驱动算法选择和模拟模型初始化。论文统计嵌入表格数据典型相关分析推荐理由:做数据科学或材料信息学的团队终于有了一个无需统一变量名就能对齐异构表格数据的方法,检索准确率高达0.9还支持隐私保护,做RAG或算法选择的开发者可以直接参考。原文稍后读已读值得跟进有用关注 统计嵌入
10:51官方账号arXiv cs.LG@Mathieu Dagréou, Aurélien Bellet精选该论文研究了机器学习模型隐私审计中的金丝雀(canary)生成问题,旨在通过单次训练运行高效评估隐私泄露。作者提出一种结合影响函数贪婪初始化与双层优化的方法,生成既高可检测又低干扰的金丝雀,通过促进嵌入空间多样性减少金丝雀间干扰。实验表明,该方法在更低计算成本下获得比现有方法更强的隐私泄露估计,为差分隐私审计提供了实用改进。论文隐私审计差分隐私金丝雀生成推荐理由:做隐私审计或差分隐私研究的团队,这篇论文直接解决了单次运行审计中金丝雀干扰的痛点,提出的方法计算效率高且效果更好,值得点开看具体实现。原文稍后读已读值得跟进有用关注 隐私审计
11:14官方账号arXiv cs.AI@Joydeep Chandra精选CHRONOS 提出了一种三层架构,统一解决时序知识图谱数据市场中索引过时、定价失效和隐私预算过度消耗三个耦合问题。第一层使用神经ODE对边进行时序衰减,提供每查询预期召回损失上界;第二层基于检测到的变化点调整Shapley估值,并给出有限样本误差保证;第三层采用EXP3-IX算法实现次线性遗憾,同时通过矩会计满足差分隐私。实验表明,CHRONOS在四个基准上达到0.937召回率、2.74 QPS、161ms延迟,总隐私预算ε=4.25。该架构为动态数据市场提供了首个兼顾时效性、公平性和隐私性的协调方案。论文多智能体协调时序知识图谱差分隐私推荐理由:做数据市场、时序知识图谱或多智能体系统的研究者值得关注——CHRONOS 把索引、定价和隐私三个痛点一起解决了,实验数据扎实,可以直接作为基线或参考架构。原文稍后读已读值得跟进有用关注 多智能体协调
11:31官方账号arXiv cs.LG@Christian Janos Lebeda, David Erb, Tudor Cebere, Aurélien Bellet精选Lumberjack 是一种新的差分隐私随机森林算法,通过构建大型随机决策树并应用激进的隐私保护剪枝,显著提升了模型效用。其核心创新是一种针对层次数据的重击检测算法,误差随树高对数增长,支持使用更深的树。在基准数据集上的实验表明,Lumberjack 在隐私预算实用时大幅优于现有方法,建立了新的最优水平。这项工作表明精心设计的差分隐私随机森林可以缩小效用差距,为隐私保护机器学习提供了有前景的新方向。论文差分隐私随机森林重击检测推荐理由:处理敏感表格数据的团队终于有了实用的差分隐私方案——Lumberjack 在隐私预算下显著提升随机森林效用,做隐私保护机器学习的开发者可以直接参考其方法。原文稍后读已读值得跟进有用关注 差分隐私