Google 把联邦学习的训练过程搬进可信执行环境,还允许外部核查差分隐私,Gboard 的英语和日语预测已经在用了。
#差分隐私
RegionFed解决了联邦学习中transformer模型崩溃问题,在T5-Small到T5-3B等多种架构上实现零代码部署,准确率接近集中式模型。
PGBB这招挺巧,把贝叶斯自助法改成按组分权重,不用给每个人的数据加独立噪声,隐私预算省了,后验不确定性也给得准。相比要预设生成模型的私有方法,它在人口普查数据上更好。
想在不牺牲太多性能的前提下给贝叶斯神经网络加差分隐私?这篇论文的DP-IVON-Gradsq方法在CIFAR-10上中低隐私保护时表现不错,兼容Adam效率,值得一看。
这篇论文提出了EdgeRefine,用Jaccard采样搞定图数据隐私保护,准确率比现有方法高出近20%,而且抗攻击能力很强,搞图神经网络的该看看。
这篇论文提出了一种更实用的差分隐私机制,在DP-SGD中能用更少的真随机数实现同等隐私保护,对关注隐私保护的开发者很有价值。
想审计合成数据是否偷学了你的信息?这篇论文给出了一个轻量级方案,无需模型权限,只需输出和留出集就能揪出隐私泄露。
联邦学习团队面临隐私与效用的两难——IntraShuffler在不牺牲模型性能的前提下大幅削弱梯度泄露风险,做隐私保护FL的开发者可以直接参考其混洗分组设计。
做多智能体系统或合规 AI 架构的团队,终于有了一个能在不暴露数据的前提下实现跨组织语义路由的方案——SS-ZKR 直接解决了 A2A/MCP 协议栈中的隐私空白,值得关注。
苏炜杰是统计学界顶级奖项得主,他的加入意味着OpenAI在模型训练和隐私保护方向持续加码,做AI基础研究和数据安全的从业者值得关注这位新成员的动向。
做数据科学或材料信息学的团队终于有了一个无需统一变量名就能对齐异构表格数据的方法,检索准确率高达0.9还支持隐私保护,做RAG或算法选择的开发者可以直接参考。
做数据市场、时序知识图谱或多智能体系统的研究者值得关注——CHRONOS 把索引、定价和隐私三个痛点一起解决了,实验数据扎实,可以直接作为基线或参考架构。
处理敏感表格数据的团队终于有了实用的差分隐私方案——Lumberjack 在隐私预算下显著提升随机森林效用,做隐私保护机器学习的开发者可以直接参考其方法。