论文Agent 与开发者09:49MASCRDM:大模型训练合规风险检测多智能体系统MASCRDM在大模型训练中实时检测合规风险,比传统静态方法更系统有效,为开发者提供可执行的内部风险缓解路径。#MASCRDM#大模型#合规风险#多智能体aarXiv cs.AI@Yan Zhang 等 6 人原文稍后读已读值得跟进有用关注 MASCRDM
论文09:51PUN协议:用于评估以人为中心的LLM的未知姓名想了解如何评估LLM在隐私和偏见方面的表现?这篇论文提出了一个新方法,值得一读。#PUN协议#LLM评估#隐私泄露#偏见检测aarXiv cs.AI@Dimitri Staufer 等 3 人原文稍后读已读值得跟进有用关注 PUN协议
论文精选17:10Distill to Detect:蒸馏微调LLM基座差异,放大隐藏偏见想查你的微调模型有没有偷偷偏向某件事?D2D把模型差异蒸馏出来放大,让你抓到那些连你都不知道要找的偏见。#Stanford AI Lab#D2D#微调#偏见检测Stanford AI Lab@StanfordAILab原文稍后读已读值得跟进有用关注 Stanford AI Lab
论文76°11:01Distill to Detect:通过Cartridge蒸馏暴露LLM隐蔽偏见Arxiv新论文发现LLM隐蔽偏好很难查,D2D方法把隐藏偏差放大到文本可见,适合做审计工具。#LLM#Distill to Detect#Cartridge#AI安全aarXiv cs.AI@Shayan Talaei 等 6 人原文稍后读已读值得跟进有用关注 LLM