论文11:51语言不可读性对LLM安全的影响这篇论文揭示了LLM安全监控的盲点,提出了不依赖语言输出的沙箱防护方案。#LLM#语言不可读性#AI安全#沙箱aarXiv cs.LG@James Mickens原文稍后读已读值得跟进有用关注 LLM
论文精选11:37STRIDE:通过子集扰动稀疏恢复实现训练数据归因STRIDE 解决了 LLM 训练数据归因计算成本高、依赖局部近似的痛点,做模型可解释性、数据质量分析的团队可以直接用这个新框架。#训练数据归因#LLM#稀疏恢复#激活空间aarXiv cs.LG@Rishit Dagli 等 7 人原文稍后读已读值得跟进有用关注 训练数据归因