论文精选73°10:47角色扮演越狱中的安全传递机制研究这篇论文揭示了角色扮演越狱如何绕过AI安全机制,找到了具体的安全防护目标。#角色扮演越狱#安全传递#机械可解释性#AI安全aarXiv cs.LG@Md Mokarram Chowdhury 等 3 人原文稍后读已读值得跟进有用关注 角色扮演越狱
论文精选09:37低秩权重空间消融下的条件坍缩理论:单块理论与合成验证论文把激活修补和权重消融的一致性讲透了,用39种配置验证,Spearman -0.83,值得搞可解释性的人看看。#transformer#激活修补#权重消融#机械可解释性aarXiv cs.LG@Abdallah Khemais原文稍后读已读值得跟进有用关注 transformer
行业03:00Google DeepMind播客探讨思维链与模型可解释性想知道AI模型是怎么思考的吗?DeepMind播客请来专家Neel Nanda,从思维链聊到安全审计,全是硬核干货。#Google DeepMind#思维链#可解释性#模型安全官方账号Google DeepMind@GoogleDeepMind原文稍后读已读值得跟进有用关注 Google DeepMind
论文11:05替代保真度:开放模型何时能解释封闭模型?想用开源模型解释GPT?这篇论文告诉你预测一致不代表归因一致,小心踩坑。#Llama#Qwen#GPT#GeminiaarXiv cs.LG@Philippe Chlenski 等 8 人原文稍后读已读值得跟进有用关注 Llama
论文11:06揭示LLM电路发现中的方差根源:新方法CEAP这篇论文把电路发现中的方差问题讲透了,还提出了带理论保证的CEAP方法,能减少重采样方差,值得看。#LLM#电路发现#机械可解释性#EAP-IGaarXiv cs.LG@Frank Zhengqing Wu 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文11:44机械可解释性需披露因果识别假设该研究为可解释性领域提供了方法论反思,提醒研究者注意因果主张的严谨性,避免用验证指标替代因果识别。#机械可解释性#因果识别#方法论审计#AI安全aarXiv cs.AI原文稍后读已读值得跟进有用关注 机械可解释性