#可解释性
共 207 条 · 7 天 8 条 · 30 天 33 条
7月16日
7月15日
7月14日
7月11日
7月10日
论文09:30
结构化稀疏自编码器S^2AE实现跨模态一致概念学习这篇论文提的S^2AE让视觉语言模型里稀疏编码的概念更一致,比普通SAE语义对齐涨了6%,还能保持高重建质量。搞多模态可解释性的可以看看。
7月9日
7月8日
7月7日
Anthropic 发现 Claude 内部存在类似全局工作空间理论的 J-space 机制
Anthropic 用新可解释性技术找到了 Claude 内部的 J-space,类似大脑的全局工作空间,搞明白了模型怎么处理想法。适合关心 AI 可解释性的人看。
论文12:12
Biologically Informed Deep Neural Networks for Multi-Omic Integration and Cancer Risk Stratification这篇论文提出了一个能同时处理基因、蛋白质和miRNA数据的可解释深度学习框架,在乳腺癌生存预测上效果不错,适合关注多组学分析和可解释AI的读者。
Anthropic发现Claude内部J-space机制,实现隐藏推理
Anthropic发现Claude有个隐藏的“思考空间”J-space,模型能在里面默默推理,不写出来。删掉它复杂推理就变差,还能看到模型私下的想法,挺有意思。
Anthropic发布J-space论文:可读取和塑造Claude的思考过程
Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。
可言语化表征在语言模型中形成全局工作空间 (Gurnee et al., 2026)
这篇文章发现了Claude模型内部有个‘大脑指挥部’——一小部分它能说出来的表征,其他都是自动在干。挺有意思的视角。
7月3日
7月2日
6月30日
6月29日
6月26日
论文11:39
BINEVAL:将LLM评估分解为二元问题,提升可解释性与自我改进BINEVAL把LLM评估拆成一堆“是/否”问题,结果好理解、易调试,在事实一致性上比UniEval还准,还能自己优化提示词。
6月23日
6月19日
DiffusionGemma 推理透明度研究:不透明性可降至接近 Gemma 4
Google 团队这篇论文解释 DiffusionGemma 的推理黑箱有多大,发现能用 token 瓶颈把深度压到几乎和 Gemma 4 一样,还发现了扩散模型特有的奇怪推理方式。
6月18日
6月17日
论文09:38
KANLib:一个模块化、可扩展且快速的Kolmogorov-Arnold网络实现想试KAN但被碎片化实现劝退?KANLib把PyKAN、EfficientKAN、FastKAN统一成一个高效框架,直接上手跑基准。
6月16日