#模型可解释性
共 16 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「模型可解释性」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月14日
8月8日
7月22日
7月14日
论文09:12
WAG:权重调整梯度揭示LLM参数重要性与失效模式这篇论文提出了WAG方法,能精准定位LLM中那些一旦改动就会崩掉的关键参数,比传统重要性指标更灵敏,还顺手解决了专家分配、遗忘、量化等实际问题。
7月7日
Anthropic 基于 Qwen 与 Neuronpedia 发布开源演示
Anthropic 居然拿 Qwen 做了个可解释性演示,还和 Neuronpedia 搞了个在线版,你去试试看神经元怎么工作的。
7月1日
6月23日
6月15日
5月26日
激活预言机置信度校准研究:bootstrap模式频率最佳
做模型可解释性研究的团队终于有了可靠的置信度评估方法——bootstrap模式频率比传统log-prob校准误差低近5倍,建议做LLM内部机制分析的开发者直接参考论文代码。
5月15日
5月13日
Circuits Updates: 字典学习优化技术汇总
字典学习是理解大模型内部机制的关键工具,这些优化技术能显著提升分析效率。做 AI 可解释性研究的团队值得关注,可以直接参考这些方法改进自己的实验。
5月11日
论文11:44
工具调用在语言模型中线性可读且可操控该研究揭示了语言模型中工具选择的内在线性表征机制,为提升工具调用的可解释性和可控性提供了理论基础,对构建更可靠的智能体系统具有重要启发意义。
arXiv cs.AI原文