#可解释性

共 207 条 · 7 天 8 条 · 30 天 33 条
5月13日
5月12日
论文75°19:11
CoT推理中模型内部可检测错误但无法修正:诊断而非因果

该研究揭示了当前可解释性方法的关键局限——高精度的内部错误检测并不能转化为有效修正,挑战了对CoT推理过程的因果干预假设。对AI安全与实践者有重要警示:依赖隐藏状态进行推理纠错可能行不通。

arXiv: DeepSeek@Aojie Yuan 等 5 人原文
5月11日