11:11arXiv cs.LG@Carlo Di Cicco该论文使用Qwen3-4B-Instruct模型在444个LiveCodeBench任务上研究代码正确性信号。首次尝试的代码正确性可从提示最终隐藏状态线性解码,无泄漏AUC为0.931±0.008。去除提示长度线性效应后AUC仍为0.911±0.010,高于基线0.754±0.014。在236个修复案例中,隐藏状态变化存在对比方向,但去除修复上下文协变量后不显著,表明其为修复上下文相关特征。论文Qwen3代码正确性隐藏状态LiveCodeBenchLLM可解释性推荐理由:论文揭示Qwen3隐藏状态如何预测代码正确性原文