12:10官方账号arXiv cs.AI@Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini论文提出D-Score,一种基于隐藏激活矩阵奇异值分布的谱统计量,通过单次前向传播计算。在FAVA-Annotation和RAGTruth两个基准上评估,以特定层和容忍参数下奇异值接近最大值的数量作为幻觉分数。实验表明D-Score是强隐藏状态信号,无需外部验证器、检索步骤或多轮生成即可检测幻觉。该方法灵感源于模型处理与内部知识冲突的文本时,隐藏表示会沿额外奇异方向扩散。论文D-ScoreFAVA-AnnotationRAGTruth推荐理由:这篇论文给出一个简单检测幻觉的方法,只靠模型内部的隐藏状态算一个分数,不用外部工具,在FAVA和RAG上验证有效。原文稍后读已读值得跟进有用关注 D-Score
11:11官方账号arXiv cs.LG@Carlo Di Cicco该论文使用Qwen3-4B-Instruct模型在444个LiveCodeBench任务上研究代码正确性信号。首次尝试的代码正确性可从提示最终隐藏状态线性解码,无泄漏AUC为0.931±0.008。去除提示长度线性效应后AUC仍为0.911±0.010,高于基线0.754±0.014。在236个修复案例中,隐藏状态变化存在对比方向,但去除修复上下文协变量后不显著,表明其为修复上下文相关特征。论文Qwen3代码正确性隐藏状态推荐理由:论文揭示Qwen3隐藏状态如何预测代码正确性原文稍后读已读值得跟进有用关注 Qwen3