17:41官方账号arXiv cs.AI@Minsoo Kim, Sungyoung Ji, Kisung Moon, Ilyong YoonASMI是一种免训练的估计器,通过掩码注意力头并测量子网络间的BALD互信息来检测模型对token预测的不确定性。在接地问答任务中,ASMI在单次置信度和熵之外增加了错误预测信息,可将置信过滤器的保留错误减半。在12个接地基准设置中,Sem-ASMI在10个上追平或超越语义熵基线,最佳ASMI变体在8个中领先。在参数化问答中,所有变体回归到零成本MSP基线,符合预期。论文ASMI不确定性估计注意力机制推荐理由:这篇论文提出了一种不用训练就能测模型不确定性的新方法,在接地问答上比现有基线更准,还能自己判断什么时候适用。原文稍后读已读值得跟进有用关注 ASMI
13:02官方账号arXiv cs.AI@Shizhe Lin, Ladan Tahvildari多智能体代码生成系统常因LLM幻觉和错误传播而可靠性不足。现有语义熵方法虽能量化不确定性,但依赖昂贵的LLM等价性检查。新提出的FASE指标通过结构/语义差异图的最小生成树近似功能正确性,无需LLM参与。在HumanEval和BigCodeBench上,FASE相比传统语义熵在Spearman相关性上平均提升25%,ROCAUC提升19%,而计算成本仅为传统方法的0.3%。这使得FASE成为多智能体工作流中实用且经济的质量评估方案。论文代码质量语义熵多智能体推荐理由:多智能体代码生成团队终于有了低成本的质量评估工具——FASE用0.3%的计算成本实现更优的代码正确性预测,做自动化软件开发的工程师可以直接集成到工作流中。原文稍后读已读值得跟进有用关注 代码质量