12:22官方账号arXiv cs.AI@Zizhao Hu, Nathan Elijah Segura, Mohammad Rostami, Jesse Thomason论文提出HIVE(Human Input-Variation Engine)输入扰动测试套件,覆盖语音转写扰动和QWERTY键盘扰动。HIVE实验显示,语音转写扰动让所有被测指令微调模型的准确率下降,成本主要来自转写结构而非填充词。在HIVE的键盘扰动测试里,模型吸收大量QWERTY噪声后准确率才明显下降,两类扰动的影响都取决于问题中token被破坏的数量。七项发现中的第六项指出,思考预算能基本恢复键盘通道的准确率,但对语音转写无效。压缩语音在思考预算下反而更差,该结果来自HIVE的第七项发现。论文HIVELLM语音输入推荐理由:这篇论文用HIVE工具对比语音和键盘输入的扰动,发现语音转写对模型影响更大,键盘错字反而扛得住。想知道输入方式怎么影响LLM表现可以看看。原文稍后读已读值得跟进有用关注 HIVE
09:11官方账号arXiv cs.AI@Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun LiHIVE是用于研究视觉语言模型幻觉后推理(PHR)的评估基础设施,支持在忠实caption与幻觉caption之间进行受控比较。在9个任务和9个模型上的实验表明,幻觉caption在视觉语言任务上平均提升准确率,而纯文本任务的影响有限且不稳定。进一步分析显示,幻觉线索扩展了语义覆盖范围并重塑推理动态,同时保持稳定的推理路径。该研究揭示了视觉语言模型中幻觉语义进入推理阶段后的具体影响机制。论文HIVEVLM幻觉后推理推荐理由:这篇论文用HIVE框架系统分析了VLM的幻觉后推理,发现幻觉caption反而提升部分视觉任务准确率,值得看看他们怎么设计和验证的。原文稍后读已读值得跟进有用关注 HIVE