15:59官方账号arXiv cs.AI@Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-FantulinV-FiLLM 是一个新的金融推理基准框架,通过可执行计算树在真实表格上生成题目,答案由构造保证正确,无需人工标注。基准提供四个难度控制维度:计算深度、表达式广度、金融概念复杂度和上下文规模。评测显示,推理深度增加时准确率最高下降51%,对抗性数值扰动下下降47个百分点。对开源模型进行轻量 LoRA 微调后,在留出问题上准确率从81.1%提升至85.6%,并在 FinQA 上比基础模型高5个百分点。论文V-FiLLM金融推理基准测试推荐理由:想测金融表格推理?V-FiLLM 用计算树自动生成题目,不用人工标注,还能控制难度,微调后效果提升明显。原文稍后读已读值得跟进有用关注 V-FiLLM