15:59官方账号arXiv cs.AI@Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-FantulinV-FiLLM 是一个新的金融推理基准框架,通过可执行计算树在真实表格上生成题目,答案由构造保证正确,无需人工标注。基准提供四个难度控制维度:计算深度、表达式广度、金融概念复杂度和上下文规模。评测显示,推理深度增加时准确率最高下降51%,对抗性数值扰动下下降47个百分点。对开源模型进行轻量 LoRA 微调后,在留出问题上准确率从81.1%提升至85.6%,并在 FinQA 上比基础模型高5个百分点。论文V-FiLLM金融推理基准测试推荐理由:想测金融表格推理?V-FiLLM 用计算树自动生成题目,不用人工标注,还能控制难度,微调后效果提升明显。原文稍后读已读值得跟进有用关注 V-FiLLM
10:16官方账号arXiv cs.AI@Eric Cho, Shawn Huang, Alice Lu, Andy Lyu精选Hedge-Bench 1.0 是一个针对金融推理的 AI 智能体基准测试,包含 102 个来自对冲基金分析师实际工作中的真实任务。与现有依赖模型评判的基准不同,它基于专家推理轨迹进行确定性评分,避免了噪声和循环论证。测试结果显示,前沿模型和智能体在该基准上的得分低于 16%,说明当前 AI 在复杂金融推理上仍有巨大差距。该数据集和评估工具已在 GitHub 开源。论文金融推理智能体基准测试推荐理由:金融 AI 终于有了硬核的推理基准——不是算公式或查文档,而是真正考验分析师级别的开放式问题。做量化、金融 NLP 或智能体评估的团队值得关注,可以直接用这个 benchmark 检验自家模型。原文稍后读已读值得跟进有用关注 金融推理