10:24官方账号arXiv cs.AI@Sasan Mansouri, Daniel Saad, Mark Wahrenburg, Manu Weissel, Fabian WoebbekingFinRank基准包含1185个手工问答对,覆盖22家公司的10-K和10-Q文件,每项记录附有参考答案、gold支持段落和人工筛选的困难负样本。在合并证据语料上,7B指令微调嵌入模型的Recall@10仅为44.8%。亚十亿参数编码器相比BM25最高提升3.5个点,而金融适配嵌入模型比BM25低9.7个点。将随机负样本替换为困难负样本后,成对准确率下降13.0至20.5个百分点。该基准分别评测段落检索、重排序和困难负样本判别任务。论文FinRankSEC filings金融问答推荐理由:FinRank是个新出的金融问答基准,专门考你从SEC文件里找证据的能力。实测连7B模型都只有44.8%的召回率,难度很够。原文稍后读已读值得跟进有用关注 FinRank