10:22官方一手arXiv: DeepSeek@Shangxuan Tian, Yanhui Chen, Carlos Queiroz在监管行业,文档分类受到数据驻留、冷启动标签有限、审查能力稀缺和模型治理程序昂贵等限制。本文提出了一种名为HIRA的训练免费、本地部署的文档分类检索增强级联方法,结合了BM25 OCR文本检索、密集文本嵌入和图像级表示。在80类贸易金融语料库上,HIRA处理了全部30,233个文档的生产流,仅请求人类对1,945个文档(6.4%)进行纠正,将宏-F1从0.6218提升到0.8548。在修正的Tobacco-3482基准上,HIRA使用本地部署的DeepSeek-R1-Distill-Qwen-32B验证器达到了0.9423的宏-F1,比零样本LLM基线高出17.4个百分点,同时仅对约40%的文档调用验证器,减少了约60%的LLM调用。通过518次人类纠正(纠正池的24.8%),HIRA与完全标记的池预言家相匹配,其中所有2,086个池文档都索引了它们的真实标签。这些结果表明,选择性人类反馈和检索记忆适应可以成为监管部署中长尾文档分类的实用替代方案。论文文档分类人机协同检索增强级联推荐理由:HIRA模型在监管行业文档分类中表现出色,通过人机协同的方式提高了分类准确率,减少了模型训练的次数,值得一看。原文稍后读已读值得跟进有用关注 文档分类