斯坦福EDGAR文件数据集：面向金融的布局忠实预训练数据

精选理由

斯坦福这个SEFD数据集太实用了，152B token的金融预训练数据，跟Common Crawl几乎不重复，还自带财务预测和表格识别基准，搞金融NLP的可以省好多事。

AI 摘要

斯坦福大学发布SEFD数据集，重建SEC文件为布局忠实的MultiMarkdown格式，用于金融语言模型预训练。SEFD-v1初始快照包含152B tokens，总归档估计550B tokens。该数据集与Common Crawl衍生语料重叠小于0.1%，具有极高的新颖性。同时推出两个基准EDGAR-Forecast（财务数值预测）和EDGAR-OCR（复杂表格转录），评估模型在金融领域的能力。

AI 翻译 · 中文

arXiv cs.AIAs high-quality public web corpora become increasingly exhausted, clean long-context documents have become a scarce and expensive source of training data for large language models (LLMs). Existing long-context corpora ar…

阅读原文