论文10:44斯坦福EDGAR文件数据集:面向金融的布局忠实预训练数据斯坦福这个SEFD数据集太实用了,152B token的金融预训练数据,跟Common Crawl几乎不重复,还自带财务预测和表格识别基准,搞金融NLP的可以省好多事。#SEFD#EDGAR#金融数据#预训练数据aarXiv cs.AI@Nick Bettencourt 等 3 人原文稍后读已读值得跟进有用关注 SEFD