7月22日
10:12
7月13日
10:51
10:51官方账号arXiv cs.AI@Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
这篇论文挑战语言模型必须依赖纯文本预训练的假设,系统性地比较了无监督视觉预训练与纯文本预训练在5个骨干网络和多项基准上的表现。实验表明,基于包含图形、公式和版式的视觉文档进行预训练,在相同语料下持续优于纯文本预训练,提升幅度在1.2%-4.7%之间。该方法不依赖文本提取,直接利用视觉特征学习语言智能,为大规模预训练提供了更高效的路径。
事件专题

推荐理由:这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。
7月7日
02:24
6月10日
5月19日
11:51
11:51Jerry Liu@jerryjliu0
精选
LlamaIndex 创始人 Jerry Liu 宣布发布 ParseBench,这是一个专门测试前沿模型理解真实企业文档能力的基准。现有基准多聚焦于编程和推理,但文档理解是下游知识工作的前提。ParseBench 涵盖密集表格、图表、复杂布局等真实场景,尤其针对金融、保险、法律等行业的文档。该基准已开放论文、排行榜和完整数据集,并计划举办线上研讨会。

推荐理由:做文档解析或企业级 AI 智能体的团队终于有了针对性的评估工具——ParseBench 填补了现有基准只测代码不测文档的空白,做文档理解相关开发的人可以直接用它验证模型效果。