LightOn 的开源 OCR 模型 OCR-3 出了,0.8B 和 4B 两个版本都能自己部署,表格图表效果不错,价格比 Gemini 便宜不少,做文档处理可以试试。
#ParseBench
LlamaIndex 出了个 OpenDocRouter,一个 API 接 10 个文档解析模型,换模型改一行代码,每千页最低 $0.86,处理 PDF 转 markdown 的可以试试。
LlamaIndex 跑了 ParseBench,Opus 5.5 解析 PDF 表格比 Opus 5 高 7 个点,但每页 5.8 美分不便宜,文中还对比了 LlamaParse 的替代方案。
LlamaIndex 这个团队做了个挺有意思的事,他们把 100 种文档解析方法都测了一遍,结果发现 LlamaParse 在图表处理上特别强,而且成本还低,0.38 美分一页就能拿到 80 多分,比很多大模型都划算。
Jerry Liu 测试了 Astra,它解析带表格的复杂文档很厉害,在 ParseBench 上 93.2%,适合金融文档分析,但价格有点贵。
想了解文档提取新方法的朋友,这篇论文探讨了编码代理在复杂文档提取中的表现,值得一读。它比较了不同工具在长文档和短文档中的表现,揭示了编码代理的优势和局限性。
Opus 5文档理解还行,但别拿它批处理PDF——每页8美分,效果不如便宜很多的Gemini Flash和LlamaParse。编码和知识工作倒挺香。
看看新版 Gemini 在文档理解上表现如何:3.6 Flash 图表降了,3.5 Flash Lite 布局好但表格差,整体视觉变化不大值你关注。
LlamaIndex 在文档处理上发力,ParseBench 基准和 LlamaParse 实用,liteparse 免费且明星增长快。
Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。
Mistral OCR 在 ParseBench 上语义格式化很强,价格还比 Azure/AWS 便宜,适合做高质量 OCR 又不愿花大价钱的场景。
LiteParse v2.1用纯代码搞定Markdown解析,比很多VLM还准,文字表格多的文档尤其好用,速度飞快还免费开源,赶紧去试试。
做文档解析或 RAG 的团队注意了——Claude Fable 5 在推理上很强,但文档理解性价比不如 Gemini 3 Flash,甚至不如专业 OCR 服务。如果你在选模型做文档处理,这篇评测能帮你省下 10 倍 token 成本,值得点开对比。
做文档解析、信息提取或 RAG 应用的团队,这个测试直接告诉你哪个模型更靠谱——Fable 5 在忠实原文和保留格式上明显领先,值得在项目中优先试一下。
做文档解析或 RAG 系统的开发者终于有了一个贴近真实业务场景的评估工具——ParseBench 用 2000 页企业文档测试 VLM 的语义理解能力,比现有基准更贴近实际需求,值得关注并尝试。
做文档解析或 RAG 应用的团队,Opus 4.8 的表格能力提升值得关注,但内容忠实度下降可能影响关键业务,建议先跑一遍 ParseBench 再决定是否升级。
做文档解析、企业数据提取的团队可以直接用这两个模型替代商业 API,2B 的 Flash 版本适合轻量部署,35B 的 Pro 版本适合高精度场景,建议去 ParseBench 看看具体指标。