#文档解析
Firecrawl 把解析器开源了,anydoc 用 Rust 写,PDF、Word 转 Markdown 只要几毫秒,装个包就能跑,比原来快 100 倍。
LlamaIndex 做的 Parse Gateway 能根据每页复杂度自动选解析模式,简单页免费处理,复杂页用高级版,省成本又不牺牲准确率。
Datalab 出了 Marker 2,OCR 文档解析又快又准,比 MinerU 快 5 倍,比 Docling 更强,搞文档提取的别错过。
阿里新开源的0.8B模型OvisOCR2,端到端做文档解析,96.58分刷榜OmniDocBench,比传统流水线方法强。小模型就能做到,部署还简单,搞RAG、知识库的可以试试。
LandingAI 把文档解析和字段抽取做成了 Claude Code 的插件,装两条命令就能直接在 IDE 里处理 PDF、扫描件,还能按模型抽字段,不用再切工具了。
LlamaIndex 刚发了 Go 和 Java 的 SDK,再加一个 CLI,几行代码就能解析文档,写代码的可以试试。
LlamaIndex 给 LiteParse 加了 gRPC 接口,后端服务间解析文档更快更高效,适合微服务架构。
Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
LlamaParse 现在会根据页面难度自动选解析方式,简单文档用 OCR 省成本,复杂表格才上 VLM,想省钱又不想降精度的话可以试试。
LlamaIndex这次把文档解析的三种场景都做了:高精度的、低成本大批量的、还有低延迟实时的。有LlamaParse和开源LiteParse,不同需求直接用对应的就行。
LiteParse v2.1用纯代码搞定Markdown解析,比很多VLM还准,文字表格多的文档尤其好用,速度飞快还免费开源,赶紧去试试。
做文档解析、合规审计或金融分析的团队终于有了可验证的溯源方案——LlamaParse 的逐词边界框让 AI 提取的每个数字都能精确定位到原文,审计流程不再靠‘大概在这页’糊弄,建议直接试用。
做合规、审计或金融文档处理的团队终于有了可追溯的 AI 提取方案——LlamaParse 的精确坐标让每个数值都有据可查,建议直接集成到你的文档处理管道中。
做文档解析或构建 AI 智能体的团队终于有了一个标准化的评测工具——ParseBench 覆盖了企业级表格、图表等真实难点,建议直接拿来评估你的解析管线。
做文档解析和智能体开发的团队值得关注——LlamaIndex 在 Snowflake Summit 上展示的复杂文档解析能力,能直接提升非结构化数据处理效率,建议开发者留意后续技术分享。
做 RAG 应用或需要文档解析的团队,现在可以直接在 Dify 工作流里用 PaddleOCR 把扫描件变成结构化数据,再配合 ERNIE-Image 生成配图,一条 workflow 搞定。建议试试这个插件组合。
做文档解析和 RAG 的团队可以直接用这个模板,LlamaParse 处理非结构化文档 + Gemini 托管代理,省去自己搭建的麻烦,值得试试。
做文档解析或自动化流程的开发者可以直接用这个模板,省去从零搭建的麻烦——LlamaParse 加持的智能体在 Gemini 沙箱里跑,效果值得一试。
文档解析是 RAG 和 LLM 应用的关键瓶颈,PaddleOCR-VL 1.6 在复杂场景(表格、印章、稀有字符)上大幅提升,做法律、金融文档处理的团队可以直接替换升级,零迁移成本值得一试。
对于处理复杂文档的数据工程师和 AI 开发者,GPT-5.5 在 Codex 中的集成直接提升了解析可靠性,值得在 Databricks 工作流中尝试。