LlamaIndex 发布面向 AI Agent 的文档解析评测基准「ParseBench」
LlamaIndex 发布了一个面向 AI Agent 的文档解析评测基准「ParseBench」 @llama_index 100 种解析方法参与评测(vlm - 67、专用解析器 - 33),...
LlamaIndex 这个团队做了个挺有意思的事,他们把 100 种文档解析方法都测了一遍,结果发现 LlamaParse 在图表处理上特别强,而且成本还低,0.38 美分一页就能拿到 80 多分,比很多大模型都划算。
LlamaIndex 发布了「ParseBench」,一个面向 AI Agent 的文档解析评测基准。该基准包含 100 种解析方法(VLM 67 种、专用解析器 33 种),基于 2000 页真实企业文档进行评测。评测维度包括表格结构、图表抽取、内容忠实度、格式语义和视觉定位。头部方法 LlamaParse 在图表抽取上表现突出,而 VLM 在视觉定位上存在明显短板。
LlamaIndex 发布了一个面向 AI Agent 的文档解析评测基准「ParseBench」 @llama_index 100 种解析方法参与评测(vlm - 67、专用解析器 - 33),...
LlamaIndex 发布了一个面向 AI Agent 的文档解析评测基准「ParseBench」 @llama_index 100 种解析方法参与评测(vlm - 67、专用解析器 - 33),2000 页真实企业文档(人工两轮校验),169011 条确定性规则,完全不用 LLM 当裁判,可复现。评测五个维度取无加权平均:表格结构、图表抽取、内容忠实度、格式语义、视觉定位。 parsebench.ai 榜单核心结论(100 个方法) · 头部被 LlamaParse 系垄断(Agentic Plus 90.2 领跑);第三方 Pulse(81.6)、anyformat(80.3)证明头部并非一家独有。 · Charts 是最大分水岭:20 多个方法归零,头部却达 88–94。大量方法总分平庸纯粹是图表拖垮的。 · Faithfulness 普遍 80+,纯文字抽取已是解决问题;差距在结构、语义、定位。 · Grounding 是 VLM 集体盲区,反而一些总分平庸的专用解析器有 75–80。要溯源就盯这一项,别看总分。 · 格局碎片化:VLM 内容强、定位崩;专用解析器布局强、图表常直接放弃。无一家全能。 · 性价比:LlamaParse Cost Effective 0.38¢ 拿 80.6,全场之最;GLM-5.3 Flash、Gemini 3 Flash 不到 1¢ 上 70;反面是 Fable 5.1,16¢/页总分反而更低。 Jerry Liu @jerryjliu0 we've evaluated 100+ models on doc parsing 🔥 from frontier VLMs, open-weight VLMs, OCR tools, and OSS parsers check out parsebench: parsebench.ai E 🔗 View Quoted Tweet 💬 0 🔄 1 ❤️ 1 👀 253 📊 1 ⚡