03:18Jerry Liu@jerryjliu0精选In schema-guided complex document extraction, coding agents like Claude Code and Codex serve as cost-effective baselines for longer documents, offering similar accuracy to specialized OCR tools. On short documents, specialized OCR tools are more cost-efficient. Coding agents excel in long documents by leveraging various tools and prompt caching, though they may be less efficient for shorter texts compared to specialized extractors. Learn more in the ParseBench paper.论文文档提取编码代理复杂文档推荐理由:想了解文档提取新方法的朋友,这篇论文探讨了编码代理在复杂文档提取中的表现,值得一读。它比较了不同工具在长文档和短文档中的表现,揭示了编码代理的优势和局限性。原文稍后读已读值得跟进有用关注 文档提取
00:08Jerry Liu@jerryjliu0精选78°LlamaIndex发布ExtractBench基准,专门评估文档提取的视觉定位能力。测试显示,通用视觉模型和编码智能体在返回证据时得分为零,而专用VLM文档工具LlamaParse表现领先。LlamaExtract Agentic Plus在页面级F1达84.9%,词级46.4%,长文档上保持87.1%,其他系统在长文档上跌至0%。基准要求字段值和引用都正确才算分,词级框IoU需达0.5。AI模型LlamaParseExtractBenchLlamaIndex1 个信源在谈事件专题推荐理由:做PDF智能体的话,这个基准和工具值得看。通用模型定位不行,LlamaParse能精确到词级框,长文档也不掉链子。原文稍后读已读值得跟进有用关注 LlamaParse
00:53LlamaIndex@llama_index精选ExtractBench对文档提取API的溯源能力进行了严格评测:字段的值及其引用必须同时正确才计分。结果显示,VLM和编码智能体完全不返回证据,两层得分均为零。在能返回框的系统中,最佳词级F1仍低于50%。某专用API在短文档上页面级F1为61.7%,长文档上直接降到0.0%。LlamaExtract Agentic Plus在页面级和词级分别达到84.9%和46.4%,长文档上仍保持87.1%。AI模型ExtractBenchLlamaExtract文档提取1 个信源在谈事件专题推荐理由:想用文档提取API?先看ExtractBench的溯源评测。多数工具给不出出处,LlamaExtract Agentic Plus在长文档上还挺得住。原文稍后读已读值得跟进有用关注 ExtractBench
00:20官方一手@OpenAIDevs@OpenAIDevs精选房地产初创公司Hypha AI用GPT-5.6 Luna做文档提取,以GPT-5.5 1/18的成本保住了98%的准确率。金融研究公司RogoAI通过程序化工具调用抓取文件并分析数据,输入token减少21%且评估质量持平。该数据由OpenAI开发者官方账号发布。AI模型GPT-5.6 LunaGPT-5.5Hypha AI9 个信源在谈事件专题推荐理由:OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
06:08Jerry Liu@jerryjliu0精选LlamaIndex发布LlamaExtract Agentic Plus模式,专为50页以上长文档设计,可提取10k-100k个字段,准确率超过94%。每个提取字段附带置信度分数和边界框,便于溯源。在ExtractBench基准测试中,该模式比Claude Code Opus 4.8和Codex GPT-5.6等通用编码智能体准确率高10-20%。测试案例包括一份FTX债权人矩阵,含75k个字段、共114页。AI产品LlamaExtractLlamaParse文档提取1 个信源在谈事件专题推荐理由:LlamaIndex给LlamaParse加了新模式,专门抽长文档里的海量字段,准确率比Claude Code和Codex高10-20%,每个字段还带出处。原文稍后读已读值得跟进有用关注 LlamaExtract
05:57Jerry Liu@jerryjliu0精选ExtractBench是面向复杂企业文档提取的基准,包含370份文档、4869页和67种文档类型。它评估了14个系统,包括前沿VLM、编程智能体和专用提取API。结果显示,超过50页的文档中,商业VLM的召回率低于35%,主要问题是静默截断列表。LlamaParse新推出的Agentic Plus层级在基准上达到95.6%的值准确率,成本不到最接近竞争对手的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。原文稍后读已读值得跟进有用关注 ExtractBench
07:45Jerry Liu@jerryjliu0精选LlamaIndex本周发布文档提取基准ExtractBench,覆盖1950年代监管文件、手填税表、传真阈值化、复印件色调、传感器噪声及手机拍摄等真实场景。该基准测试了14个系统,发现各系统的感知盲区互不重叠。Codex在扫描和手写文档上准确率超过93%,但旋转页面跌至约80%。专用OCR API在旋转和手写上表现稳定,扫描场景只有81%。Gemini 3.5 Flash在扫描页上从88.6%降至71.1%。LlamaIndex的Agentic Plus是唯一无盲区的系统,在旋转、扫描、手写上的准确率分别为95.9%、93.9%、93.8%,波动仅2个百分点。AI模型ExtractBenchLlamaIndexCodex1 个信源在谈事件专题推荐理由:LlamaIndex做了个ExtractBench,测了14个文档提取系统,发现Codex和OCR各有短处,他们自己的Agentic Plus全场景最稳。原文稍后读已读值得跟进有用关注 ExtractBench
22:49LlamaIndex@llama_index精选ExtractBench测试了14个文档提取系统,使用1950年代监管文件、手填税表和手机拍摄等非数字化文档。Codex在扫描和手写场景准确率超93%,但处理旋转或纯图像页面时降至约80%。专用API表现相反,旋转和手写识别良好,扫描准确率为81%。Gemini 3.5 Flash从干净PDF的88.6%跌至扫描件的71.1%。LlamaIndex的Agentic Plus是唯一无盲区系统,在旋转、扫描和手写三项上分别达到95.9%、93.9%和93.8%。AI模型ExtractBenchCodexGemini 3.5 Flash1 个信源在谈事件专题推荐理由:LlamaIndex测了14个文档提取系统,Codex、Gemini在扫描件上都掉链子,只有Agentic Plus三项全在93%以上。原文稍后读已读值得跟进有用关注 ExtractBench
17:49Jerry Liu@jerryjliu0LlamaParse 是 LlamaIndex 推出的文档提取工具。用户可通过 login.llamaindex.ai 注册使用。该消息由 Jerry Liu 通过 X 平台发布,获得 375 次浏览。AI产品LlamaParseLlamaIndex文档提取推荐理由:Jerry Liu 在推上邀请大家注册 LlamaParse,做文档提取用的,想试的直接点链接。原文稍后读已读值得跟进有用关注 LlamaParse
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
07:05Jerry Liu@jerryjliu0LlamaIndex推出ExtractBench,一个覆盖4869页、67种文档类型、8个真实领域的企业文档提取基准。该基准包含超过1k行的表格、嵌套表格、跨页表格、扫描件和手写文档等复杂情况。评测了14个系统,包括前沿VLM、编码智能体和专用提取API。关键发现是超过50页的文档中,商业VLM因静默列表截断导致召回率低于35%。同时发布LlamaParse新层级Agentic Plus,以95.6%的值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。原文稍后读已读值得跟进有用关注 ExtractBench
23:31Jerry Liu@jerryjliu0精选LlamaIndex 推出 ExtractBench,号称最全面的复杂企业文档信息提取基准。该基准测试了 14 个系统,包括前沿 VLM、编码智能体和专用提取 API,覆盖 370 份企业文档、4,869 页和 67 种文档类型。最大发现是超过 50 页的文档中,商业 VLM 因静默列表截断,召回率跌破 35%。ExtractBench 评估值准确率、长记录完整性、空间定位和每页成本,完全确定性且无需 LLM 评判。同时发布 LlamaParse 新层级 Agentic Plus,以 95.6% 值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。原文稍后读已读值得跟进有用关注 ExtractBench
01:46Jerry Liu@jerryjliu0LlamaParse 发布 Conversational Extract 功能,用户可通过自然语言对话定义文档提取字段,无需手写 JSON Schema。用户上传参考文档后,AI agent 自动推断 schema,支持对话交互调整。系统可在规模达 100 万以上的文档上运行提取,为每个字段返回 bounding boxes、引用和置信度分数。AI产品LlamaParseLlamaIndex文档提取推荐理由:LlamaParse 出了新功能,跟聊天一样定义要提取什么字段,不用再手写 JSON schema 了,还能一键跑百万级文档,带引用和置信度。原文稍后读已读值得跟进有用关注 LlamaParse
10:12shao__meng@shao__meng精选Re-Ink 是 LandingAI 金融 AI Hackathon 冠军项目,针对再保险承保流程中文档处理耗时严重的痛点,构建了从 PDF/DOCX 条约文档到可审核合同记录的端到端自动化方案。行业数据显示,再保险承保人约 40% 时间用于行政工作,手动提取错误率超 6%,运营预算中约 14% 用于修复此类错误。Re-Ink 使用 LandingAI 的 Agentic Document Extraction (ADE) 作为文档智能核心,结合 FastAPI + React + PostgreSQL + LangGraph 栈,实现上下文感知的字段提取,无需正则或模板。关键设计是人机协同闭环:提取后人工审核,所有数据在 reviewer 确认前不持久化,审批后以单事务创建记录,任何校验失败均回滚。项目还包含两个 LangGraph Agent 用于入库前引导和审批后分析,支持 offline 模式便于自动化测试。AI产品再保险文档提取人机协同推荐理由:再保险行业的文档处理痛点被量化到 40% 时间浪费和 14% 预算浪费,做保险科技或金融文档自动化的团队可以直接参考这个端到端方案,尤其是人机协同闭环的设计思路值得借鉴。原文稍后读已读值得跟进有用关注 再保险