LlamaIndex 的 Extract v2.5 能处理扫描件上的手写批注和叠加文字,号称比 Opus 5.5 和 GPT-6 Sol 便宜还更准,做文档提取的可以试试。
#文档提取
LlamaIndex新发布的Extract v2.5智能体能处理跨页表格,准确率超96%,比Opus 5.5和GPT-6 Sol便宜30%-4倍。
LlamaIndex新发布的Extract v2.5智能体在文档提取任务上表现优异,准确率高达95%以上,比Opus 5.5和GPT-6 Sol更便宜。
LlamaIndex 推出了 Extract Turbo 模式,能更快地提取文档里的结构化数据,比他们之前的模式快4倍,适合处理多页文档。
想了解文档提取新方法的朋友,这篇论文探讨了编码代理在复杂文档提取中的表现,值得一读。它比较了不同工具在长文档和短文档中的表现,揭示了编码代理的优势和局限性。
想用文档提取API?先看ExtractBench的溯源评测。多数工具给不出出处,LlamaExtract Agentic Plus在长文档上还挺得住。
OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
LlamaIndex给LlamaParse加了新模式,专门抽长文档里的海量字段,准确率比Claude Code和Codex高10-20%,每个字段还带出处。
LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。
LlamaIndex做了个ExtractBench,测了14个文档提取系统,发现Codex和OCR各有短处,他们自己的Agentic Plus全场景最稳。
LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。
做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。
LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。
LlamaParse 出了新功能,跟聊天一样定义要提取什么字段,不用再手写 JSON schema 了,还能一键跑百万级文档,带引用和置信度。
再保险行业的文档处理痛点被量化到 40% 时间浪费和 14% 预算浪费,做保险科技或金融文档自动化的团队可以直接参考这个端到端方案,尤其是人机协同闭环的设计思路值得借鉴。