02:54LlamaIndex@llama_index精选ExtractBench在370个企业文档、67种文档类型和4,800多页面上评估了结构引导提取。LlamaIndex CTO Simon Suo将进行技术讲解,探讨提取难度、现有基准的不足以及成本与准确性的权衡。技巧ExtractBenchLlamaIndex文档提取API推荐理由:LlamaIndex CTO Simon Suo将分享ExtractBench的测试结果,了解企业文档提取API的优缺点。原文稍后读已读值得跟进有用关注 ExtractBench
00:17LlamaIndex@llama_index精选72°传统解析器常将修订痕迹视为噪音,导致被删除的条款被错误识别为有效文本。LlamaParse 现已支持处理文档的修订跟踪功能。该工具能输出文档最终状态的干净 Markdown,并提供包含作者、内容及位置的结构化修订数据。这项功能适用于处理合同、监管提交文件及政策草案中的红线修订。AI产品LlamaParseLlamaIndexRAG推荐理由:LlamaParse 新增识别修订痕迹功能,处理合同和法规文件时能准确区分删除内容。原文稍后读已读值得跟进有用关注 LlamaParse
00:08Jerry Liu@jerryjliu0精选78°LlamaIndex发布ExtractBench基准,专门评估文档提取的视觉定位能力。测试显示,通用视觉模型和编码智能体在返回证据时得分为零,而专用VLM文档工具LlamaParse表现领先。LlamaExtract Agentic Plus在页面级F1达84.9%,词级46.4%,长文档上保持87.1%,其他系统在长文档上跌至0%。基准要求字段值和引用都正确才算分,词级框IoU需达0.5。AI模型LlamaParseExtractBenchLlamaIndex1 个信源在谈事件专题推荐理由:做PDF智能体的话,这个基准和工具值得看。通用模型定位不行,LlamaParse能精确到词级框,长文档也不掉链子。原文稍后读已读值得跟进有用关注 LlamaParse
07:45Jerry Liu@jerryjliu0精选LlamaIndex本周发布文档提取基准ExtractBench,覆盖1950年代监管文件、手填税表、传真阈值化、复印件色调、传感器噪声及手机拍摄等真实场景。该基准测试了14个系统,发现各系统的感知盲区互不重叠。Codex在扫描和手写文档上准确率超过93%,但旋转页面跌至约80%。专用OCR API在旋转和手写上表现稳定,扫描场景只有81%。Gemini 3.5 Flash在扫描页上从88.6%降至71.1%。LlamaIndex的Agentic Plus是唯一无盲区的系统,在旋转、扫描、手写上的准确率分别为95.9%、93.9%、93.8%,波动仅2个百分点。AI模型ExtractBenchLlamaIndexCodex1 个信源在谈事件专题推荐理由:LlamaIndex做了个ExtractBench,测了14个文档提取系统,发现Codex和OCR各有短处,他们自己的Agentic Plus全场景最稳。原文稍后读已读值得跟进有用关注 ExtractBench
05:44Jerry Liu@jerryjliu0LlamaIndex 在伦敦开设新办公室,目前有Frank、Max、Joe三名员工,另有两人即将入职。办公室可俯瞰泰晤士河。公司正在旧金山、伦敦和纽约招聘核心产品工程、基础设施、AI研究、前向部署AI工程师、客户经理、BDR、市场与开发者关系等岗位。创始人表示,过去几个月团队规模已翻倍。行业LlamaIndex伦敦办公室招聘推荐理由:LlamaIndex 伦敦开张了,团队几个月内翻倍,正在招工程师和销售,想跳槽的可以去官网看看。原文稍后读已读值得跟进有用关注 LlamaIndex
22:49LlamaIndex@llama_index精选ExtractBench测试了14个文档提取系统,使用1950年代监管文件、手填税表和手机拍摄等非数字化文档。Codex在扫描和手写场景准确率超93%,但处理旋转或纯图像页面时降至约80%。专用API表现相反,旋转和手写识别良好,扫描准确率为81%。Gemini 3.5 Flash从干净PDF的88.6%跌至扫描件的71.1%。LlamaIndex的Agentic Plus是唯一无盲区系统,在旋转、扫描和手写三项上分别达到95.9%、93.9%和93.8%。AI模型ExtractBenchCodexGemini 3.5 Flash1 个信源在谈事件专题推荐理由:LlamaIndex测了14个文档提取系统,Codex、Gemini在扫描件上都掉链子,只有Agentic Plus三项全在93%以上。原文稍后读已读值得跟进有用关注 ExtractBench
22:27Jerry Liu@jerryjliu082°LlamaIndex推出文档抽取引擎LlamaExtract Agentic Plus,在ExtractBench上达到95.6%的value accuracy。ExtractBench包含370份企业文档、4869页、67种文档类型,覆盖财务、能源、政府等领域。该基准发现,超过50页的长文档会让商业视觉语言模型的召回率跌破35%,原因是静默截断列表。LlamaExtract Agentic Plus定价约为Claude Code/Codex的25%-50%,每页成本低于最接近竞品的三分之一。AI产品LlamaExtractLlamaIndexExtractBench1 个信源在谈事件专题推荐理由:批量解析复杂企业文档?LlamaExtract比Claude Code便宜一半还更准,去LlamaParse体验。原文稍后读已读值得跟进有用关注 LlamaExtract
17:49Jerry Liu@jerryjliu0LlamaParse 是 LlamaIndex 推出的文档提取工具。用户可通过 login.llamaindex.ai 注册使用。该消息由 Jerry Liu 通过 X 平台发布,获得 375 次浏览。AI产品LlamaParseLlamaIndex文档提取推荐理由:Jerry Liu 在推上邀请大家注册 LlamaParse,做文档提取用的,想试的直接点链接。原文稍后读已读值得跟进有用关注 LlamaParse
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
07:05Jerry Liu@jerryjliu0LlamaIndex推出ExtractBench,一个覆盖4869页、67种文档类型、8个真实领域的企业文档提取基准。该基准包含超过1k行的表格、嵌套表格、跨页表格、扫描件和手写文档等复杂情况。评测了14个系统,包括前沿VLM、编码智能体和专用提取API。关键发现是超过50页的文档中,商业VLM因静默列表截断导致召回率低于35%。同时发布LlamaParse新层级Agentic Plus,以95.6%的值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。原文稍后读已读值得跟进有用关注 ExtractBench
23:31Jerry Liu@jerryjliu0精选LlamaIndex 推出 ExtractBench,号称最全面的复杂企业文档信息提取基准。该基准测试了 14 个系统,包括前沿 VLM、编码智能体和专用提取 API,覆盖 370 份企业文档、4,869 页和 67 种文档类型。最大发现是超过 50 页的文档中,商业 VLM 因静默列表截断,召回率跌破 35%。ExtractBench 评估值准确率、长记录完整性、空间定位和每页成本,完全确定性且无需 LLM 评判。同时发布 LlamaParse 新层级 Agentic Plus,以 95.6% 值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。原文稍后读已读值得跟进有用关注 ExtractBench
22:04LlamaIndex@llama_index精选LlamaIndex应用研究团队推出ExtractBench,号称最全面的企业复杂文档信息抽取基准。该基准测试了14个系统,包括前沿VLM、编程智能体和抽取API,覆盖370份企业文档、4869页和67种文档类型。评测完全确定性,不使用LLM作为裁判。最大发现是超过50页后,商业VLM的召回率跌破35%,精度虽高但会静默丢失大部分表格行。AI模型ExtractBenchLlamaIndex信息抽取1 个信源在谈事件专题推荐理由:做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。原文稍后读已读值得跟进有用关注 ExtractBench
02:59Jerry Liu@jerryjliu0精选LlamaIndex创始人Jerry Liu在X上发文,强调评估和hillclimbing在文档处理中的重要性。他认为未来FDE(领域专家)的工作将转向定义业务问题、编码评估标准,并利用自动化优化流程。他提到可以使用Claude Code或Codex来优化工作流,而FDE则专注于确保目标和评估的正确性。该推文还邀请有复杂文档处理需求的团队联系他们。技巧LlamaIndex文档处理评估推荐理由:LlamaIndex创始人聊文档处理的新思路,把评估和自动化优化结合起来,适合做复杂文档抽取的人看看。原文稍后读已读值得跟进有用关注 LlamaIndex
05:25Jerry Liu@jerryjliu0精选LiteParse 现在可在毫秒级从 PDF 中提取复选框状态、标注、矢量图形和词级边界框。它是目前功能最全的免费开源文档处理器,可接入编码智能体,提供源文档的上下文和引用回归。对于扫描页、多栏文本、表格等复杂文档,LiteParse 会通过内置路由器转向 VLM 方案(如 LlamaParse)。LiteParse 还输出复杂度信号,告诉用户哪些页面需要视觉模型处理。AI产品LiteParseLlamaIndexLlamaParse推荐理由:PDF 里的复选框、批注、矢量图,LiteParse 免费开源毫秒级提取,复杂页面自动转交 LlamaParse。原文稍后读已读值得跟进有用关注 LiteParse
01:13Jerry Liu@jerryjliu0精选LlamaParse推出表单自动提取功能,设置processing_options.forms='enrich'即可从复杂表单中提取全部字段与值,输出结构化JSON。该功能无需预定义schema,能自动检测每个表单键和对应值,未填写字段返回空白。同时支持识别复选框状态,并附带标准markdown输出。目前该功能以beta形式对所有付费计划开放。AI产品LlamaParseLlamaIndex表单解析推荐理由:LlamaParse现在能把W-2这类表单直接变成JSON,不用写schema,调一个参数就行,省掉一条解析管线。原文稍后读已读值得跟进有用关注 LlamaParse
02:47Jerry Liu@jerryjliu0精选LlamaIndex发布博客称,前沿模型在文档理解性能上趋于平缓,GPT-5.5到5.6、Gemini 3.5到3.6、Opus 4.8到5的视觉理解基准无明显提升。跨三个GPT世代,解析准确率仅提升约24点,而每页成本翻了4倍。LlamaParse通过代理模式和低成本模式,在密集表格和图表等复杂边界情况上超越了前沿模型。该公司表示,可将前沿模型蒸馏为参数效率更高的模型,以更低成本实现同等性能。AI产品LlamaParseLlamaIndexOCR推荐理由:LlamaIndex用数据反驳“OCR只是功能”,说LlamaParse比GPT等前沿模型更准更便宜,做文档解析的可以看看。原文稍后读已读值得跟进有用关注 LlamaParse
01:01LlamaIndex@llama_indexLlamaIndex 对比三代 GPT 模型的文档解析表现,发现精确度只提升约 24 个百分点,但每页成本涨了 4 倍。即便最新一代前沿模型,在 OCR 任务上仍落后于专用解析器。作者认为“大模型会吃掉 OCR”的说法缺乏数据支撑,性能差距还会随成本放大。AI模型GPTLlamaIndexOCR推荐理由:别信“大模型能吃 OCR”。LlamaIndex 用三代 GPT 数据反驳:成本涨 4 倍,精度还落后。原文稍后读已读值得跟进有用关注 GPT
22:09LlamaIndex@llama_indexLlamaIndex发布LiteParse更新,无需视觉模型即可从PDF中提取表单字段值、勾选状态、注释、嵌入图像、矢量图形等结构化数据。处理速度达到每页毫秒级。对于需要模型处理的页面,LiteParse会输出复杂度信号,标记扫描页、多栏文本、表格和密集图形,帮助用户把解析任务路由到LlamaParse等工具。AI产品LiteParseLlamaIndexPDF解析推荐理由:LiteParse能直接读PDF勾选框和表单字段,毫秒级,还告诉你何时该用LlamaParse。原文稍后读已读值得跟进有用关注 LiteParse
06:18Jerry Liu@jerryjliu0LlamaIndex 发布 Parse Gateway,用 LiteParse 的 is_complex 功能逐页评估 PDF 复杂度。干净文本页由 LiteParse 免费进程内解析,扫描、表格、乱码和复杂图表页路由到 LlamaParse 更高层级。Parse Gateway 还提供 MCP 服务器,智能体可自行估算复杂度并选择解析层级。这样能避免为简单页面支付 LlamaParse 的价格,同时不牺牲复杂页面的解析准确率。AI产品Parse GatewayLlamaIndexLiteParse推荐理由:PDF 解析也可以按页挑工具了,简单页面免费,复杂页面才上 LlamaParse,省心又省钱。原文稍后读已读值得跟进有用关注 Parse Gateway
06:05Jerry Liu@jerryjliu0LlamaIndex 发布 Parse Gateway,基于 LiteParse 的 is_complex 功能逐页判断文档复杂度。简单文本页面路由到免费、快速的文本解析器;复杂页面(含扫描、表格、图表等)路由到 LlamaParse 的 agentic 或 agentic plus 模式。该方案取代了传统的一刀切管道,在降低解析成本的同时保持高准确率。Parse Gateway 代码已开源,并集成到 MCP 服务器供智能体自主调用。AI产品LlamaIndexParse GatewayLiteParse推荐理由:LlamaIndex 做的 Parse Gateway 能根据每页复杂度自动选解析模式,简单页免费处理,复杂页用高级版,省成本又不牺牲准确率。原文稍后读已读值得跟进有用关注 LlamaIndex
04:35LlamaIndex@llama_indexLlamaIndex 推出了 Parse Gateway,一个智能 PDF 解析管道。它利用 LiteParse 的 is_complex 功能逐页评估复杂度(扫描页、表格、乱码、嵌入图片等),简单页面在进程中免费解析,困难页面自动路由到更强大的 LlamaParse 层级。支持 MCP 服务器,智能体可自主选择解析层级。在降低解析成本的同时不牺牲准确性。AI产品LlamaIndexParse GatewayPDF解析推荐理由:LlamaIndex 搞了个 Parse Gateway,能自动识别 PDF 里哪些页简单、哪些复杂,简单页免费快解析,复杂页才走高级管道,还能让智能体自己选层级,省成本又不丢精度。原文稍后读已读值得跟进有用关注 LlamaIndex
02:03Jerry Liu@jerryjliu0LlamaIndex 旗下的文档解析工具 LlamaParse 推出了官方批量解析体验。用户不再需要逐个文件调用 API,而是可以一次性创建包含最多 10000 个文件的批次。新功能提供了专用 UI 界面,支持审计整个批次、查看失败任务并浏览完整结果集。这提升了可靠性和代码可维护性,用户无需再自行编写异步服务来调用 API。该功能已在所有付费计划中可用。AI产品LlamaParseLlamaIndex文档解析推荐理由:LlamaParse 现在可以直接在 UI 里批量解析一万个文件,不用再写脚本了,查错和看结果都很方便。原文稍后读已读值得跟进有用关注 LlamaParse
11:57Jerry Liu@jerryjliu072°4月25日,LlamaIndex创始人Jerry Liu在X分享了一场关于agent loops和loop engineering的晚餐讨论。多数参与者未在Codex/Claude Code中主动使用/loop功能。他们认为通过多智能体交接、事件触发或cron作业堆栈可构建长时间运行的自主agent循环。几乎所有人相信1-2年内无人再审查代码,但人类仍需提供对齐、护栏、判断与创造力。行业LlamaIndexClaude Codeagent loops1 个信源在谈事件专题推荐理由:Jerry Liu分享了和一群创始人聊的agent开发心得,比如怎么搞长周期agent循环,还有1-2年后没人review代码的讨论,挺有启发。原文稍后读已读值得跟进有用关注 LlamaIndex
01:17LlamaIndex@llama_indexLlamaIndex 在 LlamaParse UI 中新增批量解析功能,用户无需编写代码即可一次性解析或提取最多 10,000 个文件。只需指定文件夹即可开始,所有付费计划用户均可使用。该功能将原本需要编写 API 脚本的工作简化为一个按钮操作。AI产品LlamaIndexLlamaParse批量解析推荐理由:LlamaIndex 把批量解析做成了 UI 按钮,不用写脚本,最多一次处理1万个文件,省时省力。原文稍后读已读值得跟进有用关注 LlamaIndex
02:59LlamaIndex@llama_indexLlamaIndex 发布 Go SDK、Java SDK 和 CLI,允许开发者用几行代码从 Go 或 Java 解析文档,或直接从终端操作。用户需获取 API 密钥即可开始使用。新工具扩展了 LlamaParse 的集成方式,降低不同语言开发者的接入门槛。AI产品LlamaIndexGo SDKJava SDK推荐理由:LlamaIndex 刚发了 Go 和 Java 的 SDK,再加一个 CLI,几行代码就能解析文档,写代码的可以试试。原文稍后读已读值得跟进有用关注 LlamaIndex
14:14Jerry Liu@jerryjliu0LlamaParse 成功解析了一篇关于 Dinitz-Garg-Goemans 猜想的数学论文 PDF,该猜想已被证明为假,这是一个存在约 30 年的图论问题。论文中展示了图形(图例中 fractional flow cost 为 58,任何不可分流的流量(容量违规 ≤15)成本至少为 60)。该结果来源于与 GPT 5.6 Pro 的对话。LlamaParse 展示了将复杂学术 PDF 转为可解析文本的能力。AI产品LlamaParseLlamaIndexPDF解析推荐理由:LlamaParse 连这种数学猜想论文的 PDF 都能解析,试试用它读你手头那些难搞的论文?原文稍后读已读值得跟进有用关注 LlamaParse
04:30Jerry Liu@jerryjliu0LlamaIndex 团队将于7月30日举办在线研讨会,演示如何将密集的金融文档(含表格、脚注、风险备注)转化为结构化输出。研讨会由解决方案架构师 Harsha 主持,重点展示表格和脚注保持完整不扁平化、提取数据可溯源至源页、以及自动校验规则并标记异常。活动时间为太平洋时间上午9点/东部时间中午12点。技巧LlamaIndex金融文档文档解析推荐理由:金融数据乱糟糟?LlamaIndex 教你直播拆解最难的表格和脚注,还能自动校验规则,做决策用的数据终于干净了。原文稍后读已读值得跟进有用关注 LlamaIndex
02:54LlamaIndex@llama_index7月30日,LlamaIndex 解决方案架构师 Harsha 将展示如何把真实金融文档(含密集表格和脚注)转化为结构化上下文。演示中表格和脚注不会被压平成文本,提取的数字可追溯至原始页面。系统会根据预设规则检查数值,并标记异常项。活动时间 9:00 AM PT / 12:00 PM ET。技巧LlamaIndex金融文档智能体工作流推荐理由:LlamaIndex 教你处理金融文档里的复杂表格和脚注,提取结构化数据,还带溯源和规则校验,做智能体工作流的可以看看。原文稍后读已读值得跟进有用关注 LlamaIndex
02:21Jerry Liu@jerryjliu0精选LlamaParse 改进了文档解析中的边界框功能,现在支持区域级、行级和单词级三层边界框。用户可以根据需求选择不同粒度来对文本进行溯源,例如审计发票中的具体数字或定位研究报告中的图表。该功能已在 LlamaParse 云端服务中可用。AI产品LlamaParseLlamaIndex文档解析推荐理由:LlamaParse 更新了文档解析的边界框,支持按区域、行、单词定位文本,方便审计和研究场景。原文稍后读已读值得跟进有用关注 LlamaParse
12:21Jerry Liu@jerryjliu0LlamaIndex创始人Jerry Liu发推指出,前沿实验室都在优化通用智能,这为其他人优化任务特定智能留出空间。每个任务需要不同的成本-能力权衡点,需要调整模型和工具来提升性能并降低成本。他认为开源模型、RL优化基础设施、垂直工作流以及像文档解析这样的领域专用模型,在快速增长的AI经济中有很大发展空间。行业Jerry LiuLlamaIndex开源模型推荐理由:Jerry Liu分析了通用智能之外的蓝海,做垂直AI产品的开发者值得读读这条思路。原文稍后读已读值得跟进有用关注 Jerry Liu
10:17Jerry Liu@jerryjliu0LlamaIndex创始人Jerry Liu发布推文,团队在旧金山进行了一周线下冲刺,团队规模较上次聚会翻倍(2x)。期间锁定了AI智能体文档基础设施的路线图,并进行了团建活动(喷绘、Topgolf、足球、密室逃脱)。团队已为Q3做好准备。行业LlamaIndex智能体文档处理推荐理由:LlamaIndex创始人发了团队近况,规模翻倍,规划了AI agent文档基础设施路线图。适合关注LlamaIndex和智能体开发的朋友看看。原文稍后读已读值得跟进有用关注 LlamaIndex
02:28Jerry Liu@jerryjliu0LlamaIndex 在过去 2 年投入大量工程资源,构建了可靠、准确的索引管道。该管道原生支持智能体(agent-native),并提供多种检索端点,可接入不同框架。现通过 cloud.llamaindex.ai 开放使用。AI产品LlamaIndexRAG智能体推荐理由:LlamaIndex 新出了索引管道,自带多种检索端点,做 RAG 和智能体应用会很顺手,可以试试他们的云服务。原文稍后读已读值得跟进有用关注 LlamaIndex
02:27Jerry Liu@jerryjliu0Jerry Liu(LlamaIndex创始人)强调2026年构建高质量检索系统的重要性,外部模型能力虽提升,但生产中的Agent检索仍需投入工程时间调优分块、同步、重排序、工具API设计、权限等细节。具体技巧包括:将内容追加到Slack线程作为连续块并利用启发式确定上下文、实现Slack实时更新、为代码库独立分块/更新、混合搜索效果良好、以及为不同项目设置自然的数据源防护栏。这些经验来自LlamaIndex内部Index功能的生产化过程。技巧LlamaIndexAgentic Retrieval混合搜索2 个信源在谈事件专题推荐理由:Jerry Liu分享了做生产级Agent检索的踩坑经验,分块、同步、重排序这些细节怎么调全告诉你,不是新理论。原文稍后读已读值得跟进有用关注 LlamaIndex
01:27Jerry Liu@jerryjliu0jerryjliu0提出在agent harness上构建工作流图,并通过外部agent循环动态创建该图,实现循环与图形的结合。这种方法允许开发者利用LlamaIndex的框架灵活编排agent行为。Peter Steinberger参与讨论循环与图形之间的转变。该思路强调重复迭代,以构建复杂的agent系统。技巧LlamaIndex智能体工作流推荐理由:想搞Agent工作流?看看jerryjliu0怎么用循环和图形动态构建的,比硬编码灵活多了。原文稍后读已读值得跟进有用关注 LlamaIndex
07:47Jerry Liu@jerryjliu0精选LlamaIndex 团队在旧金山举办全员线下会议,宣布向 AI 智能体文档基础设施方向演进。其基准 ParseBench 已包含 2000+ 企业页面,约 80 个解决方案通过验证,每月下载量达 1.5 万。轻量解析器 liteparse 在约 2 个月内收获 11.5k+ GitHub 星星。LlamaParse 推出 agentic 和 cost-effective 两种模式,定义了基于 VLM 的 OCR 解决方案的帕累托前沿。团队计划在 Q3 大幅提升 ParseBench 的垂直领域数据集和任务覆盖范围。AI产品LlamaIndexLlamaParseliteparse推荐理由:LlamaIndex 团队发了几款文档解析工具的进展和基准数据,特别是 liteparse 两个月就冲到 1.1 万星,很能打。原文稍后读已读值得跟进有用关注 LlamaIndex
06:19Jerry Liu@jerryjliu0精选LlamaIndex 本周与一家全球公司会面后,加速成为 AI 代理的文档基础设施。ParseBench 基准已覆盖 2000+ 企业页面,验证约 80 个解决方案,每月 15k 次下载,在 HuggingFace 和 Kaggle 可用。LlamaParse 的 agentic 和成本效益模式直接定义 VLM 基 OCR 解决方案的帕累托前沿,每天改进复杂表格、图表、字体和布局。免费解析器 liteparse 在约 2 个月内获得 11.5k+ GitHub 星标。AI产品LlamaIndexParseBenchLlamaParse推荐理由:LlamaIndex 在文档处理上发力,ParseBench 基准和 LlamaParse 实用,liteparse 免费且明星增长快。原文稍后读已读值得跟进有用关注 LlamaIndex
02:14LlamaIndex@llama_indexLlamaIndex 与 You.com 联合在旧金山 AWS Builder Loft 举办 Agentic Hackathon,时间定于 7 月 24 日。参与者可在一天内利用实时网络数据构建智能体,涵盖实时情报、深度研究或多智能体系统。活动包含现场演示和评委评审,报名链接通过 Luma 平台进行。行业LlamaIndexYou.comAgentic Hackathon推荐理由:想试试用实时数据搭智能体?LlamaIndex 和 You.com 办了个一天的黑客松,7月24日旧金山,直接动手还上台比。原文稍后读已读值得跟进有用关注 LlamaIndex
02:03Jerry Liu@jerryjliu0精选LlamaIndex 发布了 liteparse-grpc,一个基于 gRPC 协议的文档解析服务,支持 PDF、Office 文档和图片解析,输出 JSON、文本或 Markdown 格式。该服务提供 PDF 页面截图、文档复杂度评估和 OCR 需求判断功能。liteparse-grpc 同时提供 npm 包和 Docker 镜像,以及 TypeScript 客户端存根和 protobuf 定义,便于生成 Python、Go、Java 等语言的客户端。原有的 REST API 仍将继续维护。AI产品liteparseLlamaIndexgRPC推荐理由:LlamaIndex 给 LiteParse 加了 gRPC 接口,后端服务间解析文档更快更高效,适合微服务架构。原文稍后读已读值得跟进有用关注 liteparse
00:39LlamaIndex@llama_indexLlamaIndex 为文档处理工具 LiteParse 新增 gRPC 接口(liteparse-grpc),支持以 npm 包或 Docker 镜像运行。该接口可解析 PDF、Office 文档和图片为 JSON、text 或 Markdown,还能将 PDF 页面渲染为截图,并估算文档复杂度及是否需要 OCR。此前 LiteParse 仅可通过 REST 调用,新接口更适合服务间通信。liteparse-grpc 还包含 CLI 客户端、TypeScript 客户端存根和 protobuf 定义,方便生成 Python、Go、Java 等语言的客户端。AI产品LiteParsegRPCLlamaIndex推荐理由:LlamaIndex 给 LiteParse 加了 gRPC 接口,微服务之间调文档处理更快了,还能解析 PDF、Office 和图片,带截图和 OCR 预判,适合多语言系统。原文稍后读已读值得跟进有用关注 LiteParse
01:46Jerry Liu@jerryjliu0LlamaParse 发布 Conversational Extract 功能,用户可通过自然语言对话定义文档提取字段,无需手写 JSON Schema。用户上传参考文档后,AI agent 自动推断 schema,支持对话交互调整。系统可在规模达 100 万以上的文档上运行提取,为每个字段返回 bounding boxes、引用和置信度分数。AI产品LlamaParseLlamaIndex文档提取推荐理由:LlamaParse 出了新功能,跟聊天一样定义要提取什么字段,不用再手写 JSON schema 了,还能一键跑百万级文档,带引用和置信度。原文稍后读已读值得跟进有用关注 LlamaParse