22:47Dify@dify_aiPaddleOCR 和 ERNIE-Image 作为官方插件正式登陆 Dify Marketplace。用户现在可以在 Dify 工作流中直接调用文档解析(支持图片、PDF、多语言文档)和图像生成功能,无需额外部署。PaddleOCR 基于 PP-OCRv5 等模型,输出结构化数据用于 RAG 等下游任务;ERNIE-Image 提供免费图像生成,支持 Turbo 模式和 OpenAI 风格 API。这降低了构建文档智能和 AIGC 类 AI Agent 的门槛。AI产品DifyPaddleOCRERNIE-Image10 个信源在谈事件专题推荐理由:做 RAG 应用或需要文档解析的团队,现在可以直接在 Dify 工作流里用 PaddleOCR 把扫描件变成结构化数据,再配合 ERNIE-Image 生成配图,一条 workflow 搞定。建议试试这个插件组合。原文稍后读已读值得跟进有用关注 Dify
12:09Jerry Liu@jerryjliu0LlamaIndex 团队与 Google 合作,发布了一个基于 LlamaParse 和 Gemini API 新托管代理的模板。该模板构建了一个能够处理非结构化文档的智能代理,利用 LlamaParse 进行文档解析,再通过 Gemini 的托管代理进行后续处理。这一合作将文档解析与强大的 AI 模型结合,为处理复杂文档提供了高效解决方案。开发者可以直接使用该模板快速搭建文档处理应用。AI产品文档解析GeminiLlamaIndex推荐理由:做文档解析和 RAG 的团队可以直接用这个模板,LlamaParse 处理非结构化文档 + Gemini 托管代理,省去自己搭建的麻烦,值得试试。原文稍后读已读值得跟进有用关注 文档解析
03:57Google AI Developers@googleaidevsLlamaIndex 团队基于 Google 新发布的 Agents API 构建了一个模板,该模板利用 LlamaParse 和 LiteParse 让智能体在沙箱 Linux 环境中自动处理非结构化文档。用户只需配置 Git 仓库、克隆到沙箱、安装相关 CLI 和 SDK,即可让代理自主完成文档解析与输出。这一方案解决了真实世界文档杂乱难处理的痛点,为开发者提供了可直接使用的自动化文档处理方案。相关代码已开源在 GitHub 上。AI产品智能体文档解析LlamaParse推荐理由:做文档解析或自动化流程的开发者可以直接用这个模板,省去从零搭建的麻烦——LlamaParse 加持的智能体在 Gemini 沙箱里跑,效果值得一试。原文稍后读已读值得跟进有用关注 智能体
00:41berryxia@berryxia72°百度 PaddlePaddle 发布了 PaddleOCR-VL 1.6,在 OmniDocBench 上达到 96.33% 的 SOTA 成绩,超越开源和商业方案。该版本显著提升了表格识别、稀有字符、印章检测和图表理解能力,尤其适合金融合同、法律文件等复杂文档。与 1.5 版本完全架构兼容,零迁移成本即可使用。高精度解析能力直接提升了 RAG 系统的输入质量,降低了文档智能的门槛。AI产品OCR文档解析PaddleOCR-VL推荐理由:文档解析是 RAG 和 LLM 应用的关键瓶颈,PaddleOCR-VL 1.6 在复杂场景(表格、印章、稀有字符)上大幅提升,做法律、金融文档处理的团队可以直接替换升级,零迁移成本值得一试。原文稍后读已读值得跟进有用关注 OCR
12:40LlamaIndex@llama_index精选LlamaIndex 今日发布了 LlamaParse Opus 4.8 版本,并公布了 ParseBench 评测结果。新版本在表格解析、语义格式和布局方面有轻微提升,但在图表解析和内容忠实度上出现小幅退步。同时,每页价格略有上涨。团队表示,在教 LLM 像人类一样阅读文档方面仍有大量优化空间。LlamaParse 依然是 AI 智能体最佳的文档摄取 API。AI产品LlamaParse文档解析ParseBench推荐理由:做文档解析或构建 AI 智能体的开发者,可以看看 ParseBench 的详细数据,评估是否值得升级。原文稍后读已读值得跟进有用关注 LlamaParse
11:37官方一手@OpenAIDevs@OpenAIDevsOpenAI 在 Codex 中集成了 GPT-5.5 模型,帮助 Databricks 更可靠地解析复杂客户文档。这一改进提升了文档处理的准确性和效率,尤其适用于需要高精度提取信息的场景。该更新展示了 GPT-5.5 在专业应用中的实际价值,为数据团队提供了更强大的工具。AI产品GPT-5.5CodexDatabricks10 个信源在谈事件专题推荐理由:对于处理复杂文档的数据工程师和 AI 开发者,GPT-5.5 在 Codex 中的集成直接提升了解析可靠性,值得在 Databricks 工作流中尝试。原文稍后读已读值得跟进有用关注 GPT-5.5
01:10Jerry Liu@jerryjliu0精选LlamaIndex创始人Jerry Liu分享了@hexapode在新加坡AI工程师大会上的90分钟工作坊内容,包含116页幻灯片,系统梳理了RAG、检索、智能体循环、文档理解等AI模式在过去3年的演变。内容涵盖朴素RAG的12个痛点、重排序与查询重写的重要性、智能体循环如何简化检索层、文档解析的持续挑战,以及现代智能体形态如工作流和深度研究。对于关注AI技术演进的开发者,这是一份宝贵的历史脉络和实战经验总结。AI产品RAG智能体文档解析推荐理由:想理解RAG和AI智能体从2023到2026的完整进化路径?这份116页幻灯片是绝佳教材,做检索增强生成或智能体开发的团队值得收藏。原文稍后读已读值得跟进有用关注 RAG
21:59LlamaIndex@llama_index精选LlamaParse 新增对苹果默认图片格式 HEIC 的原生解析支持。该格式常见于企业文件系统中的白板照片、扫描文档和 iPhone 截图。用户无需事先将 HEIC 转换为 JPEG,可直接传入 .heic 文件进行解析。该功能减少了文档预处理步骤。AI产品LlamaParseHEICLlamaIndex推荐理由:LlamaParse 免去转码直接读 HEIC原文稍后读已读值得跟进有用关注 LlamaParse
09:12LlamaIndex@llama_indexLlamaIndex 推出了 ParseBench,这是首个专门为 AI 智能体设计的文档 OCR 基准测试。现有的基准测试无法满足 AI 智能体在实际生产环境中的需求,ParseBench 填补了这一空白。该基准测试旨在评估文档解析器在真实场景下的表现,帮助开发者判断其是否适合投入生产。LlamaIndex 将通过线上研讨会详细解读 ParseBench 的设计原理和应用方法。AI产品文档解析OCR基准测试推荐理由:做文档解析或 AI 智能体开发的团队,终于有了一个贴近真实生产环境的评估标准,建议关注 ParseBench 的细节,看看你的解析器能否通过考验。原文稍后读已读值得跟进有用关注 文档解析
08:00LlamaIndex@llama_index精选LlamaIndex 团队构建了一个演示代理,能够从 SEC 文件中提取数据并回答金融分析师的提问,答案附带原始 PDF 页面的精确高亮引用。该代理仅用约 600 行 Next.js 代码实现,无需向量数据库,完全依赖 LiteParse 进行文档解析。金融分析师约 70% 的时间用于从 PDF 中提取数字,该工具可大幅提升效率。项目代码和博客文章已公开,供开发者参考和复用。AI产品LlamaIndexLiteParse金融分析推荐理由:金融从业者终于有了一个轻量级工具来替代手动翻 PDF 的苦活——LlamaIndex 这个 600 行代码的代理直接解决了数据提取和引用验证的痛点,做金融分析或文档处理的团队值得点开看看。原文稍后读已读值得跟进有用关注 LlamaIndex
07:59LlamaIndex@llama_index精选Google 发布了 Agents API,这是一个在沙盒 Linux 环境中构建和运行自定义智能体的服务。LlamaIndex 团队随即构建了一个模板,使这些智能体能够集成 LlamaParse 和 LiteParse,自动处理非结构化文档。工作流程包括配置 Git 仓库、克隆到沙盒、安装解析工具和技能,然后让智能体自主执行任务。该方案让智能体可以直接处理真实世界的复杂文档,适合需要自动化文档处理的开发者。AI产品智能体GoogleLlamaIndex推荐理由:Google 的 Agents API 让智能体有了安全沙盒环境,LlamaIndex 的模板直接打通了文档解析能力,做文档自动化处理的团队可以立刻上手试试。原文稍后读已读值得跟进有用关注 智能体
07:59Jerry Liu@jerryjliu0LlamaIndex 创始人 Jerry Liu 宣布,LlamaParse 和 LiteParse 现在可以通过 MCP(模型上下文协议)或技能(skill)方式,以极简配置集成到任意 AI 智能体中。LlamaParse 提供高质量文档处理与提取能力,可通过 MCP 设置快速接入;LiteParse 则支持一行代码安装为智能体技能,得益于 Vercel 的技能工具。这一更新让开发者无需复杂集成即可为智能体添加强大的文档解析功能,显著降低了开发门槛。AI产品LlamaParseLiteParseMCP/工具推荐理由:做文档解析或智能体集成的开发者,现在可以用 MCP 或一行代码把 LlamaParse/LiteParse 接入自己的智能体,省去大量配置工作,值得直接试试。原文稍后读已读值得跟进有用关注 LlamaParse
07:55Jerry Liu@jerryjliu0精选LlamaIndex 发布了 LiteParse,一个免费、开源、无需模型的文档解析器,专门用于从复杂布局的财务文档(如 SEC 文件)中提取文本和表格,并返回精确的引用边界框。基于此,他们构建了一个约 600 行 Next.js 代码的尽职调查 AI 智能体演示,无需向量数据库即可回答用户问题并高亮原始 PDF 中的来源。该工具解决了金融分析师约 70% 时间用于从 PDF 中提取数字的痛点,且完全免费。LiteParse 作为智能体工作流的关键组件,为开发者提供了低成本构建文档分析应用的模板。AI产品LiteParseLlamaIndex文档解析推荐理由:金融团队终于有了免费开源的 PDF 解析利器——LiteParse 能处理复杂表格并给出精确引用,做尽职调查或财务分析的开发者可以直接拿来构建智能体,省去昂贵的解析费用。原文稍后读已读值得跟进有用关注 LiteParse
20:14Jerry Liu@jerryjliu0Google AI 通过 Gemini API 推出了 Managed Agents 服务,这是对 Anthropic Managed Agents 的回应。该服务基于新的 Antigravity 智能体(由 Gemini 3.5 Flash 驱动),号称是面向开发者最具成本效益的通用智能体沙箱。LlamaIndex 团队已为 Gemini Managed Agents 构建了第一天支持,通过 LlamaParse 和 LiteParse 让智能体能够解析 PDF 等非结构化文档。开发者可以配置 Git 仓库,将数据和输出存入其中,智能体在沙箱内自动安装工具并处理文档任务。这为需要处理复杂真实世界文档的开发者提供了一个低成本、自动化的解决方案。AI产品智能体GoogleGemini10 个信源在谈事件专题推荐理由:Google 终于推出了自己的托管智能体服务,而且基于 Gemini 3.5 Flash 成本极低,做文档处理的团队可以直接用 LlamaIndex 的模板快速上手,省去自己搭建解析流程的麻烦。原文稍后读已读值得跟进有用关注 智能体
12:31LlamaIndex@llama_indexLlamaIndex 推出了 ParseBench,这是首个专门为 AI 智能体设计的文档 OCR 基准测试。现有的基准测试无法满足 AI 智能体在文档解析方面的实际需求,ParseBench 填补了这一空白。该基准测试将帮助开发者评估文档解析器在生产环境中的真实表现。LlamaIndex 将通过线上研讨会详细解读其背后的原理和方法。AI产品文档解析OCR基准测试推荐理由:做文档解析或 AI 智能体应用的开发者终于有了针对性的评估工具,ParseBench 能帮你判断解析器是否真的 ready for production,建议关注后续研讨会细节。原文稍后读已读值得跟进有用关注 文档解析
00:30官方一手Hugging Face: Blog(博客/媒体)精选PaddleOCR 3.5 版本正式发布,新增对 Transformers 后端的支持,允许用户使用 Hugging Face 生态中的预训练模型进行 OCR 和文档解析任务。这一更新打破了原有框架对 PaddlePaddle 模型的依赖,提升了模型选择的灵活性和生态兼容性。新版本还优化了文档解析性能,支持更多语言和复杂版面分析。对于需要集成 OCR 能力的开发者来说,这是一个重要的升级,可以直接利用社区丰富的 Transformers 模型资源。AI产品OCR文档解析PaddleOCR推荐理由:PaddleOCR 拥抱 Transformers 生态,做文档解析和 OCR 的团队可以更灵活地选模型,不用被框架绑死,值得升级试试。原文稍后读已读值得跟进有用关注 OCR
13:27shao__meng@shao__meng精选LandingAI 发布了一个名为“解析前”的页面级分类 API,能在昂贵的文档解析之前对 PDF 逐页打标签。它解决企业文档混杂的问题:如 50 页房贷 PDF 中混有工资单、银行流水等,直接解析会浪费算力并导致抽取幻觉。API 支持自定义类别列表、并发逐页评估、返回标签及推理说明,还能处理未知页面并建议类别。企业可根据标签丢弃无关页或分流到不同流水线,调用方式为简单的 curl POST 请求。AI产品文档解析页面分类API推荐理由:做文档处理或企业 RAG 的团队,终于有个低成本方案在解析前先做“分诊”,避免为噪音付 OCR 和 LLM 的冤枉钱,值得直接试。原文稍后读已读值得跟进有用关注 文档解析