8月15日
23:12
8月5日
00:52
00:52Firecrawl@firecrawl_dev
72°
Firecrawl 今日发布开源文档解析引擎 anydoc,基于 Rust 编写。它能在 5 毫秒内将 PDF、Word、幻灯片等 13 种格式转换为 Markdown,处理 500 个 docx 文件仅需 1.7 秒。anydoc 已全面支撑 Firecrawl 的 /parse 端点,开发者和智能体可获得百倍速本地解析能力。
事件专题

推荐理由:Firecrawl 把解析器开源了,anydoc 用 Rust 写,PDF、Word 转 Markdown 只要几毫秒,装个包就能跑,比原来快 100 倍。
7月24日
14:51
14:51IT之家博客/媒体
81°
阿里云发布OvisOCR2,一个0.8B参数端到端文档解析模型。在OmniDocBench v1.6上以96.58综合得分登顶,首次超越流水线方法。该模型由Qwen3.5-0.8B后训练得到,采用SFT、RL、在线策略蒸馏和模型融合四阶段训练。以Apache 2.0开源,兼容vLLM和Qwen3.5推理生态,可无缝集成。

推荐理由:阿里新开源的0.8B模型OvisOCR2,端到端做文档解析,96.58分刷榜OmniDocBench,比传统流水线方法强。小模型就能做到,部署还简单,搞RAG、知识库的可以试试。
02:59
02:59LlamaIndex@llama_index
LlamaIndex 发布 Go SDK、Java SDK 和 CLI,允许开发者用几行代码从 Go 或 Java 解析文档,或直接从终端操作。用户需获取 API 密钥即可开始使用。新工具扩展了 LlamaParse 的集成方式,降低不同语言开发者的接入门槛。

推荐理由:LlamaIndex 刚发了 Go 和 Java 的 SDK,再加一个 CLI,几行代码就能解析文档,写代码的可以试试。
7月10日
09:44
09:44官方一手arXiv: DeepSeek@Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi
精选
Infinity-Parser2 是一个大型多模态模型,通过可控数据合成管道和多任务强化学习实现端到端文档解析。研究团队构建并开源了包含500万样本的中英双语数据集Infinity-Doc2-5M,涵盖多种文档类型和标注形式。模型采用8个联合训练目标,包括文档解析、布局分析、表格/数学公式/图表/化学公式解析及文档VQA。Infinity-Parser2-Pro 在olmOCR-Bench上达到87.6%,在ParseBench上达到74.3%,超越DeepSeek-OCR-2、PaddleOCR-VL-1.5和MinerU2.5。Flash变体推理吞吐量较Infinity-Parser-7B提升3.68倍。
推荐理由:Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
7月9日
07:47
07:47Jerry Liu@jerryjliu0
LlamaParse新增三个功能:用户元数据标签允许为每个解析任务附加自定义标签并回传;使用标签可按项目或团队筛选解析用量和成本;签名Webhook通过HMAC签名确保回调真实性。这些功能帮助处理每日数百万文档的团队精细追踪使用情况和成本。

推荐理由:LlamaParse现在能让你给每个解析打标签,按项目团队看成本,还能用签名webhook安全触发工作流。处理大量文档更可控了。
7月5日
11:10
11:10官方一手marktechpost@Michal Sutter
精选
2026年,多数企业数据仍存储在PDF、扫描件和幻灯片中。开源文档提取模型可在本地硬件上将它们转为结构化JSON。但“PDF转JSON”涵盖两种不同问题:架构驱动提取和通用提取。选择合适的模型取决于目标格式和文档类型。
推荐理由:这篇指南帮你分清两类PDF提取任务,不用纠结选哪个开源模型。适合自己搭管线的开发者。
6月26日
00:24
6月24日
12:40
12:40小互@imxiaohu
精选
百度发布新 OCR 模型 UnlimitedOCR,支持单次推理解析数百页文档,同时保持高吞吐速度。在 OmniDocBench v1.5 基准上,其准确率达到 93%,比原始 DeepSeek-OCR 基线提升 6 个百分点。模型已开源,可在 Hugging Face 和 GitHub 下载。
事件专题

推荐理由:百度新出的 UnlimitedOCR 能一次处理几百页,速度还很快,直接比 DeepSeek-OCR 高了 6 个点,真正好用。
03:42
03:42官方一手marktechpost@Asif Razzaq
精选
Datalab发布了lift,一个9B参数的开源视觉模型。该模型能将PDF与图像转换为符合给定schema的JSON结构。它使用schema约束解码确保输出有效,并训练弃权机制避免幻觉,在225份文档的基准上达到90.2%的字段准确率。
推荐理由:Datalab的lift模型能自动把PDF转成你需要的JSON格式,准确率90.2%,还不会瞎编字段。
6月21日
04:25
6月10日
07:12
07:12Jerry Liu@jerryjliu0
LlamaIndex 在 LlamaParse 中推出了细粒度边界框功能,能够为文档中的每个单词、行和表格单元格提供精确的视觉坐标。这使得 AI 代理在提取信息时,可以追溯到文档中的具体位置,而不仅仅是段落或页面。该功能专为审计、合规审查和需要验证的 AI 工作流设计,解决了知识工作自动化中决策可审计性的关键痛点。用户现在可以在 cloud.llamaindex.ai 上体验。
推荐理由:做文档解析、合规审计或金融分析的团队终于有了可验证的溯源方案——LlamaParse 的逐词边界框让 AI 提取的每个数字都能精确定位到原文,审计流程不再靠‘大概在这页’糊弄,建议直接试用。
6月2日
09:58
09:58LlamaIndex@llama_index
LlamaIndex 团队宣布将参加 Snowflake Summit 2026,在展台与参会者交流。他们聚焦于解析复杂文档和让智能体以人类级精度读取非结构化上下文。这标志着 AI 基础设施市场的持续火热,也展示了 LlamaIndex 在文档解析和智能体应用方面的最新进展。

推荐理由:做文档解析和智能体开发的团队值得关注——LlamaIndex 在 Snowflake Summit 上展示的复杂文档解析能力,能直接提升非结构化数据处理效率,建议开发者留意后续技术分享。