LightOn 的开源 OCR 模型 OCR-3 出了,0.8B 和 4B 两个版本都能自己部署,表格图表效果不错,价格比 Gemini 便宜不少,做文档处理可以试试。
#OCR
Jerry Liu推出的OpenDocRouter让你不用再折腾各种OCR模型,一个接口就能用上Opus 5.5等130多种模型,还自动处理限流和计费。
LlamaIndex 出了个 OpenDocRouter,一个 API 接 10 个文档解析模型,换模型改一行代码,每千页最低 $0.86,处理 PDF 转 markdown 的可以试试。
做文档处理的朋友可以看看,LlamaIndex 把 10 个解析模型塞进一个 API,一行代码切换,还附 ParseBench 成绩单,按 token 计费。
LlamaIndex 的 Logan 写了篇实操文:OCR 别再单次跑,改成布局感知、难元素路由、多轮自检的循环,能救回表格和图表。
LlamaIndex 的 Logan Markewich 写了篇文档解析新玩法,传统 OCR 一遍过就完事,现在改成循环识别加自检,表格图表都能抠出来,做 RAG 的可以看看。
LlamaIndex 拿美联储 dot plot 当例子,演示表格空单元格怎么让 agent 读错数,LlamaParse 解析后 9 个数字全对上。做文档解析的可以试试。
AI Engineer 把 2026 大会的视觉 OCR 场次全放出来了,LlamaIndex 和 Hugging Face 的人都来讲实战,做文档和视觉应用的很值得刷一遍。
一次看完五个视觉与 OCR 实战案例:Sarvam 读了 13 万亿 token,Reducto 解析 PDF 能提分省 token,Noyan 花几美元训检测器,做法都够具体。
LlamaIndex 跑了 ParseBench,Opus 5.5 解析 PDF 表格比 Opus 5 高 7 个点,但每页 5.8 美分不便宜,文中还对比了 LlamaParse 的替代方案。
朋友,青海师范大学的藏语智能实验室发布了我国首款藏语多语言全模态 AI 输入法,叫智达 AI 输入法,支持手机、电脑全终端,还能语音输入藏语,挺方便的。
Jina AI 推出了个新模型叫 jina-ocr-v1,用 DeepSeek-OCR 微调的,能解析文档转 Markdown,在 L4 GPU 上速度挺快,比很多同类模型都快。
JinaAI 新出的 jina-ocr-v1 OCR 模型,在 COCO-Text 基准上表现不错,直接在 Hugging Face 上就能用。
Jerry Liu 新发布的 FlyOCR 很有意思,他用果蝇大脑模型来识别 PDF,准确率挺高的,可能比一些传统的 VLMs 更好。
Jerry Liu 测试了 Astra,它解析带表格的复杂文档很厉害,在 ParseBench 上 93.2%,适合金融文档分析,但价格有点贵。
Hugging Face和EleutherAI测了14款开源OCR,dots.mocr最准,97.6%准确率,每千页不到2美元,处理旧书够用了。