#OCR
geekbb 发了 doc7,用你自己配的 OpenAI 兼容模型就能把文档转 Markdown,不用再搭 OCR、公式那套模型栈。
Datalab 出了 Marker 2,OCR 文档解析又快又准,比 MinerU 快 5 倍,比 Docling 更强,搞文档提取的别错过。
百度这个 Unlimited OCR 通过 R-SWA 机制解决了长文档 OCR 的拼接问题,30 亿参数就能处理几十页,开源后社区反响超火,连 LeCun 都点赞了。
百度开源了个 30 亿参数的 OCR 模型,能一次读完 100 页 PDF,不用分段处理,海外开发者都说好,Yann LeCun 都转了。
Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
LlamaParse 现在会根据页面难度自动选解析方式,简单文档用 OCR 省成本,复杂表格才上 VLM,想省钱又不想降精度的话可以试试。
SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。
新数据集让僧伽罗语OCR有了真实评测基准,LightOnOCR-2-1B 只用1.05%错误率碾压商业和开源方案,适合做古籍或法律文档自动识别。
如果你对多语言OCR或印地语文本识别感兴趣,这篇论文揭示了主流模型在天城体上的真实差距,尤其是GPT-5.5表现不如开源Qwen3-VL-8B。
百度开源了Unlimited-OCR,在vLLM上跑,能一次性解析整本书,内存不涨,比DeepSeek-OCR快35%,做文档OCR的好东西。
PaddleOCR 把 v6 的部署数据拉得很细,A100 0.13 秒、M4 0.35 秒,还有三种尺寸选,想在生产环境搭 OCR 的直接抄作业。
PaddleOCR的PP-OCRv6上HF了,支持transformers和ONNX Runtime双后端,切换框架不用改代码,超实用。
百度开源了Unlimited OCR,3B参数却只有500M激活,表格解析超强,能一次性读完40页文档,比PaddleOCR-VL-1.6强在表格和阅读顺序上。试试看?
Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。
Mistral OCR 在 ParseBench 上语义格式化很强,价格还比 Azure/AWS 便宜,适合做高质量 OCR 又不愿花大价钱的场景。
百度搞了个Unlimited-OCR,用Constant KV Cache解决长文档识别,缓存不爆炸,性能还最强,适合处理几百页的合同或文献。
百度新出的 Unlimted OCR 用了一种叫 R-SWA 的注意力机制,让它处理几十页文档时不会变慢,内存占用也恒定。想做长文档 OCR 的可以试试。
百度开源了Unlimited-OCR,几百页文档一次搞定,不用分块拼接,速度稳准狠,OmniDocBench上93分压了DeepSeek-OCR一头。
Obsidian 用户快看,OCR Extractor 现在支持本地模型了,不用联网就能把 PDF 和图片里的文字提取出来变成可搜索的笔记,隐私更好还免费。
Claude Fable 5 在视觉评测中拿下 OCR 第一,做文档处理、教育或图表分析的团队可以重点关注这个模型的实际表现。