百度开源了个 30 亿参数的 OCR 模型,能一次读完 100 页 PDF,不用分段处理,海外开发者都说好,Yann LeCun 都转了。
百度开源的 Unlimited OCR 模型再次登上 HuggingFace 全球模型总趋势榜第三名,超过 GLM-5.2。该模型仅 30 亿参数,支持 32K 上下文,可一次性解析 100 页 PDF 且无需分页,40 页后错误率低于 0.11。它采用 R-SWA 机制保持 KV Cache 恒定,解决了长文档 OCR 的显存和效率问题。目前 GitHub Star 超 1.65 万,HuggingFace 下载量达 224 万。
兄弟们,这几天真的是国产模型的高光时刻啊,又有模型海外刷屏! Yann LeCun 转发,Unli…
兄弟们,这几天真的是国产模型的高光时刻啊,又有模型海外刷屏!
Yann LeCun 转发,Unlimited-OCR 开源模型再次登上 HuggingFace 总榜🔥
Unlimited OCR 模型又火了!
之前还分享过它家出品的几个OCR的新模型,这个模型因为我没有本地部署的资源,因此还没有实测,结果这个模型在海外又出圈了!
近日,图灵奖获得者、AI 科学家杨立昆(Yann LeCun)转发推荐百度开源的 Unlimited OCR,该项目再次登上 HuggingFace 全球模型总趋势榜,目前位列第三,再次超过 GLM-5.2。
截至目前,Unlimited OCR 的 GitHub Star 已突破 1.65万,HuggingFace 下载量达到 224万,热度仍在持续攀升。
要知道,上个月发布时它就已经疯过一轮:发布次日登顶 GitHub Daily Trending 总榜、Python 榜,5 天 Star 破万,横扫 GitHub、HuggingFace 四大榜单第一。
如今时隔一月再次冲入全球趋势榜前三,Unlimited OCR 正在从一次出圈走向持续增长,成为近期全球开发者社区关注度最高的开源 AI 项目之一。
海外开发者直接炸了👇
🔹知名播客主持人 Mario Nawfal:30 亿参数,一次性解析整本 100 页 PDF,无需分页、无上下文丢失。40 页之后错误率低于 0.11,而其他所有 OCR 工具到这个阶段已经无法正常工作了。
🔹GrowthSchool 创始人 Vaibhav Sisinty:传统 OCR 逐页切割,跨页表格断裂、阅读顺序丢失。Unlimited-OCR 一次性处理整个文档,32K 上下文,文本、公式、表格、阅读顺序全部跨页保留,完全免费本地运行。
🔹网友 Superman:中国开源了一个「花生大小」的 OCR,只有 30 亿参数,本地运行,免费,永久。大多数人还不知道它的存在。
🔹网友 Macro Bombastic:这正是能彻底摧毁 SaaS 敲诈的办法,免费、本地化、准确率 93%,简直太棒了。
持续刷屏的背后是长程解析的技术突破
过去 OCR 处理长文档只能「逐页解析+结果拼接」,输出越长 KV Cache 越膨胀,推理越慢显存越贵。
Unlimited OCR 提出的 R-SWA 机制借鉴人类抄书的方式:始终盯着原文,只保留最近生成的「工作记忆」。
数十页文档一次连续解析,KV Cache 恒定规模,效率和显存成本两个都要,为端到端长文档解析提供了新的技术方案。
免费、开源、本地跑,感兴趣的快去试试👇🏻 GitHub:https://t.co/YRrqO7CTq0