百度这个 Unlimited OCR 通过 R-SWA 机制解决了长文档 OCR 的拼接问题,30 亿参数就能处理几十页,开源后社区反响超火,连 LeCun 都点赞了。
百度推出的 Unlimited OCR 采用 Reference Sliding Window Attention (R-SWA) 机制,将解码阶段 KV Cache 控制在恒定规模,仅用 30 亿参数模型即可连续解析数十页文档。该项目开源次日即登上 GitHub Trending 和 HuggingFace 模型下载趋势榜双第一,目前 GitHub Star 突破 1.65 万,HuggingFace 下载量超 224 万。Yann LeCun 也关注到该项目。
感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Win...
感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Window Attention (R-SWA)机制,不用传统的“逐页解析+结果拼接”方法,通过借鉴人类阅读和抄长文档的工作方式,把解码阶段 KV Cache 控制在恒定规模,仅用30亿参数模型,实现数十页文档一次连续解析。 上个月开源的 Unlimited OCR,发布第二天就冲上 GitHub Trending 和 HuggingFace 模型下载趋势榜双第一。 如今项目 GitHub Star 已突破 1.65 万,HuggingFace 下载量超 224 万,再一次登上Trending,目前已经位列第二,并再次超过 GLM-5.2。 作为大模型训练数据清洗的基建型项目,Unlimited OCR 吸引了全球大量开发者的关注。 #无限OCR #UnlimitedOCR #百度 #文心大模型 #文心 💬 2 🔄 0 ❤️ 1 👀 451 📊 2 ⚡
- berryxia08:27原文