百度发布 Unlimited OCR,基于 R-SWA 机制实现长文档连续解析

感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Win...

精选理由

百度这个 Unlimited OCR 通过 R-SWA 机制解决了长文档 OCR 的拼接问题,30 亿参数就能处理几十页,开源后社区反响超火,连 LeCun 都点赞了。

AI 摘要

百度推出的 Unlimited OCR 采用 Reference Sliding Window Attention (R-SWA) 机制,将解码阶段 KV Cache 控制在恒定规模,仅用 30 亿参数模型即可连续解析数十页文档。该项目开源次日即登上 GitHub Trending 和 HuggingFace 模型下载趋势榜双第一,目前 GitHub Star 突破 1.65 万,HuggingFace 下载量超 224 万。Yann LeCun 也关注到该项目。

原文 · 向阳乔木

感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Win...

感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Window Attention (R-SWA)机制,不用传统的“逐页解析+结果拼接”方法,通过借鉴人类阅读和抄长文档的工作方式,把解码阶段 KV Cache 控制在恒定规模,仅用30亿参数模型,实现数十页文档一次连续解析。 上个月开源的 Unlimited OCR,发布第二天就冲上 GitHub Trending 和 HuggingFace 模型下载趋势榜双第一。 如今项目 GitHub Star 已突破 1.65 万,HuggingFace 下载量超 224 万,再一次登上Trending,目前已经位列第二,并再次超过 GLM-5.2。 作为大模型训练数据清洗的基建型项目,Unlimited OCR 吸引了全球大量开发者的关注。 #无限OCR #UnlimitedOCR #百度 #文心大模型 #文心 💬 2 🔄 0 ❤️ 1 👀 451 📊 2 ⚡

百度发布 Unlimited OCR,基于 R-SWA 机制实现长文档连续解析 · AI 热点