主要来源arXiv: DeepSeek
查看原文事件专题 · 官方一手
Unlimited OCR:用恒定KV缓存实现长文档转录
Unlimited OCR 模型以 DeepSeek OCR 为基线,将所有解码器注意力层替换为 Reference Sliding Window Attention (R-SWA),使解码过程中 KV 缓存保持恒定,不再随输出长度增长。在标准最大长度 32K 下,Unlimited OCR 可一次性转录数十页文档。相比传统端到端 OCR 模型,Unlimited OCR 解决了长序列中内存和速度下降的问题。R-SWA 是一种通用解析注意力机制,还可应用于 ASR、翻译等任务。代码和权重已在 GitHub 开源。
当前结论
百度新出的 Unlimted OCR 用了一种叫 R-SWA 的注意力机制,让它处理几十页文档时不会变慢,内存占用也恒定。想做长文档 OCR 的可以试试。
6 个信源69° AI 热度最后更新 2026/6/22 09:01:29
证据链
相关来源 1berryxia
查看原文相关来源 2小互
查看原文相关来源 3向阳乔木
查看原文相关来源 4Pandaily
查看原文相关来源 5AK
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。