8月15日
23:12
7月22日
23:07
21:44
7月10日
09:44
09:44官方一手arXiv: DeepSeek@Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi
精选
Infinity-Parser2 是一个大型多模态模型,通过可控数据合成管道和多任务强化学习实现端到端文档解析。研究团队构建并开源了包含500万样本的中英双语数据集Infinity-Doc2-5M,涵盖多种文档类型和标注形式。模型采用8个联合训练目标,包括文档解析、布局分析、表格/数学公式/图表/化学公式解析及文档VQA。Infinity-Parser2-Pro 在olmOCR-Bench上达到87.6%,在ParseBench上达到74.3%,超越DeepSeek-OCR-2、PaddleOCR-VL-1.5和MinerU2.5。Flash变体推理吞吐量较Infinity-Parser-7B提升3.68倍。
推荐理由:Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
7月9日
7月1日
00:46
00:46官方账号LMSYS Org (SGLang)@lmsysorg
精选72°
SGLang 集成百度无限 OCR 功能,通过参考滑动窗口注意力(R-SWA)替换传统解码注意力,使 KV 缓存大小在整个解码过程中保持恒定。该方案在单次前向传播中可处理最长 32K token 的文本,转录数十页文档。其高压缩率来自 DeepSeek OCR 编码器,且 R-SWA 方法可扩展至 ASR、翻译等任务。

推荐理由:SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。
6月30日
6月29日
03:06
03:06AK@_akhaliq
百度发布的Unlimited-OCR模型在Hugging Face模型排行榜上位列第一,超越其他模型。该模型专注于OCR文字识别任务,具体基准成绩尚未公布。其排名基于社区下载量和交互数据,反映出较高的关注度。
事件专题

推荐理由:百度这个OCR模型居然冲到Hugging Face第一了,想搞文字识别的可以看看它有什么本事。
6月25日
6月24日
07:34
03:28
6月23日
16:21
16:21官方一手Pandaily@contact@pandaily.com (Pandaily)
百度推出Unlimited-OCR技术,核心是Constant KV Cache方法,专为超长文档设计。该技术在长文档OCR任务上取得SOTA性能,解决了传统KV缓存随文档长度线性增长的问题。Constant KV Cache将缓存大小保持常数,显著降低内存占用和推理延迟。
事件专题

推荐理由:百度搞了个Unlimited-OCR,用Constant KV Cache解决长文档识别,缓存不爆炸,性能还最强,适合处理几百页的合同或文献。
14:46
14:46向阳乔木@vista8
76°
百度发布Unlimited OCR,模拟人类抄书注意力模式,每生成一个token时参考完整图像和提示词,但输出侧仅回看前128个token。KV缓存固定为128长度,避免长文档推理时内存爆炸。在超长文档OCR任务上效果显著,已在GitHub和Hugging Face开源。
事件专题

推荐理由:百度开源了一个超聪明的OCR方案,用固定128 token缓存模拟人眼抄书,长文档不爆内存,快去试试!
14:45
12:05
12:05官方一手arXiv: DeepSeek@Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia
Unlimited OCR 模型以 DeepSeek OCR 为基线,将所有解码器注意力层替换为 Reference Sliding Window Attention (R-SWA),使解码过程中 KV 缓存保持恒定,不再随输出长度增长。在标准最大长度 32K 下,Unlimited OCR 可一次性转录数十页文档。相比传统端到端 OCR 模型,Unlimited OCR 解决了长序列中内存和速度下降的问题。R-SWA 是一种通用解析注意力机制,还可应用于 ASR、翻译等任务。代码和权重已在 GitHub 开源。
事件专题

推荐理由:百度新出的 Unlimted OCR 用了一种叫 R-SWA 的注意力机制,让它处理几十页文档时不会变慢,内存占用也恒定。想做长文档 OCR 的可以试试。