11:46官方一手arXiv: DeepSeek@Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng以DeepSeek-OCR为代表的视觉-文本压缩方法在长上下文任务中宣称了很高的token压缩比。但现有评测依赖下游任务表现,MLLM的语义先验会掩盖文本保留的真实质量。新框架将视觉与语义能力解耦,ZeroSense Benchmark特意降低测试样本的语义关联。跨多个数据集的实验显示,压缩质量和下游准确率出现明显分歧,说明解耦式评测是必要的。论文DeepSeek-OCRZeroSense视觉-文本压缩推荐理由:DeepSeek-OCR这类压缩方法旧评测没测准,ZeroSense基准去掉语义干扰后,压缩质量和下游准确率明显脱节。原文稍后读已读值得跟进有用关注 DeepSeek-OCR
12:40小互@imxiaohu精选百度发布新 OCR 模型 UnlimitedOCR,支持单次推理解析数百页文档,同时保持高吞吐速度。在 OmniDocBench v1.5 基准上,其准确率达到 93%,比原始 DeepSeek-OCR 基线提升 6 个百分点。模型已开源,可在 Hugging Face 和 GitHub 下载。AI模型UnlimitedOCRBaiduOmniDocBench8 个信源在谈事件专题推荐理由:百度新出的 UnlimitedOCR 能一次处理几百页,速度还很快,直接比 DeepSeek-OCR 高了 6 个点,真正好用。原文稍后读已读值得跟进有用关注 UnlimitedOCR
13:55Geek@geekbb精选百度开源了一个基于DeepSeek-OCR升级的视觉语言模型OCR项目,支持一次性解析超长文档。该模型提供两种推理模式:gundam模式用于处理单张图片中的密集文字,base模式适用于多页文档或PDF。项目代码已在GitHub上发布,允许开发者直接使用。AI模型百度DeepSeek-OCR视觉语言模型推荐理由:百度开源的OCR模型,在DeepSeek-OCR上做了升级,能一次性处理超长文档和密集文字,两种模式很实用。原文稍后读已读值得跟进有用关注 百度
00:47berryxia@berryxia精选72°百度在Hugging Face上开源了Unlimited-OCR模型,其核心创新是R-SWA(Reference Sliding Window Attention),让KV Cache保持恒定,避免随页数爆炸。该模型可一次性解析单张图或多页PDF,在OmniDocBench上获得93分,比DeepSeek-OCR高出6个百分点。它取代了传统“分块+拼接”流程,实现端到端长文档理解,输出质量更高。AI模型Unlimited-OCR百度OmniDocBench5 个信源在谈事件专题推荐理由:百度开源了Unlimited-OCR,几百页文档一次搞定,不用分块拼接,速度稳准狠,OmniDocBench上93分压了DeepSeek-OCR一头。原文稍后读已读值得跟进有用关注 Unlimited-OCR