AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:文档解析×
6月25日
15:45
15:45IT之家(博客/媒体)
精选71°
百度于6月22日开源Unlimited OCR模型,总参数30亿,推理时仅激活5亿参数。该模型基于DeepSeek OCR架构,采用两级视觉编码和16倍token压缩,将1024×1024的PDF图像压缩为256个视觉token。训练基于DeepSeek OCR检查点继续训练4000步,使用约200万文档样本,在8×16 A800 GPU上运行。在OmniDocBench v1.5上整体得分93.23,高于DeepSeek OCR的87.01和DeepSeek OCR 2的89.17。文本编辑距离0.038,公式CDM 92.61,表格TEDS 90.93,读序编辑距离0.045。
AI模型Unlimited OCRDeepSeek OCR百度OCR文档解析

推荐理由:百度开源了一个能一次性解析长文档的OCR模型,不再越处理越慢,性能还超过了DeepSeek OCR。
原文
6月24日
03:42
03:42marktechpost@Asif Razzaq
精选
Datalab发布了lift,一个9B参数的开源视觉模型。该模型能将PDF与图像转换为符合给定schema的JSON结构。它使用schema约束解码确保输出有效,并训练弃权机制避免幻觉,在225份文档的基准上达到90.2%的字段准确率。
AI模型Datalablift视觉模型文档解析JSON提取

推荐理由:Datalab的lift模型能自动把PDF转成你需要的JSON格式,准确率90.2%,还不会瞎编字段。
原文
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月19日
00:30
00:30Hugging Face: Blog(博客/媒体)
精选
PaddleOCR 3.5 版本正式发布,新增对 Transformers 后端的支持,允许用户使用 Hugging Face 生态中的预训练模型进行 OCR 和文档解析任务。这一更新打破了原有框架对 PaddlePaddle 模型的依赖,提升了模型选择的灵活性和生态兼容性。新版本还优化了文档解析性能,支持更多语言和复杂版面分析。对于需要集成 OCR 能力的开发者来说,这是一个重要的升级,可以直接利用社区丰富的 Transformers 模型资源。
AI产品OCR文档解析PaddleOCRTransformers开源/仓库

推荐理由:PaddleOCR 拥抱 Transformers 生态,做文档解析和 OCR 的团队可以更灵活地选模型,不用被框架绑死,值得升级试试。
原文
精选全部日报登录