Cohere 发布 Parse 5 文档解析模型

Cohere 官方发布 Parse 5 > 2.3B 参数 > 8192 上下文窗口 > 支持输入 PDF、PPT、JPEG > 支持英、法、德、意、西、葡、日、韩、阿拉伯语 Parse 5 是一...

精选理由

Cohere 新出的 Parse 5 专门解析企业文档,比传统 OCR 更强,价格还低。

AI 摘要

Cohere 发布 Parse 5,这是一款 2.3B 参数的专用文档解析视觉语言模型。Parse 5 支持 PDF、PPT、JPEG 等格式,拥有 8192 上下文窗口。在 ParseBench 测试中,Parse 5 获得 79.2 分,超过 Mistral OCR 4(74.5)等竞争对手。该模型能将非结构化企业文档转换为结构化 Markdown 数据,支持表格、表单和图片处理。

原文 · shao__meng

Cohere 官方发布 Parse 5 > 2.3B 参数 > 8192 上下文窗口 > 支持输入 PDF、PPT、JPEG > 支持英、法、德、意、西、葡、日、韩、阿拉伯语 Parse 5 是一...

Cohere 官方发布 Parse 5 > 2.3B 参数 > 8192 上下文窗口 > 支持输入 PDF、PPT、JPEG > 支持英、法、德、意、西、葡、日、韩、阿拉伯语 Parse 5 是一个专用文档解析视觉语言模型(VLM),核心任务是把 PDF、PPT、图片等非结构化企业文档,一次性转换成干净的、机器可读的 Markdown 结构化数据。 体验地址 huggingface.co/spaces/CohereL… # 为什么官方说"超越 OCR"? 传统 OCR 只做文字识别,Parse 5 是端到端单次前向传播(前面没有独立的 OCR 阶段),一次输出: · 文本:按正确阅读顺序排列(多栏排版不乱序) · 表格:渲染为结构化 HTML,能处理旋转表格、合并单元格等复杂情况 · 表单:提取键值对 · 图片:生成文字描述,并附带边界框(bounding box)坐标 · 语义格式:保留删除线、斜体、上下标、标题层级等"会改变数据含义"的样式 两种输出模式: · markdown(默认):整页 Markdown,表格内联为 HTML,图片以 ![](image_id) 引用 · blocks:结构化内容块数组,每个块带类型(text/table/image)和边界框,适合做版面分析和引用溯源 # 性能:ParseBench 79.2 分 超过 Mistral OCR 4(74.5)、Databricks AI Parse(72.4)、Azure Document Intelligence(69.3) 需要知道的三个重要前提 · 只测了 5 个维度中的 3 个。ParseBench 完整维度是:表格、内容忠实度、语义格式、版面定位(Layout)、图表(Charts)。Cohere 排除了后两项: · Layout 被排除是因为 Parse 5 设计上只对表格和图片输出边界框,不对文本块输出——Cohere 称这是"有意的输出格式选择"; · Charts 被排除是因为 Parse 5 把图表当作"带描述的图片"处理,不做图表数据提取(官方称下个版本才支持)。 · 在全 5 维度上,LlamaParse Agentic(84.9)仍是榜首。Cohere 的"领先"声明限定在三维度和同价位专用解析器范围内。 · 评分规则刚改过(2026 年 8 月修复了粗体/标题检测的计分 bug,旧规则会虚高语义格式分),Cohere 用新规则重跑了所有竞品,这一点相对公允。 Cohere @cohere Introducing Cohere Parse 5. Our newest document parsing model with the strongest price-performance on the market. Ideal for high-volume enterprise work. Get high-quality parsing accuracy while keeping per-page prices at an industry low. 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 97 ⚡

Cohere 发布 Parse 5 文档解析模型 · AI 热点