腾讯开源微信文档解析模型 WeVisDoc,整页图片转 Markdown
腾讯开源微信的端到端文档解析模型 WeVisDoc 一张图片直接出 Markdown WeVisDoc,有 2B 和 4B 两个版本 主要功能特点: 整页图片直接转 Markdown:输入一张...
腾讯开源的 WeVisDoc 模型,能直接把整页文档图片转换成 Markdown,不用再手动裁剪标题、正文、表格和公式了。
腾讯开源的 WeVisDoc 模型,有 2B 和 4B 两个版本。它能直接处理整页文档图片,输出完整 Markdown,无需先分割标题、正文、表格和公式。模型能保留复杂文档结构,将正文转为普通 Markdown,公式转为 LaTeX,表格转为 HTML,并恢复阅读顺序。所有解析任务由一个模型完成,无需额外部署版面检测器和 OCR 引擎。
腾讯开源微信的端到端文档解析模型 WeVisDoc 一张图片直接出 Markdown WeVisDoc,有 2B 和 4B 两个版本 主要功能特点: 整页图片直接转 Markdown:输入一张...
腾讯开源微信的端到端文档解析模型 WeVisDoc 一张图片直接出 Markdown WeVisDoc,有 2B 和 4B 两个版本 主要功能特点: 整页图片直接转 Markdown:输入一张文档页面图,模型一次输出完整页面,不需要先把标题、正文、表格和公式分别裁出来。 保留复杂文档结构:正文转成普通 Markdown,公式转成 LaTeX,表格转成 HTML,并按页面内容恢复阅读顺序。 单模型完成解析:版面理解、文字识别、公式识别和表格重建都由同一个视觉语言模型完成,不需要另外部署版面检测器和 OCR 引擎。 提供 2B 与 4B 两个版本:2B 更适合资源有限或清晰页面较多的场景;4B 在拍照、翻拍等退化页面上更有优势。 Your browser does not support the video tag. 🔗 View on Twitter 💬 2 🔄 0 ❤️ 9 👀 1562 📊 5 ⚡
- shao__meng09-18 02:14原文