模型精选78°

腾讯微信视觉团队开源文档解析器「WeVisDoc」

腾讯微信视觉团队开源了端到端文档解析器「WeVisDoc」 输入一张页面图像,直接输出结构化 Markdown,其中文本、LaTeX 公式、HTML 表格和阅读顺序统一在单一输出序列里,没有流水线式...

精选理由

微信团队开源的文档解析器,能把图片里的文字结构化,支持 LaTeX 公式和 HTML 表格,在真实拍摄、光照不均的场景下表现更好。

腾讯微信视觉团队开源了端到端文档解析器「WeVisDoc」,基于 Qwen3-VL-2B/4B-Instruct 微调,提供 WeVisDoc-4B 和 WeVisDoc-2B 两个版本,支持中英文。在 OmniDocBench v1.6 基准上,WeVisDoc-4B 得分 95.38,超过 HunyuanOCR-1.5。在 PureDocBench 的 Real Degraded 子集上,WeVisDoc-4B 得分 69.08,超过 Logics-Parsing-v2。

原文 · shao__meng

腾讯微信视觉团队开源了端到端文档解析器「WeVisDoc」 输入一张页面图像,直接输出结构化 Markdown,其中文本、LaTeX 公式、HTML 表格和阅读顺序统一在单一输出序列里,没有流水线式...

腾讯微信视觉团队开源了端到端文档解析器「WeVisDoc」 输入一张页面图像,直接输出结构化 Markdown,其中文本、LaTeX 公式、HTML 表格和阅读顺序统一在单一输出序列里,没有流水线式的中间交接。模型基于 Qwen3-VL-2B/4B-Instruct 微调,提供 WeVisDoc-4B 和 WeVisDoc-2B 两个版本,支持中英文,许可证为 Apache-2.0。 @Weixin_WeChat WeVisDoc 官方网站 tencent.github.io/WeVisDoc/ @huggingface 开源模型 huggingface.co/tencent/WeVisD… # 核心方法:数据为中心的两阶段训练 工作最有意思的地方在训练策略。它的口号 “From Coverage to Capability” 概括了整个思路,架构在两个阶段之间完全不变,变的只是数据分配策略: Stage I (覆盖扩展):首先用源平衡的异构数据把语义、结构、外观三个维度的覆盖面铺开,并配合“保结构的样式合成”来扩充外观多样性。目标是让模型先“什么都见过”。 诊断阶段(残差分析):用留出的探针数据做残差分析,按结构、内容、语言、采集条件等维度聚类,找出连贯的失败簇——不是零散的错误,而是系统性的薄弱区。 Stage II (能力分配):根据诊断结果,用裁剪过的残差感知权重加上精选的困难样本,把训练 token 预算定向投放到薄弱区域,同时刻意不挤占自然数据的份额,防止顾此失彼。 # 性能:干净场景微弱领先,退化场景拉开差距 在 OmniDocBench v1.6 这个以标准文档为主的综合基准上,WeVisDoc-4B 取得 95.38 分,超过此前最强的 HunyuanOCR-1.5 (94.74) 0.64 分。这个幅度不小到不可质疑,但也不算拉开代差——干净、规整的输入上,各家头部模型已经挤在一起了。 真正体现差异的是 PureDocBench,它按采集条件分为三个子集,WeVisDoc-4B 的表现是: · Clean (洁净数字文档):79.81,超过 FD-RL(78.38)约 1.4 分; · Digital Degraded (数字退化,如压缩噪声、模糊):77.74,超过 FD-RL(76.33)约 1.4 分; · Real Degraded (真实拍摄,光照不均、透视、阴影):69.08,超过 Logics-Parsing-v2(67.64)约 1.4 分。 更能说明问题的是内部消融:Stage II (能力分配) 带来的增益随场景退化程度递增,OmniDocBench 上 +1.16,PDB Clean 上仅 +0.49,PDB Digital 上 +2.55,到 PDB Real 上达到 +4.03。换句话说,输入条件越恶劣、外观变化越剧烈,残差驱动的能力分配就越能兑现为实际提升。项目主页的 Recovery Lab 也印证了这一点:一个 9×9 数独表格的 TableTEDS 从 0.333 恢复到 1.000。 DailyPapers @HuggingPapers Tencent just released WeVisDoc on Hugging Face An end-to-end document parser that turns page images into structured Markdown, with LaTeX formulas and HTML tables. It tops OmniDocBench (95.38) and PureDocBench (75.54) among end-to-end parsers. 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 59 ⚡