01:43Jerry Liu@jerryjliu0精选ExtractBench测试20多个模型在文档提取任务上的表现,Qwen 3.8模型表现最佳,GLM-5.3-flash和qwen 3.8 flash新版本也刚刚发布。测试结果基于统一F1的“价值准确性”指标,不包含视觉定位和置信度评分。论文ExtractBench文档提取模型测试10 个信源在谈事件专题推荐理由:ExtractBench最新测试了20多个模型,Qwen 3.8模型表现抢眼,新版本GLM-5.3-flash和qwen 3.8 flash也值得关注。原文稍后读已读值得跟进有用关注 ExtractBench