22:04LlamaIndex@llama_index精选LlamaIndex应用研究团队推出ExtractBench,号称最全面的企业复杂文档信息抽取基准。该基准测试了14个系统,包括前沿VLM、编程智能体和抽取API,覆盖370份企业文档、4869页和67种文档类型。评测完全确定性,不使用LLM作为裁判。最大发现是超过50页后,商业VLM的召回率跌破35%,精度虽高但会静默丢失大部分表格行。AI模型ExtractBenchLlamaIndex信息抽取1 个信源在谈事件专题推荐理由:做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。原文稍后读已读值得跟进有用关注 ExtractBench
06:00Google AI Developers@googleaidevs82°Google DeepMind 发布了 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。Box 公司对 3.5 Flash-Lite 与 3.1 Flash-Lite 进行企业文档任务评估,总体准确率从 41% 提升至 58%。数据分析任务提升 27 个百分点,零售任务提升 28 个百分点,金融服务任务提升 16 个百分点,消费品任务提升 21 个百分点。新模型在更轻量更快速的同时实现了性能代际提升。AI模型Gemini 3.6 FlashGemini 3.5 Flash-LiteGoogle DeepMind10 个信源在谈事件专题推荐理由:Box 实测 Gemini 3.5 Flash-Lite 在企业文档任务上比上代强了 17 个点,速度快还更轻,做数据分析和金融场景的可以关注。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
11:51Jerry Liu@jerryjliu0精选LlamaIndex 创始人 Jerry Liu 宣布发布 ParseBench,这是一个专门测试前沿模型理解真实企业文档能力的基准。现有基准多聚焦于编程和推理,但文档理解是下游知识工作的前提。ParseBench 涵盖密集表格、图表、复杂布局等真实场景,尤其针对金融、保险、法律等行业的文档。该基准已开放论文、排行榜和完整数据集,并计划举办线上研讨会。AI产品文档理解基准测试LlamaIndex推荐理由:做文档解析或企业级 AI 智能体的团队终于有了针对性的评估工具——ParseBench 填补了现有基准只测代码不测文档的空白,做文档理解相关开发的人可以直接用它验证模型效果。原文稍后读已读值得跟进有用关注 文档理解
11:43Jerry Liu@jerryjliu0精选LlamaIndex 团队在 AI Engineer Singapore 大会上举办了一场 90 分钟的工作坊,主题是如何在企业文档上构建智能体工作流。主讲人 @hexapode 重点讲解了如何从 PDF 等非结构化文档中提取信息,并将其整合为确定性的智能体工作流。团队表示将很快分享幻灯片,并预告在旧金山世界博览会上会有更多精彩内容。AI产品智能体企业文档LlamaIndex推荐理由:企业文档中大量非结构化数据被浪费,这个工作坊直接给出了从 PDF 提取信息到构建确定性智能体工作流的完整方案,做企业知识管理或文档自动化的开发者值得关注。原文稍后读已读值得跟进有用关注 智能体