8月11日
22:04
22:04LlamaIndex@llama_index
精选
LlamaIndex应用研究团队推出ExtractBench,号称最全面的企业复杂文档信息抽取基准。该基准测试了14个系统,包括前沿VLM、编程智能体和抽取API,覆盖370份企业文档、4869页和67种文档类型。评测完全确定性,不使用LLM作为裁判。最大发现是超过50页后,商业VLM的召回率跌破35%,精度虽高但会静默丢失大部分表格行。
事件专题

推荐理由:做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。
5月19日
11:51
11:51Jerry Liu@jerryjliu0
精选
LlamaIndex 创始人 Jerry Liu 宣布发布 ParseBench,这是一个专门测试前沿模型理解真实企业文档能力的基准。现有基准多聚焦于编程和推理,但文档理解是下游知识工作的前提。ParseBench 涵盖密集表格、图表、复杂布局等真实场景,尤其针对金融、保险、法律等行业的文档。该基准已开放论文、排行榜和完整数据集,并计划举办线上研讨会。

推荐理由:做文档解析或企业级 AI 智能体的团队终于有了针对性的评估工具——ParseBench 填补了现有基准只测代码不测文档的空白,做文档理解相关开发的人可以直接用它验证模型效果。
5月18日
11:43
11:43Jerry Liu@jerryjliu0
精选
LlamaIndex 团队在 AI Engineer Singapore 大会上举办了一场 90 分钟的工作坊,主题是如何在企业文档上构建智能体工作流。主讲人 @hexapode 重点讲解了如何从 PDF 等非结构化文档中提取信息,并将其整合为确定性的智能体工作流。团队表示将很快分享幻灯片,并预告在旧金山世界博览会上会有更多精彩内容。

推荐理由:企业文档中大量非结构化数据被浪费,这个工作坊直接给出了从 PDF 提取信息到构建确定性智能体工作流的完整方案,做企业知识管理或文档自动化的开发者值得关注。