arxiv ColPali: Efficient Document Retrieval with Vision Language Models

/documents/78948/

基本信息

文件基本信息

名称
ColPali: Efficient Document Retrieval with Vision Language Models
描述
文档是视觉丰富的结构,通过文本、图形、页面布局、表格甚至字体来传达信息。由于现代检索系统主要依赖从文档页面提取的文本信息来索引文档(通常通过漫长而脆弱的过程),因此它们很难有效地利用关键视觉线索。这限制了它们在许多实际文档检索应用中的能力,例如检索增强生成(RAG)。为了对当前系统进行视觉丰富的文档检索进行基准测试,我们引入了视觉文档检索基准 ViDoRe,它由跨越多个领域、语言和实际设置的各种页面级检索任务组成。现代系统固有的复杂性和性能缺陷催生了一个新的概念;通过直接嵌入文档页面的图像来进行文档检索。我们发布了 ColPali,这是一种经过训练的视觉语言模型,可以从文档页面的图像生成高质量的多向量嵌入。与后期交互匹配机制相结合,ColPali 的性能在很大程度上优于现代文档检索管道,同时更加简单、更快且可进行端到端训练。我们在开放许可证下在此 https URL 发布模型、数据、代码和基准 ...