arxiv An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models

/documents/73112/

基本信息

文件基本信息

名称
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
描述
大型多模态模型 (LMM) 在一系列视觉和语言任务中取得了出色的性能。然而,他们的空间推理能力尚未得到充分研究。在本文中,我们构建了一个新颖的 VQA 数据集 Spatial-MM,以全面研究 LMM 的空间理解和推理能力。我们对对象关系和多跳推理的分析揭示了几个重要的发现。首先,边界框和场景图,甚至是合成的,可以显着增强 LMM 的空间推理能力。其次,LMM 更难解决从人类角度提出的问题,而不是相机角度提出的图像问题。第三,思想链(CoT)提示并不能提高涉及空间关系的复杂多跳问题的模型性能。此外,跨 MLLM 的空间推理步骤比非空间推理步骤的准确性要低得多。最后,我们对 GQA 空间的扰动分析表明,LMM 在基本目标检测方面比复杂空间推理强得多。我们相信我们的基准数据集和深入分析可以激发对 LMM 空间推理的进一步研究。 Spatial-MM 基准测试可在以下位置获取:此 https URL ...