/documents/75096/
基本信息
文件基本信息
名称
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
描述
近年来,多模态大语言模型(MLLM)在视觉识别任务中取得了快速进展。鉴于它们有可能集成到许多关键应用中,了解它们视觉感知的局限性非常重要。在这项工作中,我们研究了 MLLM 在回答有关图像的问题时是否能够像感知大视觉细节一样有效地感知小视觉细节。我们观察到他们的表现对问题的视觉主题的大小非常敏感,并通过进行干预研究进一步表明这种影响实际上是因果关系。接下来,我们研究了 MLLM 在回答视觉问题时的注意力模式,有趣的是,他们始终知道该看哪里,即使他们提供了错误的答案。基于这些发现,我们提出了免训练的视觉干预方法,利用任何 MLLM 本身的内部知识,以注意力和梯度图的形式,来增强其对小视觉细节的感知。我们在两个广泛使用的 MLLM 和七个视觉问答基准上评估了我们提出的方法,并表明它们可以显着提高 MLLM 的准确性,而无需任何培训。我们的结果阐明了将 MLLM 应用于涉及小细节的视觉识别任务的风险,并表明使用模型内部状态进行视觉干预是减轻这种风险的一个有希望的方向 ...