arxiv Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

/documents/71651/

基本信息

文件基本信息

名称
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
描述
事实证明,思想链 (CoT) 提示对于增强大型语言模型 (LLM) 和多模态大型语言模型 (MLLM) 中的复杂推理非常有效。然而,它在复杂的空间推理任务中表现不佳。尽管如此,人类认知超越了语言本身,具有以文字和图像进行思考的非凡能力。受这种机制的启发,我们提出了一种新的推理范式,多模态思维可视化(MVoT)。它通过生成推理轨迹的图像可视化来实现 MLLM 的视觉思维。为了确保高质量的可视化,我们将标记差异损失引入自回归 MLLM。这项创新显着提高了视觉连贯性和保真度。我们通过几个动态空间推理任务验证了这种方法。实验结果表明,MVoT 表现出了跨任务的竞争性能。此外,它在 CoT 失败的最具挑战性的场景中表现出了强大而可靠的改进。最终,MVoT 为复杂的推理任务创造了新的可能性,其中视觉思维可以有效地补充言语推理 ...