
RotBench论文总结与关键部分翻译一、文章主要内容本文聚焦多模态大型语言模型(MLLMs)在图像旋转识别任务中的能力评估,核心内容围绕以下维度展开:1. 研究背景与问题提出尽管MLLMs在图像文本检索、图像分割、视觉问答等复杂视觉任务中表现出色,但现有研究表明其对图像旋转、翻转、模糊等简单变换敏感,在人类直觉性任务中易失效。而机器人手臂操控、第一视角极限运动分析等下游任务要求MLLMs具备稳健的空间推理能力,无论图像朝向如何。因此,本文核心问题为:MLLMs能否准确识别图像的旋转角度(0°、90°、180°、270°)?2. 基准数据集ROTBENCH构建为评估MLLMs的旋转识别能力,作者提出ROTBENCH基准数据集,包含350张人工筛选图像,分为两个子集:ROTBENCH-LARGE:300张图像,源自Spatial-MM数据集,涵盖生活场景、人像、风景等类型;ROTBENCH-SMALL:50张图像,用于建立人类性能基线,同样经严格筛选。数据集通过两阶段筛选确保有效性:第一阶段:由单一标注者判断图像是否包含清晰旋转视觉线索(如站立的人)、旋转后是否有显著差异,筛选出“接受”“丢弃”“标记”三类图像;第二阶段:3名人类评估者对标记图像的4种