前两天帮一位准备毕业答辩的硕士朋友看问卷数据,他问我:审稿意见让报告共同方法偏差,我在SPSS里翻了半天,怎么就没找到哪个按钮直接测这个?——这个问题我几乎每隔几个月就会遇到一次。Harman单因素检验本来就不是SPSS里预置好的“一键分析”,它的原理是在因子分析输出结果里手工读取首因子解释率。SPSS实战中,这项检验是问卷研究里最常被要求的诊断指标之一,也是很多硕博论文和期刊投稿路上绕不开的一道坎。这篇内容,我会从原理到操作、从输出解读到论文汇报,把完整流程展开讲清楚,适合正在写论文的硕博生、准备投稿的科研人,以及所有用问卷做量化研究的从业者。
1. 共同方法偏差与Harman单因素检验:先弄懂逻辑再动手
1.1 什么时候审稿人会让你做共同方法偏差检验
先说一个我观察到的规律:凡是“一次性问卷、自评式作答、同一批被试报告所有变量”的研究,审稿人几乎都会追问共同方法偏差(Common Method Bias,简称CMB)的处理情况。原因很简单,当你让同一个受访者在一个时间点同时填写自变量和因变量,两个人之间的真实关系可能被“作答风格”“社会赞许倾向”“当时的心情”等因素污染。这不是某个变量本身能解释的误差,而是测量方法本身带来的系统性偏差。
所以你会发现,越是做组织行为学、市场营销、教育学、公共管理这类社科领域,越频繁看到Harman单因素检验。严格点说,Harman单因素检验只是众多CMB诊断手段里最基础、最快速的一个。它的核心逻辑粗暴但很直观:如果CMB很严重,那么把所有题项丢进因子分析后,要么只出现一个公因子,要么第一个因子会解释掉绝大部分方差;如果第一个因子解释率不高,就说明不存在单一因子主导的局面,CMB问题相对可控。
很多初学者会误以为,报告了Harman检验就万事大吉。其实这种检验更像是“体检初筛”,它只能告诉你“有没有大病”,没法告诉你“病根在哪儿”。审稿人让你做这个,本质上是在考核你有没有意识到CMB可能污染结论,并主动采取应对策略。所以后面我还会专门讲,如果检验不理想,有哪些更严谨的替代方案。
1.2 Harman单因素检验的基本原理与常见判断标准
Harman单因素检验的原理可以概括成一句话:把所有测量题项同时放进一个探索性因子分析,不旋转因子,提取因子后重点看“未旋转时第一个公因子解释的方差比例”。如果这个比例过大,就暗示所有题目背后可能存在一个共同的因素,也就是方法因子;如果这个比例可控,则说明方法效应对测量结果的影响不严重。
具体到SPSS操作上,你不需要额外安装任何模块,也不需要编程,只需要用“分析 → 降维 → 因子分析”功能,在“提取”对话框里把方法选为“主成分”,旋转方式选“无”,就能在输出里找到“总方差解释表”。表格里“初始特征值”一列中的第一行,对应的“方差百分比”就是首因子解释率。
关于判断阈值,目前学术论文里最常引用的标准有两个:40%和50%。比较保守的报告写法是:首因子方差解释率低于40%,认为不存在严重的共同方法偏差;稍宽松一点的说法是低于50%可以接受。不同学科、不同期刊的惯例略有差异,我自己的建议是,如果你的首因子解释率在30%以下,基本可以放心;在30%到40%之间,可以正常汇报;在40%到50%之间,最好结合其他诊断手段再做补充说明;超过50%,那就不能只说一句“情况可控”了,必须认真考虑用统计方法做进一步控制。
还有一种文献里常见的做法是同时报告“未旋转时提取出的因子数量”。如果特征值大于1的因子只有一个,而且这个因子解释率还很高,这就是CMB存在的典型信号。实际操作里,大多数情况会提取出三四个、五六个甚至更多因子,单因子局面并不多见,所以单纯看“因子数量”这个信号,很多时候并不那么敏感。大家记住一句话:首因子解释率才是Harman检验的核心输出指标。
2. SPSS详细操作:一步步跑出Harman单因素检验结果
2.1 分析前必须完成的数据预处理
很多人在因子分析之前只检查了一遍数据完整性,却忽略了三个关键细节,导致跑出来的结果被审稿人一眼看穿。
第一,反向题必须重新计分。问卷里如果有“我不喜欢目前的工作”这类反向表述,你没有做反向计分就直接和正向题放进一起做因子分析,因子结构会乱成一团,首因子解释率也可能被严重高估或低估。建议在SPSS里用“计算变量”或“重新编码为不同变量”把所有反向题统一转成正向方向。如果你用的是李克特五点计分,把1变5、2变4、3还是3,用SPSS的录入语法可以一句搞定:
RECODE q5 q8 q12 (1=5) (2=4) (3=3) (4=2) (5=1) INTO rq5 rq8 rq12. EXECUTE.第二,剔除缺失比例过高的个案。常见做法是,如果一份问卷里缺失题项超过10%,直接剔除该样本。当然也可以先做缺失值插补,比如EM插补,但在Harman检验这个场景里,我建议用“按列表排除个案”或“按配对排除个案”就行,方法越简单越容易向审稿人解释。
第三,不要把人口统计学变量放进去。性别、年龄、学历、工龄这类背景信息,通常不是同一个潜变量结构的成员,把它们混进因子分析会人为拉低首因子解释率,制造一种“虚假安全”。Harman检验应该只针对研究模型中的主要量表题项,不含人口学变量,不要把这个问题搞混。
在处理完反向题、缺失值和变量范围之后,再用“描述统计”快速看一眼所有题项的均值和标准差,确认没有某个题目出现明显离群问题。这一步花不了两分钟,但能避免后面反复重跑。
2.2 菜单操作步骤与参数设置
下面进入正题。假设你的研究有12道核心量表题,变量名分别是q1到q12,现在要在SPSS里做Harman单因素检验。完整操作如下。
第一步,打开SPSS,载入数据文件,然后在菜单栏依次选择“分析 → 降维 → 因子”。这一步的目标是把所有核心题项选入“变量”框,不需要填“选择变量”或“个案标签”。
第二步,点击“描述”按钮,勾选“初始解(KMO与Bartlett检验)”。虽然Harman检验本身不强制要求KMO和Bartlett,但既然输出都出来了,顺手把KMO一起报告也能增强说服力,表示数据适合做因子分析。
第三步,点击“提取”按钮,方法选择“主成分”,勾选“未旋转因子解”,在“依据特征值”处保留“特征值大于1”。这是非常关键的一步。很多教程扎实只让你勾选这些就结束了,但我要提醒你:这里不要勾“碎石图”,你不需要在图上去主观猜几个因子,主成分法加特征值大于1就够用。
第四步,点击“旋转”按钮,选择“无”。Harman检验要求看“未旋转”的解,所以这一点必须保证。如果你之前习惯了做最大方差旋转,这里要专门改过来。
第五步,点击“选项”按钮,勾选“按大小排序”和“抑制小系数”,抑制系数可以设0.30。这里的“抑制小系数0.30”只是为了让成分矩阵看起来清爽,不影响首因子解释率的计算。如果你只是初筛,也可以不勾选,结果一样。
第六步,点击“确定”运行分析。如果你想用语法窗口操作,也可以把下面这段粘进SPSS语法编辑器:
FACTOR /VARIABLES q1 q2 q3 q4 q5 q6 q7 q8 q9 q10 q11 q12 /MISSING LISTWISE /ANALYSIS q1 q2 q3 q4 q5 q6 q7 q8 q9 q10 q11 q12 /PRINT INITIAL EXTRACTION /CRITERIA MINEIGEN(1) ITERATE(25) /EXTRACTION PC /ROTATION NOROTATE /METHOD=CORRELATION.菜单操作和语法操作两者选一个就行,对结果没有差别。我个人的习惯是优先用菜单,因为SPSS的菜单界面每一步都有英文或中文提示,不容易漏参数。
2.3 结果在哪里看:读懂总方差解释表和成分矩阵
运行之后,输出窗口会出现一系列表格,重点看两个地方。
第一个是“总方差解释”表,英文版是Total Variance Explained。这张表分成三块:初始特征值、提取载荷平方和、旋转载荷平方和。因为Harman检验用的是未旋转解,所以你要看的是“初始特征值”那一列。第一行初始特征值对应的“方差百分比”,就是首个公因子解释的总方差。举个例子,如果你的输出显示第一个特征值是3.46,方差百分比是28.84,这意味着第一个因子解释了28.84%的总变异,远低于40%阈值,可以判断不存在严重的共同方法偏差。
第二个可以辅助看的是“成分矩阵”表,也就是未旋转的因子载荷矩阵。你关注第一列载荷。如果几乎所有题项在第一列的载荷都大于0.6,说明存在一个非常强的共同因子,即使首因子解释率在40%以下,也需要打一个问号。反之,如果载荷分散在几个因子上,且第一列明显没有统摄全局,则进一步佐证CMB不严重。
这里要特别提醒一件事:不要在“旋转成分矩阵”里去找首因子,那是旋转后的结果,不是Harman检验依据。Harman检验本质上考察的是未旋转状态下方差被单一因子吸收的程度,旋转后所有因子的方差会被重新分配,两者不是一回事。
2.4 论文结果部分怎么写:可直接套用的汇报模板
跑完数据只是第一步,更让人头疼的往往是怎么写进论文里。我给你们一个可以直接套用的中文模板,亲测在毕业论文和中文期刊投稿中都能用:
“本研究采用Harman单因素检验对共同方法偏差进行诊断。将全部量表题项放入探索性因子分析,采用主成分分析法提取公因子,不进行因子旋转。结果显示,未旋转时共提取出X个特征值大于1的因子,第一个因子解释的方差变异量为XX.XX%,小于40%的临界判断标准,表明本研究不存在严重的共同方法偏差。”
英文模板也顺手放一个,方便英文期刊投稿:
“To assess the potential influence of common method bias, we conducted Harman’s single-factor test. All measurement items were subjected to an unrotated exploratory factor analysis. The results showed that the first factor accounted for XX.XX% of the total variance, which was below the recommended threshold of 40%, suggesting that common method bias was not a serious concern in this study.”
写这部分时,你还要交代样本量、量表题项数量、提取方法、旋转方式、判断阈值来源等细节。有些审稿人会追问“40%的阈值是谁定的”,你最好引用一两篇方法学文献做支撑,比如Podsakoff等关于共同方法偏差的综述,这样更稳妥。
3. 实操中的坑:这些细节决定结果是否可靠
3.1 反向题不处理,检验结果会扭曲
我见过最多的问题就是反向题没有重新计分,导致因子分析结果里出现了一个奇怪的对立项因子。比如你测量“工作满意度”,有一道题是“我对当前工作感到失望”,如果你不反向计分,这道题和正向题之间的相关性就是负的,在因子分析里它可能单独聚成一个因子,甚至在未旋转解里降低第一个因子的解释率。
表面上看首因子解释率变低了,好像“不存在共同方法偏差”,但这个结论是假象。反向题不处理,整个分析就是一个错误操作。所以你在正式分析前,务必逐题核对量表计分说明,把所有反向题先转换过来。转换完之后可以顺手做一道相关矩阵检查,看同一维度内的题项是否都是显著正相关,这是最快捷的审计方式。
3.2 主成分法和主轴法对结果有影响
SPSS的因子分析里,“提取”方法有多种选择,最常用的是“主成分”和“主轴”。主成分法试图最大化解释总方差,主轴法更关注提取公共因子。两者计算得到的初始特征值和方差解释率略有差异。Harman检验的经典做法是主成分法,这也是绝大多数文献默认的配置。
如果你在论文里写了Harman单因素检验,方法部分却选了“主轴”或“最大似然”,审稿人不一定会较真,但严格来说,这和经典操作不一致。为了少惹麻烦,建议统一用主成分法。还有一点,SPSS不同版本的中英文菜单翻译有细微差别,你用中文版SPSS时如果找不到“主成分”,可以找“主成分分析”或“Principal components”,原理一样。
3.3 “特征值大于1”陷阱与强制提取单因子
有些研究者的问卷总共就10道题,而且维度结构本就不强,此时用“特征值大于1”自动提取出的因子数量可能只有两个甚至一个。如果只提取出一个因子,审稿人会很自然地联想到CMB严重。但实际原因可能是题目数量少、样本量有限、因子结构分离不够明显,而不是单因子真的解释了所有变异。
这种情况不能只看SPSS自动提取的结果,可以再做一次“强制提取多个因子”的诊断:在“提取”对话框里把“依据特征值”改成“固定因子数量”,手动填3或者4,看看旋转后的因子结构是否能够区分开。如果固定提取后各个理论维度能明显分开,那就说明题目本身有区分效度,单因子结果更多是提取规则造成的假象,可以在论文里补充说明。这个操作很实用,能帮你应对那些较真的审稿人。
3.4 阈值到底用40%还是50%,不要记混
关于阈值,我特意提醒大家:不同文献引用标准不一致,你写论文之前一定要先确认目标期刊或导师的习惯说法。40%是较保守标准,50%是较早文献提到的宽松阈值。如果你首因子解释率是45%,用40%的标准你看似“不通过”,换50%又“通过”了,这种摇摆其实暴露了阈值选择的随意性。
我的建议是:提前在方法部分写清楚自己用的哪个标准,最好说明依据文献。别在结果部分临时改阈值。如果你测得的结果在35%-40%之间,你可以放心用40%作判断;如果结果在45%以上,我建议你谨慎一些,不要强行解释成“不存在严重共同方法偏差”,可以做第4节的补充方案来缓解风险。
4. 检验不通过怎么办:更严谨的替代方案与组合思路
4.1 程序性补救:回到研究设计源头
Harman检验属于事后统计诊断,但CMB问题最好在设计阶段就堵住。如果你还在问卷设计阶段,一定要做三件事:一是尽可能采用多维来源采集数据,不要所有变量都靠被试一个人自评;二是打乱题目顺序,不要把所有自变量放前面、因变量放后面;三是在问卷中穿插反向题和注意力检测题,降低默认作答倾向。
问卷完全匿名、强调答案没有对错之分,也能减少社会赞许性偏差。这些都属于“程序性补救”措施,和Harman检验属于两条线。即便你事后统计结果显示CMB不严重,在设计上做了这些努力也会让审稿人更放心。反之,如果设计阶段什么都没做,只靠事后一个检验,说服力会打折扣。
4.2 统计控制:标记变量、CFA单因子模型与三因子比较
如果你的Harman检验结果不太理想,比如首因子解释率超过了45%,或者未旋转成分矩阵第一列载荷整体偏高,可以考虑上更严格的统计控制方案。
最常用的一种是CFA单因子模型比较。在AMOS或Mplus里,你先检验理论模型对应的多因子验证性因子分析模型,再把所有题项加载到同一个潜因子上,拟合一个单因子模型,最后比较两个模型的卡方差异。如果多因子模型的拟合显著优于单因子模型,说明题项结构是可区分的,CMB影响有限。这个思路比单纯看Harman首因子解释率更细,因为你同时评估了测量模型。
另一种思路是加入未测潜在方法因子,也就是把共同方法因子作为一个潜变量,控制它的载荷路径,然后看关键路径是否仍然显著。这种模型相对复杂,对样本量和模型识别有要求,不适合过于简单的研究模型。
还有一种实操上更方便的“标记变量法”,就是在问卷里加入一个在理论上和核心变量不相关的标记变量,比如“我今天的心情如何”,然后把标记变量作为控制变量放入回归模型,再看核心关系的显著性变化。这个方法在SPSS里就能跑,但前提是你当初有远见,在设计问卷时就埋进了一个标记变量。
4.3 论文汇报时更稳的策略
统计控制并不是万能钥匙,使用不当反而会被审稿人追问更多问题。我的经验是,在论文结果部分可以采用“多证据组合”的方式:先报告Harman单因素检验的结果,再补充说明程序性补救措施,比如匿名填写、顺序打乱、反向题设置。如果有需要,再把CFA单因子比较作为辅助证据放在稳健性检验部分。
这种“程序补救 → 统计诊断 → 稳健性补充”的三层级汇报思路,能让你的方法部分显得更成熟,也能避免因为单一检验结果不理想而被打回修改。
5. 常见问题与排查技巧速查表
这里整理一份我平时辅导学生时最常遇到的故障清单,每个问题都对应一句人话排查思路。
| 问题现象 | 可能原因 | 排查与解决建议 |
|---|---|---|
| 总方差解释表里第一个因子解释率高达60%以上 | 反向题未重新计分,或所有题项措辞高度相似 | 核对反向题计分方向,检查量表维度设置 |
| 首因子解释率很低,但KMO低于0.6 | 样本量不足或题项间相关性过低 | 检查样本量是否在题项数的5倍以上,考虑增加样本或删减低载荷题项 |
| 未旋转时只提取出一个特征值大于1的因子 | 题目数量少、因子结构弱或样本问题 | 尝试固定提取多个因子,配合CFA做区分效度检验 |
| 结果里找不到“总方差解释”表 | 可能只勾选了描述统计,没有勾选提取结果 | 在“提取”里勾选“未旋转因子解”,或直接在语法里加/PRINT EXTRACTION |
| 首因子解释率超过40%,但理论模型本身很稳定 | 阈值选择太严格,或该方法本身灵敏度有限 | 改用CFA单因子比较或标记变量法做补充 |
| 用中文版SPSS找不到“主成分”选项 | 翻译叫法不同 | 寻找“主成分分析”或“Principal components” |
| 把人口学变量也放进因子分析后,首因子解释率明显下降 | 人口学变量稀释了公共因子方差 | 去掉人口学变量,只对核心量表题项做检验 |
| 首因子解释率每次分析都不一样 | 前后使用了不同的缺失值处理方式 | 固定使用“按列表排除个案”,并在论文中说明 |
排查时,先看看自己的变量选入范围、缺失值选项和提取方法,再谈结果。这三个环节最容易出错,但也是最容易自查的。
6. 最后再说点实操体会
我个人的习惯是,Harman单因素检验不是数据跑完了才想起来的收尾步骤,而是在问卷回收完成、数据清洗结束后第一件要做的事。先跑一遍,看看首因子解释率的大致范围,心里有底了,再去做信度分析、验证性因子分析和回归假设检验。顺序一变,很多问题可以提前暴露。
另外,如果你手头有AMOS或Mplus,建议顺手把CFA单因子比较也做一遍。哪怕论文里不报告,自己心里知道结论是稳的,答辩或外审时也不会慌。纯粹只靠SPSS的Harman检验,碰上较真的评审確實会有压力。但反过来,如果你连最基础的Harman检验都说得不清楚,那后面的文章也很难让审稿人信服。先把这篇实操流程走顺,再考虑更高阶的方案,就已经超过大部分论文新手了。