1. 从"测不准"到"替代":代理变量到底在解决什么问题
做实证研究的人,十有八九都撞见过同一个窘境:你费尽心思把理论模型写好,把假设推得漂漂亮亮,到了数据环节却发现,模型里最核心的那个变量,数据库里根本没有。拿最常见的"能力"来说——你研究教育回报率,知道不控制能力就会犯遗漏变量偏误,可能力怎么测?数据里没有"能力"这一列。这时候有人会告诉你:用智商、用高考成绩、用学历年数作为能力的代理变量。这就是代理变量的典型应用。
代理变量,说白了就是用一个能观测到的、和真实变量高度相关的替代指标,去近似一个不可观测或难以测量的变量。它解决的,是实证研究中最常见也最头疼的"想测的东西测不了"的问题。这篇文章我想把代理变量这件事系统梳理一遍:理论基础是什么、识别条件有哪些、和工具变量的关系是什么、经典案例怎么用、实操中怎么选、怎么报、容易踩哪些坑。适合正在写论文的研究生、刚接触实证分析的研究者,以及那些对计量方法有基础但一直没搞透代理变量细节的从业者。
有人可能会问:现在机器学习那么发达,方法那么多,为什么还要用代理变量这种"土办法"?答案是:代理变量不是终点,它是你在数据约束下做出的最优可行选择。任何复杂模型,都无法凭空创造数据里不存在的信息。你可以在模型技术上精进,但数据层面的根本约束没有变。所以搞懂代理变量的逻辑,比学再多高级方法都优先。
1.1 一个典型场景:想测"能力",手里只有成绩单
为了把问题讲得具体,我拿劳动经济学里的Mincer收入方程举例。研究教育年限对收入的影响,回归方程是:
ln(wage) = α + β × edu + γ × ability + ε
理论上必须控制ability,否则教育变量会吸收部分能力的影响,β估计有偏。但"能力"不是商品,没有市场价格,没有一个数据表叫"个人能力列表"。这时候研究者能拿到什么?可能是受访者当年的高考总分、大学GPA、或者某种心理测评得分。于是就用其中一个作为能力变量的代理。
整个过程的内在逻辑是这样的:真实变量X*不可观测,但有一个可观测变量X,满足X和X*高度相关,且X的测量误差与回归模型中的扰动项没有系统性关系。我们把X放进回归,替代X*,目的是尽量把X*的效应从其他变量的系数里"剥离"出来。注意,这个逻辑和"我要精确度量X*"完全不同。你追求的不是估计X*的精确效应本身,而是减少遗漏变量对其他系数造成的偏误。
所以我在给学生讲的时候常说一句话:代理变量是"曲线救国",不是"直捣黄龙"。它能让主要解释变量的系数更干净,但代价是代理变量自己的系数往往不准、有偏、还被压低。想明白这一点,很多使用误区就不会踩。
1.2 代理变量的三类典型使用场景
代理变量不是只用在"能力"这种特质变量上。归纳下来,实证分析中它主要出现在三类场景。
第一类是纯粹不可观测的个体特质,比如能力、努力程度、天赋、偏好、文化背景。这类变量理论上存在,但本质上不属于任何统计报表,只能找现阶段的近似指标。
第二类是"理论上可测、实操中太贵"的变量。比如要测一家企业的全要素生产率,严格按照生产函数计算需要极其完整的投入产出数据,中小企业的数据往往缺胳膊少腿。这时候可能用劳动生产率、人均产出、甚至是单位能耗作为TFP的代理变量。不是测不准,是成本不允许。
第三类是概念过于宽泛、学界对测度方式从未达成一致的变量,比如制度质量、幸福感、社会资本。这类变量每个人心里都有个数,但没有统一标尺。你用"信任度调查"度量社会资本,别人也可能用"社团成员数量"。这种变量天然需要代理。
把这三类场景区分清楚有个实际好处:它决定了你后续做稳健性检验的力度。第一类场景,你换一个代理变量也许结构类似;第二类场景,你有机会用更精细的数据做交叉验证;第三类场景,你必须接受"概念自身就有多种理解"这一事实,做多代理变量分析几乎是标配。
1.3 为什么不用更"高级"的方法替代代理变量
聊代理变量时,总躲不开一个问题:既然有测量误差,为什么不直接用工具变量?为什么不把不可观测变量当作潜变量做结构方程?为什么不跑一个机器学习模型把缺失值预测出来?
我给的回答是:这些方法各有用处,但都不能替代"找一个合理代理变量"这一步。
- 工具变量解决的是内生性问题,不是不可观测问题。你拿父母的受教育年限做孩子教育年数的工具变量,前提是教育年数本身可观测。如果连被解释变量里的核心变量都不可观测,工具变量也无从谈起。
- 潜变量和结构方程模型确实可以处理不可观测变量,但代价是强假设:你给不可观测变量设定了一个测量模型,且对测量误差的分布有具体要求。这些假设在绝大多数经济学实证场景中并不比"选一个好代理变量"来得更可靠。
- 机器学习填补缺失值就更偏向了。代理变量解决的是"变量不存在",缺失值填补解决的是"变量存在但部分缺失"。这是两回事。
所以,真正专业的实证流程是:优先思考能否找到一个高质量的代理变量,再考虑用稳健性检验来论证代理变量的有效性,必要时辅以工具变量等方法进行交叉验证。代理变量不是粗糙的代名词,它在研究设计中有自己的恰当位置。
2. 识别条件背后的计量逻辑:为什么代理变量会把系数"压低"
理解了代理变量在解决什么问题之后,下一步要搞懂它的计量结构。很多人会问:既然X是X*的代理,那直接用X做回归不就行了?理论上是这样,但OLS的结果不会直接给出X*的真实效应,因为测量误差会扭曲估计结果。具体怎么扭曲,方向是什么,幅度受什么影响,这就是这一节要拆的内容。
2.1 经典测量误差模型下的系数衰减
假设真实模型是:
y = β X* + ε
其中X*不可观测,我们观测到的是X,满足:
X = X* + v
v是测量误差,满足E(v|X*) = 0,且Var(v) = σ²v。也就是说,测量误差是纯随机的,跟真实值水平无关。这个设定叫经典测量误差(classical measurement error)。
在这种设定下,用X回归y得到的系数估计值是:
plim β̂ = β × [σ²X* / (σ²X* + σ²v)]
注意中括号里这个比值一定小于1,而且大于0。意思是,OLS估计量会向0方向收缩。X*的方差相对测量误差方差越大,衰减程度越轻;测量误差占比越大,β̂越是缩水。这就是衰减偏误(attenuation bias)的由来。
这个结果的直观含义是:你做出来的系数,是真实效应的"缩水版"。如果真实效应是0.5,代理变量噪声比较大时,估计出来可能只有0.2甚至0.1。效应显著当然好,但即便显著,你也不能直接把0.2解读为"真实效应是0.2",真实的效应通常比你估计到的更大。
有一个非常经典的推导可以帮助记忆:当测量误差占比一半时(σ²X* = σ²v),估计系数就只有真实值的一半了。对做实证的人来说,这意味着如果文献中某个变量用了一个很粗糙的代理变量,估计系数偏小,并不一定代表效应不存在,也许只是被衰减了。
2.2 合格的代理变量需要满足哪些条件
衰减偏误只是结果,更重要的是理解什么样X能成为合格的代理变量。我把它归纳为三个识别条件,缺了哪一条都可能让代理变量失效。
条件一是相关性,Cov(X, X*) ≠ 0,而且越强越好。如果X和X*几乎不相关,那它不是代理变量,是一堆无用的噪音。实操中这个条件靠前期文献和描述性统计来验证。另一个程度上的指标是"信度"这个概念,X的方差中来自X*的比重越大,代理质量越高。
条件二是测量误差与真实值无关,也就是E(v|X*) = 0。这一条保证衰减方向是确定的、可预期的。如果测量误差还跟真实值水平正相关——比如越有能力的人越容易被高估——估计量的性质就会变得复杂,方向可能是正的也可能是负的。
条件三是代理变量相对于回归中其他变量的外生性。严格表述是:给定X*之后,X不再携带关于扰动项ε的信息,即Cov(X, ε|X*) = 0。这在数学上对应着排他性,它保证你把X放进回归不会引入新的内生性。实操中最常违反的就是这一条。比如用"是否上大学"代理"个人能力",但上大学这件事本身还受到家庭背景、地区政策、信息渠道的影响,而这些因素又往往直接影响收入。那么大学这个变量和扰动项就有关联,代理变量被污染了。
2.3 代理变量到底能不能消除遗漏变量偏误
这是所有人最关心的问题:加了代理变量后,主要解释变量系数是不是就干净了?
我的答案是:有所改善,但不保证完全消除。原因要从代理变量在回归中的角色说起。假设:
y = α + β edu + γ X* + ε
我们把X = X* + v放进回归,得到:
y = α + β edu + γ X + (ε - γv)
新扰动项是ε - γv。只要v和edu不相关,教育年限系数的偏误来源就只剩下ε了。也就是说,代理变量的加入可以把之前由"能力"本身带来的遗漏变量偏误吸收掉一部分,只要代理变量和主要解释变量相关的那部分能力变量被控制住了。
但问题在于,X*通常不是一个变量,而是一个概念集合。比如"能力"就至少包含认知能力、非认知能力、健康状况、社会适应力等多个方面。只拿一个考试成绩做代理,只能覆盖认知能力,其余部分仍然在扰动项里。如果非认知能力和教育年限相关——事实是确实相关——那么教育系数仍有偏误。
现实中有时候研究者会在同一个回归中加入多个代理变量,比如把智商测试、学历、甚至身高都放进去,每覆盖一个维度就减少一份遗漏变量偏误。这种方法很常见,在计量上也不需要额外假设,只是注意别把其他变量的解释含义给搅乱了。
3. 代理变量不等于工具变量:最常被混淆的一组概念
独立做实证分析的人,几乎都犯过一个错:把代理变量当工具变量用。这两个概念听起来有点像,都属于"变量不完美,找个替代品"的思路,但它们的识别逻辑截然不同。搞混了,后果很严重。
3.1 两种识别策略的根本差异
工具变量解决的核心问题是内生性。假设模型:
y = β X + ε
如果X和ε相关,OLS不一致。工具变量Z要满足两个条件:相关性,Cov(Z, X) ≠ 0,排他性,Cov(Z, ε) = 0 。IV估计量的识别逻辑是:只用Z带来的外生变异去识别X的效应。X本身不干净没关系,Z干净就行。
代理变量解决的核心问题是不可观测。假设真实模型里是X*,而不是X。我们观测不到X*,只能用X去接近它。代理变量的逻辑不是找外生变异,而是找一个"足够接近X*的变量"替身。
用一句话区分:工具变量是给可观测的X找外生变化来源,代理变量是给不可观测的X*找可观测的近似载体。这两个思路面对的问题类型不同,处理手段也就不能互换。
实际操作中还有一个更隐蔽的区别:工具变量需要X*本身可观测,就像"上课出勤率"影响"成绩",成绩可测,但出勤率内生,因此找天气做工具变量。而代理变量处理出勤率不可测,用"宿舍到教室的距离"做代理。前者是内生性,后者是测量缺失,完全不是一码事。
3.2 把代理变量当工具变量的灾难性后果
如果用了不满足排他性的代理变量做工具变量,问题有多严重?我举一个直接、具体的场景。
假设想研究"工作培训时长"对"收入"的影响。真实模型里需要控制"员工能力水平"X*,但不可观测。你用一个测试得分X来代理能力。现在你把X当作培训时长的工具变量,IV估计本质上是"使用X中与培训时长相关的那部分变异"来识别培训的效应。可X既然是能力的代理,它同时和收入直接相关,排他性就被破坏了:Cov(X, ε) ≠ 0。
在排他性被破坏的情况下,IV估计量一般比OLS偏得更厉害,方向也很难说。OLS的偏误方向好歹在经典测量误差下是向零衰减,而用了不合格的IV之后,偏差可能被放大、可能反向,还可能造成一种"显著性幻觉"。对审稿人来说,这是最致命的方法论硬伤。
这里可以看一个常见例子:用"父母受教育年限"作为"个人受教育年限"的工具变量。父母教育影响个人教育没问题,相关性成立;但父母教育也很可能通过家庭文化氛围、育儿投入直接影响个人收入,排他性就存疑了。至于父母教育作为"个人能力的代理变量",倒是可以说在某种程度上合理——它确实反映了家庭认知环境的一部分。这个例子也说明,同一个变量在一种设计里可以是代理变量,在另一种设计里可以是工具变量的候选,但代理变量和工具变量这两个功能不能混着用。
3.3 什么时候选择"替换",什么时候选择"外生冲击"
既然二者不同,选择标准就很重要。我的经验可以概括为三个问题:
第一个问题:你的核心变量是否本身可观测?
- 可观测但内生,比如教育年限、培训时长、是否加入某计划,走工具变量路线。
- 不可观测但理论明确,比如能力、偏好、全要素生产率,走代理变量路线。
第二个问题:你的数据里是否存在真正满足排他性的工具?
如果没有,强行找IV几乎必然是弱工具或者排他性存疑,还不如老老实实用代理变量并做充分的稳健性检验。很多领域的实证文献已经积累了大量公认的代理变量,用它们不会出错。
第三个问题:你的研究目标是什么?
如果目的是精确估计某个机制的大小,代理变量的衰减偏误是绕不开的,需要想办法校正(比如做信度校正或结构估计)。如果目的只是减少遗漏变量带来的污染,让主要解释变量的系数更可信,那么代理变量就够用了。
这三个问题,我在实际研究中每次都过一遍。做了这个分类,再回看很多文献里"用代理变量做IV"的写法,你就会意识到,那通常属于研究设计上的偷懒,而不是合理的近似。
4. 五个应用案例拆解:不同实证场景里的代理变量
理论讲到这里,必须配案例。代理变量的使用高度依赖研究场景,每个领域的"共识代理变量"各不相同。我把五个代表性场景拆开讲,每个案例都说清楚:真实变量是什么、为什么不可观测、代理变量选了什么、有什么风险、怎么检验。
4.1 教育经济学:用学校资源度量教育质量
教育生产函数研究里常有这样一个问题:想估计"学校质量"对学生成绩的影响,但学校质量是什么?老师水平、教学管理、校园文化、同伴效应……每一项都很模糊。所以研究者在实际中常用生均经费、师生比、教师学历比例、教育支出等可观测的学校投入变量作为"学校质量"的代理。
楼层逻辑是:学校质量越高,往往反映在更好的投入条件上。这些可观测的投入指标确实和真实质量高度相关,但它们并不等于质量本身——比如一个学校经费高也有可能因为地处高成本地区,而非质量高。这就是代理变量带来的指标污染。
此类研究的标准做法是:把多个学校投入指标同时放进回归,得到"net school quality"的效应;或者只在回归中控制"教育资源"这个变量,接受它可能混合了成本因素的事实。换代理变量的稳健性检验也很常见,比如从"师生比"换成"教师拥有硕士学位的比例",看系数方向和显著性是否保持一致。
4.2 劳动经济学:用可观测特征代理不可观测能力
这已经是计量经济学教科书中的经典用法。能力不可观测,研究者用各种测试得分代理。教育回报率研究的经典文献中,明显出现了一个现象:只控制教育年数时系数偏高,加入能力分数后系数降低,说明原来的教育系数吸收了一部分能力效应。
这类场景需要注意两点。第一,代理变量不能完全消除遗漏偏误,因为能力是多维的。第二,能力测试分数本身也受后天学习等影响,它既是能力的代理,也直接受教育影响,形成一个反馈回路。这意味着在高阶回归里,能力代理变量可能和教育变量存在机械相关性。
实用建议是:明确你是把能力代理当控制变量,还是当引起内生性的影响渠道。如果只是控制偏误,稳健的做法是给能力一个较广的指标集,比如成绩、问题解决测试、工作经历年数,同时用一个因子分析提取"一般能力"因子,再放进回归。这个做法比单用一个测试得分要稳。
4.3 制度与发展研究:用感知指数代理制度质量
制度与经济增长的实证研究里,制度质量是不可观测的核心驱动之一。研究者常使用各种"感知型指数"——比如产权保护评价、腐败感知指数、司法效率评价、开办企业流程天数——来代理制度质量。由于这些指数多数来自企业调查或专家的主观打分,用它代理制度质量是必然的选择。
这一选法的问题也很典型:主观感知可能受到经济表现的反向影响。一个地方经济好,受访者容易给出更积极的评价,这就让"制度质量代理变量"和被解释变量收入水平之间形成机械关联。反过来看,经济好也可能是因为制度好,这里就存在方向不清的问题。
处理这类问题,我见过的成功做法一般是三类:第一类用历史数据或地理特征做工具变量,比如殖民时代的制度遗产、距离欧洲的纬度距离;第二类用同一制度变量的多个不同代理做综合分析,看结论是否一致;第三类用滞后期的制度指数,利用时间结构缓解反向因果。这些做法的共同点都是承认代理变量可能内生,然后用其他手段做交叉验证。
4.4 健康经济学:用自评健康度量真实健康水平
健康是一个典型的"多维不可观测"变量。传统上,研究者有三种常见的健康代理变量:自评健康(SRH)——受访者回答"你觉得自己的健康状况如何";客观指标——BMI、血压、慢性病数量、日常生活活动能力(ADL);主观结合客观,构造一个健康指数。
自评健康的数据容易拿,但在健康经济学里它的测量误差结构很特殊。它既包含真实的健康信息,也包含个人的主观参照系、性格倾向,以及"回答环境"带来的噪音。研究发现,自评健康确实能预测后续死亡风险,这是它有信息量的证据;但它和实际健康状况的相关度并不高。更麻烦的是,如果研究"健康对收入的影响"而用自评健康做代理,那些不乐观、容易负面解读的人会同时低评健康又低报收入,产生系统性偏误。
我建议的做法是:如果数据允许,优先用客观指标构造健康指数,并将自评健康作为辅助稳健性代理;反过来,如果只能拿自评健康,就一定要在回归中加入人格特征控制变量,并用滞后多期的健康自评做检验。
4.5 企业实证:用研发投入代理创新意愿
企业管理研究里,创新意愿、创新文化、技术吸收能力这类变量很难直接观察。最常用的一个代理组合是R&D投入、专利数量、新产品销售占比。R&D投入的优势是它可以用会计数据度量,客观清晰;劣势是它反映的是"花钱",不等于"创新能力"——有些企业的R&D投入是在维持现有技术,有些则是在突破式创新。
工业组织领域有个经典做法:用专利引用数而不是单纯的专利数代理创新能力。原因是单纯专利数量混杂了大量低价值专利,而引用数能反映技术影响力。这个改造本质上是换了一个质量更高的代理变量,其相关性和X*的关联度都更好。
企业类数据的另一个常见陷阱是计量单位。R&D投入在企业规模上高度异质,大企业的创新投入天然高于小企业。把变量取对数并用员工人数标准化是基本的处理,但这也意味着衡量的是创新强度而非总量。写论文时,把创新强度和创新总量区分开,能让你的最强结论站得住脚。
5. 从选变量到写结论:代理变量使用的完整实操流程
理论知识讲完了,案例也拆过了,接下来是执行层的东西。代理变量的使用不是一个随意的决定,它有自己的一套流程。我在实际操作里总结了一个"四步法":定义真变量、审计数据、匹配合格代理、做足检验和报告。每一步都有一些值得注意的细节。
5.1 第一步:把"真实变量"拆成可操作的定义
很多人选不好代理变量,根源在于没有先把真实变量定义清楚。"能力"是什么?每个人都有自己的理解。如果定义是"解决新问题的认知技能",那合适的代理是流体智力测试;如果定义是"在工作场合中长期表现出来的综合胜任力",那管理者的绩效评分也许更好。定义都不清晰,代理怎么选都像是在掷骰子。
我的做法是在研究方案里先写下三句话:理论概念是什么、这个概念的操作性定义是什么、我预期的代理变量会在哪个维度上遗漏真实变量。把第三句写出来特别重要,因为它直接提示你可能遗漏哪些相关维度,提醒你在稳定性检验时补上。
比如研究"互联网使用对收入的影响",真实变量可能是"数字技能"。操作性定义可以是"使用搜索引擎解决特定任务的能力"。代理变量如果用"每周上网时长",很明显遗漏了技能的深度维度,所以你在稳健性检验里至少要补一个"是否能完成网上支付"之类的技能变量。
5.2 第二步:数据可得性与代理变量的匹配确认
定义清楚了,接下来要翻数据。核心问题:你的数据表里有没有和被定义概念匹配的可用指标?匹配时要警惕表面相似。
举一个常见的例子:一个面板数据里有"有无互联网接入"这个二值变量,有人直接拿它当"互联网使用程度"的代理。但接入≠使用。接入是使用的前提,不是使用的量度。如果研究目的是"使用强度对收入的影响",这个代理变量明显太弱。
匹配确认做三件事:第一,列出候选变量;第二,逐个检查它们的测量口径、覆盖范围、缺失率;第三,做一个简单的相关性矩阵,看候选变量之间的相关性。如果多个候选变量之间的相关性很低,说明它们测的可能不是同一个概念,需要回到定义环节重新审视。
5.3 第三步:稳健性检验的几种常见打法
代理变量永远是不完美的,所以审稿人会天然地质疑:换一个代理变量,你的结论还在吗?应对这种质疑,有三套标准打法。
第一套是替代检验。用另一个相关代理变量重新跑主回归,看系数方向和显著性是否保持一致。比如用"考试成绩"替代"学历年数"做能力的代理,结论不变,就比较有说服力。
第二套是多代理联立。把多个代理变量同时放进回归,偷懒做法是全部主效应一起放,精细做法则要考虑变量之间的交互和共线性,用因子分析先提取共同的代理因子。
第三套是边界分析。按代理变量取值范围做分组回归,比如把代理变量分成高、中、低三组,看主效应是否在每组都稳健。这个方法特别适合纠正"代理变量本身波动大"的问题,因为它利用的是代理变量内部的变异信息。
实操小建议:每一种稳健性检验的结果,都整理成表格放在论文附录里,而不是只挑对自己有利的一次检验放正文。审稿人一旦感觉你在选择性报告,对论文信誉的影响很大。
5.4 论文报告里的措辞与自检清单
论文写作中,代理变量的报告要时刻提醒读者"我这里用了替身,有代价"。措辞上的几个关键点:
第一,在首次出现代理变量时,用"作为...的代理"这样的明确表述,不要含糊地用"我们用X来度量概念Y"。这是最基础的学术写作规范,但很多稿子都不达标。
第二,在数据章节加入代理变量与原变量概念差异的讨论段落,说明遗漏方向。
第三,在结论的局限性一栏,明确提到代理变量测量误差的存在、衰减偏误的可能,以及你已经为缓解它做了哪些工作。
我在投稿前会给论文做一个代理变量自检清单,这里分享出来:
- [ ] 是否明确说明了哪个真实变量不可观测,为什么不可观测?
- [ ] 是否给出了代理变量与理论概念的相关性论证?
- [ ] 是否讨论了测量误差可能对系数产生什么方向的影响?
- [ ] 是否已经做了至少一种替代代理变量检验?
- [ ] 是否在局限性部分诚实交代了代理变量的缺陷?
这些内容看起来琐碎,但审稿人对"代理变量用得偷不偷懒"的判断,往往就基于这些细节。
6. 踩过的坑与后续规避习惯:几个真实教训
经验部分来了。我做了不少年实证研究,代理变量上踩过大大小小的坑,有教训也有一些已经内化的防御习惯。
6.1 第一个坑:把代理变量系数直接当作真实变量的效应
这是我早年犯过的错,也是很多初入实证门的人最容易踩的。论文初稿里写"X作为Y的代理变量,其对Z的影响显著为负",意思好像是"Z对Y的真实影响是负的"。但更准确的说法应该是:"观测到的代理变量X与Z呈负相关,考虑到X是Y的近似,且测量误差只会造成向零的衰减,真实关系可能在负方向更强。"
问题在于,有时候衰减不是唯一代价,如果测量误差与真实值相关,系数的方向和幅度都可能改变。所以我的习惯是:论文里凡是用代理变量的回归结果,解释部分都要紧贴观测变量的表述,只在稳健性分析之后的讨论部分才谨慎地对真实变量做推断。
6.2 第二个坑:被审稿人质疑代理变量内生性时的应对
有一篇研究,我用了感知型指数做核心解释变量的代理,审稿人径直质疑"这个感知指数受被解释变量反向影响"。当时我的第一反应是解释代理变量和X*的相关性有多高,结果并不奏效。后来才明白,审稿人不是在问"你这个代理变量质量好不好",他是在问"这个代理变量是不是在悄悄吸收被解释变量的信息"。
彻底解决问题的方式,不是继续防御,而是换识别策略。我当时采用的办法是找了一个历史的同源变量做工具变量,把感知指数当作内生可观测变量处理,同时把历史变量作为外生冲击的来源。这次修订让我意识到,代理变量和工具变量并不是非此即彼:很多研究里,你可以先是代理变量,然后用IV做稳健性交叉验证。代理变量负责解决含量问题,IV负责把内生性兜住。
6.3 第三个坑:弱代理带来的假阴性
还有一个反直觉的坑:代理变量太弱时,可能造成"假阴性"结论。衰减偏误已经说了,测量误差占比越高,估计越向零缩水。如果真实效应本来就不大,弱代理可能让系数看起来完全不存在,研究者于是误判"没有效应"。
我在一个关于"企业数字化程度对利润影响"的项目里就撞上过这个坑。第一轮回归数字化转型得分系数不显著,一度以为真的没有效应。后来改用更贴近"数字化深度"的度量——比如企业使用的数据仓库系统的数量、自动化流程覆盖率——系数变得显著。真是惊出一身汗。这件事之后的习惯是:当代理变量粗略、理论预期效应又不大时,至少要做一次信度校正或者用文献里的信度值做敏感性分析,避免假阴性误导决策。
最后分享一个我现在正在用的工作习惯:建立一个"代理变量档案"。每做完一个项目,就把使用的代理变量、它的识别假设、潜在偏误方向、已做稳健性检验记录下来。下次做同领域的新课题时,先翻档案再动手。写这篇文章的过程也算是一次档案整理,希望这些经验能帮你少走一些弯路。