假设数据由若干群组构成——对同一批个人、企业或地区进行重复观测——并且每个群组都存在与解释变量相关的、固定但未观测的特征。**固定效应(FE)**通过让每个群组成为自身的对照来处理这一问题。
带有群组特定截距的模型为:
y_ig = x_ig'β + α_g + ε_ig
组内(FE)估计量从每个变量中减去群组均值,ỹ_ig = y_ig − ȳ_g,从而完全消去 α_g:
β̂_FE = ( Σ x̃_ig x̃_ig' )⁻¹ Σ x̃_ig ỹ_ig
在代数上,它等价于包含完整群组虚拟变量的一般 OLS(LSDV)。收益很大:只要混杂因素在群组内部保持不变,FE 就能消除所有不随时间变化的群组混杂,无论是否可观测。这样无需逐一测量,就能去除一整类遗漏变量偏误。
代价同样重要:
- FE 只能利用组内变异进行识别。任何在群组内部恒定的解释变量都会与
α_g一同被消除,因而无法估计其系数。 - 它会舍弃组间变异。如果真正关心的正是群组之间的差异,FE 会丢弃有效信号;此时它是错误工具,或至多只能作为一个会削弱目标系数的稳健性检验。
FE 与其他估计量的关系如下:
| 估计量 | 对 α_g 的假设 |
使用的变异 |
|---|---|---|
| 合并 OLS | 与 x 不相关且为零 |
组间 + 组内 |
| 随机效应 | 与 x 不相关 |
组间 + 组内(有效率) |
| 固定效应 | 可以与 x 相关 |
仅组内 |
Hausman 检验比较 FE 与 RE;显著结果表明 α_g 与解释变量相关,因此应倾向 FE。
固定效应的边界也必须明确:它只能吸收在群组内部恒定的混杂因素。任何在群组内部变化、同时仍与 x 相关的因素——例如随时间变化的冲击——都不会被处理,仍需要工具变量或明确的研究设计。
常见错误包括:试图在 FE 下估计群组内部恒定变量的效应(这在结构上不可能);以及当研究对象本身就是组间差异时仍机械地使用 FE。