当诊断结果确认空间依赖确实存在时,下一项选择是:依赖究竟存在于模型的哪一部分?经典答案有两种,另有一个同时包含二者的一般模型。
空间误差模型(SEM)。 将依赖放入扰动项:
y = Xβ + u, u = λWu + ε
系统部分 Xβ 与普通回归相同;误差具有空间相关,通常源于被遗漏且具有空间结构的因素,例如跨越行政边界的未观测社区质量。参数 λ 衡量相邻残差共同变动的强度。重要的是,X 对 y 的边际效应仍然只是 β,模型中不存在结果溢出。SEM 是一项干扰修正:它修复 OLS 的错误标准误,却不改变经济叙述。不能把 λ 解释为“邻居的结果影响了我的结果”。
空间滞后/自回归模型(SLM/SAR)。 将依赖放入结果变量:
y = ρWy + Xβ + ε
此时每个单元的 y 取决于邻居的 y,对应真实的互动或扩散机制,如参照定价、模仿与拥堵。由此产生两个后果。第一,Wy 在结构上与 ε 相关,因此 OLS 有偏且不一致;应使用极大似然估计,或将 WX、W²X 作为工具变量进行 IV/GMM 估计。第二,由于冲击会通过空间乘数 (I − ρW)⁻¹ 反馈,系数 β 不再等于边际效应。影响需要分解为直接效应(本地影响及反馈)、间接效应(对其他位置的溢出)与总效应。
同时嵌套二者的空间 Durbin 模型(SDM)。 再加入邻居的协变量:
y = ρWy + WXθ + Xβ + ε
SDM 允许邻居的结果与属性同时发挥作用,因此能够较稳健地处理与已纳入变量存在空间相关的遗漏变量。它嵌套了其他模型:θ = 0 得到 SLM;“共同因子”限制 θ = −ρβ 得到 SEM;ρ = 0 则得到仅包含空间滞后 X 的模型。由于它包含两类常用形式,一种常见策略是从一般的 SDM 开始,再通过检验约化为更简单的模型。
贯穿始终的原则是:估计之前必须说明依赖位于何处。在误差模型中,系数保留普通含义且不存在结果溢出;在滞后或 Durbin 模型中,溢出确实存在,Wy 具有内生性,“系数”必须由影响分解取代。判断错误损失的不只是效率,还会直接改变数字的含义。