空间依赖与空间异质性并非同一问题

空间方法01 / 笔记

地理进入回归的两种不同方式:相邻单元之间的关联,以及在空间上不保持恒定的关系;两者的区别为何会决定整个建模链条。

把地理因素放进回归之后,“空间”几乎从来不只代表一件事。它通常包含两个需要不同工具处理的问题。首先判断面对的是哪一个,才是建模中真正的第一项决定;若在这里判断错误,后续推断会在不易察觉的情况下失效。

两种现象,而非一种

空间依赖是数据协方差结构的属性:某个结果,或其周围的误差,会在相邻单元之间相关。Tobler 第一定律——邻近事物通常比遥远事物关系更密切——是它的非正式表述。研究者用空间权重矩阵 W 编码“相邻”(接壤、距离带或 k 近邻,通常进行行标准化),随后写出两个经典模型之一:

空间滞后(SAR): y = ρ W y + X β + ε
空间误差(SEM): y = X β + u,  u = λ W u + ε

滞后模型中,结果本身会发生溢出:本地取值响应邻近单元的取值,ρ 衡量这种关联强度。由于 y 同时出现在等式两侧,任何一处冲击都会通过约化式 y = (I − ρW)⁻¹(Xβ + ε) 向全局传播,因此一个协变量的效应必须拆分为直接效应间接(溢出)效应;此时朴素的 β 已不再等于边际效应。在误差模型中,溢出来自由 λ 捕捉的、被遗漏且具有空间结构的因素;这里 β 在 OLS 下仍保持一致,但标准误错误,推断会产生误导。

关键在于:这两个模型中的关系仍是全局的。一组 β 描述整张地图。空间进入协方差结构,而不是参数本身。

空间异质性恰好相反——参数本身会随空间位置变化:

y_i = β₀(u_i, v_i) + Σ_k β_k(u_i, v_i) · x_ki + ε_i

其中 (u_i, v_i) 是观测 i 的坐标。地理加权回归(GWR)在每个位置分别估计一个核加权回归,带宽由 AICc 或交叉验证选择,最终得到局部系数组成的表面,即每个位置都有一个 β。此时不存在唯一的“X 的效应”,而只有这里的效应与那里的效应。空间进入参数,而不再只是协方差。

如何区分

  1. 先估计全局 OLS,并检查残差。
  2. 对残差计算 Moran’s I,检验是否仍存在空间结构:
I = (n / S₀) · (eᵀ W e) / (eᵀ e)

显著的 I 只能说明“空间仍然存在”,却不能说明是哪一种空间问题。依赖与未建模的异质性都可能留下自相关残差,因此 Moran’s I 是烟雾报警器,而不是诊断结果。 3. 若要识别依赖的形式,应使用 LM(拉格朗日乘数)检验及其稳健版本(Anselin 决策规则)。稳健 LM-error 与稳健 LM-lag 的结果可指向 SEM 或 SAR。 4. 若要识别异质性,应提出另一类问题:全局模型是否在完整区域中呈现系统性失配?空间分区或 Chow 类检验、GWR 相对全局模型的 AICc 改善,以及呈斑块状的局部 R² 表面,都是可能的信号。

这一区分为何不是术语之争

  • 若真实关系随空间变化,却只加入一个滞后项,模型会把失配吸收到 ρ 中,最后报告一个在任何地点都不准确的平均系数。
  • 若问题只是相邻误差相关,却使用 GWR,系数会为了吸收噪声而四处漂移,模型过度拟合出一个实际上由估计机制制造的“异质性”表面。

二者也可能同时出现。一项关系可以随空间变化,同时仍留下相邻相关的误差;这时需要同时处理,例如采用具有空间稳健推断的 GWR、空间变系数模型,或在不同协变量作用于不同空间尺度时使用 MGWR。

一句话判断

需要问的是:邻居的取值是否渗入了我的取值,还是 Xy 之间的规则在地图上移动时发生了改变?前者是协方差问题(空间依赖),后者是参数问题(空间异质性)。整个建模链条取决于哪一个答案为“是”。