先从全局问题开始:相邻位置的取值是否相似?全局 Moran’s I 用一个数回答这一问题。它本质上衡量每个单元经均值中心化后的取值 z_i,与其邻居平均值 Wz_i 之间的相关:
I = (n / S₀) · (Σ_i Σ_j w_ij z_i z_j) / (Σ_i z_i²), S₀ = Σ_i Σ_j w_ij
在行标准化的 W 下,它可简化为 I = z'Wz / z'z。正的 I 表示相似取值相互聚集(热点与冷点区域);负的 I 表示高值与低值交错排列,近似棋盘格。
推断中有两个常见误区:
- 在空间随机的零假设下,
E[I] = −1/(n−1),即期望值略小于零,而不是零;只有当n增大时它才趋近于零。检验应以该期望值为基准。 - 显著性既可根据封闭形式的方差(正态或随机化假设)计算,也可通过置换检验获得:将取值在位置之间反复随机打乱,构造经验零分布。当正态性存疑时,置换通常更稳妥。
但全局 I 有一个盲点:它是平均值。一个统计量可能掩盖这样的地图——某一区域高度聚集,另一区域毫无结构;也可能存在两种方向相反、相互抵消的模式。这正是局部统计量存在的理由。
LISA(局部空间关联指标;Anselin,1995)将全局统计量分解为每个单元一个数:
I_i = z_i · Σ_j w_ij z_j
它根据本地取值与邻居平均值的符号,将位置分为四类:
| 类型 | 本地单元 | 邻居 | 解释 |
|---|---|---|---|
| HH | 高 | 高 | 热点 |
| LL | 低 | 低 | 冷点 |
| HL | 高 | 低 | 低值区域中的高值离群点 |
| LH | 低 | 高 | 高值区域中的低值离群点 |
HH 与 LL 是聚集(正的局部关联),HL 与 LH 是空间离群(负的局部关联)。所有局部项加总后可还原全局 I,因此这是一项严格分解。
最容易使 LISA 地图失真的陷阱是:每个位置都进行一次假设检验,意味着可能同时存在数千项检验。若不校正,伪 p 值会在地图上散布大量虚假的“显著”聚集。应在相信彩色地图之前进行多重比较校正(FDR、Benjamini–Hochberg,或 Anselin 讨论的条件调整)。而且整个图像始终取决于 W;邻居定义改变后,热点也可能移动。
还有一项值得明确的限制:若计算 Moran’s I 的变量本身已被空间平滑——例如由重叠核估计得到的系数——测得的部分自相关可能只是平滑过程机械制造的结果,并不证明存在真实空间过程。在解释聚集之前,应先知道变量是如何产生的。