每一种空间统计量——Moran’s I、空间滞后、空间误差项——都建立在一项更早的决定之上:谁是谁的邻居? 空间权重矩阵 W 就是回答这一问题的地方。它是一个 n × n 矩阵,其中 w_ij 表示单元 i 与单元 j 的连接强度,按惯例 w_ii = 0。一旦矩阵固定,空间滞后 Wz 便只是每个单元邻居取值的加权平均,也是空间方法真正操作的对象。
数据不会自动给出 W,研究者必须选择它的结构:
- 接壤。 若区域
i与j共享边界,则w_ij = 1。Rook 接壤要求共享边;Queen 接壤还将共享顶点计为邻接,因此邻居更多。它适用于行政区或普查区等面状单元。 - 距离带。 若距离
d_ij不超过阈值δ,则w_ij = 1,否则为 0。方法简单,但阈值敏感:过小时,一些单元会成为没有邻居的孤岛;过大时,高密度区域会获得数量庞大的邻居。 - k 近邻。 每个单元连接距离最近的
k个单元,保证所有位置恰好拥有k个邻居。它在密度不均时较稳健(拥挤中心与稀疏边缘并存),代价是矩阵天然可能不对称——i可以是j的邻居,而反向关系不一定成立。
随后进行行标准化:将每行元素除以该行之和,使 Σ_j w_ij = 1。此时 Wz 是真正的平均值,可在邻居数量不同的单元之间比较;空间参数(ρ、λ)也落入更易解释的有界范围。Moran’s I 与空间回归通常都采用这一处理。
必须理解的一点是:W 是建模假设,而不是测量结果。 它是外生且预先设定的;不能根据结果变量 y 反向估计。它也会实质性影响结论:更稠密的 W 通常会提高测得的自相关,而选择不当的 W 甚至可能改变决定空间模型类型的诊断检验。因此,至少需要遵守以下纪律:
- 根据实质机制选择结构——为什么这些单元应当互为邻居?
- 在查看结果之前固定矩阵,避免把
W调整到预期答案。 - 使用其他合理的
W重新估计(不同的k、Rook 与 Queen、不同距离阈值),并报告结论是否保持。
如果一个叙述只在某个精心挑选的权重方案下成立,那么它说明的更可能是 W,而不是空间本身。