Vera 比较邻接、距离带与 k 近邻三种构造方式,说明每一种 W 都隐含不同的空间机制。短片先建立选择逻辑,正文再讨论标准化、非对称结构与稳健性检验。
短片用于比较常见邻居定义;矩阵选择的理论依据与敏感性检查仍以正文为准。
每一种空间统计量——Moran’s I、空间滞后、空间误差项——都建立在一项更早的决定之上:谁是谁的邻居? 空间权重矩阵 就是回答这一问题的地方。它是一个 矩阵,其中 表示单元 与单元 的连接强度,按惯例 。一旦矩阵固定,空间滞后 便只是每个单元邻居取值的加权平均,也是空间方法真正操作的对象。
数据不会自动给出 W,研究者必须选择它的结构:
- 接壤。 若区域 与 共享边界,则 。Rook 接壤要求共享边;Queen 接壤还将共享顶点计为邻接,因此邻居更多。它适用于行政区或普查区等面状单元。
- 距离带。 若距离 不超过阈值 ,则 ,否则为 0。方法简单,但阈值敏感:过小时,一些单元会成为没有邻居的孤岛;过大时,高密度区域会获得数量庞大的邻居。
- k 近邻。 每个单元连接距离最近的
k个单元,保证所有位置恰好拥有k个邻居。它在密度不均时较稳健(拥挤中心与稀疏边缘并存),代价是矩阵天然可能不对称——i可以是j的邻居,而反向关系不一定成立。
随后进行行标准化:将每行元素除以该行之和,使 。此时 是真正的平均值,可在邻居数量不同的单元之间比较;空间参数(、)也落入更易解释的有界范围。Moran’s I 与空间回归通常都采用这一处理。
必须理解的一点是:W 是建模假设,而不是测量结果。 它是外生且预先设定的;不能根据结果变量 y 反向估计。它也会实质性影响结论:更稠密的 W 通常会提高测得的自相关,而选择不当的 W 甚至可能改变决定空间模型类型的诊断检验。因此,至少需要遵守以下纪律:
- 根据实质机制选择结构——为什么这些单元应当互为邻居?
- 在查看结果之前固定矩阵,避免把
W调整到预期答案。 - 使用其他合理的
W重新估计(不同的k、Rook 与 Queen、不同距离阈值),并报告结论是否保持。
如果一个叙述只在某个精心挑选的权重方案下成立,那么它说明的更可能是 W,而不是空间本身。