Alias Archive档案更新中
档案更新中

先构造数据,再进入模型:空间回归的数据管线

空间方法07 / 笔记

空间研究的大部分工作发生在回归之前:把原始点位与边界整理成具有真实距离的分析图层,再在其上依次建立 OLS、全局空间与局部模型。

归档日期
归属板块
研究
语言版本
ZH / 阅读版本

空间研究中最显眼的部分是模型:系数、局部效应地图,以及某种关系在何处更强的解释。更庞大也更安静的部分,发生在第一次回归之前:每一行是否真的可比,距离是否以真实的米来计算,出行成本是否沿街道路网而不是用直尺穿过地图。本文以通用方式整理这条管线——从原始点位与边界到可供分析的单一图层,再到建立在其上的建模阶梯。示例刻意保持在教科书层面,例如“步行到最近车站的时间”;能够跨研究复用的是流程,而不是某个项目的结论。

从原始数据到可分析图层

下图以 ★ 标出的环节最容易在不报错的情况下悄然失败,因此需要格外检查。

连接之前,先清洗并建立主键

第一次表连接往往是无声丢失数据的地方。属性表可能带有行尾空格、全角与半角字符混用、名称写法不一致;若直接用未经处理的名称字段连接,不匹配的行会在没有提示的情况下掉出去。因此第一步是文本标准化——去除多余空格,统一字符宽度与大小写——然后建立一个能够表达每行独特性的组合主键

只由一个名称字段构成的主键通常不够。如果观测会跨时期重复,主键还必须包含时期,例如 年份 + 区域,这样同一地点在不同时期仍然是两行,而不会被悄然合并。基本原则是:凡是用来区分一个观测的字段,都应进入主键;在继续之前,还要确认连接后的行数符合预期。

投影到米制坐标,并避开元数据陷阱

经纬度是角度,不是距离。直接在地理坐标上计算长度、面积或出行时间,会得到位置相关的误差。因此在任何距离工作之前,应把所有图层重投影到投影坐标参考系:其单位是米,并且在研究范围内的形变较小。

这里有一组名称相近却含义不同的工具。一个工具会真正执行重投影,把坐标重新计算到新坐标系;另一个只会定义投影,也就是改写元数据标签而不移动坐标。把后者误当作前者,会得到一个看起来拥有正确投影、实际上几何位置从头到尾都错的数据集。需要的是重投影,而不是重新贴标签。

可达性应沿路网计算,而不是画直线

“到车站的距离”可以指两件完全不同的事。直线距离计算方便,却几乎总会低估真实可达成本,因为人不能穿过建筑、河流或封闭地块。特征价格或可达性模型通常需要的是路网距离或时间——真实步行或驾车所需的成本——它应在可通行街道路网上通过起讫点成本矩阵计算。

常见情形有两类:

  • 设施已经指定。 每个地点只对应一个指定设施时,直接取该配对的路网成本。
  • 可以在多个设施中选择。 没有指定设施时,取成本矩阵中最近设施的记录,作为可获得的最佳可达性近似。

直线距离仍应保留,但不作为可达性指标,而是用于下一步的质量检查。

对距离进行质量控制

路网图会损坏。缺失或错误吸附的路段,可能迫使算法绕行一条不合理的路径;少量异常出行时间也足以影响估计。绕行度指标可以把这些候选暴露出来:它比较路网成本与按照名义速度由直线距离推得的成本。

绕行度 = 路网时间 /(直线距离 / 名义速度)

接近直接路径时,绕行度较低;数值较高则意味着明显绕行。可以用四分位距围栏筛查分布上尾,而不是随意指定一个阈值。

上界 = 第三四分位数 + 常用倍数 × 四分位距

但异常值不自动等于错误,这一步也无法完全交给程序。河流或铁路走廊造成的绕行属于真实地理条件,代表真正的出行摩擦,应当保留;断裂路网造成的绕行才是噪声。统计量负责提出候选,人需要回到地图上作出判断。仅凭阈值删除,可能恰好删掉研究本来想测量的空间阻力。

合并并裁剪为单一分析图层

距离通过检查后,统一字段规范——每个字段采用约定的名称和类型——再把并行的子流程合并成一个分析图层。最后按照研究边界裁剪图层与底图,使所有地图在同一边界结束,而不是向周边区域无规则延伸。

这一阶段最终只交付一张表:行之间可比,距离采用米制,出行成本来自路网,质量控制过程有记录。到这里,建模才真正开始。

建模阶梯:OLS → 空间 → 局部

从全局平均到局部表面

这张分析图层支持一个三步递进过程。每一步都应由诊断结果触发,而不是预先假定。

  • 先以 OLS 建立基线,再诊断。 普通最小二乘提供全局平均关系,随后用 Moran’s I 检查残差是否在地图上聚集。如果相邻地点的残差相似,说明 OLS 尚未解释空间结构,其标准误也不能直接信任。
  • 全局空间模型吸收依赖。 存在空间依赖时,空间误差模型或空间滞后模型会把邻接结构纳入设定;空间 Durbin 模型能够覆盖两类结构。它修正依赖问题,但仍假定同一种关系在所有地点成立。
  • 关系本身变化时使用局部模型。 如果效应随空间而变化——这是空间异质性,而不只是依赖——**地理加权回归(GWR)**会为每个位置估计一个系数,形成可绘制的表面,而不是要求一个数字解释所有地方。

为什么局部视角值得额外工作

单个全局系数与各地系数

单个全局系数可能只是相反局部关系的平均。当一个区域的正向关系与另一区域的负向关系彼此抵消时,全局模型甚至会报告“没有关系”。以教科书式例子说明:邻近车站在高密度核心区可能对应较明显的价格差异,在城市外围则可能很弱。全局拟合只给出一个数字并遮蔽这种分化;局部拟合则能显示关系如何随地点变化。

整条数据管线的作用,是让这种差异能够被可靠地看见——局部系数应反映现实空间,而不是断裂的路网边或尚未投影的距离。

这条流程可以复用;系数和地图则属于每一项具体研究。二者应始终分开:方法能够跨项目迁移,发现只属于真正产生它的项目。

关联阅读

03 / LINKS
C01

局部系数意味着什么

地理加权回归为每个位置给出一个系数,而不是为整张地图提供一个系数。这个表面能说明什么,以及它可能悄然误导研究者的三种方式。

阅读全文 ↗
C02

两类常用空间模型及其统一形式

空间误差、空间滞后以及同时包含二者的 Durbin 模型:依赖存在于何处、是否产生溢出,以及系数为何不再等于边际效应。

阅读全文 ↗
C03

当平均值遮蔽空间结构:Moran's I 与局部地图

全局自相关统计量说明聚集是否存在,局部分解则说明它位于何处、属于哪一种类型,以及两者最容易被误读的环节。

阅读全文 ↗