空间研究中最显眼的部分是模型:系数、局部效应地图,以及某种关系在何处更强的解释。更庞大也更安静的部分,发生在第一次回归之前:每一行是否真的可比,距离是否以真实的米来计算,出行成本是否沿街道路网而不是用直尺穿过地图。本文以通用方式整理这条管线——从原始点位与边界到可供分析的单一图层,再到建立在其上的建模阶梯。示例刻意保持在教科书层面,例如“步行到最近车站的时间”;能够跨研究复用的是流程,而不是某个项目的结论。
下图以 ★ 标出的环节最容易在不报错的情况下悄然失败,因此需要格外检查。
连接之前,先清洗并建立主键
第一次表连接往往是无声丢失数据的地方。属性表可能带有行尾空格、全角与半角字符混用、名称写法不一致;若直接用未经处理的名称字段连接,不匹配的行会在没有提示的情况下掉出去。因此第一步是文本标准化——去除多余空格,统一字符宽度与大小写——然后建立一个能够表达每行独特性的组合主键。
只由一个名称字段构成的主键通常不够。如果观测会跨时期重复,主键还必须包含时期,例如 年份 + 区域,这样同一地点在不同时期仍然是两行,而不会被悄然合并。基本原则是:凡是用来区分一个观测的字段,都应进入主键;在继续之前,还要确认连接后的行数符合预期。
投影到米制坐标,并避开元数据陷阱
经纬度是角度,不是距离。直接在地理坐标上计算长度、面积或出行时间,会得到位置相关的误差。因此在任何距离工作之前,应把所有图层重投影到投影坐标参考系:其单位是米,并且在研究范围内的形变较小。
这里有一组名称相近却含义不同的工具。一个工具会真正执行重投影,把坐标重新计算到新坐标系;另一个只会定义投影,也就是改写元数据标签而不移动坐标。把后者误当作前者,会得到一个看起来拥有正确投影、实际上几何位置从头到尾都错的数据集。需要的是重投影,而不是重新贴标签。
可达性应沿路网计算,而不是画直线
“到车站的距离”可以指两件完全不同的事。直线距离计算方便,却几乎总会低估真实可达成本,因为人不能穿过建筑、河流或封闭地块。特征价格或可达性模型通常需要的是路网距离或时间——真实步行或驾车所需的成本——它应在可通行街道路网上通过起讫点成本矩阵计算。
常见情形有两类:
- 设施已经指定。 每个地点只对应一个指定设施时,直接取该配对的路网成本。
- 可以在多个设施中选择。 没有指定设施时,取成本矩阵中最近设施的记录,作为可获得的最佳可达性近似。
直线距离仍应保留,但不作为可达性指标,而是用于下一步的质量检查。
对距离进行质量控制
路网图会损坏。缺失或错误吸附的路段,可能迫使算法绕行一条不合理的路径;少量异常出行时间也足以影响估计。绕行度指标可以把这些候选暴露出来:它比较路网成本与按照名义速度由直线距离推得的成本。
绕行度 = 路网时间 /(直线距离 / 名义速度)
接近直接路径时,绕行度较低;数值较高则意味着明显绕行。可以用四分位距围栏筛查分布上尾,而不是随意指定一个阈值。
上界 = 第三四分位数 + 常用倍数 × 四分位距
但异常值不自动等于错误,这一步也无法完全交给程序。河流或铁路走廊造成的绕行属于真实地理条件,代表真正的出行摩擦,应当保留;断裂路网造成的绕行才是噪声。统计量负责提出候选,人需要回到地图上作出判断。仅凭阈值删除,可能恰好删掉研究本来想测量的空间阻力。
合并并裁剪为单一分析图层
距离通过检查后,统一字段规范——每个字段采用约定的名称和类型——再把并行的子流程合并成一个分析图层。最后按照研究边界裁剪图层与底图,使所有地图在同一边界结束,而不是向周边区域无规则延伸。
这一阶段最终只交付一张表:行之间可比,距离采用米制,出行成本来自路网,质量控制过程有记录。到这里,建模才真正开始。
建模阶梯:OLS → 空间 → 局部
这张分析图层支持一个三步递进过程。每一步都应由诊断结果触发,而不是预先假定。
- 先以 OLS 建立基线,再诊断。 普通最小二乘提供全局平均关系,随后用 Moran’s I 检查残差是否在地图上聚集。如果相邻地点的残差相似,说明 OLS 尚未解释空间结构,其标准误也不能直接信任。
- 全局空间模型吸收依赖。 存在空间依赖时,空间误差模型或空间滞后模型会把邻接结构纳入设定;空间 Durbin 模型能够覆盖两类结构。它修正依赖问题,但仍假定同一种关系在所有地点成立。
- 关系本身变化时使用局部模型。 如果效应随空间而变化——这是空间异质性,而不只是依赖——**地理加权回归(GWR)**会为每个位置估计一个系数,形成可绘制的表面,而不是要求一个数字解释所有地方。
为什么局部视角值得额外工作
单个全局系数可能只是相反局部关系的平均。当一个区域的正向关系与另一区域的负向关系彼此抵消时,全局模型甚至会报告“没有关系”。以教科书式例子说明:邻近车站在高密度核心区可能对应较明显的价格差异,在城市外围则可能很弱。全局拟合只给出一个数字并遮蔽这种分化;局部拟合则能显示关系如何随地点变化。
整条数据管线的作用,是让这种差异能够被可靠地看见——局部系数应反映现实空间,而不是断裂的路网边或尚未投影的距离。
这条流程可以复用;系数和地图则属于每一项具体研究。二者应始终分开:方法能够跨项目迁移,发现只属于真正产生它的项目。