Alias Archiveアーカイブ更新中
アーカイブ更新中

平均が空間構造を隠すとき:Moran's I と局所地図

空間手法03 / ノート

大域的な自己相関統計量は集積の存在を示し、局所分解はその場所と種類を示す。両者を読み違えやすい点も含めて整理する。

記録日
所属分野
研究
言語版
JA / 閲覧版
映像解説 · 01:45 「集積はあるか」と「どこにあるか」を分ける

Vera が「近い場所の値は似ているか」という問いから始め、大域 Moran's I と局所 LISA がそれぞれ何に答えるかを区別する。映像で大域統計量と局所地図の関係をつかみ、本文で有意性、多重比較、解釈上の限界を確認する。

英語解説 · 中国語字幕 · 16:9再生を選択するまで動画は開始しません。

映像は大域的な集積判定と局所的な位置の特定を区別するためのものであり、数式、推論条件、多重比較補正、因果解釈の限界は本文を基準とする。

まず大域的な問いから始める。近い場所の値は似ているか。大域 Moran’s I は一つの数で答える。各単位の平均中心化された値 ziz_i と、その近隣平均 WziWz_i の相関に相当する。

I=nS0ijwijzizjizi2,S0=ijwijI = \frac{n}{S_0}\frac{\sum_i\sum_j w_{ij}z_i z_j}{\sum_i z_i^2},\qquad S_0 = \sum_i\sum_j w_{ij}

行標準化された WW なら I=zTWzzTzI = \frac{z^{\mathsf T}Wz}{z^{\mathsf T}z} に簡略化できる。正の II は似た値同士の集積(ホットゾーンとコールドゾーン)、負の II は高値と低値が隣り合う市松模様を意味する。

推論では二点が誤解されやすい。

  • 空間ランダム性を帰無仮説とすると、E[I]=1/(n1)\operatorname{E}[I] = -1/(n-1) であり、わずかに負であってゼロではないnn が大きくなるときだけゼロへ近づく。比較対象はゼロではなく、この期待値である。
  • 有意性は正規/ランダム化分散の閉形式からも、置換からも得られる。値を位置間で何度も入れ替え、経験的な帰無分布を作る。正規性が疑わしいときは置換の方が安全である。

しかし大域 I には盲点がある。これは平均だからである。ある地区では強い集積があり、別の地区では何もない地図や、反対方向のパターンが相殺する地図を一つの数が隠してしまう。そのために局所版がある。

LISA(局所空間関連指標;Anselin, 1995)は、大域統計量を単位ごとの値へ分解する。

Ii=zijwijzjI_i = z_i\sum_j w_{ij}z_j

そして自地点の値と近隣平均の符号から各場所を分類する。

類型自地点近隣読み方
HHホットスポット
LLコールドスポット
HL低値地域の高値外れ
LH高値地域の低値外れ

HHLL はクラスター(正の局所関連)、HLLH は空間外れ値(負の局所関連)である。局所項の和は大域 II に戻り、厳密な分解になっている。

LISA 地図を壊す最大の罠は、各場所で一つずつ仮説検定するため、何千もの同時検定になりうることだ。補正しない擬似 p 値は、偽の「有意」クラスターを地図中に散らす。色付き地図を信じる前に、多重比較補正(FDR/Benjamini–Hochberg、または Anselin が論じる条件付き調整)を行う必要がある。そして常に、全体像は WW に依存する。近隣の定義を変えれば、ホットスポットも動きうる。

最後に、対象変数がすでに空間平滑化されている場合——重なるカーネルで推定した係数など——Moran’s I が拾う自己相関の一部は、実在する空間過程ではなく平滑化が機械的に作ったものかもしれない。集積を評価する前に、変数がどう生成されたかを確認すべきである。