迁移流的对数线性模型
期望得到的数据:人口迁移数据
方法:人口迁移
模型介绍
对数线性模型为研究和估算不同地区间的迁移提供了多种有价值的分析方法。至今为止,这些方法常用于分析一个国家内部不同行政区域间的国内迁移,但是这些方法不应仅限于国内迁移研究,也可用于国际迁移研究(雷穆 2007)。
迁移流量是指在给定时间框架内,从一个地区迁移到另一个地区的人口数量。人口流动量的计算有许多不同的方法,并且每种方法最终计算的结果也不尽相同。比如,瑞斯和威利金斯(1986)对登记制度和普查两种统计方法在计算迁移流量时的不同进行了区分。前者计算的是某个参照期内跨区域居住地发生变化的人口数量,而后者统计的则是那些在普查时点上的与参照期开始时的居住地点不同的人口。
无论使用哪种统计方法计算,迁移流量通常用列联表来表示。列联表是一个反映迁移人口来源地和目的地之间人口流动数量的方形表格。列联表中的迁移流量可以被乘法分量模型来完美再现,这个模型是一个饱和对数线性模型(所谓饱和模型是指数据点的数目和被估计的参数数目相同)。威利金斯 (1983), 罗杰斯、威利金斯、利特尔等(2002)以及罗杰斯、利特尔和雷穆(2010)等人用列联表来反映跨区域人口迁移矩阵;雷穆和罗杰斯 (2007), 雷穆、邦纳圭迪和瓦伦缇尼(2006) 以及罗杰斯、利特尔和雷穆 (2010)等人则将列联表用于研究不同年龄组的跨区域人口迁移流量。乘法分量模型适用于概括所研究地区间的迁移人口的结构流量(罗杰斯、威利金斯、利特尔等 2002)。在比较多个时期、年龄、性别、种族等不同人群间的分区域迁移时,乘法分量模型也是有用的。
对数线性模型可用于简化描述迁移人口结构,它比饱和模型更简洁。简化模型是否恰当可以用两种方法来确定,一个是考察预测流量对观测流量的拟合程度,另一个是通过统计方法计算拟合度。如果简化模型有价值,也就是说数据拟合程度好,这个模型可以被用来间接估计人口的迁移数量。以独立模型为例,其假定跨区域迁移流量的分布可以被不同来源地和不同目的地之间迁移流量的边际分布模式来预测。如果独立模型可以被确定是适当的,则跨区域间的迁移流量就是可以预测的且可以间接估算的,而如果每一个区域的总迁出量和迁入量已知,这种估算就是准确的。
有时候不同时间、年龄、性别和种族之间的迁移结构被假定是不变的。这些假定可以用对数线性模型来表示并加以检验。在允许迁移规模有所不同的条件下,现有研究证明了不同时间上迁移结构的稳定性,特别是年龄别迁移率的稳定性(缪瑟1989; 奈尔1985; 思内卡斯和维布 1977)。其他一些研究也同样证明了不同时间上跨区域迁移中年龄别迁移模式之间的一致性(雷穆和罗杰斯2007) 。此外,最小年龄人口的迁移结构可根据分出生地的人口存量数据来推断。而在某些场合下,这个指标被证明可用来估算总人口的迁移规模和其他年龄上的人口迁移状况(雷穆和罗杰斯2007; 罗杰斯、利特尔和雷穆 2010) 。
这些研究证明了替代法是间接估算迁移流量的一种成功的新方法。这种方法是对数线性模型的一种特例。它将一个已知的人口迁移结构放到一个跨区域迁移流数据存在缺失或不可靠的人口中去。使用这种方法,也可以将某一时期已知的迁移结构应用于另一个时期。另外,当迁移流量按年龄分组时,某一时期年龄别跨区域迁移流量也可用于另一时期。雷穆和罗杰斯(2007)揭示了,基于替代法,可以用出生时的终身期望迁移状况来间接估算其他年龄上的迁移状况。
以下章节首先介绍来源地和目的地的二维列联表,随后逐一论述对数线性模型的应用以及相关的假定。在这一章节中,对数线性模型是在二维迁移流量表的背景下被应用的;而乘法分量和加法饱和模型却是演绎性和解释性的。本章还将介绍独立对数线性模型以及“仅限迁移人口”的准独立模型,这里包括一些实例以及对评估拟合度方法的简要介绍。
本章将用一个替代法实例作结束,示范如何用一个时期的迁跨区域移模式来间接估算另一时期的迁移模式。当两个时期的迁移流量数据都可用时,则可用对数线性模型和替代法来检验不同时期迁移模式不变的假定。分年龄、来源地和目的地的迁移流量模式也作了介绍,并附以实例。这个实例展示了如何基于替代法用分年龄的乘法模型来间接估计另一时期年龄别跨区域的迁移流量数据。
双变量模型的应用
为了说明双变量对数线性模型的应用,本文以1973年和1976年荷兰按城镇化程度分的六组不同的市政区划间的人口迁移为例。这个案例来自威利金斯(1983)的研究,见表37.1。在表37.1中有两个变量,来源地(\(O)\)和目的地(\(D)\)。它们都不是因变量。而因变量可以是乘法模型中跨区域的迁移流量,\(n_{ij}\);或者是加法模型中迁移流量的自然对数,\(ln(n_{ij})\)。
接下来的章节中,将分别介绍饱和模型中的乘法分量模型和加法线性模型。这两种模型都完美地再现了观测数据。在随后的三个小节中介绍三种间接估算方法:独立模型、准独立模型和替代模型。
应用一: 乘法分量模型
饱和对数线性模型的乘法表达式被称为乘法分量模型,其公式如下:
\[ n_{i,j} = T\,O_i\,D_j\,OD_{i,j} \tag{1} \]
严格来说,与所有饱和模型一样,乘法分量模型是一种数据的表示方式而非一个模型。公式中,\(n_{ij}\)为观测到的从地区\(i\) 到地区\(j\)的迁移流量,\(T\), \(O_i\), \(D_j\), \(OD_{ij}\)分别为效应参数。因此,表37.1中 6×6子矩阵内任一从i到j的流量都可以用与公式1中相同的公式和相应参数来表示。\(T\) 为整体效应参数, \(O_i\) 为来源地i的效应参数, \(D_j\) 为目的地j的效应参数,\(OD_{ij}\)为\(O_i\)和\(D_j\)之间的交互效应参数。总起来说,饱和模型中的所有参数反映的是迁移流量的空间结构(罗杰斯、威利金斯、利特尔等 2002) 。
满足乘法分量模型的另外两组参数在迁移研究中也有所应用,在此将对其作一介绍。每组参数对迁移结构的呈现和解释方式不同。第一组参数叫做几何平均效应法(geometric mean effect coding)(诺克和伯客 1980; 威利金斯 1983),第二组参数叫做总效应参照法(total sum reference coding)(雷穆和罗杰斯 2007; 罗杰斯、利特尔和雷穆 2010)。第三种乘法分量模型将在以下关于对数线性加法模型的章节里作一介绍
表 37.1 根据城镇化程度分的市政辖区的迁移,荷兰, 1973 和 1976年
| A. 1973 年迁移表 | ||||||||
|---|---|---|---|---|---|---|---|---|
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 50,498 | 23,829 | 8,566 | 21,846 | 16,264 | 18,856 | 139,859 | |
| 2 | 25,005 | 27,536 | 6,953 | 14,326 | 16,212 | 18,282 | 108,314 | |
| 3 | 15,675 | 10,710 | 13,874 | 6,266 | 9,819 | 19,701 | 76,045 | |
| 4 | 23,457 | 14,169 | 4,431 | 10,209 | 9,386 | 10,973 | 72,625 | |
| 5 | 29,548 | 25,267 | 11,802 | 13,160 | 15,979 | 20,406 | 116,162 | |
| 6 | 46,815 | 39,123 | 42,399 | 25,012 | 26,830 | 23,304 | 203,483 | |
| 合计 | 190,998 | 140,634 | 88,025 | 90,819 | 94,490 | 111,522 | 716,488 | |
| B. 1976 年迁移表 | ||||||||
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 14,473 | 14,327 | 6,077 | 11,689 | 10,618 | 9,897 | 67,081 | |
| 2 | 14,833 | 36,258 | 13,289 | 17,391 | 20,899 | 21,869 | 124,539 | |
| 3 | 8,330 | 17,764 | 25,113 | 10,489 | 18,171 | 29,220 | 109,087 | |
| 4 | 11,315 | 16,498 | 8,935 | 10,537 | 10,762 | 12,519 | 70,566 | |
| 5 | 11,875 | 24,370 | 19,151 | 12,312 | 16,724 | 22,591 | 107,023 | |
| 6 | 16,582 | 32,336 | 52,415 | 22,264 | 28,182 | 27,810 | 179,589 | |
| 合计 | 77,408 | 141,553 | 124,980 | 84,682 | 105,356 | 123,906 | 657,885 | |
| *1: 农村辖区 | ||||||||
| 2: 工业化的农村辖区 | ||||||||
| 3: 通勤人员驻地辖区 | ||||||||
| 4: 农村集镇和小城镇辖区 | ||||||||
| 5. 中等城镇辖区 | ||||||||
| 6. 10万人或以上大城镇辖区 | ||||||||
| 来源: 荷兰中央统计局,海牙。 | ||||||||
应用二:几何平均效应法(Geometric mean effect coding)
几何平均效应法是公式1用于迁移分析的第一种分解形式。该方法由伯茨(1963)提出,相当于迁移研究中的引力模型(威利金斯 1983)。表2中显示了将表1中荷兰迁移流量数据用几何平均效应法求得到的乘法分量模型结果。需要指出的是,总效应参数\((T)\)置于表中总计的位置,来源地效应参数\((O_i)\)置于表中的行合计的位置,目的地效应参数\((Dj)\)位于表中列合计的位置,而来源地与目的地之间交互效应\((OD_{ij})\)位于表中的每一个单元格内。
表37.2 几何平均效应法的乘法分量
| A. 1973 年迁移表 | ||||||||
|---|---|---|---|---|---|---|---|---|
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 1.457 | 0.94 | 0.656 | 1.352 | 0.933 | 0.882 | 1.180 | |
| 2 | 0.885 | 1.332 | 0.653 | 1.087 | 1.14 | 1.048 | 0.962 | |
| 3 | 0.771 | 0.720 | 1.811 | 0.661 | 0.959 | 1.570 | 0.692 | |
| 4 | 1.275 | 1.052 | 0.639 | 1.190 | 1.014 | 0.966 | 0.627 | |
| 5 | 0.943 | 1.102 | 1.000 | 0.901 | 1.013 | 1.055 | 1.067 | |
| 6 | 0.838 | 0.957 | 2.015 | 0.960 | 0.954 | 0.676 | 1.903 | |
| 合计 | 1.711 | 1.252 | 0.644 | 0.798 | 0.861 | 1.056 | 17,168.00 | |
| B. 1976 年迁移表 | ||||||||
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 1.753 | 0.984 | 0.571 | 1.317 | 0.979 | 0.787 | 0.656 | |
| 2 | 0.986 | 1.366 | 0.686 | 1.075 | 1.057 | 0.954 | 1.195 | |
| 3 | 0.655 | 0.792 | 1.533 | 0.767 | 1.088 | 1.508 | 1.010 | |
| 4 | 1.277 | 1.055 | 0.783 | 1.106 | 0.925 | 0.927 | 0.704 | |
| 5 | 0.900 | 1.047 | 1.127 | 0.868 | 0.965 | 1.124 | 1.048 | |
| 6 | 0.769 | 0.850 | 1.888 | 0.960 | 0.995 | 0.847 | 1.712 | |
| 合计 | 0.768 | 1.354 | 0.989 | 0.825 | 1.008 | 1.169 | 16,401.92 | |
总效应参数\(T\)是一个恒定比例,表示总效应的大小(威利金斯 1983)。它是所有跨区域迁移流量的几何平均数公式如下:
\[ T = \left[ \prod_{i,j} n_{i,j} \right]^{\frac{1}{n \times m}} \]
其中,\(m\)表示来源地的数量(行数)=目的地的数量(列数)。1973年和1976年的T值分别为17,168.003和16,401.919。
就某一特定地区\(i\)而言,来源地的主效应等于来源地\(i\)的所有迁移流量的几何平均数除以整个迁移的几何平均数后得到的比率:
\[ O_i = \frac{1}{T}\left[\prod_{j} n_{i,j}\right]^{\frac{1}{m}} \]
来源地主效应\(O_i\)反映地区\(i\)作为迁移来源地的相对影响力 (阿隆索 1986) 。以1973年数据为例,类别4作为来源地区的相对重要性为:
\[ O_4=\frac{1}{17168.003}\left[23457\times14169\times4431\times10209\times9386\times10973\right]^{\frac{1}{6}}=0.627 \]
该值是这一行中最小的,表明在1973年的迁移过程中类别4作为来源地的影响是最弱的。
类似地,目的地主效应\(D_j\)表示目的地j在多大程度上吸引了迁移人群。它等于\(j\)列的几何平均数除以总迁移流量的几何平均数后得到的比率,公式如下:
\[ D_j=\frac{1}{T}\left[\prod_i n_{ij}\right]^{\frac{1}{n}} \]
例如,1973年类别4目的地的主效应为:
\[ D_4=\frac{1}{17168.00}\left[21846\times14326\times6266\times10209\times13160\times25012\right]^{\frac{1}{6}}=0.798 \]
其他各行各列的效应可以用同样的方法计算出来,即每一行(列)的几何平均数除以总的几何平均数。这些参数相当于引力模型中的平衡因子(威利金斯 1983)。
这些效应可以在不同区域或不同时期进行比较。例如,类别6在1973年和1976年的迁移中都是最重要的来源地(1973年类别6的影响力为1.903, 1976年为1.712,均比同期其他任何地区都要高)。类别1作为目的地,其1976年的影响力要低于1973年(1976年的影响力为0.768小于1973年的1.711);另外,类别1作为来源地的影响在1973年(1.180)要小于其作为目的地的影响(1.711)。
表37.2中的板块A和板块B为空间互动矩阵。矩阵中的元素就是公式1中的交互效应\(OD_{ij}\)。每一矩阵元素都等于观测到的由\(i\) 到 \(j\)的迁移流量除以其他三个参数乘积求得的期望迁移流量。公式如下:
\[ OD_{ij}=\frac{n_{ij}}{(T)(O_i)(D_j)} \]
其中,\(OD_{ij}\)表示观测到的流量\(n_{ij}\)与基于来源地i和目的地j之间不存在关联性这一假设而获得的期望流量\((T)\)\((O_i)\)\((D_j)\)相偏离的程度。这些指标代表了两地互通性、交互性或者相互的吸引力(罗杰斯、威利金斯、利特尔等 2002) 。
\(OD_{ij}\)等于1.0表示独立性,即来源地与目的地之间不存在关联效应。若公式1中的\(OD_{ij}\)为1.0,则意味着\(n_{ij}\)是仅由\(T\), \(O_i\) 和 \(D_j\)决定的。任何偏离1.0的值,不论其方向,都意味着来源地和目的地之间存在某种关联效应。该值越高于1.0说明地区间的互通性或吸引力比期望值越高,该值比1.0越小,说明地区间的互通性或吸引力比期望值越小。
由于1973年数据结果的对角线数值均超过1.0,这说明同一等级的辖区之间的吸引力较大。类别6是个例外。从一个超过10万人口的大城镇(即类别6)迁移到通勤级别城镇(即类别3)的吸引力远远超过迁移到其他相同级别的大城镇(因为前者的影响因子2.015大于后者的影响因子0.676)。
表37.2中包括了重现1973年和1976年两年迁移流量数据所需的所有参数。为验证表37.1中任何迁移流量数据都可用乘法分量模型来重现,可以用1973年类别2到类别3的流量数据为例:
\[ n_{2,3}=6953=17168.003 \times 0.962 \times 0.644 \times 0.653 \]
然而,各参数值并非彼此都完全独立。换言之,有些参数值可由其他参数导出。如表37.2所示,就某一年所有的\(i\)和 \(j\)组合而言,共有36个交互效应参数,6个来源地主效应参数,6个目的地主效应参数以及一个总效应参数。然而,表37.2中每一年的49个参数值,只来源于36个被观测到的迁移流量数据,这就意味着有13个参数值是多余的。也就是说,这49个参数中的13个参数能够通过另外36个参数而计算得到,其参数间的关系取决于以下和几何平均效应的约束条件。第一个约束条件是所有来源地主效应(及所有目的地主效应)的乘积等于1。如下所示:
\[ \prod_i O_i = 1 \quad \text{且} \quad \prod_j D_j = 1 \]
第二个约束条件应用在各行各列之间的交互项,即各行各列的内部元素的乘积等于1。换言之,如果某一个来源地(或目的地)的六个交互项效应中有五个效应已知,那么第六个就可被推出。如下所示:
\[ \prod_i O_{ij}=1 \quad \text{且} \quad \prod_j D_{ij}=1 \]
通常,如果有\(m\)个地区,那么就有\(m^2\)个线性独立的参数和\(1+m+m+(m × m)\)个乘法分量。关于几何平均效应的所有计算,请参见随附的乘法分量工作表中的表37.2。
应用三:总效应参照法(Total sum reference coding)
几何平均效应法将几何平均数用作参考值, 是最早用于描述迁移过程分解的对数线性模型 (罗杰斯、威利金斯、利特尔等 2002; 威利金斯 1983) 。然而,总量参照法成正在日益成为更加标准化的方法(雷穆和罗杰斯 2007; 罗杰斯、利特尔和雷穆 2010)。虽然两种分解模式都适用于等式(1),但是总量参照法的效果更加清晰。例如,总体效应T在总量参照法中指迁移总量,用\(n_{++}\)来表示,\(O_i\)现在表示在所有迁移者中来源地i的迁出人口所占的比例,即\(n_{i+}/n_{++}\);而\(D_j\)表示在所有的迁移者中迁移到目的地\(j\)的人口所占的比例,即\(n_{+j}/n_{++}\)。原来的交互参数\(OD_{ij}\)在总量参照法中用\(n_{ij}/[(T)(O_i)(D_j)]\)来表示,即被观测到的迁移流量\(n_{ij}\)与预测值\((T)(O_i)(D_j)\)之间的比率。所有这些效应提供了呈现迁移空间结构的一种新方式。
由总量参照法所获得的乘法分量见表37.3。例如,1973年从类别1迁移到类别3的8566人,可以拆分成以下四个乘法分量:
\[ \begin{aligned} n_{13} &= (T)(O_1)(D_3)(OD_{13}) \\[4pt] &= n_{++} \left( \frac{n_{1+}}{n_{++}} \right) \left( \frac{n_{+3}}{n_{++}} \right) \left[ \frac{n_{13}} {n_{++} \left( \frac{n_{1+}}{n_{++}} \right) \left( \frac{n_{+3}}{n_{++}} \right)} \right] \\[6pt] &= (716488) \left(\frac{139859}{716488}\right) \left(\frac{88025}{716488}\right) \left(\frac{8566}{17183}\right) \\[6pt] &=716488(0.102)(0.190)(0.477) \\[4pt] &=8566 \end{aligned} \]
对这四个分量的解释是相对容易的。总分量代表的是1973年的总迁移人口数,即716,488。来源地分量代表的是每一个迁出地迁出人口占总迁移量的份额,比如从类别1迁出的人口占总迁移人口的份额为10%。目的地分量代表的是每一个目的地迁入人口占总迁移量的比例,比如,总迁移人口中有19%的人选择类别3作为迁移的目的地。最后,交互分量反映的是被观测到的迁移流量与预期迁移流量的比率,在本例中,每100个预期的从类比1到类别3的迁移量中有近48个被观测到。预期流量是基于边际总和信息, 即,\((T)(O1)(D3)\)得出来的。
表37.3 基于几何平均效应法计算的乘法分量
| A. 1973 年迁移表 | ||||||||
|---|---|---|---|---|---|---|---|---|
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 1.354 | 0.868 | 0.499 | 1.232 | 0.882 | 0.866 | 0.195 | |
| 2 | 0.866 | 1.295 | 0.523 | 1.043 | 1.135 | 1.084 | 0.151 | |
| 3 | 0.773 | 0.718 | 1.485 | 0.650 | 0.979 | 1.664 | 0.106 | |
| 4 | 1.212 | 0.994 | 0.497 | 1.109 | 0.980 | 0.971 | 0.101 | |
| 5 | 0.954 | 1.108 | 0.827 | 0.894 | 1.043 | 1.129 | 0.162 | |
| 6 | 0.863 | 0.980 | 1.696 | 0.970 | 1.000 | 0.736 | 0.284 | |
| 总计 | 0.267 | 0.196 | 0.123 | 0.127 | 0.132 | 0.156 | 716,488 | |
| B. 1976 年迁移表 | ||||||||
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 1.834 | 0.993 | 0.477 | 1.354 | 0.988 | 0.783 | 0.102 | |
| 2 | 1.012 | 1.353 | 0.562 | 1.085 | 1.048 | 0.932 | 0.189 | |
| 3 | 0.649 | 0.757 | 1.212 | 0.747 | 1.040 | 1.422 | 0.166 | |
| 4 | 1.363 | 1.087 | 0.667 | 1.160 | 0.952 | 0.942 | 0.107 | |
| 5 | 0.943 | 1.058 | 0.942 | 0.894 | 0.976 | 1.121 | 0.163 | |
| 6 | 0.785 | 0.837 | 1.536 | 0.963 | 0.980 | 0.822 | 0.273 | |
| 总计 | 0.118 | 0.215 | 0.19 | 0.129 | 0.16 | 0.188 | 657,885 | |
与几何平均效应法类似,总量参照法的分解给出的参数个数要比原始数据点多。用于定义参数间相关关系以及导出冗余参数的约束条件如下所示:
\[ \sum_i O_i = 1, \qquad \sum_j D_j = 1, \qquad \frac{\sum_i O_i \sum_j OD_{ij}}{m} = 1 \]
且
\[ \frac{\sum_j O_i \sum_i OD_{ij}}{m}=1 \]
其中,\(m\)表示迁移地区的数量(雷穆、邦纳圭迪和瓦伦缇尼 2006)。
关于总量参照效应法的计算,参见随附的乘法分量工作表中的表37.3。
两类乘法分量模型的比较
如果当同样的分解方法应用于某一区域系统两组不同的迁移流量数据时,那么除了\(T\)参数以外的全部参数都只有比率意义。这就意味着,两组分量的比率将提供一种不受总体迁移水平变动而能检验移结构稳定性的简单方法 (罗杰斯、威利金斯、利特尔等 2002) 。表37.4中列出了1976年与1973年相应分量相比的比率。有些比率偏离数值1很大,这反映了1973年至1976年三年间迁移结构发生了变化。例如,\(OD_{11}\)分量的比率为1.354,这一数值意味着1976年类别1作为目的地的吸引力高于1973年。相反,\(OD_{33}\)分量的比率为0.816,说明1976年类别3内部迁移的吸引力不及1973年。
表37.4 1976年与1973年乘法分量的比率
| 目的地 | |||||||
|---|---|---|---|---|---|---|---|
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 |
| 1 | 1.354 | 1.144 | 0.957 | 1.099 | 1.121 | 0.904 | 0.522 |
| 2 | 1.169 | 1.045 | 1.075 | 1.040 | 0.923 | 0.860 | 1.252 |
| 3 | 0.839 | 1.055 | 0.816 | 1.149 | 1.062 | 0.854 | 1.562 |
| 4 | 1.125 | 1.093 | 1.342 | 1.046 | 0.972 | 0.970 | 1.058 |
| 5 | 0.988 | 0.955 | 1.139 | 1.000 | 0.936 | 0.993 | 1.003 |
| 6 | 0.909 | 0.854 | 0.906 | 0.993 | 0.980 | 1.117 | 0.961 |
| 合计 | 0.441 | 1.096 | 1.546 | 1.015 | 1.214 | 1.21 | 0.918 |
应用四:对数线性加法模型
饱和对数线性模型的另一种形式是线性加法模型,该模型是乘法分量模型的一种替代形式。无论是饱和对数线性模型的线性加法形式还是乘法分量形式,其参数代表的都是迁移的空间结构(罗杰斯、威利金斯、利特尔等 2002) ,通过不同的参数,而每一个实际迁移流量都能够通过参数被再现出来。
由于乘法模型实际上等同于引力模型(威利金斯 1983),因而呈现迁移空间结构时该模型比线性加法模型更加适用。但从另一个方面来看,线性加法模型在统计学中更加常用。当使用常用的统计软件(如SPSS, Stata, R)计算对数线性模型时,各参数经常被用线性加法模式表示。由于这个原因,本小节将介绍线性加法模型中参数的常规计算和解释。
线性加法形式是对数的线性函数,这一更直接地说明了为什么该模型叫做对数线性模型(诺克和伯克 1980)。在数学计算上,它等同于乘法分量模型, 是对公式1等式两边同时取对数得到的:
\[ \ln(n_{ij})=\ln(T)+\ln(O_i)+\ln(D_j)+\ln(OD_{ij}) \]
可以简化为:
\[ \ln(n_{ij})=\lambda+\lambda_i^{O}+\lambda_j^{D}+\lambda_{ij}^{OD} \tag{2} \]
$\lambda$的各个值是公式1中各参数取自然对数之后的值。\(O\), \(D\), 和\(OD\)上标分别代表参数符号(并非是幂),而i和j下标分别表示来源地或者目的地的类别变量。
将表37.2和表37.3中的参数取自然对数后将得到一组相应的线性加法参数。但正如乘法分量模型至少有几何平均效应模型和总效应参照效应模型两种分解形式一样,对于线性加法模型,也存在有多种分解参数的方法(帕沃斯和谢 2008),而且标准统计软件中所用的方法也并非是简单地将之前得到的乘法分量模型取对数。
如前所述,一个包括 $m$ 个地区的迁移,会有 $m \times m$ 个线性独立的参数。前面提到的乘法分量模型可以用\(1 + m + m + (m \times m)\)个参数给出一个可解释的值,只要它们彼此之间并不是线性独立的。另外,SPSS、Stata 和 R 等统计软件能够用于计算线性独立参数,其中包括 1 个 \( p_i^{o}\), \( (m-1) \) 个 \( \lambda_i^{o}\), \( (m-1) \) 个 \( \lambda_j^{o}\), \( (m-1)(m-1) \) 个 \(\lambda_{ij}^{o}\)。
计算所得的某一特定组的参数值取决于使用软件时将哪一地区设定为对照组。被设定为对照组的那一地区的线性加法模型中的所有参数都被赋值为0.例如,SPSS软件将最后一个地区设为对照组,即本例中编码数值m最大的那个地区。在这种情况下,\(
\lambda_0^{O}=\lambda_0^{D}=\lambda_{i0}^{OD}=\lambda_{0j}^{OD}=0\) 。表37.5中显示的是经SPSS命令输出的荷兰迁移数据的参数值。附录1中列出了计算1973年迁移表的SPSS程序和输出结果(也可参见本手册《人口学估计方法》网站)。随附的Excel电子工作簿中的Constrasting Coding 工作表给出了表37.5中参数的计算公式。
表 37.5 用"最后一个地区"作为对照组的线性加法参数
| A. 1973 年迁移表 | ||||||||
|---|---|---|---|---|---|---|---|---|
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 0.288 | -0.284 | -1.388 | 0.076 | -0.289 | 0.000 | -0.212 | |
| 2 | -0.384 | -0.109 | -1.565 | -0.315 | -0.261 | 0.000 | -0.243 | |
| 3 | -0.926 | -1.128 | -0.949 | -1.216 | -0.837 | 0.000 | -0.168 | |
| 4 | 0.062 | -0.262 | -1.505 | -0.143 | -0.297 | 0.000 | -0.753 | |
| 5 | -0.327 | -0.304 | -1.146 | -0.509 | -0.385 | 0.000 | -0.133 | |
| 6 | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | |
| 合计 | 0.698 | 0.518 | 0.598 | 0.071 | 0.141 | 0.000 | 10.056 | |
| B. 1976 年迁移表 | ||||||||
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 0.897 | 0.219 | -1.122 | 0.389 | 0.057 | 0.000 | -1.033 | |
| 2 | 0.129 | 0.355 | -1.132 | -0.007 | -0.059 | 0.000 | -0.24 | |
| 3 | -0.738 | -0.648 | -0.785 | -0.802 | -0.488 | 0.000 | 0.049 | |
| 4 | 0.416 | 0.125 | -0.971 | 0.050 | -0.165 | 0.000 | -0.798 | |
| 5 | -0.126 | -0.075 | -0.799 | -0.385 | -0.314 | 0.000 | -0.208 | |
| 6 | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | |
| 合计 | -0.517 | 0.151 | 0.634 | -0.222 | 0.013 | 0.000 | 10.233 | |
注意到,最后一个地区的所有参数都等于0,因此,它对等式(2)没有任何的作用。因表37.5中参数的数值为对数值,因此对它们的解释是相对复杂的。若将它们指数化,则会产生满足等式(1)的另一组乘法分量模型。表37.6给出了这些结果,它们是以最后一个地区为对照组下的乘法分量。一般情况下,这些参数不是用来反映迁移空间结构的,而是用来描述迁移系统的,这是因为在加法模型中交互作用参数\(OD_{ij}\)是一个比率。
表37.6 用最后一个地区为对照组的乘法分量
| A. 1973 年迁移表 | ||||||||
|---|---|---|---|---|---|---|---|---|
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 1.333 | 0.753 | 0.250 | 1.079 | 0.749 | 1.000 | 0.809 | |
| 2 | 0.681 | 0.897 | 0.209 | 0.730 | 0.770 | 1.000 | 0.785 | |
| 3 | 0.396 | 0.324 | 0.387 | 0.296 | 0.433 | 1.000 | 0.845 | |
| 4 | 1.064 | 0.769 | 0.222 | 0.867 | 0.743 | 1.000 | 0.471 | |
| 5 | 0.721 | 0.738 | 0.318 | 0.601 | 0.680 | 1.000 | 0.876 | |
| 6 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | |
| 合计 | 2.009 | 1.679 | 1.819 | 1.073 | 1.151 | 1.000 | 23,304 | |
| B. 1976 年迁移表 | ||||||||
| 目的地 | ||||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 | |
| 1 | 2.453 | 1.245 | 0.326 | 1.475 | 1.059 | 1.000 | 0.356 | |
| 2 | 1.138 | 1.426 | 0.322 | 0.993 | 0.943 | 1.000 | 0.786 | |
| 3 | 0.478 | 0.523 | 0.456 | 0.448 | 0.614 | 1.000 | 1.051 | |
| 4 | 1.516 | 1.133 | 0.379 | 1.051 | 0.848 | 1.000 | 0.450 | |
| 5 | 0.882 | 0.928 | 0.450 | 0.681 | 0.731 | 1.000 | 0.812 | |
| 6 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | |
| 合计 | 0.596 | 1.163 | 1.885 | 0.801 | 1.013 | 1.000 | 27,810 | |
例如,表 37.5 中 1973 年迁移数据的总体参数 $\lambda$ 提供了对照地区观测到的迁移流的自然对数。
$\ln(n_{66}) = 10.056$,而表 37.6 中对应的参数给出了迁移流量 $n_{66}$:
$$
n_{66} = \exp(10.056) = 23{,}304 .
$$
表 37.5 中 1973 年迁移流数据还显示了来源地效应因子是如何相加得到总体参量,从而再现表 37.1 中所示的类别 1 到 6 的迁移量的。例如,
$\ln(n_{16}) = 10.056 - 0.212 = 9.845$,
相应的乘法分量 $O_i$ 乘以表 6 中的 $T_j$ 得出:
$$ n_{16} = 27{,}810 \times 0.356 = 18{,}856 . $$
用同样的方法,将等式(1)应用于表37.6中对应的参数可以复制出所有对数形式的迁移数据,或者将等式(2)应用于表37.5中的参数,可以再现所有的观测流量。
线性形式的关联参数\( \lambda_{j}^{OD} \) 是一个对数比率,它是两个比率的比率的对数,两个比率分别是:1)第一个比率代表的迁出地i迁移到目的地j而不是对照地区的比率;2)第二个比率是指从对照地区迁移到目的地j而不是留在对照地区的比率。例如,表37.5中1973年迁移流量子表数据中 \( \lambda_{23}^{OD} \)= –1.565,它是用下面的公式计算出来的:
\[ \lambda_{23}^{OD} = \ln \left[ \frac{\frac{n_{23}}{n_{26}}}{\frac{n_{63}}{n_{66}}} \right] = \ln \left[ \frac{\frac{6953}{18282}}{\frac{42399}{23304}} \right] = -1.565 \]
简言之,该参数代表的是比较类别2和类别6作为迁移来源地时,其人口迁移到类别3而类别6的比率的对数。
比率测量的是一个结果相对于另一个结果的相对可能性。因为它要比对数比率更加标准化,因此将对数比率进行指数化成为比率,会更易于解释表37.6中的关联参数。例如,基于1973年的数据,模型参数OD23的计算过程如下:
\[ OD_{23}=\exp(-1.565) =\frac{\frac{n_{23}}{n_{26}}}{\frac{n_{63}}{n_{66}}} =0.209 \]
总之,从类别2迁移到类别3而非类别6的可能性是从类别6迁移到类别3而非类别6的可能性的1/5倍。比率总是正的,其大小取决于对照地区的选择。当比率等于1时,意味着两者之间不存在任何关系,即统计上独立。当其值大于1时意味着正相关,当其值小于1时意味着负相关。
Stata和R两个统计软件使用的对照组方法与SPSS不同。这两个统计软件都是将“第一个地区”作为对照组而非SPSS中的“最后一个地区”。在这两个统计软件中,对第一地区,即被赋予最小数值,其参数都为0. Stata和R两个统计软件对1973年迁移数据生成线性加法从参数的命令和相应结果可以在这一章的附录1中得到(也可参见本手册《人口学估计方法》网站)。
用于估算交互效应参数的所有饱和模型的形式和所有的统计方法其实都是类似的,且结果也是相同的。计算相关参数的公式可在随附的工作簿的Linear Additive Parameters工作表找到。另外,在SPSS和Stata等统计软件中,每一个线性加法交互效应参数是否等于0的假定的检验是自动完成的。结果详见本章的附录1(也可参见本手册《人口学估计方法》网站),这些结果显示每一个非冗余的交互效应参数都是在统计上显著的。关于这些估计值标准误的论述,详见阿格莱斯迪和菲雷 (2009)以及帕沃斯和谢 (2008)。
应用五:独立模型
前面介绍的所有模型都是饱和模型,所以能完美地再现被观测的数据。一般来说,最有意义的参数通常是交互效应参数,这是因为这类参数代表着各区域之间的关联效应。然而,独立模型假定所有的交互效应参数都是没有意义以及不必要的,这是因为在独立模型中所有乘法模型中的交互效应参数ODij都等于1,或者说在所有加法模型中的交互效应参数\( \lambda_{j}^{OD} \) 都等于0。独立模型意味着交互项都不应该在模型中出现,从而将前面所提到的乘法模型和加法模型转化为双变量模型最简约的形式,即\( n_{ij} = (T)(O_i)(D_j) \) ,或者等效地,\( \ln(n_{ij}) = \lambda + \lambda_i^{O} + \lambda_j^{D} \) 。
饱和对数线性模型中交互效应参数的目测检验是调查独立性假定是否成立的一种方法。另一种方法是通过计算行或者列的条件分布。如果行变量(来源地)中的条件分布是相同的,那么就说明来源地与目的地之间是独立的。另外,由于独立性是对称的,当行变量(来源地)中的条件分布相同时,列变量(目的地)中的条件分布也应是相同的(格莱斯迪和菲雷 2009; 帕沃斯和谢 2008)。随附工作簿中的Independence工作表计算了荷兰移民列变量(目的地)的百分比。与各种交互效应参数显示的一样,列变量的百分比彼此是很不一样的,这说明在这个例子中统计独立性假设是不成立的。
独立性假设意味着每个特定区域内的迁移规模都可以通过边际迁移流量的大小来确定。假定独立性假设成立,Nij为从区域i到j的期望迁移流量。那么\(N_{ij}\)应该等于迁移系统内的迁移总额\(n_{++}\)乘以从地区i的迁出量占总迁移数的比例\(n_{i+}/n_{++}\)再乘以迁入到地区j的人口占总迁移量的比例\(n_{+j}/n_{++}\),即\(N_{ij} = n_{++}(n_{i+}/n_{++})(n_{+j}/n){++})\)。如果独立性假设成立,那么\(N_{ij}\)就是跨区域迁移人口数量很好的估计值。这样,而跨区域迁移流量的估算方法也被真正简化了。
被观测流量 $n_{ij}$ 与预测流量 $N_{ij}$ 的差异性,是拟合度评估和皮尔逊卡方统计量 $\chi^2$ 的基础。卡方统计方法被广泛用来概括这类差异,其计算公式为:$ \chi^2 = \sum \frac{(n_{ij} - N_{ij})^2}{N_{ij}}, $其中将所有迁移矩阵内的数据求和。当迁移矩阵内所有单元的观测值与期望值完全一致时,$ \chi^2 = 0, $,也就意味着独立模型完美地拟合了数据。当\(n_{ij}\)与\(N_{ij}\)的差异值增大时, $\chi^2$ 的值也越大,说明独立模型越不使用。一般而言,$\chi^2$ 的值越小,模型的拟合度越好; $\chi^2$ 的值越大,模型拟合度越差。
如果独立假设成立,则$\chi^2$ 值取决于自由度为\((m – 1)×(m – 1)\)的$\chi^2$ 概率分布。该分布提供了 $\chi^2$ 显著性检验的基础(阿格莱斯迪 2007; 阿格莱斯迪和菲雷 2009)。如果 值落在其分布图的最右侧,意味着低概率,比如p < 0.05,那就说明独立性假设为假,模型应被拒绝。将独立模型应用到表37.1中的荷兰迁移流数据,其$\chi^2$ 值的过程请参见随附工作簿中的Independence工作表格。用SPSS, Stata 和R统计软件来检验1973年数据是否适用独立模型的程序详见附录2(也可参见本手册《人口学估计方法》网站)。
1973年数据中的 $\chi^2$值为47,623,自由度\((df)\)为25。而p值小于0.000,因而独立性假设不成立。(但是,当大样本时,需参见下文中关于该检测局限性的评论。)鉴于表37.2、表73.3和表37.6中给出的关于荷兰迁移数据的三种乘法分量分解,这一结果并不奇怪。数据一致地显示各迁移地区之间存在着关联效应,并且很多乘法交互效应参数的值也并不接近于1。另外,在本章附录1(也可参见本手册《人口学估计方法》网站)中由SPSS和Stata等统计软件计算出的标准误也显示线性加法模型的交互效应参数并不接近于0。
一种替代 $\chi^2$ 统计量的方法被称为似然比统计量,偏差统计量,或者\(G^2\)统计量。所有不同的名称指的都是同一种检验统计方法,而最终选用哪个名称由取决于教科书作者和统计软件开发者的偏好。为了简单起见,本文使用\(G^2\)统计量这个名称。与$\chi^2$ 一样,当\(G^2\)值接近0时意味着模型拟合程度好,而其值越大说明模型拟合度越差。如果独立模型的假设成立,则\(G^2\)统计量呈$\chi^2$ 分布。
\(G^2\)统计量拥有更加广阔的应用,不仅仅限于检验对数线性分析中的独立模型。它被广泛应用来比较一个简单模型和一个较复杂模型。\(G^2\)统计量基于两个似然值的比率:1)约束模型(这里是指独立模型)拟合数据程度的似然性,2)非约束模型(这里指饱和模型)拟合数据程度的似然性。当该比率越接近1,说明越简约而有约束的模型则更好,这是因为约束模型所代表的数据同复杂模型一致。
两个似然值得的比率不呈$\chi^2$ 分布。但是当该比率转化为自然对数形式且乘以-2后就变成了\(G^2\),它就是一个自由度为\((m – 1)×(m – 1)\)的 分布。假定\(L_c\)代表与约束模型(即独立模型)相关联的似然值,\(L_u\)代表与非约束模型(即饱和模型)的似然值,则\(G^2\)的计算形式如下:
\[G^2 = -2 \ln\left(\frac{L_c}{L_u}\right) = -2 \ln L_c + 2 \ln L_u\]
由于饱和模型完美地拟合了数据(即\(L_u\) = 1),因此\(G^2 = –2\ln L_c\)。关于\(G^2\) 统计软件结合实例的计算过程参见附录2。该值等于46,477.63,其在SPSS和Stata软件中被称为"偏差"。在R软件中,该值近似为46,480,被称为"残差"。在自由度为25时,该独立模型为真的概率是0。
$\chi^2$ 和\(G^2\)统计量是基本等价的(帕沃斯和谢 2008),它们分别是皮尔逊卡方检验和似然比检验的基础。与所有推断检验一样,有效使用检验方法需要注意它们的基本假定和条件限制。两个检验都基于迁移表中的每一跨区域迁移流量都遵循独立的泊松分布的假定(帕沃斯和谢 2008),而两个检验方法都有很大的局限性,即受到样本规模的影响。大样本量下,$\chi^2$ 值将会被夸大。因而,在大样本情况下,皮尔逊卡方检验并不适用,而\(G^2\)统计量检验和似然比检验比较合适(帕沃斯和谢 2008)。当期望频数的均值在1至10之间时,皮尔逊卡方检验更为有效。但是当大多参数期望频数小于5时,无论哪种检验方法都不会很有效(阿格莱斯迪和菲雷 2009; 帕沃斯和谢 2008)。
在大样本情况下,\(G^2\)统计量也会受到批评 (洛夫特里1 1986, 1995)。逐渐有共识指出,在评估模型拟合度时,信息测度与传统检测应该相结合。贝叶斯信息准则(Bayesian Information Criterion ,BIC)与\(G^2\)统计量紧密相关。在Stata软件中,BIC的计算公式为: \(\mathrm{BIC} = G^2 - df \cdot \ln(m \times m)\),在SPSS中,其计算公式为:
\[
BIC = -2 \ln L_c + p \ln (m \times m)
\]
其中,\(p\)为独立模型中所要估算的参数的个数,即\(2m – 1\)。贝叶斯信息数值小意味着选择独立模型比选择饱和模型更适合(帕沃斯和谢 2008)。
赤池信息量准则(Akaike’s Information Criterion,AIC)是另一种替代方法,其值越小,模型拟合效果越好, 这是因为它要判断拟合数据与期望值的接近程度(阿格莱斯迪 2007)。在SPSS和R软件中,其计算公式如下:
\[
AIC = -2(\ln L_c - p)
\]
其中,\(p\)为独立模型中所要估计的参数个数,即\(2m – 1\)。在Stata软件中,其计算公式为:
\[
AIC = \frac{-2(\ln L_c - p)}{m \times m}
\]
附录2(也可参见本手册《人口学估计方法》网站)中,SPSS和Stata软件给出了\(BIC\)和\(AIC\)结果,而R软件只给出\(AIC\)结果。如前所示,这些软件所用的公式是有所不同的。SPSS软件中\(BIC\)的值为46,934.237,而Stata软件中\(BIC\)的值是46,388.04。R软件只给出了\(AIC\)的值,为46,920,SPSS取整后的\(AIC\)为46,916.818, Stata软件中的\(AIC\)值小很多,为1,303.245。这里所有计算出的数值都偏大,这也说明独立模型在这个示例中并不适用。
准独立模型
独立模型很少能够很好地拟合迁移数据。某种程度上是因为绝大部分人口倾向于留在原地。准独立模型能将这种“不流动性”因素(贝叶斯信息 2008)从模型中剔除,这样就提高了对跨区域人口迁移的预测。准独立模型在分析国家层面的普查数据时已得到很好应用 (阿格莱斯迪 1990; 罗杰斯、利特尔和雷穆 2010; 罗杰斯、威利金斯、利特尔等 2002) ,那些普查时的居住地与参照时期起始点居住地相同的人口就是迁移表中位于对角线上的数据。
作为示例,表37.7中A部分列出了出生在美国的人口在1985至1990年间的迁移数据。表中清晰可见, 在对角线上的四个数值远大于非对角线上的数值,这意味着人们更倾向于留在原居住地而不是迁移到其他地区。
对角线上数据的集聚使得独立模型的拟合度较差,而且留在原居住地的未迁移人口所造成的巨大影响使得研究者们希望在建模中忽略这些数据。假设将迁移人口定义为那些改变了居住地的人群,那么由这类迁移人口所组成的数据矩阵被称为“迁移人口”迁移矩阵。由于准独立模型剔除了那些没有迁移或者在本区域内迁移的人口,这种矩阵在分析迁移人口结构时更加有效。表37.7B部分展示的迁移流量表格中,对角线上的数据被设为0,边际总量也经过了相应的调整。
表 37.7 出生在美国的人口在1985-1990年期间的迁移流向
| A. 全部人口迁移表 | |||||
|---|---|---|---|---|---|
| 目的地 | |||||
| 来源地 | 东北 | 中西部 | 南部 | 西部 | 合计 |
| 东北 | 40,262,319 | 336,091 | 1,645,843 | 479,819 | 42,724,072 |
| 中西部 | 351,029 | 50,677,007 | 1,692,687 | 958,696 | 53,679,419 |
| 南部 | 778,868 | 1,197,134 | 69,563,871 | 1,150,649 | 72,690,522 |
| 西部 | 348,892 | 668,979 | 1,082,104 | 37,872,893 | 39,972,868 |
| 合计 | 41,741,108 | 52,879,211 | 73,984,505 | 40,462,057 | 209,066,881 |
| B. 迁移人口迁移表 | |||||
| 目的地 | |||||
| 来源地 | 东北 | 中西部 | 南部 | 西部 | 合计 |
| 东北 | 0 | 336,091 | 1,645,843 | 479,819 | 2,461,753 |
| 中西部 | 351,029 | 0 | 1,692,687 | 958,696 | 3,002,412 |
| 南部 | 778,868 | 1,197,134 | 0 | 1,150,649 | 3,126,651 |
| 西部 | 348,892 | 668,979 | 1,082,104 | 0 | 2,099,975 |
| 合计 | 1,478,789 | 2,202,204 | 4,420,634 | 2,589,164 | 10,690,791 |
表37.8所示的是总量参照法下全部人口迁移表和迁移人口迁移表中的乘法分量数据。全部人口迁移表中乘法分量模型的参数值与独立性假设所期望的值当然不同,其对角线上的数据均远大于1.0,而非对角线上的数值均远小于1.0。比较而言,为了再现零对角线结构,迁移人口迁移表中的乘法分量在对角线上的数据被强制规定为0。这样一来,非对角线上的分量数据更趋于1.0。
准独立模型要求不同地区间的迁移人口符合独立性假设。模型的估计可使用两种不同却等价的方法。第一种方法使用表37.7中A部分的全部人口迁移表,并当迁移人口的来源地和目的地相同,即$i = j$时,将交互效应$OD_{ij}$的权重赋值为0,即$n_{ij} = 0$。这零值被称为结构零值。当迁移人口的来源地和目的地不相同时,即$i ≠ j$时,则令交互效应为1.0,这就与独立模型一样,可以通过准独立假设来预测非对角线上的迁移流量。该方法在SPSS, Stata 和 R软件中的应用参见附录3(也可参见本手册《人口学估计方法》网站)。
表 37.8 出生在美国的人口1985-1990年间的乘法分量迁移数据
| A. 全部人口迁移表 | |||||
|---|---|---|---|---|---|
| 目的地 | |||||
| 来源地 | 东北 | 中西部 | 南部 | 西部 | 合计 |
| 东北 | 4.720 | 0.031 | 0.109 | 0.058 | 0.204 |
| 中西部 | 0.033 | 3.733 | 0.089 | 0.092 | 0.257 |
| 南部 | 0.054 | 0.065 | 2.704 | 0.082 | 0.348 |
| 西部 | 0.044 | 0.066 | 0.076 | 4.896 | 0.191 |
| 合计 | 0.200 | 0.253 | 0.354 | 0.194 | 209,066,881 |
| B. 迁移人口迁移表 | |||||
| 目的地 | |||||
| 来源地 | 东北 | 中西部 | 南部 | 西部 | 合计 |
| 东北 | 0 | 0.663 | 1.617 | 0.805 | 0.230 |
| 中西部 | 0.845 | 0 | 1.363 | 1.318 | 0.281 |
| 南部 | 1.801 | 1.859 | 0 | 1.520 | 0.292 |
| 西部 | 1.201 | 1.547 | 1.246 | 0 | 0.196 |
| 合计 | 0.138 | 0.206 | 0.413 | 0.242 | 10,690,791 |
第二种方法使用的不是全部人口迁移数据表,而是表37.7B部分中的“迁移人口”迁移表。这种方法最适合用加法模型表示,\[
\ln(n_{ij}) = \lambda + \lambda_i^{O} + \lambda_j^{D} + \delta_i I
\] ,其中,$I$指示性变量,对对角线上(当$i = j$时)的数值赋值1,对非对角线上$(i ≠ j)$的数值赋值0 (阿格莱斯迪 2002)。这就需要另一个额外的参数$ \delta_i $来估算对角线上的每个数据,而对于其他那些跨区域的迁移流数据,$\delta_i I $参数为0,准独立模型就成为了独立模型。因此,这个模型就如独立模型一样,在加法模型中位于非对角线上的交叉参数被设为0(在乘法模型中被设为1)。此方法的在Stata软件中的使用请见附录3(也可参见人口学估计方法网页)。
在第一种方法中,准独立模型将$m$个$OD_{ii}$($i$从1到$m$)设定为0。在第二种方法中,使用$m$个参数$\delta_i$ ,而这些参数的指数均趋近于0。无论使用哪种形式,准独立模型中的比独立模型多$m$参数个,而同时自由度少了m。
附录3(参见本手册《人口学估计方法》网站)中给出了如何用SPSS, Stata 和 R等统计软件来估算美国出生的人口1985年至1990年之间迁移的独立模型。当用独立模型对全部人口迁移数据进行估算时,所有有关数据拟合度的指标都偏大:$ \chi^2$= 544,479,395 $(df = 9)$, $G^2$ = 461,411,576$ (df = 9)$;而Stata软件下BIC和AIC的值分别是461,000,000 和28,800,000。当使用准独立模型时,所有的这些指标的数值都变小了,$ \chi^2$ = 327,233 $(df = 5)$,$G^2$ = 330,220$(df = 5)$;而Stata软件下的BIC和AIC的值分别是330,207 和27,535。
推断检验的结果是显著的,因而必须拒绝准独立模型代表实际迁移模型的假设。准独立模型和独立模型不能用似然比检验进行比较,因为它们并不是嵌套模型。但是信息指标可以直接比较。在准独立模型下,无论是BIC还是AIC都大幅降低,因而准独立模型比独立模型更好。
另外,表37.9中比较了独立模型和准独立模型估算的期望迁移数据。将表37.9中的估计数据与表37.7中的实际观测数据进行对比就可以发现,准独立模型估算的数据与实际观测的数据之间的差别较小。表37.9还给出了另外两个概括性的统计量:$R^2$和平均绝对百分误差($MAPE$)。通过R2的比较可得,独立模型只能解释观测数据10%的变化,而准独立模型则可以解释95%的变化。另外,准独立模型的平均绝对百分误差($MAPE$=28),也比独立模型的平均百分误差($MAPE$ = 2,492)小很多。
由于准独立模型所预测的数据与实际观测数据并不是十分吻合,因此它不能被接受为“实际”模型。但是在没有观测数据时,准独立模型也不失为一种合理的预测跨区域迁移数据的方法。
表37.8 根据准独立模型和独立模型估算的出生在美国的人口在1985年至1990年间的迁移
| A. 独立模型 | ||||
|---|---|---|---|---|
| 目的地 | ||||
| 来源地 | 东北 | 中西部 | 南部 | 西部 |
| 东北 | 8,530,046 | 10,806,184 | 15,119,178 | 8,268,664 |
| 中西部 | 10,717,328 | 13,577,116 | 18,996,052 | 10,388,923 |
| 南部 | 14,512,977 | 18,385,588 | 25,723,693 | 14,068,264 |
| 西部 | 7,980,756 | 10,110,323 | 14,145,583 | 7,736,206 |
| R2= | 0.104 | MAPE= | 2492.322 | |
| B. 准独立模型 | ||||
| 目的地 | ||||
| 来源地 | 东北 | 中西部 | 南部 | 西部 |
| 东北 | 0 | 535,839 | 1,349,561 | 576,353 |
| 中西部 | 442,768 | 0 | 1,793,640 | 766,005 |
| 南部 | 720,681 | 1,159,163 | 0 | 1,246,806 |
| 西部 | 315,340 | 507,201 | 1,277,434 | 0 |
| R2= | 0.945 | MAPE= | 27.575 | |
应用六:替代法
独立模型和准独立模型的有效性可以通过对数线性模型的结果由推断检验来评估。在某些情况下,即使当检验结果不显著时,应用这两个模型也可得到有一定意义的人口迁移估算数据。替代法假定辅助数据中的跨区域关联结构能代表未知的迁移结构。这个方法就是用辅助数据的结构来推算缺失的迁移数据。
在过去的研究中,辅助信息通常是指历史上另一个时期内的迁移流量 (罗杰斯、利特尔和雷穆 2010; 罗杰斯、威利金斯、利特尔等 2002; 罗杰斯、威利金斯和雷穆 2003; 威利金斯 1983),但实际上辅助信息也可以是另一个年龄段(雷穆和罗杰斯 2007),另一个性别或者另一个种族的迁移数据。这些数据可以从其他数据中获得,比如返税数据或者机动车登记数据。
用$n_{ij}^{*}$ 表示辅助迁移数据,则对数线性替代模型为,\( \ln(n_{ij}^{*}) = \lambda + \lambda_i^{O} + \lambda_j^{D} + \ln(n_{ij}) \)。该模型可以估算与辅助数据拥有类似迁移结构的迁移流量,\tilde{n}_{ij} ;与此同时,该估计值是由研究者预先给定的边际总量调整过的。从这个角度来看,这种方法类似于独立模型和准独立模型,因为替代法给出的期望的迁移流量分布的边际行与列的合计与预先假定的估计值一致。
以表37.1中1976年荷兰迁移流量数据为例来说明替代法的使用。假定我们希望保留原表中行合计和列合计的数值不变,但是与此同时使用替代法, 将1976年的迁移交互影响的观测值用1973年的观测值替换。这一改变将对原有对数线性参数有何变化呢?表37.10中A部分给出的是替代法所估算的迁移流量矩阵,B部分给出的是使用总量参照模型得到的乘法分量。需要注意的是,表37.10 B部分中估算的$T$, $O_i$ 和$D_j$与表37.3 B部分中的1976年的观测数值是一致的。然而,另一个参数(即交互效应参数$OD_{ij}$)反映了表37.3 A部分中1973年的观测数据的迁移结构,以及1976年数据中的行合计和列合计的联合影响。因此,替代法将辅助数据的结构(在本例中为1973年数据)应用到1976年的迁移数据但同时又保留了1976年观测到的迁移总量。
表37.9 基于1976年边际总量和1973年流量用替代法预测的1976年荷兰跨区域迁移流量
| 部分 A. 替代法的估计值 | |||||||
|---|---|---|---|---|---|---|---|
| 目的地 | |||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 |
| 1 | 12,344 | 13,769 | 6,890 | 12,199 | 10,361 | 11,518 | 67,081 |
| 2 | 13,329 | 34,695 | 12,195 | 17,445 | 22,522 | 24,353 | 124,539 |
| 3 | 9,728 | 15,711 | 28,330 | 8,883 | 15,881 | 30,553 | 109,087 |
| 4 | 11,281 | 16,107 | 7,011 | 11,216 | 11,764 | 13,187 | 70,566 |
| 5 | 12,609 | 25,486 | 16,570 | 12,828 | 17,770 | 21,760 | 107,023 |
| 6 | 18,116 | 35,786 | 53,984 | 22,110 | 27,058 | 22,535 | 179,589 |
| 合计 | 77,408 | 141,553 | 124,980 | 84,682 | 105,356 | 123,906 | 657,885 |
| R2= | 0.966 | MAPE= | 8.364 | ||||
| 部分 B. 总量参照法估算的乘法分量 | |||||||
| 目的地 | |||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 |
| 1 | 1.564 | 0.954 | 0.541 | 1.413 | 0.964 | 0.912 | 0.102 |
| 2 | 0.910 | 1.295 | 0.515 | 1.088 | 1.129 | 1.038 | 0.189 |
| 3 | 0.758 | 0.669 | 1.367 | 0.633 | 0.909 | 1.487 | 0.166 |
| 4 | 1.359 | 1.061 | 0.523 | 1.235 | 1.041 | 0.992 | 0.107 |
| 5 | 1.001 | 1.107 | 0.815 | 0.931 | 1.037 | 1.080 | 0.163 |
| 6 | 0.857 | 0.926 | 1.582 | 0.956 | 0.941 | 0.666 | 0.273 |
| 合计 | 0.118 | 0.215 | 0.19 | 0.129 | 0.16 | 0.188 | 657,885 |
表37.10 A部分中的估算是基于SPSS, Stata, 以及R统计软件程序用替代法得到的结果。执行命令详见附录4(参见本手册《人口学估计方法》网站)。关于替代法的其他应用请参见附带的Excel电子工作簿中的Method of offsets工作表。
由于1976迁移数据是直接观测得到的,有几种方法可用来检验替代法估算数据时有效性。一种简单的方法就是直接目测如表37.4所示的乘法分量。另外一种方法是利用估计对数线性模型过程中的推断检验和信息指标。这些方法所检验的假设是,1973年至1976年间的迁移流量的结构,即交互效应参数,没有发生变化。以表37.10中数据为例,其相应的$G^2$统计量为5,914(自由度=25)。因此要拒绝辅助迁移数据与被观测数据具有一样迁移结构的假设。本文介绍的最后一种检验方法是通过$R^2$和$MAPE$来判断推测数据和观测数据之间的拟合度。表37.10 A部分中的$R^2$和平均百分误差分别为0.97和8.36。这些结果与表37.4中的比率都说明,替代法对1976年迁移流量的一系列估计值可能是恰当的。
表37.10 缺乏观测迁移流量的情况下替代法中的输入值
| 部分 A. 预估的边际总量,荷兰, 1976年 | |||||||
|---|---|---|---|---|---|---|---|
| 目的地 | |||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 |
| 1 | 67,081 | ||||||
| 2 | 124,539 | ||||||
| 3 | 109,087 | ||||||
| 4 | 70,566 | ||||||
| 5 | 107,023 | ||||||
| 6 | 179,589 | ||||||
| 合计 | 77,408 | 141,553 | 124,980 | 84,682 | 105,356 | 123,906 | 657,885 |
| 部分B. 基于独立模型的预估迁移流量分布 | |||||||
| 目的地 | |||||||
| 来源地 | 1 | 2 | 3 | 4 | 5 | 6 | 合计 |
| 1 | 7,893 | 14,433 | 12,744 | 8,635 | 10,743 | 12,634 | 67,081 |
| 2 | 14,654 | 26,796 | 23,659 | 16,030 | 19,944 | 23,456 | 124,539 |
| 3 | 12,835 | 23,472 | 20,724 | 14,042 | 17,470 | 20,545 | 109,087 |
| 4 | 8,303 | 15,183 | 13,406 | 9,083 | 11,301 | 13,290 | 70,566 |
| 5 | 12,593 | 23,027 | 20,331 | 13,776 | 17,139 | 20,157 | 107,023 |
| 6 | 21,131 | 38,641 | 34,117 | 23,116 | 28,760 | 33,824 | 179,589 |
| 合计 | 77,408 | 141,553 | 124,980 | 84,682 | 105,356 | 123,906 | 657,885 |
拟合度的重要程度在于替代法使用的观测数据的质量。如果这种方法要在实际分析中可行,那么它也就必须能够用来分析那些没有被直接观测到的跨地区迁移数据。在缺乏迁移数据时,该方法仍需要求对边际总量进行预估。如果要像附录4所示那样运用该方法(参见本手册《人口学估计方法》网站),那么跨区域迁移流量的预估值就是必须的。因此,需要将行和列合计的预估值分配到矩阵表内部的每一个单元格,使每一个单元格上的数据相加可以分别得到行和列的合计。表37.11 的A部分就提供了一个典型例子,尽管它仍使用的是来自荷兰1976年观测数据的迁移边际总量。一个最简单的解决方法就是根据独立模型,即 \( \hat{n}_{ij} = (T)(O_i)(D_j) \),将数据分布到单元格中。表37.11 B部分所示的就是这些流量的预估值。
只要跨区域迁移流量加总后与各行和列合计相符,那么用不同方式得出的分布数据并不会影响预测结果。这是因为替代法利用辅助数据得到的最终的推测值是通过按比例迭代拟合法得出的(阿格莱斯迪 1990; 德明和史蒂芬 1940)。换言之,输入到对数线性替代模型中的1976年荷兰迁移流量的预估值,可以是表37.1 中B部分的数据,也可以是表37.11中B部分的数据。两组中的任何一组数据都将得出表37.10中A 部分的预测数。
另一个方面,需要注意的是,替代法中的推断检验统计量和信息指标,必须用预估值来作出解释。例如,假设预估值来自表37.11中的B部分,那么相关的 $\chi^2$和 $G^2$的统计量就应该检验这些预测数据的分布是否符合独立模型。
简单地加以修改替代法,即可将其应用于预测“迁移人口”的迁移数据。SPSS,Stata以及R软件的运行命令也只需要稍作修改即可, 这些可参考附录4中的论述(参见本手册《人口学估计方法》网站)。详细的示例子见随附工作簿中的Method of offsets, migrants only工作表。该示例使用1985年至1990年美国的迁移观测数据,来回溯估算罗杰斯、威利金斯和利特尔等(2002)报告的1975年至1980年美国的迁移流量。
参考文献
Agresti A. 1990. Categorical Data Analysis. New York: Wiley.
Agresti A. 2002. Categorical Data Analysis. New York: Wiley-Interscience.
Agresti A. 2007. An Introduction to Categorical Data Analysis. Hoboken, NJ: Wiley-Interscience.
Agresti A and B Finlay. 2009. Statistical Methods for the Social Sciences. Upper Saddle River, NJ: Pearson Prentice Hall.
Alonso W. 1986. Systemic and log-linear models: From here to there, then to now, and this to that. Discussion paper 86-10. Cambridge, MA: Harvard University, Center for Population Studies.
Birch MW. 1963. "Maximum likelihood in three-way contingency tables", Journal of the Royal Statistical Society Series B-Statistical Methodology 25(1):220-233.
Deming WE and FF Stephan. 1940. "On a least squares adjustment of a sampled frequency table when the expected marginal totals are known", Annals of Mathematical Statistics 11(4):427-444. doi: https://dx.doi.org/10.1214/aoms/1177731829
Knoke D and PJ Burke. 1980. Log-linear Models. Beverly Hills, CA: Sage Publications.
Mueser P. 1989. "The spatial structure of migration: An analysis of flows between states in the USA over three decades", Regional Studies 23(3):185-200. doi: https://dx.doi.org/10.1080/00343408912331345412
Nair PS. 1985. "Estimation of period-specific gross migration flows from limited data: Bi-proportional adjustment approach", Demography 22(1):133-142. doi: https://dx.doi.org/10.2307/2060992
Powers DA and Y Xie. 2008. Statistical Methods for Categorical Data Analysis. Bingley, UK: Emerald.
Raftery AE. 1986. "Choosing models for cross-classifications", American Sociological Review 51(1):145-146. doi: https://dx.doi.org/10.2307/2095483
Raftery AE. 1995. "Bayesian model selection in social research", Sociological Methodology 25(1):111-163. doi: https://dx.doi.org/10.2307/271063
Raymer J. 2007. "The estimation of international migration flows: A general technique focused on the origin-destination association structure", Environment and Planning A 39(4):985-995. doi: https://dx.doi.org/10.1068/a38264
Raymer J, A Bonaguidi and A Valentini. 2006. "Describing and projecting the age and spatial structures of interregional migration in Italy", Population, Space and Place 12(5):371-388. doi: https://dx.doi.org/10.1002/psp.414
Raymer J and A Rogers. 2007. "Using age and spacial flow structures in the indirect estimation of migration streams", Demography 44(2):199–223. doi: https://dx.doi.org/10.1353/dem.2007.0016
Rees P and FJ Willekens. 1986. "Data and accounts," in Rogers, A and FJ Willekens (eds). Migration and Settlement: A Multiregional Comparative Study. Dordrecht: D. Reidel, pp. 19-58.
Rogers A, JS Little and J Raymer. 2010. The Indirect Estimation of Migration: Methods for Dealing with Irregular, Inadequate, and Missing Data. Dordrecht: Springer.
Rogers A, F Willekens, JS Little and J Raymer. 2002. "Describing migration spatial stucture", Papers in Regional Science 81(1):29-48.
Rogers A, FJ Willekens and J Raymer. 2003. "Imposing age and spatial structures on inadequate migration-flow datasets", The Professional Geographer 55(1):56-69.
Snickars F and JW Weibull. 1977. "A minimum information principle: Theory and practice", Regional Science and Urban Economics 7(1-2):137-168. doi: https://dx.doi.org/10.1016/0166-0462(77)90021-7
Willekens F. 1983. "Log-linear modeling of spatial interaction", Papers of the Regional Science Association 52:187-205. doi: https://dx.doi.org/10.1007/BF01944102
书籍遍历链接: 迁移流的对数线性模型
Suggested citation
Little JS and Raymer J. 2013. Log-linear models of migration flows. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/log-linear-models-migration-flows.