复合指数模型迁移表

期望得到的数据:人口迁移数据

方法:人口迁移

方法描述

本章描述用复合指数模型迁移表来拟合至观测的迁移数据。

在过去三十年里,由罗杰斯和卡斯特罗(1981)创立的迁移表在表现迁移的典型年龄模式方面相当成功。本质上,不论是同时考察地区间和国家间的迁移,还是单独考察某特定地区的人口迁出,都会观测到相同的迁移年龄模式。复合指数函数旨在通过一个含有7个、9个、11个 或13个参数的指数曲线的递增序列来反映迁移和年龄之间的依存关系。参数数量的确定取决于迁移方式的复杂性和维持增加参数的数据的能力和可靠性。

在拟合按单岁组迁移率的迁移表时,罗杰斯-卡斯特罗模型提供了一个迁移表的最优拟合的渐进表达式,它可以用来平滑观测迁移率数据序列,从而直接增进人们对迁移动态的理解。其结果还有其他应用,比如创建迁移表来进行多地区人口预测。理想情况下,研究人员应该获得单年度单岁的人口迁移数估计值,从而可以使用罗杰斯-卡斯特罗模型进行拟合。但是,大多数发展中国家通常由于数据质量低而无法进行如此精细程度的计算,而只有五岁组的数据。这样的话,在用罗杰斯-卡斯特罗模型进行拟合之前,这些数据需要通过本章描述的一个方法通过内插值来获得单岁的迁移人口数据。

数据要求和假定

所需数据列表

• 年龄从0岁至65岁以上分单岁组的(如果没有单岁数据,则可以使用分五岁组数据)的迁移倾向率或迁移率。

理想情况下,应该使用分单岁组率。在只有五岁组数据情况下,必须在拟合复合指数曲线之前,通过内插从五岁组估计值推导出单岁的估计值。年龄上限的选择从某种程度上来说是主观的,但在拟合模型迁移表的过程中,该数据的上限至少应该要高于峰值退休年龄。

重要假定

最近一次人口普查准确登记了分地区和出生地的人口数据,且确认了之前某时点(如上次人口普查)以来在地区间发生了迁移的人口。

准备工作和初步检查

应用此方法之前,必须至少从以下几个方面对数据质量进行考察:

• 人口的年龄结构(分地区);

• 人口普查登记(分地区)的相对完整率。

注意事项和提示

应用此方法考察净迁移数据时必须谨慎,因为分年龄迁移率的复合指数分布是对总迁移量(即总迁入或总迁出的人口数量)建模,而不一定对净迁移量建模,除非在所有年龄上,迁入和迁出中的其中一个在数量上远大于另一个。

复合指数模型迁移表概述

复合指数函数由罗杰斯和卡斯特罗(1981)创建,旨在反映迁移与年龄的依存关系。通常,一岁时的迁移水平较高,而至青少年早期下降至低点,随后急剧增高,在年轻成年人时期达到顶点。此后,除了在退休年龄可能会有所攀升外,迁移水平便一直下降。在某些情况下,迁移水平可能在老年时期呈现上升趋势(罗杰斯和卡斯特罗 1981; 罗杰斯和沃特金斯1987)。

在过去三十年里,该迁移表(即罗杰斯-卡斯特罗模型迁移表)已被证实在表现迁移年龄模式方面取得了显著成就(利特尔和罗杰斯 2007; 雷穆和罗杰斯 2008; 罗杰斯和卡斯特罗 1981,1986; 罗杰斯和利特尔 1994; 罗杰斯、利特尔和雷穆 2010; 罗杰斯和雷穆 1999; 罗杰斯和沃特金斯 1987)。在不同地区和分种族、性别的各种人口群体中都观测到了这些相同的迁移年龄模式(罗杰斯和卡斯特罗 1981)。不论是同时考察国家内地区间的迁移,还是单独考察从某地区的人口迁出,也都出现了这些相同的迁移年龄模式。定向迁移(即从地区i至地区j)也呈现同样的模式。比如,罗杰斯-卡斯特罗模型迁移表已经在以下情况下成功地拟合了迁移人口数据,包括英国不同地区之间的人口迁移(贝茨和布莱肯 1982, 1987),加拿大的城市和非城市地区之间的人口迁移(里奥和奈各纳 1985),日本、韩国和泰国的地区人口迁移(河边 1990),以及南非和波兰的人口迁移(赫夫梅尔 1988; 波特瑞科夫斯卡 1988)。

在拟合单岁迁移率的迁移表时,罗杰斯-卡斯特罗模型提供了一个对迁移表的最优的渐进的表达,根据迁移表的复杂性及数据的丰富程度,分别利用7个、9个、11个 或13个参数来建构迁移表。此外,因为观测的年龄别迁移率不可靠而出现的无规律的波动,也能得到平滑。

罗杰斯-卡斯特罗模型迁移表已应用于加拿大人口预测(乔治 1994)。当迁移数据不足或者不可用时,该模型仍能应用于不同时间段、地区及人口群体的分析(罗杰斯、利特尔和雷穆 2010)。

完整的模型迁移表有13个参数,这是该模型最完整和最复杂的复合指数形式。假设M(x)被定义为单岁年龄x岁的迁移率,则完整的模型如下:

\[ \begin{aligned} M(x)={}& a_1\exp(-\alpha_1 x) \\ &+ a_2\exp\{-\alpha_2(x-\mu_2)-\exp[-\lambda_2(x-\mu_2)]\} \\ &+ a_3\exp\{-\alpha_3(x-\mu_3)-\exp[-\lambda_3(x-\mu_3)]\} \\ &+ a_4\exp(\lambda_4 x)+c \end{aligned} \]

这个公式包含五个累加部分。第一个\(a_1\exp(-\alpha_1x)\)为负单指数曲线,代表参加工作前的迁移模式。第二个\(a_2\exp\{-\alpha_2(x-\mu_2)-\exp[-\lambda_2(x-\mu_2)]\}\)为左偏单峰曲线,描述工作时期人口的迁移模式。第三个\(a_3\exp\{-\alpha_3(x-\mu_3)-\exp[-\lambda_3(x-\mu_3)]\}\)是一个几乎呈正态分布的曲线,代表退休后人口的迁移模式,即退休后迁移人口急剧增加随后又下降。与第三个部分相关,第四个部分代表退休后的正单指数曲线\(a_4\exp(\lambda_4x)\),这个部分反映了(有时候)观测到的退休后迁移人口的广义增长。例如,美国老年人从东北部迁移到东南部和西南部的“阳光地带”州。第五个部分是一个常量c,代表“背景”人口迁移。

之前的研究(罗杰斯, 利特尔和雷穆 2010)将复合指数迁移表分为四个类别。其中只有一类容纳了全部13个参数及五个累加部分,而显示了退休期峰值和退休后的增长期。该类别在老年人口迁移研究中被观测到了(罗杰斯和沃特金斯 1987),示于图36.1的右下图中。

罗杰斯-卡斯特罗模型迁移表的四个主要类别及其累加部分
图36.1 罗杰斯-卡斯特罗模型迁移表的四个主要类别及其累加部分

来源:雷穆和罗杰斯 (2008)。

注:图中的图例按顺序分别为(1)参加工作前迁移表;(2)工作时期迁移表;(3)退休后的迁移人口的涨落;(4)退休后迁移人口的广义增长; Total-全部年龄段。

而其他三种类别都是完整模型的简约形式,即这三种类别都至少省略了一个累加部分。比如,罗杰斯、利特尔和雷穆 (2010)确定的最常见的迁移表包括了7个参数和前两个累加部分及常量,被称为标准迁移表,示于图36.1的左上图。

有几个迁移表在标准迁移表的基础上加上了一个退休期迁移高峰(罗杰斯和卡斯特 1981,1986),从而成为了11-参数的模型,包括了第一、二、三和第五个累加部分,示于图36.1的左下图。在具有明显劳动力迁移的人口中,尤其是在发展中国家中,第三个累加部分可能是一个低谷而不是高峰,这是因为迁移者会在退休后返乡。

在标准表中,当参加工作前期和工作时期的迁移模式明显时,应采用9-参数模型。如图36.1的右上图所示,在这个模型下,退休期有一段攀升的曲线显示了迁移数的增加。罗杰斯和卡斯特罗(1981)在1974年的荷兰多个地区都发现了这种类别的存在。

以上讨论充分显示,所有参数都可得到解释,并且可以用来描述模型迁移表的特征。

对于他们最初的11-参数复合指数迁移模型中,罗杰斯和卡斯特罗(1981)使用了1974年斯德哥尔摩男性人口的迁出率数据。图36.2显示了原始数据(锯齿状线条)以及用11-参数迁移表拟合这些原始数据的平滑结果。

11个参数中的5个(\(\alpha_1\), \(\alpha_2\), \(\alpha_3\), λ2 和λ3)给出了模型迁移表不同部分的变化率,而水平参数(a1, a2, a3 和 c)对应了模型迁移表的曲线的高度,a1对应一岁时的高峰,a2对应工作时期的高峰,a3对应退休期的高峰,c则代表不分年龄段的一般迁移率。μ2和μ3分别代表工作期高峰和退休期高峰的年龄。

用罗杰斯-卡斯特罗11-参数模型迁移表拟合的1974年斯德哥尔摩地区男性人口的迁出率
图36.2 用罗杰斯-卡斯特罗11-参数模型迁移表拟合的1974年斯德哥尔摩地区男性人口的迁出率

来源:罗杰斯和卡斯特罗(1981)。此图使用经国际应用系统分析研究所(IIASA)授权

一些指标可用来描述观测的迁移表或者模型迁移表。例如,xl代表参加工作前迁移处于低谷的年龄,xh代表工作时期迁移处于高峰的年龄,xr代表处于退休期迁移处于高峰的年龄。xl与xh之间的差异被称为“劳动力让位期”,X; xl到xh之间的迁移率增长被称为“跳跃”增长B;“父母让位期”,A,用来描述父母迁移及对应的子女迁移之间的平均年龄差。总“迁移生产”率(GMR)为所有年龄段的迁移率之和(即曲线以下的区域),被用来测量一个地区的总的迁出水平,或者地区间(即从地区i迁移至地区j)总的定向迁移水平 (罗杰斯和卡斯特罗 1981)。

方法的应用

该方法的应用过程分为以下几个步骤:

步骤 1:为观测到的迁移率准备一个迁移表

估算模型迁移表的步骤 1是准备数据。选择迁移的测量方式取决于数据来源(登记、人口普查或调查)以及研究目的。比如,在迁移模式的比较研究中,只要在不同背景下建构相同的测量,则任何测量都可用来进行比较。另一方面,如果模型迁移表要用于单岁人口的预测,拟合的迁移表应该代表单年和单岁的迁移率。但是,如果没有单年单岁的数据,而无法获得分年龄相对平滑的迁移曲线时,则首先必须将数据转换为单年单岁的数据。以下将讨论几种常见情况。

A) 人口普查数据、年度迁移率,五年迁移间隔

如果有普查中五年迁移间隔期间存活的迁移人口数及其最近一次迁移的年份,则可通过多灵顿和莫尔特里(2009)提出的逆推预测方法得出单年单岁的迁移率。该方法在概念上简单易懂,但其算法却相当复杂。它通过将一般人口死亡率应用于迁移人口来抵消死亡率的影响,同时通过用最近时期的年度迁移率来估算普查前一年分地区人口数,来抵消地区间迁移的影响,并据此计算人口普查前两年的迁移率和人口数量等。该方法额外需要普查时点年龄为0‑4岁人口的出生地信息,以及分地区的单年单岁人口数。根据此方法得出的迁移表再通过罗杰斯-卡斯特罗模型迁移表进行拟合与平滑,并可以用于单岁组的人口预测。

B) 从五岁组迁移倾向率通过内插法计算单岁组的迁移倾向率

在不考虑迁移时间间隔情况下,不论采用人口普查数据或是人口登记数据,五岁组的迁移倾向率比单岁组更为可靠(罗杰斯、利特尔和雷穆 2010)。特别地,按单岁登记的迁移人口数量通常只能从数据样本获得,因为国家人口部门通常只按五岁组发布跨地区的迁移人口数据。

如果最初的迁移比例是按五岁组划分的,则在应用复合指数模型时需要将五岁组数据转换成单岁数据。三次样条内插法(Cubic-spline interpolation)(麦克奈尔、特拉塞尔和特纳 1977)可导出所有整数年龄的平滑迁移表。罗杰斯和卡斯特罗 (1981)曾使用瑞典的人口迁移数据(该数据同时具备单岁和五岁组两种格式)来验证三次样条内插法的准确性,并获得了较为满意的结果。

为获取平滑的单岁迁移数据,最初的五岁组的迁移比例需要被近似分配到五岁间隔的中间年龄上,比如2岁, 7岁, 12岁, 15岁, …,72岁, 77岁等(如果计算迁移率而不是迁移概率,则采用2.5岁, 7.5岁, 12.5岁, …,等)。根据这组数据点,通过三次样条内插法建立处理预先设定的控制点(节点)序列的三次多项式,从而获取连续年龄上的迁出倾向率。微软Excel里的商业或免费插件,比如XlXtrFun,也可以用来实施三次样条内插法。

另外一个方法是采用比尔斯六参数内插法(Beers’ 6-parameter interpolation procedure)(比尔斯 1945),在最小和最大年龄组之间内插计算迁移率,并外推0岁和1岁的值(如果计算迁移率而不是迁移倾向率,则外推为0.5和1.5岁)。在外推最小年龄上的值时,需要假定1岁和2岁之间的迁移概率差别与2岁和3岁之间的差别以及3岁和4岁之间的差别是一致的。

应用以上两种方法的任何一种,都需要获得从0-4岁到至少65-69岁的分五岁组的迁移率。

步骤 2:确定复合指数模型的形式

一旦观测值的迁移表准备就绪,接下来就要选择复合指数模型的形式。之前,对复合指数模型迁移表的概述介绍了7-参数、9-参数、11-参数或13-参数模型的特点。在选择模型形式时,必须通过目测检验迁移表,力图保证反映人口迁移的真实情况。有时候,即使在建立迁移表之后,如何最好地拟合退休期和老年期的迁移人口也不十分明确。比如,标准的7-参数模型或9-参数模型(在老年期人口迁移都有增长)可能都显得较为适合。在这一情况下,如果要选择9-参数模型,则必须持有老年期人口迁移增长的理论预期。此外,若拟合优度检验显示9-参数模型劣于7-参数模型,则必须舍弃此模型,因为它不够简约。在决定选择哪种模型时,建议比较简单模型和复杂模型的拟合优度(比如比较7-参数和11-参数模型的拟合优度)。一般原则是,如果要采用一个更为复杂的模型,就必须有可靠的数据以及拟合度有显著的提高。

对大部分发展中国家来说,尤其对那些“退休”并不集中于60‑65岁之间而且老年期存在年龄高报现象的国家,其数据很可能不够可靠而无法拟合多于7-参数的模型。

步骤 3:利用规划求解程序拟合模型

考虑到复合指数模型的参数数目(从7个到13个),一开始就使用试错法来决定最优拟合效果是不可取的,而应该采用分析性算法。下面的一个算法可以使用微软Excel的规划求解(Solver)来实现。规划求解功能可能没有在微软Excel的标准安装模式下被常规安装。若需要使用,则需要通过点击文件→选项→加载项→管理Excel加载项→确定…” 然后勾选“规划求解加载项”的复选框。

规划求解的各项功能、使用条件和限制的设置都已列在本章随附的工作簿中。在现有工作表上运行规划求解,需点击“ 数据→规划求解→求解”。

模型通过随附工作簿进行拟合,并允许使用者设定观测值与拟合值的差值平方和或卡方统计量的最小化“目标”。

默认的规划求解使用所有参数来拟合。如果想只使用部分参数来拟合曲线,则必须在“可变单元格”窗口中输入这些参数,并将其他参数设置为恰当的常量(常量可能为零或不为零,这取决于拟合程序的要求)。以下将举例说明在何种情况下需要进行这种有限制的优化。

差值平方和计算如下:

\[\frac{1}{n}\sum_{i=1}^{n}(O_i-F_i)^2\]

其中,Oi代表年龄在i岁时的观测值,Fi代表年龄在i岁时的拟合值,n代表年龄组数。

卡方统计量的计算如下:

\[\frac{1}{n}\sum_{i=1}^{n}\frac{(O_i-F_i)^2}{F_i}\]

卡方统计量对迁移率低的年龄段的拟合失误(导致成比例增大的误差)反应更为敏感。因此,当拟合“退休高峰”(第三个部分)时,卡方统计量是衡量拟合优度更好的标准。

为拟合程序选择初始值

选择初始参数值是非线性参数计算的主要难点。理想状态下,一套初始值会经过一个迭代计算过程,得出一套“优化”值。然而,该优化值仅仅产生局部优化值,而非总体优化值。对初始值的推测越准确,拟合优度就越高,因此会得出完全不同的最终值。而较差的初始值甚至会阻碍一个局部优化值的产生。

因此,要保证拟合过程结果是总体优化值,最有效的办法是选择“类似”曲线中的现有的参数值。这样的话,分析人员可以从工作簿中已有的参数值入手。在以下例子中的曲线拟合中用到了这些参数值。

对于11-参数和13-参数模型,取得优化值的难度更大。如果要拟合这类参数很多的模型,可以首先选择一个标准的7-参数模型来拟合数据(这样可以确保拟合迁移表的峰值以及工作期间的峰值)。然后将获得的七个参数的估计值固定(即从此以后视这些参数为常量),再计算剩下的参数。另外一个有效的方法是首先执行一个不需要依赖迭代计算的线性估算方法。该方法首先由罗杰斯和卡斯特罗 (1981)提出,随后被包括在罗杰斯、卡斯特罗和李 (2005)归纳的几种替代方法中。

确定优化值解决方案的另一个难点在于为迭代算法选择合适的终止标准。当迭代过程得到一个解时,测量观测值与迭代值差异的卡方统计量会降低。当卡方统计值在两次迭代计算间的差异很小时,则说明找到了一个可接受的优化值。这一微小差异被称为“允许值”,可由使用者设置。为获得真实的最小卡方值,使用者倾向将该差异设置为一个极小值,比如非常接近零。但是如此做的风险在于,即使已获得一个解,如此低的“允许值”也是很难实现的。普莱斯、弗兰纳里、托克尔斯基等人(1986)提出允许值设置为0.001较为合理。如果计算软件无法产生数据聚合的解,则可适当降低聚合标准,即提高允许值或改用新的初始值。

有一种选择初始值的试错法利用了随附Excel工作簿中的图(见网站)。通过在其中一个工作表中替换观测数据的迁移表,可选择每个参数的初始“猜测值”,并输入到每个参数最终值的表格中。然后通过目测检查拟合度,找出不合理的参数值,再使用新的参数值进行目测检查。按这种方法一直重复下去,直到拟合迁移表合理地接近观测的迁移表。至此,可知找到了合适的初始值,然后可以进一步使用非线性最小二乘法的估计程序。

步骤 4:评估模型拟合程度

我们通过平均绝对百分比误差(MAPE)统计来评估模型拟合:

\[MAPE=\frac{100}{n}\sum_{i=1}^{n}\left|\frac{O_i-F_i}{O_i}\right|\]

MAPE经常会夸大误差,尤其是当观测的迁移表有许多值接近零时(莫里森、布莱恩和斯旺森 2004)。

除了平均绝对百分比误差, 我们还计算了R2,即Oi和Fi相关系数的平方。一般来说,当平均绝对百分比误差小于等于15%且R2高于90%时,拟合结果就被认为是合理的。

此外,由于该方法假定罗杰斯-卡斯特罗模型迁移表代表了迁移表的真实形式,因此估算出的模型迁移表应该可以代表观测数据的分布。

步骤 5:解释拟合结果

如果目标是描述迁移模式,而且复合指数模型已经成功地拟合了数据,那么任何概括性指标(如GMR, X, B和A)以及参数值都可以用来描述迁移表。本章的概述部分对概括性指标和参数解释已有说明。

示例

在以下示例中,复合指数模型迁移表被应用于一系列不同来源、不同质量和不同复杂程度的数据。所有示例都已包含在人口学估计方法网站的工作簿中。

由于对成年人的条件存活概率拟合模型生命表需要迭代计算,文本中并没提供示例的详细计算过程。读者可参看上一节关于如何使用微软Excel的规划求解来确认最优拟合的相关介绍。随附的工作簿是针对规划求解设计的。通过规划求解可获得本章演示的结果。

人口普查数据,单年迁移间隔

图36.3的迁移表为基于普查数据按单年迁移间隔测量的单岁迁移倾向率。数据来自于2005年美国社区调查(ACS),该调查是美国人口普查局组织的年度全国性调查。可是即使对加利福尼亚州这样一个人口众多的州,单年单岁的迁移倾向率也是非常不稳定的。在这里,MAPE为17%,R2为0.92。

在使用单年单岁的迁移倾向率时,必须谨慎。就每个单岁而言,迁移历险的人口数以及实际迁移的人口数可能都不大,从而导致迁移倾向率的波动性和不稳定性。因此估算五岁组的迁移倾向率可能更为可取,这已被证明比单岁迁移倾向率的估算更加可靠(罗杰斯、利特尔和雷穆 2010)。根据上述方法应用章节所阐述的,单岁的迁移倾向率可以使用三次样条内插法或比尔斯6-参数内插法来获得。

基于11-参数模型迁移表拟合的2004-2005年加利福尼亚单年间隔的人口迁出倾向率,2005年美国社区调查
图36.3 基于11-参数模型迁移表拟合的2004-2005年加利福尼亚单年间隔的人口迁出倾向率,2005年美国社区调查

人口普查数据,五年迁移间隔

图36.4展示了使用美国新罕布什尔州人口普查数据的例子。美国人口普查局提供的1%微观数据是来自人口普查数据的小样本,而新罕布什尔州是美国人口最稀少的州之一。单岁的迁移倾向率波动剧烈,很不稳定,但是模型迁移表能提供一个反映真实迁移的较为平滑的估计值。这里,平均绝对百分比误差为52%,R2 为0.68。

基于7-参数模型迁移表拟合的1995-2000年新罕布什尔州五年间隔的人口迁出倾向率,美国2000年人口普查1%微观数据
图 36.4 基于7-参数模型迁移表拟合的1995-2000年新罕布什尔州五年间隔的人口迁出倾向率,美国2000年人口普查1%微观数据

图36.5显示了三次样条内插法的应用,使用了从新罕布什尔州1%微观数据获得的五岁组的人口迁移倾向率。对五岁组迁移率进行内插获得的迁移表比图36.4中的单岁观测值更平滑可靠,因此拟合后的复合指数曲线提供了一组更好的估计值。平均绝对百分比误差从单岁时的52%减少至按五岁组内插后的15%,而R2从0.68增加至0.94。

图36.5中的新罕布什尔州的迁移表的水平高于图36.4中的加州迁移表水平,其原因有多种。首先,加州的迁移表反映的是单年间隔期间的人口迁移,而新罕布什尔州迁移表则是五年间隔期间的人口迁移。此外,新罕布什尔州的面积远远小于加州,而一般来说,面积更小的地区的迁移相对流量会更强些。

基于五参数模型迁移表拟合的1995-2000年新罕布什尔州五年间隔的人口迁出倾向率,2000年人口普查1%微观数据 (迁移率基于五岁年龄组,并使用内插值)
图36.5 基于五参数模型迁移表拟合的1995-2000年新罕布什尔州五年间隔的人口迁出倾向率,2000年人口普查1%微观数据 (迁移率基于五岁年龄组,并使用内插值)

诊断、分析和解释

核查和验证

通过目测来检验分年龄的迁移率“形态”是否符合罗杰斯-卡斯特罗模型,这点非常重要。如果两者不一致,则说明这些模型的拟合度不佳。同样地,还需要检查是否有极端数据点,尤其在老年期。这些数据点会干扰参数选择甚至干扰对参数数目的选择。如果观测的估计值非常凌乱无章,则最好将数据按五岁分组,然后通过比尔斯六参数内插法或三次样条内插法来拟合曲线,从而得到平滑估计。

方法应用中的问题

本章开头的概述部分已介绍了复合指数模型的构成,此处不再赘述。在本节中,我们将仔细讨论在实际操作中应用此方法时应考虑的各个方面的问题。

数据的准备

复合指数模型被应用于估算从0岁开始的单岁迁移率的迁移表。该迁移表通常将年龄范围延至65岁或以上,以全面考察老年人的迁移模式。年龄别迁移表可能反映的是定向迁移(即从地区i至地区j)或全部人口迁出(即从地区i至任何其他地区),或所有地区间没有特定迁出地或目的地的迁移。通常,迁移数据来自于国家的人口普查(或在发达国家中,来自人口登记)。复合指数模型可应用于这些数据来源推导出的多种单岁迁移倾向率的指标。

当迁移率来自于国家人口登记制度时,在间隔期开始时年龄为x岁的人口迁移率是这段时期的迁移人口数除以平均迁移历险的人年数得到的比率。一个人在间隔期间可以有多次迁移经历。这些迁移率是发生-风险率,尽管该率的分子中并不包括非幸存者的迁移 (罗杰斯和卡斯特罗 1981)。

图36.2中观测到的迁移表来自于某一年份瑞典全国人口登记中男性从斯德哥尔摩外迁的数据。作为对照,图36.6展示了瑞典在某一五年间隔期内观测到的不同地区间男性人口的迁移数据和估算的模型迁移表。正如所料,图36.6显示的迁移水平比斯德哥尔摩单独的水平高得多,这是因为所有地区在一起有更为频繁的迁移活动。同样地,按五年间隔计算的迁移水平也应该比按单年间隔计算的迁移水平高。瑞斯(1977)发现按五年间隔计算的迁移率一般会低于按单年间隔计算的迁移率的五倍(大概在三到五倍之间)。观测的迁移表数据也会更平滑,并和图36.6中的模型迁移表更相似,这说明更长时间间隔上计算出的单岁迁移率的可靠性更高。

11-参数模型迁移表拟合的1968-1973年五年间隔的瑞典男性人口地区间迁移
图36.6 11-参数模型迁移表拟合的1968-1973年五年间隔的瑞典男性人口地区间迁移

另一方面,人口普查登记了幸存的迁移人口(非迁移次数)。迁移人口是在时间间隔开始时生活在一个地区且在普查时居住在另一地区的人口。如在时间间隔内迁出又迁回原地,那么在全国人口登记中的多次迁移者可能在人口普查中只能被算作非迁移者。一般来说,人口普查登记的迁移数据低估了实际的人口迁移,尤其是在间隔期较长存在大量回迁人口和非幸存迁移者的情况下。因此,基于人口登记数据的迁移表与基于人口普查数据的迁移表并不具备可比性(罗杰斯和卡斯特罗 1986)。

人口普查通常记录现居住地,并询问一年前或五年前的居住地。根据这些信息以及被调查者在普查时点的年龄,可计算存活的迁移人口数以及有可能迁移的存活人口数。两者的比率有时被称为“条件存活比例”,因为这组人都肯定活过了人口普查所界定的迁移时间间隔。由于这些比例不是发生-风险率,因此被称为迁移倾向率。

人口普查数据,单年迁移间隔

如果人口普查询问了一个人一年之前的居住地,为获得按单年间隔的迁移倾向率,受访者需要“回溯”一年前他们小一岁时的居住地,这就可以得出从那个地区有可能迁出的人口数。例如,2010年人口普查时某个年满一岁的人在2009年同时点应为零岁。如果2010年人口普查的年龄范围是1岁至85岁,则在2009年同时点的年龄范围应是0岁至84岁(注:只有年满一岁和以上的人口才能申报一年前的居住地)。通过受访者回溯,能得出在2010年人口普查时存活的、2009年有可能从地区i迁出的人口数。迁移人口数将是2009年在地区i仍存活但在2010年生活在其他地区的人口数。对每个单岁组,迁移人口数与有可能迁移的人口数的比例就是单年的分年龄别的人口迁出倾向率。当分子是定向迁移人口时,即从地区i迁移至地区j,该比例反映从地区i迁移至地区j的年龄别迁移倾向率。

当使用单年单岁迁移倾向率时,需要谨慎。对每一个单岁年龄,迁移人口数及迁移历险的人口数可能并不多,这种情况导致所得出的迁移倾向率不规则、不稳定。因此获取按五岁组的迁移倾向率更可取。经证实五岁组迁移倾向率比单岁迁移倾向率更可靠(罗杰斯、利特尔和瑞莫尔2010)。而这些五岁组值可以通过内插来获得单岁组的倾向率。

人口普查数据,五年迁移间隔

如果人口普查询问了一个人五年之前的居住地,只要有单岁的迁移人口信息,就可以获得五年间隔期内的单岁迁移倾向率。这是通过回溯所有人五年前在他们年轻五岁时的居住地而获得。例如,在2000年人口普查时五岁的人口在1995年时才零岁。如果2000年时的年龄范围是5岁至85岁,则1995年同时点的年龄范围应是0岁至80岁。迁移人口数就是1995年生活在i地区但在2000年生活在另一地区的人口数。对于每个单岁年龄组,迁移人口数与有可能迁移的人口数之间的比例就是五年间隔的年龄别人口迁出倾向率。

人口普查数据,年度迁移率,五年迁移间隔

当普查中五年间隔期的存活的迁移人口数可用时,可通过多灵顿和莫尔特里 (2009)的逆推预测方法获得单年和单岁迁移率。它通过将一般人口死亡率应用于迁移人口来抵消死亡率的影响,同时通过用最近时期的年度迁移率来估算普查前一年分地区人口数,来抵消地区间迁移的影响,并据此计算人口普查前两年的迁移率和人口数量等。该方法需要普查时点年龄为0‑4岁人口的出生地的额外信息,以及分地区的单年单岁人口数。根据此方法得出的迁移表再通过罗杰斯-卡斯特罗模型迁移表进行拟合与平滑,并可以用于单岁的人口预测。

局限性

如果没有精确和适当的数据,复合指数模型将不会产生非常接近的拟合结果,而且会过度参数化,即许多组的参数都可以对观测值产生相同的虚假的优良拟合结果。这种情况下,可能需要通过固定一到两个参数,然后再拟合余下参数。建议减少参数数目达成简约的模型。

模型的拓展

复合指数模型的应用并不局限于迁移率或迁移倾向率的迁移表。一些研究说明,迁移人口(如果使用人口登记数据,则可为迁移人次)的年龄分布经常呈现一个复合指数形式,并且能通过罗杰斯-卡斯特罗模型迁移表来准确表现出来(利特尔和罗杰斯 2007; 罗杰斯、利特尔和瑞莫尔2010)。

单岁组的迁移人口数/迁移人次可以通过以上所述的任何数据来源或方法来获得,因为这些数据在迁移倾向率和迁移率的计算中只作分子。模型迁移表拟合后的观测值就是单岁年龄在总迁移人口/迁移人次中的比例。值得注意的是,如果迁移人口数是按五岁分组的,则需要使用某种内插法。如果运用三次样条内插法,每个节点上的数量应为分五岁组迁移人口/迁移人次的数值的五分之一。

比如,图36.7显示了观测到的瑞典迁移人口年龄构成的比例。从此图中可见,除了老年时期以外,曲线形状非常平滑和可信。用7-参数模型迁移表拟合的结果非常理想,R2为99%,平均绝对百分比误差为29%。但是,这也是一个说明平均绝对百分比误差如何夸大模型拟合程度低的示例,因为当存在很多小的观测偏差时,平均绝对百分比误差会变得很大。

用7-参数模型迁移表拟合1968-1973年瑞典地区间迁移的年龄构成
图36.7 用7-参数模型迁移表拟合1968-1973年瑞典地区间迁移的年龄构成

除了Excel工作簿,还有两个可拟合复合指数曲线的软件:1)Data Master 2003,一个使用利文贝格-马夸特算法的免费曲线拟合程序;2)免费软件R (R开发核心团队2012年),一个服务于多用途统计分析和制图的软件环境。但是完全掌握R软件需要花费大量时间来学习。人口学估计方法网站上的本章附录提供了非常基础的定义R函数的指令。这些指令用高斯-牛顿算法以及7-参数和11-参数模型来估算迁移率。

参考文献

Bates J and I Bracken. 1982. "Estimation of migration profiles in England and Wales", Environment and Planning A 14(7):889-900. doi: http://dx.doi.org/10.1068/a140889

Bates J and I Bracken. 1987. "Migration age profiles for local-authority areas in England, 1971-1981", Environment and Planning A 19(4):521-535. doi: http://dx.doi.org/10.1068/a190521

Beers H. 1945. "Six-term formulas for routine actuarial interpolation", The Record of the American Institute of Actuaries 33(2):245-260.

Dorrington R and TA Moultrie. 2009. "Making use of the consistency of patterns to estimate age-specific rates of interprovincial migration in South Africa," Paper presented at Annual Meeting of the Population Association of America. Detroit, Michigan, 29 April - 2 May 2009.

George MV. 1994. Population Projections for Canada, Provinces and Territories, 1993-2016. Ottawa: Statistics Canada, Demography Division, Population Projections Section.

Hofmeyr BE. 1988. "Application of a mathematical model to South African migration data, 1975–1980", Southern African Journal of Demography 2(1):24–28.

Kawabe H. 1990. Migration Rates by Age Group and Migration Patterns: Application of Rogers' Migration Schedule Model to Japan, The Republic of Korea, and Thailand. Tokyo: Institute of Developing Economies.

Liaw K-L and DN Nagnur. 1985. "Characterization of metropolitan and nonmetropolitan outmigration schedules of the Canadian population system, 1971-1976", Canadian Studies in Population 12(1):81-102.

Little JS and A Rogers. 2007. "What can the age composition of a population tell us about the age composition of its out-migrants?", Population, Space and Place 13(1):23-19. doi: http://dx.doi.org/10.1002/psp.440

McNeil DR, TJ Trussell and JC Turner. 1977. "Spline interpolation of demographic data", Demography14(2):245-252. doi: http://dx.doi.org/10.2307/2060581

Morrison PA, TM Bryan and DA Swanson. 2004. "Internal migration and short-distance mobility," in Siegel, JS and DA Swanson (eds). The Methods and Materials of Demography. San Diego: Elsevier pp. 493-521.

Potrykowska A. 1988. "Age patterns and model migration schedules in Poland", Geographia Polonica 54:63-80.

Press WH, BP Flannery, SA Teukolsky and WT Vetterling. 1986. Numerical Recipes: The Art of Scientific Computing. Cambridge: Cambridge University Press.

R Development Core Team. 2012. R: A language and environment for statistical computing: Reference Index. Vienna, Austria: R Foundation for Statistical Computing. http://www.mendeley.com/research/r-language-environment-statistical-computing-13/

Raymer J and A Rogers. 2008. "Applying model migration schedules to represent age-specific migration flows," in Raymer, J and F Willekens (eds). International Migration in Europe: Data, Models and Estimates. Chichester: Wiley, pp. 175-192.

Rees PH. 1977. "The measurement of migration, from census data and other sources", Environment and Planning A 9(3):247-272. doi: http://dx.doi.org/10.1068/a090247

Rogers A and LJ Castro. 1981. Model Migration Schedules. Laxenburg, Austria: International Institute for Applied Systems Analysis. http://webarchive.iiasa.ac.at/Admin/PUB/Documents/RR-81-030.pdf

Rogers A and LJ Castro. 1986. "Migration," in Rogers, A and F Willekens (eds). Migration and Settlement: A Multiregional Comparative Study. Dordrecht: D. Reidel, pp. 157-208.

Rogers A, LJ Castro and M Lea. 2005. "Model migration schedules: Three alternative linear parameter estimation methods", Mathematical Population Studies 12(1):17-38. doi: http://dx.doi.org/10.1080/08898480590902145

Rogers A and JS Little. 1994. "Parameterizing age patterns of demographic rates with the multiexponential model schedule", Mathematical Population Studies 4(3):175-195. doi: http://dx.doi.org/10.1080/08898489409525372

Rogers A, JS Little and J Raymer. 2010. The Indirect Estimation of Migration: Methods for Dealing with Irregular, Inadequate, and Missing Data. Dordrecht: Springer.

Rogers A and J Raymer. 1999. "Estimating the regional migration patterns of the foreign-born population in the United States: 1950-1990", Mathematical Population Studies 7(3):181-216. doi: http://dx.doi.org/10.1080/08898489909525457

Rogers A and J Watkins. 1987. "General versus elderly interstate migration and population redistribution in the United States", Research on Aging 9(4):483-529. doi: http://dx.doi.org/10.1177/0164027587094002

原文作者
珍妮•利特尔 ,罗伯•多灵顿
Suggested citation

Little JS and Dorrington RE. 2012. The multi-exponential model migration schedule. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/multi-exponential-model-migration-schedule.