假想冈珀茨关联模型
可用数据:多次普查数据
期望得到的数据:生育率
方法:冈珀茨关联模型
方法描述
假想冈珀茨关联模型是冈珀茨关联法估算年龄别生育率和总和生育率的一个拓展。该模型使用两个时间点上搜集的子女数数据,以及基于分年龄的近期生育申报数来估算两次调查间隔期间的生育率。
该方法是为相隔五年或者十年进行的普查或调查 而设计的,且允许在调查间隔期内生育率发生变化。这种情况下,第一次调查时的妇女队列的存活者可以在第二次调查时被确定,并且队列的平均子女数的变化可以被计算出来。然后,对得到的不同队列在调查间隔期内增加的子女数进行累加来计算按观察到的追加子女数所隐含的生育率生育的一个假想队列的平均子女数。
与这些假想队列估计值相比较的时期生育率,在理想情况下,应该涵盖询问了曾生子女数的两次调查的整个间隔期。确保这一点的一种方法是使用该间隔期中每一日历年的按母亲年龄划分的出生登记数据。如果这些数据是可得的,每个年龄组在此期间登记的所有出生数可以通过加总各个日历年度的数值来计算。两次调查间隔期的平均生育率可以通过将出生数除以在各年龄组的妇女生存人年数来获得,而妇女生存人年数可通过该间隔期期初和期末登记的妇女人数来估算。
如果这种出生数据不易获得或者不可靠,那么一种更简单的并且一般来说比较恰当的方法就是计算该间隔期最初和最后几年的年龄别生育率,并且将这两组数据的算术平均值作为整个时期的生育率。如果没有出生登记数据,但是有两次调查或普查搜集了过去一年的出生数据,那么这个期间的年龄别生育率就可以用期初和期末观察到的生育率的平均值来近似获得。如果在每次调查前12个月的出生数是按照母亲在调查时点的年龄来分的,那么观察到的生育率所对应的实际年龄应该比所在年龄组小六个月(或年龄组移位六个月)。分析时需要将这一点考虑在内。
一旦计算出两次调查间隔期的相应子女数和生育率,那么对生育率的累计和内插,以及它们与平均子女数的比较,都与传统的冈珀茨关联模型所阐述的一样。
所需数据
所需数据如下:
- 相隔五年或十年的两次调查或普查中按母亲五岁组年龄分的曾生孩子数;
- 每次调查前一年的按母亲五岁组年龄分的出生数,或者调查间隔期内每一日历年按母亲五岁组年龄分的出生登记数。如果没有调查间隔期的最后几年的按母亲五岁组年龄分的出生登记数,那么可以使用的一个大致对应该时期中点的适当的年龄别生育率。
- 两次调查或普查的按五岁组年龄分的妇女人数
- 如果要计算粗出生率,或者估算生命登记系统的数据的相对完整率,那么需要每次调查或普查的总人口数。
假定
大部分假定是那些与冈珀茨关联模型有关的假定:
- 选择用于拟合的标准的年龄别生育率适当地反映了该人口的生育分布的形状。
- 任何调查间隔期生育率的变化都是平滑和渐进的,并以大致相同方式影响所有年龄组。
- 校正前,中心年龄组(20-39岁)的妇女在生育率上的的误差是等比的,因此过去一年中申报的生育数所描述的生育年龄模式是比较准确的。
- 二十几岁的年轻妇女所申报的子女数是准确的。
假想队列的平均子女数的计算假定死亡率和人口迁移对实际的子女数分布没有影响。换句话说,假定那些在两次调查之间死亡或迁移的妇女的平均子女数,与那些在该时期结束时还活着并且还在原登记居住地的相应年龄的妇女的平均子女数没有显著不同。
准备工作和初步检查
在使用这种方法开始分析生育水平之前,应该就以下几个方面检查数据质量:
- 人口的年龄和性别结构;
- 过去一年中申报的生育数;
- 平均子女数以及是否需要使用巴德里校正法对其予以校正。
注意事项和提示
对几套生育率取平均值之前,确保它们的年龄分类一致是十分重要的。如果它们最初不一致,比如一个使用了移位六个月的年龄组而另一个不是,那么在继续操作之前就需要调整前者(例如,应用只考虑生育率发生变化的冈珀茨关联模型)。在一般情况下,不应该合并基于不同数据来源估算(如生命登记和普查)的年龄别生育率,因为这样做可能会导致年龄别生育率的失真。
如果没有调查间隔期的最后几年的年龄别生育率,可以使用大致对应该时期中点的一套年龄别生育率。应该记住的是,在应用冈珀茨关联模型时,只有调查间隔期年龄别生育率的模式才是重要的,所以如果该模式在此时期或多或少是恒定的,那么所使用的生育率对应的确切日期是否准确就不重要了。
如果使用出生登记数据,不同时间上分年龄组数据的完整率的变化会使生育率模式失真。这种情况下,应谨慎使用本方法。
方法的应用
本方法通过以下步骤来应用。
步骤 1:计算申报的平均子女数
计算两次调查中(t1和t2)各个年龄组[x, x + 5)岁妇女的平均子女数,$$_5P_x(t_1)$$和$$_5P_x(t_2)$$,其中x =15, 20 … 45。为了便于说明,我们用$$P(i,t)=_5P_x(t)$$来表示年龄组i在时间t的平均子女数,其中i=(x/5-2)。这样,从第一次人口普查或调查所得到的平均子女数用P(i,1)表示,而从第二次普查或调查所得到的平均子女数用P(i,2)表示。
步骤 2:计算假想队列的平均子女数
计算子女数的方法取决于调查间隔期的长度。
a)间隔期为五年
如果这两个数据间隔五年, 第一次调查时年龄组i的所有幸存者第二次调查时将在年龄组 i+1,并且相应队列在间隔期的子女增加数为P(i+1,2)-P(i,1)。这个增加数可以对每个年龄组计算,而通过依次累计就得到假想队列的子女数。因此,如果第一次调查时年龄组i的队列的子女增加数为∆P(i+1), 并且假想队列的年龄组i的子女数为P(i,s) (其中s代表假想队列),则$$\Delta P(i+1)=P(i+1,2)-P(i,1)$$。其中,i=1,..., 6。 因此,
$$P(i,s)=\sum_{j=1}^i\Delta P(j)$$。
最年轻年龄组(i= 0)的子女增加数∆P(i+1)被视为等于P(1,2),也就是假定P(0,1) 等于零,即第一次调查时年龄为10-14岁的女性的平均子女数为零。如果生育率变化很快,那么∆P(1)的值所反映的时期生育率将更接近第二次调查时点而不是间隔期中点的时期生育率,从而会稍微高估生育率的变化。
b)间隔期为十年
如果普查或调查的间隔期为十年,那么第一次调查时年龄组i的所有幸存者第二次调查时将在年龄组i+2。假想队列的子女数则可以通过累计两个平行序列的子女增加数而获得。再次说明,对于最年轻的年龄组,∆P(i)被视为等于P(1,2) 而∆P(2)等于P(2,2)。其他年龄组的子女增加数可计算为$$\Delta P(i+2)=P(i+2,2)-P(i,1)$$,其中i=1…5。
偶数年龄组的假想队列的子女数是通过将偶数年龄组的子女增加数累计而获得,而那些奇数年龄组的的假想队列的子女数则是通过将奇数年龄组的子女增加数加总而获得。因此,
$$\begin{align*} P(1,s) &= \Delta P(1) = P(1,2) \\ P(2,s) &= \Delta P(2) = P(2,2) \\ P(3,s) &= \Delta P(1) + \Delta P(3) \\ P(4,s) &= \Delta P(2) + \Delta P(4) \\ P(5,s) &= \Delta P(1) + \Delta P(3) + \Delta P(5) \\ P(6,s) &= \Delta P(2) + \Delta P(4) + \Delta P(6) \\ P(7,s) &= \Delta P(1) + \Delta P(3) + \Delta P(5) + \Delta P(7) \end{align*}$$
步骤 3:计算当前生育率
计算此年龄组生育率f(i) 的方法(其中i和以前一样代表年龄组)取决于可用的数据。
a)来自生命登记系统的数据
一个可能的方法是使用所申报的每次调查前一年的出生数据来计算大致指向两次调查间隔期的最初和最后年份的年龄别生育率。在这种情况下,对于每次调查,可以将每一个五岁组中母亲申报的出生数除以同年龄组的妇女人数,这样就可以通过计算两次调查相同年龄组生育率的算术平均值来获得间隔期的年龄别生育率。
另外,如果整个时期各年的年龄别生育率可从生命登记系统获得,那么可以使用每个年龄组在该时期的一个各年平均的年龄别生育率。计算这个平均值,要将各年龄组母亲的申报出生数加总,然后除以各年龄组存活的人年数(可通过将间隔期期初和期末年龄组的人数取平均值,再乘以该时期的年数求得)。
从生命登记获得的年龄别生育率,根据定义,是按照孩子出生娩时的母亲年龄划分的。
b)可生成步骤 2中平均子女数的调查数据
如果生育率数据来自(用于推导平均子女数的)妇女所申报的每次调查前一年的近期生育率,那么两套年龄别生育率的算术平均值仍然可以作为间隔期的生育率的估算值。然而,这种方式得到的年龄别生育率指向每次调查之前的六个月,因此必须调整生育率的年龄划分以揭示母亲的年龄是按其在普查时点上而不是按孩子出生时的年龄来分类的。在应用冈珀茨关联模型时,必须考虑到生育率的这个年龄移位。
冈珀茨关联模型对数据的拟合过程与第7章中关于该模型的阐述一样。这里仅需注意以下不同点:
- 估算值对应间隔期中点,即第二次调查之前的2.5或5年。
- 工作表只使用传统冈珀茨关联模式,即使用子女数来设置级别并使用基于间隔期当前生育数据的年龄别生育率来确定生育曲线的形状。
- 如果数据是按调查时的母亲年龄来划分的(即当前期的生育率数据不是来自生命登记系统,而是来自也能够提供平均子女数的普查或调查),随附的Excel工作簿要求近期生育率数据只能来自所申报的普查或调查前12个月的出生数。
相关步骤见下文。
步骤 4:选择用于模型的生育标准模式
默认的生育标准模式是由布斯提出,后经扎巴(1981)略加修改。该标准模式适用于高生育率和中等生育率的人口,它就是一个标准化的累计年龄别生育模式(即总和生育率等于1)。标准模式Ys(x)的值由标准模式的冈比特转换值来决定的。基于平均孩子女数的标准模式的Ys(i)值是与标准生育模式相关联的子女数的冈比特转换值。标准模式的选择决定了在回归拟合过程中使用的g()和e()的值。
步骤 5:评估P点和F点的作图
对同一坐标体系中的z(x) - e(x)与g(x)作图,以及z(i) - e(i) 与g(i)作图,可用于鉴别数据常见错误和趋势,关于这一点在第7章中的冈珀茨关联模型有详细讨论。
步骤 6:通过选择要使用的数据点来拟合模型
所有的数据点在一开始都应该被包括在模型中。唯一的例外是,如果某年龄组的平均子女数高于下一年龄组的平均子女数,则需剔除这个数据点,因为在这种情况下冈比特值将无法确定且模型不能使用该数据点拟合。(这种情况不会发生在一个真正的队列中,但可能因为数据错误或者生育率正处在迅速变化的时期而出现在假想队列中。)
如果子女数数据和生育数据是内部一致的,那么z() - e() 对g()的作图应该产生直线。那些导致各个图形偏离直线的P点和F点应被剔除在模型外。使用普通线性回归(最小二乘法)为P点和F点拟合直线,并按顺序地识别那些没有整齐地拟合在直线上的点,这么做的目的在于寻求(几乎)落在同一条直线上的P点和F点的最大的组合,并用这些数据点来拟合模型。
剔除和保留数据点的原则如下:
- 数据点的连续系列必须被包括在模型中,也就是说,只能剔除位于两端的数据点。(这是因为图形中每个点都是基于一对相邻的数据值的比率而计算的。如果分析得出的结论,认为某数据值作为这些比率之一的分母不可靠,那么将其作为下一个比率的分子也不合理)。
- P点的剔除应优先于F点。这是因为平均子女数数据通常比生育数据更容易在各年龄上产生差错。
- 在拟合过程的早期,就应该剔除那些明显偏离由其他所有P点拟合的直线的P点,以及剔除明显偏离由其他所有F点拟合的直线的F点。
- 较大年龄上的P点和F点的剔除应该优先于那些较小年龄上的P点和F点,这是因为较大年龄段的数据通常最不可靠,并且终身生育率和近期生育率之间的一致性最差。20岁以下的女性是个例外。对于这些年轻女性,事件数目小经常会使平均子女数或者累计生育率不可靠。
- 包括更多数据点而拟合程度只有小幅下降,这要好于选择更少数据点但拟合程度略有提升的情况。基于用于拟合模型中的数据点,工作表可以计算均方根误差(RMSE)
$$RMSE=\sqrt{\frac{\sum\left(\left(z()-e()-\left(\alpha+\left(\beta-1\right)^2\frac{c}{2}+\beta g()\right)\right)^2\right.}{n}}$$。
在比较两个模型时,该统计量可以帮助确定数据点选择的最佳数目,即应该选择均方根误差值较低的模型。
步骤 7:评估拟合参数
对于拟合所选择的P点和F点而获得的最佳拟合线,必须检查α和β的值以确认它们没有过分偏离它们各自的中心值。若非如此,则所选择的标准是不合适的。一个好的拟合直线要求α和β的取值范围分别为:-0.3<α<0.3,且0.8<β<1.25。
如果参数在该范围之外,这意味着所使用的一套或两套数据是有问题的,或者所选择的生育标准模式不合适。在进一步分析数据之前,应使用另一种生育标准模式或者改变数据点的选择进行测试。如果参数仍在范围之外,就不应该使用本方法。
步骤 8:拟合的年龄别生育率和总和生育率
对模型的两个参数进行估算后,将其代入基于子女数的标准生育模式公式就可获得拟合的基于子女数的冈比特值,
$$Y(i)=\alpha+\beta Y^s(i)$$。
然后通过反冈比特转换,将其转换为年龄组i的生育累计比例的指标。这些基于子女数分布的反冈比特值反映该年龄组达到的生育比例。将观察到的各年龄组的子女数除以这些比例就得出了一系列的总和生育率的估算值。而将用于估计α和β的那些年龄组中的估计值取平均值,就得到总和生育率的拟合估计值$$\hat{T}$$。
对于划分年龄组的常规年龄(即20,25... 50),将相同的α和β应用到标准模式的冈比特值上,再将反冈比特变换值乘以$$\hat{T}$$,就得到一套标准刻度下的累计生育模式。将相邻两个累计生育率相减并除以5就能得到常规年龄组(15-19岁;20-24岁等)的拟合生育率(即使数据的最初分类有半年移位)。
示例
此示例使用肯尼亚1989年和1999年搜集的相隔十年的两次普查数据。这两次普查都询问了普查前一年的生育数以及终身生育率。本方法的操作见随附的Excel工作簿。
步骤 1:计算申报的平均子女数
1989年人口普查数据已运用巴德里校正法进行了校正。相比之下,1999年的普查数据没有缺失数据,很明显已在发布前被编辑过。两次普查的平均子女数示于表10.1的前两列。根据这些数据可以看出,年龄较大的妇女的终身生育率在这十年中大约下降了0.6个孩子。然而,年轻妇女的终身生育率的增加多少有些令人吃惊。
步骤 2:计算假想队列的平均子女数
两次普查的间隔期为十年(从1989年至1999年)。因此,我们使用步骤 2(b)中描述的程序推导出假想队列的平均子女数,见表10.1的最后一列。
表10.1 分年龄组的平均子女数,肯尼亚1989 年和 1999 年普查
年龄组 | 1989年 | 1999年 | 假想队列子女数 P(i,s) |
|---|---|---|---|
15-19 | 0.2416 | 0.2848 | 0.2848 |
20-24 | 1.5247 | 1.3640 | 1.3640 |
25-29 | 3.2138 | 2.6073 | 2.6505 |
30-34 | 4.7602 | 4.1432 | 3.9825 |
35-39 | 6.2390 | 5.3867 | 4.8234 |
40-44 | 7.1204 | 6.3818 | 5.6041 |
45-49 | 7.5103 | 6.9143 | 5.4987 |
如上述步骤 2所述,$$\Delta P(1)=P(1,2)=0.2848$$,并且$$\Delta P(2)=P(2,2)=1.3640$$,同时$$P(5,s)=\Delta P(1)+\Delta P(3)+\Delta P(5)=0.2848+(2.6073-0.2416)+(5.3867-3.2138)=4.8234$$。
对曾生孩子数的漏报看起来发生在较大年龄段,因为最大年龄组的假想队列的平均子女数比40-44岁年龄组低。
步骤 3:计算当前生育率
妇女申报的每次普查前一年中最后一次生育的年份和月份是可用数据。正如评估近期生育率数据的章节中所描述的那样,通过假定普查当月申报的生育数都发生在普查日期之前,并且通过依此处理普查前一年同一月份的生育数,这些申报可以转换为年龄别生育率和总和生育率的估算值。这样就得到表10.2中年龄别生育率和总和生育率的直接估计值。通过将1989年和1999年各年龄组的生育率取平均值得到的间隔期生育率,见表10.2最后一列。
值得一提的是,两次人口普查中生育率申报的数据质量都比较差。这些数据隐含的生育率水平显著低于假想队列子女数所隐含的生育率水平,也显著低于肯尼亚1993年人口和健康调查所获得的每名妇女生育5.3儿童的总和生育率。
表10.2 年龄别生育率和总和生育率的直接估计值,
肯尼亚1989年和1999 年普查
年龄组 | 1989年 | 1999年 | 平均生育率 |
|---|---|---|---|
15-19 | 0.0679 | 0.1107 | 0.0893 |
20-24 | 0.2179 | 0.2381 | 0.2280 |
25-29 | 0.2309 | 0.2124 | 0.2217 |
30-34 | 0.1908 | 0.1728 | 0.1818 |
35-39 | 0.1458 | 0.1193 | 0.1326 |
40-44 | 0.0764 | 0.0583 | 0.0673 |
45-49 | 0.0351 | 0.0203 | 0.0277 |
总和生育率 | 4.82 | 4.66 | 4.74 |
步骤 4:选择用于模型的生育标准模式
默认的生育标准模式是由布斯提出经扎巴(1981)略加修改的那套生育模式。对于女性生育率,不存在其他经同行评审过的标准生育模式。
步骤 5:评估P点和F点的作图
首先使用所有的P-点和F-点拟合模型,其结果示于随附Excel工作簿Diagnostic plots工作表中的第一个图形。
步骤 6:通过选择要使用的数据点拟合模型
遵循上述准则,依次从模型中剔除数据点来最大化P-点和F-点的一致性。结果证明最佳拟合来自年龄为20-39岁的P点和年龄为20-44岁的F点(图10.1)。

步骤 7:评估拟合参数
在此应用中,α(-0.0286)和β(1.0042)的拟合值很好地落在设定范围内。
步骤 8:拟合的年龄别生育率和总和生育率
拟合模型所导出的总和生育率为每名妇女5.56个孩子(表10.3),并且大约对应于1994年8月。该模型已经考虑到了数据中因母亲年龄分类而产生的年龄移位。这一生育率水平,与肯尼亚1993年人口和健康调查得到的每名妇女5.3个孩子的估计值大体一致,也与应用冈珀茨关联法分别对每个数据估计的结果大体一致。
表10.3 基于假想子女增加数的生育率估计值,肯尼亚1989-1999年
年龄组 | 年龄别生育率 |
|---|---|
15-19 | 0.139 |
20-24 | 0.267 |
25-29 | 0.261 |
30-34 | 0.213 |
35-39 | 0.153 |
40-44 | 0.070 |
45-49 | 0.009 |
总和生育率 | 5.56 |
方法详述
此处所描述的方法,在效果上相当于冈珀茨关联模型的一种。它不是基于一个时间点上搜集的子女数数据和生育数据,而是基于两个时间点上申报的当前生育率和终身生育率,获得一个“平均”的生育率。本手册其他相关章节对冈珀茨关联模型的数学原理进行了详细介绍。
更多的阅读材料和参考文献
该方法最早是由佐罗汀克和希尔(1981年)提出,并被纳入在《手册十》的41-45页(联合国人口司1983年)。这里的描述基本忠实于原方法。不同之处在于,它被作为冈珀茨关联模型的一种形式,其中所用子女数是从两个调查中得出的调查间隔期子女数而生育率是调查间隔期的估算值。
UN Population Division. 1983. Manual X: Indirect Techniques for Demographic Estimation. New York: United Nations, Department of Economic and Social Affairs, ST/ESA/SER.A/81. https://www.un.org/development/desa/pd/sites/www.un.org.development.desa.pd/files/files/documents/2020/Jan/un_1983_manual_x_-_indirect_techniques_for_demographic_estimation.pdf
Zaba B. 1981. Use of the Relational Gompertz Model in Analysing Fertility Data Collected in Retrospective Surveys. Centre for Population Studies Research Paper 81-2. London: Centre for Population Studies, London School of Hygiene & Tropical Medicine.
Zlotnik H and KH Hill. 1981. "The use of hypothetical cohorts in estimating demographic parameters under conditions of changing fertility and mortality", Demography 18(1):103-122. doi: https://dx.doi.org/10.2307/2061052
书籍遍历链接: 假想冈珀茨关联模型
Suggested citation
Moultrie TA. 2013. Synthetic relational Gompertz models. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/synthetic-relational-gompertz-models.