冈珀茨关联模型
可用数据:单次普查法
期望得到的数据:生育率
方法:冈珀茨关联模型
方法描述
冈珀茨关联模型是布拉斯P/F比率法的改进式,旨在估算分年龄生育率和总和生育率。这个方法通过人口普查或调查中申报的近期出生数来确定年龄别生育率的形状,并通过年轻妇女申报的平均子女数来确定生育率水平。
在估算分年龄别生育率和总和生育率的过程中,本方法力图纠正生育数据中常见的错误,即在参照期内的生育数申报过少或过多,终身生育率的漏报以及较大年龄妇女中存在的年龄误报。这些错误在第3章和第5章中有更详细的描述。
本方法基于(累计)冈珀茨分布, $G(x)=\exp\!\big(a\cdot \exp(bx)\big)$,的一个特征,即该分布具有S形,但又具有右偏的风险函数特征。因此冈珀茨分布能很好反映妇女分年龄的平均子女数以及累计生育率的分布。$G(x)$ 的形式意味着比例累计生育率或平均子女数的双负对数转换对大多数年龄范围来讲接近于一条直线。该双负对数转换, $Y(x) = -\ln\!\big(-\ln(G(x))\big)$,被称为冈比特转换,与死亡率分析中常见的罗吉特转换类似。但是布拉斯发现,更优的线性拟合可以由一个关联模型来获得,该关联模型将观察到的生育率的冈比特转换值表达为确定的标准生育模式的冈比特转换值的线性函数,即$Y(x) = \alpha + \beta Y^{s}(x)$,其中$Y^{s}(x)$为标准生育模式的冈比特转换值。显然,如果α= 0和β= 1,年龄别生育模式将等同于标准的年龄别生育模式。$\alpha$代表所考察人口中生育年龄分布不同于标准生育模式中生育年龄分布的程度(负值意味着生育年龄的分布比标准模式要更加年长)。$\beta$衡量生育率分布的离散程度(值大于1意味着较窄的分布)。
就输入数据而言,本方法需要每个年龄组的平均子女数 ${}_{5}P_{x}$ (x为15, 20, … , 45), 以及相应年龄组的生育率${}_{5}f_{x}$。为了便于说明并更清楚区分终身生育率和近期生育率,${}_{5}P_{15}$被称为$P(1)$, ${}_{5}P_{20}$为 $P(2)$ ,以此类推。从普查数据推导这些输入数据的方法在第3章中有详细的阐述。和其他方法一样,若有必要,应该对平均子女数用巴德里校正法进行校正。
每个年龄组末端的累计(时期)生育率$F(x)$,由下式给出$F(x+5)$=$5 \cdot \sum_{a=15,5}^{x} {}_{5}f_{a}$。布拉斯(1978)的最初方法使用了一系列累计生育率比率的冈比特转换值,该比率是每个年龄组末端的累计生育率对50岁的累计生育率(即总和生育率)的比率,从而给出了最小值为0和最大值为1(在最后的年龄组)的S曲线。平均子女数的冈比特转换值也以类似方式推导得出。
本方法存在两个固有缺点。第一,它需要将总和生育率作为输入值,而从申报的年龄别生育率得出的总和生育率可能有偏差。事实上,总和生育通常才是最受关注的估算参数。第二,对子女数冈比特转换值的处理隐含了不同时间生育率不变的假定。尽管如此,布拉斯的方法启发了布斯(1980,1984)对沿用至今的标准生育模式的推导。
以上两个局限性由扎巴(1981)对本方法的全面改进而得到解决,即避免了原方法对总和生育率的使用,同时也摒弃了对生育率没有变化的假定。扎巴这一未正式发表的研究进一步地整合了模型的其他各种形式从而使模型一般化了(其中一些在本文有所描述)。对扎巴的改进方法的完整阐述将在随后章节中给出。简言之,她表明该模型可以表示为
$z(x) - e(x) = \alpha + \beta g(x) + \frac{c}{2}(\beta - 1)^2 \tag{1}$
其中$e(x)$, $g(x)$和$c$为所选的标准生育模式的函数,$z(x)$是相邻年龄组的累计时期生育率的比率的冈比特转换值,即以$F(x)/F(x+5) $替代布拉斯最初提出的$F(x)/50$,
$z(x) = -\ln\!\left(-\ln\!\left(\frac{F(x)}{F(x+5)}\right)\right)$
对于子女数数据,该模型使用相邻年龄组的平均子女数的比率,$P(i)/P(i+1)$。这意味着该模型无需在拟合生育模式形状参数之前估算总和生育率。进一步地,由等式1得出,$z(x) - e(x)$ 对 $g(x)$作图应该是一条直线,其斜率为$\beta$,截距为$\alpha + \frac{1}{2}c(\beta - 1)^2$。(值得注意的是,$\beta$应该接近1,本方法的早期形式认为截距的后一部分并不重要,而将$\alpha$近似作为截距。鉴于目前的计算技术水平能力,现在已经没有理由忽视这种近似带来的精度损失。然而,$\beta$接近于1的要求仍然存在)。
同样的推理适用于对子女数数据的评估。通过$P(i)/P(i+1)$,即平均子女数在连续两个年龄组的比率,以及把$z(i)-e(i)$ 和 $g(i)$联系起来的线性方程,导出
$z(i) - e(i) = \alpha + \beta g(i) + \frac{c}{2}(\beta - 1)^2 \tag{2}$
按照惯例,从子女数数据获得的数据点被称为$P-$点,来自生育率的数据点被称为$F-$点。模型拟合过程的目标是找到彼此内部一致的$P-$点和$F-$点的结合(即两组点基本上都在的相同的线上),然后使用这些点来共同确定上面等式(1)和(2)中的参数$\alpha$和$\beta$。 $\alpha$和$\beta$的值被用来推导关联的冈比特值,$Y(x) = \alpha + \beta Y^{s}(x)$,以及$Y(i)$。
使用冈珀茨关联方法来推导拟合生育率分布,需要年龄别平均子女数和生育率。将生育率累计,计算相邻年龄组的累计值的比率,计算相邻年龄组的平均子女数的比率,计算这些比率的冈比特值,并对两组匹配数据作图,即 $z(x) - e(x)$和$g(x)$, 以及 $z(i) - e(i)$和$g(i)$。拟合直线的斜率等于$\beta$,截距项则包括$\alpha$,$\beta$和$>c$三个参数,从中可算出$\alpha$。$\alpha$和$\beta$的值被用于将标准累计量的冈比特值转化为拟合的冈比特值,随后再转化为拟合的平均子女数和生育率。生育率的等级由最可靠的子女数的数据点决定。这些数据点通常对应那些年龄在20-29岁或20-34岁的妇女。相比于老年妇女,她们不太可能漏报出生数,并且能更准确地申报年龄。
在拟合生育率分布的计算上,冈珀茨关联模型要比早期的$P / F$比率法具有几个优势。该模型对于中等生育水平和较高生育水平的人口采用了可靠的生育率模式,即布斯标准 (the Booth standard)。因此,从上一年的出生数申报中估算的不可靠的生育率,可以由更可靠的数据点拟合而成的模型值所取代。对两个组的数据点作图可以确定每个点的可靠性,识别数据的错误,以及判断生育率趋势。所有可靠的数据点都可以用于推导拟合的模型分布。该模型还提供了数值之间内插计算的可靠途径,使子女数和累计生育率数据具有可比性,并且能将非常规年龄组的生育率转换为适用于常规年龄组的生育率。
数据要求和假定
所需数据列表
• 普查或调查日期时分五岁组的妇女人数;以及
• 调查前12、24或36个月分五岁组的妇女生育数。
• 分五岁组的妇女人数;以及
• 分五岁组妇女的生育孩子总数。
重要假定
• 在拟合过程中使用的标准生育模式比较准确地反映了该人口的生育率分布的形状。
• 任何生育率的变化都是平稳和渐进的,而且以大致相同的方式影响所有年龄组。
• 校正前,中心年龄组(20-39岁)的妇女在生育率上的误差是等比的,因此申报的近期生育数所描述的生育年龄模式是比较准确的。
• 年轻(20-29岁或20-34岁的)妇女申报的子女数是准确的。
• 本方法通常能发现违反这些假定的情况。
准备工作和初步检查
• 人口的年龄和性别结构;
• 上一年申报的出生数;
注意事项和提示
• 应用本方法需要特别谨慎地确定并正确地界定母亲的年龄分类。
• 适当和必要的话,应该对平均子女数使用巴德里校正法予以调整,从而修正无子女妇女被误报为子女数没有申报的情况。
• 本方法可以处理为期三年的汇总数据。然而,当处理超过一年期的数据时,应谨慎使用完全模型(也不能简单地用它来平滑数据)。理想情况下,使用时期较长的数据,对历险人年数的计算需要更加准确。此外,时期较长还有发生多胎出生的可能,而普查或调查的问卷中问项可能不足以鉴别这种情况。
• 如果数据中提供了抽样或设计的权数,在生成列表作为输入数据时,要根据所用统计软件的要求正确应用这些权数。
• 当拟合的生育率分布的形状明显不同于观测的生育模式时,本方法是不适合的。由于模型中的参数$\alpha$和$\beta$界定了生育模式的形状和位置,扎巴(1981)建议只有在-0.3<α<0.3和0.8<β<1.25的情况下才能应用该模型。如果α和β在这些范围之外,则应考虑其他模型。
最年轻和最年老的年龄组的数据在估计方程时的效果要比中间年龄段的数据差,尤其在观测的生育模式与标准生育模式完全不同的情况下。因此要额外谨慎对待这些妇女申报所对应的数据点。然而这一点对总和生育率估算的影响并不大。
方法的应用
本方法的应用分以下几个步骤。
步骤 1:计算申报的平均子女数
如果在初步检查中或者在使用巴德里校正法过程中尚未计算出各个年龄组[x,x+5)妇女的平均子女数,${}_{5}P_{x}$,其中,$x =15, 20…45$,则首先需要对它们进行估计。平均子女数的推导和校正在本手册第3和第4章中进行了阐述。
步骤 2:确定母亲的年龄分类
根据可用的数据,生育率可以根据调查时母亲年龄或者孩子出生时母亲的年龄进行分类。普查数据中几乎都是前一种年龄,即普查时母亲的申报年龄,而后一种年龄在从生命登记系统数据中更经常遇到。至关重要的是要正确确定这个分类,否则生育率估算会产生偏差。
本模型的工作表可以处理没有年龄移位的数据(即根据孩子出生时母亲申报的年龄),或者(当数据是按照调查时母亲的年龄进行分类时)有半年,1年或1年半年度的移位数据(分别对应12月,24月和36月的考察期间)。
步骤 3:计算隐含的年龄别生育率
年龄别生育率是将申报的调查时点前 (1年,2年或3年) 考察期间内的出生数除以各年龄组的妇女人数。
步骤 4:选择生育率标准模式以及拟合模型的形式
默认的生育率标准模式由布斯提出,后经扎巴(1981)略作修改。该标准模式适用于高生育率和中等生育率的人口,它是一个标准化的累计年龄别生育模式(即总和生育率为1)。标准模型$Y^s(x)$的值由生育模式的冈比特值来决定的。基于平均子女数的标准模式的$Y^s(i)$值是与标准生育模式相关联的子女数的冈比特转换值。标准模式的选择决定了在回归拟合过程中使用的$g()$和$e()$的值,这些值是从$Y^s()$运用代数方法导出的。
这里介绍了冈珀茨关联模型的两个形式。默认的形式对生育率数据固有误差的性质做出了与布拉斯$P / F$比率法一样的假定,即近期生育率的申报受到了与年龄无关的参考期的错误和漏报的影响;而终身生育率申报受到随年龄增加而增长的漏报影响。在工作表中,这被称为“形状F-水P”形式。
第二种形式使用冈珀茨关联模型来纠正生育率分布“形状”中出现的可能失真,同时保持生育率水平不变。显然,如果涉嫌有参考期错误或漏报错误,这个形式将不会对生育率给出一个合理的估算。
步骤5:评估$P-$点和$F-$点的作图
对同一坐标体系中的$z(x) - e(x)$ 和 $g(x)$作图, 以及 $z(i) - e(i)$ 和$g(i)$作图,可用于鉴别数据中常见的错误和趋势(见下文)。
步骤 6:通过选择要使用的数据点来拟合模型
所有的数据点应该在一开始都被包括在模型中,唯一的例外是,如果一个年龄组的平均子女数高于下一年龄组的平均子女数,则需要剔除这个数据点,因为在这种情况下,冈比特值将无法确定且模型也不能使用这点进行拟合。(这样的情况不会发生在真实队列中,但可能会由于数据错误或者生育率正处在迅速变化的时期而出现在假想队列中。)
如果子女数数据和生育率数据内部一致,那么$z() - e()$ 和$g()$的数据对在图中应该是一条直线。那些导致各个图形偏离直线的$P-$点和$F-$点都应该被剔除在模型外。使用普通线性回归(最小二乘法)为$P-$点和$F-$点拟合直线,并按顺序地识别那些没有整齐地拟合在直线上的点。这样做的目的在于寻求(几乎)落在同一条直线上的$P-$点和$F-$点的最大组合,并用这些数据点来拟合模型。
剔除和保留数据点的原则如下:
• 数据点的连续系列必须被包括在模型中,也就是说,只能剔除位于两端的数据点。(这是因为图形中每个点都是基于一对相邻的数据值的比率而计算的。如果分析得出结论,认为某数据值作为这些比率之一的分母不可靠,那么将其作为下一个比率的分子也不合理。)
• $P-$点的剔除应优先于$F-$点。这是因为平均子女数数据通常比生育数据更容易在各年龄上产生误差。
• 在拟合过程的早期,就应该剔除那些明显偏离由其他所有P点拟合的直线的P点,以及剔除明显偏离由其他所有F点拟合的直线的F点。
• 较大年龄上的P-和F-点的剔除应该优先于那些较小年龄上的P-和F-点,这是因为较大年龄段的数据通常是最不可靠,并且终身生育率和近期生育率之间的一致性最差。20岁以下的女性是个例外。对于这些年轻女性,事件数目小经常会使平均子女数或累计生育率不可靠。
包括更多的点而拟合程度只有小幅下降,这要好于选择更少的数据点但拟合程度略有提升的情况。基于用于拟合模型中的数据点,工作表可以计算均方根误差($RMSE$):
\[ \mathrm{RMSE} = \sqrt{ \frac{ \sum \left[ (z()- e()) - \left(\alpha + \frac{c}{2}(\beta - 1)^2 + \beta g()\right) \right]^2 }{n} } \]
在比较两个模型时,本统计量可以帮助确定数据点选择的最优数目,即应该选择RMSE值较低的模型。
步骤 7:评估拟合参数
对于拟合所选择的P-点和F-点而获得的最佳拟合线,必须检查$\alpha$和$\beta$的值以确认它们没有过分偏离各自的中心值,若非如此,则所选择的标准是不合适的。一个好的拟合直线要求$\alpha$和$\beta$的中心值区间分别为:-0.3<$\alpha$<0.3和0.8<$\beta$<1.25。
如果参数落在该范围之外,这意味着所使用的一套或两套数据是有问题的,或者所选生育标准模式不合适。在进一步分析数据之前,应使用另一种生育标准模式(见下文)或者改变数据点的选择进行测试。如果参数仍落在范围之外,就不应该使用本方法。
步骤 8:拟合的年龄别生育率和总和生育率
对模型的两个参数进行估算后,将其代入标准值的公式就可获得拟合的基于子女数的冈比特值,$Y(i) = \alpha + \beta Y^{s}(i)$。然后通过反冈比特转换,将其转换为年龄组i的生育累计比例的指标。这些基于子女数分布的反冈比特反映该年龄组达到的生育比例。将观察到的各年龄组的子女数除以这些比例就得出了一系列的总和生育率的估算值。而将用于估计α和β的那些年龄组中的估计值取平均值,就得到总和生育率的拟合估计值$\hat{T}$。
对于划分年龄组的常规年龄(即20,25... 50),将相同的α和β应用到标准模式的冈比特值上,使用反冈比特变换并乘以$\hat{T}$,就得到一套标准化的累计生育模式。将相邻两个累计生育率相减并除以5就能得到常规年龄组(15-19岁;20-24岁等)的拟合生育率(即使数据的最初分类有半年移位)。
(如果模型的拟合只使用了F-点,那么$\alpha$和$\beta$仅由F-线决定。平滑后的生育模式可以由上述步骤得到,但是其中的拟合比例并不与基于子女数得到的估计值相乘,而是与从最近数据本身估算的生育率水平相乘。)
解释和诊断
数据中的典型错误
那些从小于20岁妇女的数据中得出的数据点往往是不可靠的,因为它们通常来自于相当小数目的事件且容易有各种申报错误,例如将十几岁的母亲登记为较大的年龄。因此,通常来说,不是那些来自非常年轻或是年长的年龄上的数据点,而是基于生育高峰年龄段(20-34)上的P-点和F-点所拟合的直线比较一致。如果P线和F线甚至在20-34岁也不汇合,那么要么是一套或两套数据点(甚至在这些年轻的年龄)存在错误,要么是近期生育率发生了(重大的)改变。
所有的P-点和F-点所构成的图可揭示数据中的错误和近期的生育率趋势。在解读图形时,最好要记住,$z() - e()$的值($y$轴)会随观察到的生育率和子女数分布模式而变化,而$g()$的值却不会(只由标准模式决定)。同样地,$z() - e()$按各年龄基本比率变化的相同方向变化。
图形诊断揭示的最常见的问题包括,年龄较大妇女中的子女数漏报、年龄高报、以及近期生育率下滑趋势。
扎巴(1981)使用了基于布斯标准模式的模拟数据来探讨数据错误和生育率变化对图形的影响。其结果如下所述。
1) 年龄较大妇女在终身生育率申报中漏报子女
如果年龄较大妇女在申报终身出生子女数时存在漏报,则相对于预期的直线,P-值会趋向过高(因为每个累计值的分母不成比例地降低)而P-点在老年阶段会向上弯曲。
2) 年龄较大妇女高报出生数或年龄
这两种错误产生的效果相同,要么是因为误将出生数归为了年龄较大的妇女,或者是因为年轻妇女(她们往往有较高的近期生育率)被错误归类到更大的年龄。结果是,F线在最老的年龄段向下弯曲。
3) 生育率趋势
图上显示的P-点和F-点的差异可揭示生育水平的趋势。如果生育率一直在下降,同一年龄上的F-累计值往往高于P-累计值,并且F-点的坡度会比P-点的坡度更陡。因此若F-点的线在P-点的线的上面,就揭示生育率的下降趋势,反之亦然。
年轻生育年龄上的生育率快速变化通常会阻止P-点和F-点落在一条线上,即使在拟合中剔除几乎所有P-点也是如此。将那些相邻的P-点在拟合中加以剔除仍无法使P-点和F-点拟合成一条直线就表明年轻年龄组的近期生育率已经发生了迅速改变。
基于布斯标准模式的典型诊断图如图7.1所示。

可以看出,如果年龄较大妇女漏报了活产儿,P-点在右侧刻度上(即那些较大年龄)向上弯曲。当妇女申报(或被申报)的年龄超过实际年龄时,F-曲线在育龄晚期阶段向下弯曲。最后,如果生育率下降,F-点通常会位于P-点的上面。
在处理真实的数据时,数据申报误差和生育率变化趋势经常混合在一起,情况可能比这里讨论的复杂得多。数据中的严重差错可能掩盖真实的生育率变化趋势,所以不要不加区别地使用本方法。
P/F比率
本手册没有介绍P / F比率法,而应用本方法所得到的比率能够有效地确定生育率的近期趋势。它们也可以用作某些估算儿童死亡率方法的指南。
各年龄组的假想的P / F比率可以很容易地从一个拟合的冈珀茨关联模型中得出。该比率通过下式计算:
\[ \frac{P}{F}(x) =
\frac{{}_{5}P_{x}}{\hat{F} \cdot \exp\!\left(-\exp\!\left(\alpha_{F} + \beta_{F} Y^{s}(x+2.5)\right)\right)}, \quad x = 20, 25, \ldots, 45 \]
其分子为各年龄组所观察到的平均子女数,而分母为使用仅基于F-点估算的α和β的值(如同仅基于F-点的模型形式)而求得的调整后的每个年龄组中点的标准模式的冈比特值。随后将反冈比特值调整到模型中使用的F-点所暗示的总和生育率水平。对于最年轻的年龄组,不计算比率,因为一般来说这个组的平均子女数很低,累计到17½年龄的生育率同样很低,从而导致年龄组中的比率不稳定。
这些P / F比率可以按相反的顺序作图,即把最大的年龄组放在左边。这样,该系列的P / F比率就可以按照日历时间从左至右地读取(这是考虑到,在一般情况下,年龄较大妇女的生育会在时间上早于年轻女性的生育)。过度偏离总体趋势表明数据中存在差错。P / F比率的下降趋势(如图所绘)显示了随着年龄的增加,队列生育率和周期生育率之间的差异在增加,从而表明生育率在下降。
示例
本示例使用了马拉维2008年人口普查的生育率报告中使用的数据。方法的操作见本章随附的工作簿。
步骤 1:计算申报的平均子女数
平均子女数示于《马拉维2008年人口普查的生育率报告》的表2.6中。不清楚报告中的子女数是否被编辑过,也不清楚数据是否已经使用了巴德里校正法。数据如表7.1所示。
表7. 1 生育指标,马拉维2008年人口普查
| 普查时点年龄 | 平均子女数 | 时期生育率 |
|---|---|---|
| 15-19 | 0.283 | 0.111 |
| 20-24 | 1.532 | 0.245 |
| 25-29 | 2.849 | 0.230 |
| 30-34 | 4.185 | 0.195 |
| 35-39 | 5.214 | 0.147 |
| 40-44 | 6.034 | 0.072 |
| 45-49 | 6.453 | 0.032 |
步骤 2:确定母亲年龄的分类
在马拉维2008年的人口普查中关于近期生育率问题是“在过去12个月中有多少活产婴儿”。由于没有办法得到孩子的出生日期,我们可以假定数据是根据普查时点上母亲的年龄分类的,而不是根据孩子出生时母亲的年龄来分类的。
步骤 3:计算隐含的年龄别生育率
《马拉维2008年人口普查的生育率报告》中的表2.6给出了生育率。(对这些生育率的推导表明5f20的值是0.250,但为了示例,表2.6中的生育率被保留以便与推导结果进行更好的比较。)
步骤 4:选择生育率标准模式以及拟合模型的形式
如果没有别的选择,我们应该选用布斯标准模式,并为了校正生育率数据的形状和水平,选择“F形状-P水平”的模型形式。系数e()和g()是从表7.2到7.4中推导得出的。
表7.2 当数据存在半年位移时,推导$e(x)$ 和$g(x)$
| 年龄 $x$岁 | $F^s(x)/F$ | $Y^s(x)$ | 比率 | $\phi$ | $\phi '$ | $\phi "$ | $e(x)$ | $g(x)$ |
|---|---|---|---|---|---|---|---|---|
| [1] | [2] | [3] | [4] | [5] | [6] | [7] | [8] | [9] |
| =第2列的冈比特值 | $=F^s(x)/F^s(x+5)$ | =第4列的冈比特值 | =[5]-[6] | =[6] | ||||
| 14 ½ | 0.0011 | -1.9228 | 0.0094 | -1.5410 | -2.4565 | 0.9155 | -2.4565 | |
| 19 ½ | 0.1140 | -0.7753 | 0.3233 | -0.1216 | -1.4527 | 0.9563 | 1.3311 | -1.4527 |
| 24 ½ | 0.3528 | -0.0411 | 0.6007 | 0.6741 | -0.7426 | 0.9632 | 1.4167 | -0.7426 |
| 29 ½ | 0.5872 | 0.6305 | 0.7529 | 1.2592 | -0.0364 | 0.9530 | 1.2957 | -0.0364 |
| 34 ½ | 0.7800 | 1.3925 | 0.8479 | 1.8021 | 0.8405 | 0.9615 | 0.8405 | |
| 39 ½ | 0.9199 | 2.4830 | 0.9298 | 2.6209 | 2.1799 | 0.4409 | 2.1799 | |
| 44 ½ | 0.9893 | 4.5323 | 0.9893 | 4.5324 | 4.5315 | 0.0010 | 4.5315 | |
| $\phi ''$的均数 | 0.9575 |
用表7.2第2列的标准模式值,可得到示于第3列的相应的冈比特值。例如,在以19½岁为结束的年龄组中,极值是$-ln(-ln(0.1140)) = -0.7753$。需要注意的是累计值应该对应于年龄14½岁,19½岁等,以反映母亲年龄分组中有半年的位移。基于第2列]标准值的累计生育率相邻两组的比值示于第4列,它们的冈比特值示于第5列。比如,在以39½岁为结束的年龄组,它的值是$2.6209=-ln(-ln(0.9298))=-ln(-ln(0.9199/0.9893))$。
当$\beta= 1$时,一阶和二阶导数列于第6和第7列,其公式为:
\[ \frac{d}{d\beta}\,\phi_x(1) = \phi'_x(1) = \frac{ Y^{s}(x+5)\,\exp\!\big(Y^{s}(x)\big) - Y^{s}(x)\,\exp\!\big(Y^{s}(x+5)\big) }{ \exp\!\big(Y^{s}(x)\big) - \exp\!\big(Y^{s}(x+5)\big) } \]
\[ \frac{d^{2}}{d\beta^{2}}\,\phi_x(1) = \phi''_x(1) = \frac{ \left(Y^{s}(x) - Y^{s}(x+5)\right)^{2}\,\exp\!\left(Y^{s}(x) + Y^{s}(x+5)\right) }{ \left(\exp\!\left(Y^{s}(x)\right) - \exp\!\left(Y^{s}(x+5)\right)\right)^{2} } \]
最后,第8列$e(x)$的值由第5列减去第6列得到。
表7.3 当数据没有年龄位移时,推导$e(x)$ 和 $g(x)$
| 年龄 $x$ | $F^s(x)/F$ | $Y^s(x)$ | 比率 | $\phi$ | $\phi '$ | $\phi "$ | $e(x)$ | $g(x)$ |
|---|---|---|---|---|---|---|---|---|
| [1] | [2] | [3] | [4] | [5] | [6] | [7] | [8] | [9] |
| 15 | 0.0028 | –1.7731 | 0.0204 | –1.3591 | –2.3278 | 0.9688 | –2.3278 | |
| 20 | 0.1358 | –0.6913 | 0.3600 | –0.0214 | –1.3753 | 0.9582 | 1.3539 | –1.3753 |
| 25 | 0.3773 | 0.0256 | 0.6200 | 0.7379 | –0.6748 | 0.9629 | 1.4127 | –0.6748 |
| 30 | 0.6086 | 0.7000 | 0.7644 | 1.3143 | 0.0393 | 0.9510 | 1.2750 | 0.0393 |
| 35 | 0.7962 | 1.4787 | 0.8559 | 1.8607 | 0.9450 | 0.9157 | 0.9450 | |
| 40 | 0.9302 | 2.6260 | 0.9378 | 2.7455 | 2.3489 | 0.3966 | 2.3489 | |
| 45 | 0.9919 | 4.8097 | 0.9919 | 4.8098 | 4.8086 | 0.0012 | 4.8086 | |
| $\phi "$的均数 | 0.9575 |
表7.3重复了表7.2的计算过程,但只是针对那些未移位的数据;要得到最终的、没有移位的生育率估算值,必需要计算这些值。使用标准模式的子女数转换数据,即第2列的输入值,表7.4列示了对$e(i)$, $g(i)$和$c$的推导。
表7.4 从子女数数据推导e(i) 和 g(i)
| 年龄组 $i$ | $P^s(i)$ | $Y^s(i)$ | 比率 | $\phi$ | $\phi '$ | $\phi ''$ | $e(i)$ | $g(i)$ |
|---|---|---|---|---|---|---|---|---|
| [1] | [2] | [3] | [4] | [5] | [6] | [7] | [8] | [9] |
| =第2列的冈比特值 | $=P^s(i)/P^s(i + 1)$ | =第4列的冈比特值 | =[5] - [6] | =[6] | ||||
| 0 | 0.0003 | –2.0961 | 0.0056 | –1.6449 | –2.6738 | 1.0289 | –2.6738 | |
| 1 | 0.0521 | –1.0833 | 0.2044 | –0.4622 | –1.7469 | 0.9519 | 1.2846 | –1.7469 |
| 2 | 0.2549 | –0.3124 | 0.5143 | 0.4081 | –1.0159 | 0.9638 | 1.4240 | –1.0159 |
| 3 | 0.4957 | 0.3541 | 0.7014 | 1.0367 | –0.3349 | 0.9597 | 1.3717 | –0.3349 |
| 4 | 0.7067 | 1.0579 | 0.8140 | 1.5810 | 0.4406 | 1.1404 | 0.4406 | |
| 5 | 0.8681 | 1.9561 | 0.8969 | 2.2184 | 1.5162 | 0.7022 | 1.5162 | |
| 6 | 0.9679 | 3.4225 | 0.9701 | 3.4943 | 3.2238 | 0.2705 | 3.2238 | |
| $\phi "$的均数 | 0.9585 |
步骤 5:评估P-点和F-点的作图
按照上述指导原则,我们首先使用所有的P-点和F-点分别拟合模型。其结果展示在随附工作簿的Diagnostic plots工作表的第一张图中(图7.2)。

马拉维2008年人口普查 (蓝色为F点,红色为P点)
虽然拟合P-点和F-点的直线几乎接近,但它们没有特别好地拟合了数据系列。F-点曲线在最年长年龄段显著下降,表明这些年龄上的数据存在一定程度的年龄高报,而P-点刚好位于F-点之下,则表明生育率正在轻微下降。
步骤 6:通过选择的数据点来拟合模型
检验图形表明,如果剔除最后一个年龄组的P-点和F-点,可更好地拟合两条线。剔除这些点,重新检验新的图形(图7.3)。
图7.3 剔除了45-49岁年龄组的数据点后z() - e()对g()作图,
马拉维2008年人口普查 (蓝色为F点,红色为P点)

两条线不再靠近并且不再平行。目测检查提示,剔除下一个最年长年龄组的P-点仍可能使所有剩下的数据点落于在一条线上(图7.4)。

针对所有意图和目的,这些数据点可以被认定落在了一条线上,这意味着这些点所对应的平均子女数和生育率是相互一致的。没有证据表明生育率下降了。尽管剔除35-39岁年龄组的$P-$点也许可以获得更好的拟合,为了一个非常小的拟合改进而进一步减少模型中数据点的数量是不值得的。事实上,剔除35-39岁年龄组的$P-$点将导致均方根误差从0.044略微上升至0.045。
我们可以接受这个冈珀茨关联模型的拟合。工作表中的第三个图表明,最优拟合剩余九个数据点的直线方程为$z() - e()=0.9936.g() - 0.0272$。
由此看来,$\beta$的值被直接确定为0.9936,而$\alpha$的值可从下述公式推导得出,
$ \alpha = -0.0272 - \frac{1}{2}((\beta - 1)^2 c) = -0.0272$
其中,$c$是从表7.2中目前生育率数据(由于数据有半年位移)和表7.4中平均子女数数据得出的$\phi''_{x}(1)$的平均值。
步骤 7:评估拟合参数
$\alpha (-0.0272)$和$\beta (0.9936)$的估计值很好地接近于0和1的标准值。总的来说,$\alpha$为较小的负值表明,马拉维2008年观察到的生育率分布比标准年龄稍大,而$\beta$值小于1表明分布的离散程度比标准稍高。
步骤 8:拟合年龄别生育率和总和生育率
为了确定生育率整体水平,对于那些$P-$点被包括在拟合模型中的年龄组,$\alpha$和$\beta$的拟合值被应用于计算标准子女数模式下的冈比特值(表7.4第3列)以及计算拟合的反冈比特值(表7.5)。将所观察到的一个给定年龄组的平均子女数除以拟合的反冈比特值,就能够得出平均子女数所隐含的生育率水平(表7.5第6列), 并且可以从这些估计值的算术平均值中得出总和生育率$\hat{T}$的估算值(=5.9784)。
表7.5 计算总和生育率的估算值$\hat{T}$,马拉维2008年人口普查
| 年龄组 $i$ | $Y^s(i)$ | $Y(i)$ | 反冈比特值 | $P(i)$ | 隐含的生育率水平 |
|---|---|---|---|---|---|
| [1] | [2] | [3] | [4] | [5] | [6] |
| $=α + βY^s$ | |||||
| 1 | -1.0833 | -1.1034 | 0.0491 | 0.283 | 5.7662 |
| 2 | -0.3124 | -0.3375 | 0.2462 | 1.532 | 6.2218 |
| 3 | 0.3541 | 0.3246 | 0.4854 | 2.849 | 5.8694 |
| 4 | 1.0579 | 1.0239 | 0.6982 | 4.185 | 5.9937 |
| 5 | 1.9561 | 1.9162 | 0.8631 | 5.214 | 6.0407 |
| $\hat{T}$ | 5.9784 |
要获得常规年龄组的年龄别生育率,需要再次应用$\alpha$和$\beta$,但这次将其用于表7.3中的当前生育率的冈比特值,$Y^s(x)$。拟合值的反冈比特值会生成一个累计生育率的分布。这些比例与先前步骤得到的$\hat{T}$估计值相乘,产生绝对累计生育率的分布。两者相减并除以5将得到最终的年龄别生育率(表7.6)。
表7.6的最后一列示列了每名妇女总和生育率(15-49岁)为5.96个子女时的年龄别生育率。
表7.6 计算修正的生育率, 马拉维2008年人口普查
| (至$x$岁的)年龄组 | $Y^s(i)$ | $Y(i)$ | 反冈比特值 | 总和生育率估计值 | 年龄别生育率 |
|---|---|---|---|---|---|
| [1] | [2] | [3] | [4] | [5] | [6] |
| $=\alpha + \beta Y^s(i)$ | $F(x)=[4]*5.9784$ | ${}_5f_{x-5}=(F(x)-F(x-5)) / 5$ | |||
| 15 | -1.7731 | -1.7887 | 0.0025 | 0.0151 | 0.0030 |
| 20 | -0.6913 | -0.7140 | 0.1298 | 0.7758 | 0.1521 |
| 25 | 0.0256 | -0.0017 | 0.3673 | 2.1956 | 0.2840 |
| 30 | 0.7000 | 0.6683 | 0.5989 | 3.5807 | 0.2770 |
| 35 | 1.4787 | 1.4419 | 0.7894 | 4.7194 | 0.2277 |
| 40 | 2.6260 | 2.5817 | 0.9271 | 5.5428 | 0.1647 |
| 45 | 4.8097 | 4.7512 | 0.9914 | 5.9269 | 0.0768 |
| 50 | 13.8155 | 13.6984 | 1.0000 | 5.9784 | 0.0103 |
方法的详述
介绍
冈珀茨关联模型从布拉斯P/F比率法演变而来。它使用相同的输入数据,并使用年轻妇女的平均子女数数据来设置生育率的水平,然而生育率分布的形状则由妇女申报的近期生育数决定。
数理阐述
生育率的冈珀茨关联模型是由布拉斯(1978)提出的,在许多方面都类似于死亡率的罗吉特模型。本模型基于一个标准的生育率分布和可产生所需的特定模式的参数来描述任何生育率分布。作为两个生育率分布之间的关系基础的转换被称为冈珀茨转换。在该模型的最初公式中,它是基于一个累计的比例分布,即其中每个子女数或生育率累计量被表示为总和生育率的一定比例(求和的分布)。因此分布的和为1。变换后的比例被称为冈比特值由公式 $Y(x) = \mathrm{gompit}\!\left(\frac{F(x)}{F}\right)
= -\ln\!\left(-\ln\!\left(\frac{F(x)}{F}\right)\right)$ 计算得出,其中$F(x)$是累计到年龄x岁的年龄别生育率的和,F是总和生育率。如果用各年龄组的平均子女数取代$F(x)$,并用年龄50岁以上的累计子女数取代F,那么相同的关系对于平均子女数同样成立。冈珀茨转换“延伸”了最初的年龄轴,以至于冈比特值和年龄几乎形成一条直线。然而,这种转换并非完美,在两端会略微弯曲,正如图7.5所示。该图描绘了基于布斯(1984)标准模式而估算得到的年龄别生育率。
冈珀茨转换可以作为关联模型的基础,这是因为用各套不同的生育率的冈比特值对年龄作图时,其偏离线性的方式是类似的,因此两组冈比特值本身之间的关系通常是接近线性的。使用关联模型能使模型参数通过直线拟合来估算,这个直接明了的过程使解释结果变得更容易解释。

因为任意两个生育分布的生育累计量的冈比特值具有近似线性的关系,所以可以根据准确的数据将观察到的生育分布的冈比特值与标准分布的冈比特值通过如下关系联系起来:
$Y(x) = \alpha + \beta Y^{s}(x)$,
其中,$Y(x)$为年龄$x$上的累计比例生育率的冈比特值,$Y^s(x)$为标准模式的生育率累计量的冈比特值。
在这个公式中,$\alpha$代表所研究人口的生育年龄与标准模式的生育年龄的差异程度。$\alpha$值为负,表明生育年龄较大。$\beta$代表所研究人口的生育年龄的离散在多大程度上与标准不同。$\beta$值大于1,则表明离散程度低。
事实上,该模型是一个三个参数的模型。通过逆向转换将拟合的冈比特值转变回累计的生育率估算值,从而会产生一个总和为1的比例分布。所有的拟合值要乘以第三个参数以达到正确的生育率水平。这就是分析人员力图估算的总和生育率。但是由于申报错误,基于观测数据的估算可能不可靠。因而最原始的拟合程序(未在这里描述)被扎巴(1981)修正了。下面就对扎巴修正法的贡献和扩展进行阐述。
扎巴的方法主要是基于生育率相邻累计量的比率的冈比特值将对形状参数的估算从对生育率水平的估算中分离:$Y(x) = \mathrm{gompit}\!\left(\frac{F(x)}{F(x+5)}\right)= -\ln\!\left(-\ln\!\left(\frac{F(x)}{F(x+5)}\right)\right)$。
如果累计量$F(x)$符合冈珀茨模型,其参数为$\alpha$和$\beta$,那么
\[ \begin{aligned} Y(x) &= -\ln\!\left(\exp\!\left(-(\alpha + \beta Y^{s}(x))\right) - \exp\!\left(-(\alpha + \beta Y^{s}(x+5))\right)\right) \\ &= \alpha - \ln\!\left(\exp\!\left(-\beta Y^{s}(x)\right) - \exp\!\left(-\beta Y^{s}(x+5)\right)\right) \\ &= \alpha + \phi_x(\beta) \end{aligned} \]
其中$\phi_{x}(\beta)$为$-\ln\!\left(\exp\!\left(-\beta Y^{s}(x)\right) - \exp\!\left(-\beta Y^{s}(x+5)\right)\right)$。
对于$\beta$值接近1的情况,$\phi_{x}(\beta)$可以用$\beta= 1$的一个泰勒级数展开式近似估计:
\[ \phi_x(\beta) = \phi_x(1) + (\beta - 1)\,\frac{d}{d\beta}\phi_x(1) + \frac{(\beta - 1)^2}{2}\,\frac{d^2}{d\beta^2}\phi_x(1) + \cdots \tag{3} \]
根据$\phi_{x}(\beta)$定义,$\phi_x(1) = Y(x)$。另外,$\phi(1)$的一阶和二阶导数可表示如下:
\[ \begin{aligned} \frac{d}{d\beta}\,\phi_x(1) &= \phi'_x(1) = \frac{ Y^{s}(x+5)\,\exp\!\big(Y^{s}(x)\big) - Y^{s}(x)\,\exp\!\big(Y^{s}(x+5)\big) }{ \exp\!\big(Y^{s}(x)\big) - \exp\!\big(Y^{s}(x+5)\big) }, \\[6pt] \frac{d^{2}}{d\beta^{2}}\,\phi_x(1) &= \phi''_x(1) = \frac{ \left(Y^{s}(x) - Y^{s}(x+5)\right)^{2} \,\exp\!\big(Y^{s}(x) + Y^{s}(x+5)\big) }{ \left(\exp\!\big(Y^{s}(x)\big) - \exp\!\big(Y^{s}(x+5)\big)\right)^{2} }. \end{aligned} \tag{4} \]
扎巴(1981)评估了对不同$x$值下的二阶导数的估计值,表明在15≤x<30的范围它基本恒定。(这也可以从表7.2到表7.4对该导数的推导情况中看出来)。因此在这个年龄范围,可用这个量的算术平均值c来取代 $\phi_x''(1)$,并且改写等式(3)为
$Y_x = \alpha + \phi_x(1) + (\beta - 1)\phi'_x(1) + \frac{(\beta - 1)^2}{2}c,$
或者
$Y_x - \phi'_x(1) - \phi_x(1)= \alpha + \frac{c}{2}(\beta - 1)^2 + \beta \phi'_x(1)$。
换句话说,$Y_x+ \phi'_x(1) - \phi_x(1)$和$\phi_x'(1)$之间有线性关系。在随后的研究工作中(思劳格特、布拉斯、埃尔德里奇等1994),扎巴和同事们将这些术语重新表述如下:
| 原术语 | 重新表述的术语 |
|---|---|
| $$ \phi_x'(1) $$ | g(x) |
| $$\phi_x(1)-\phi_x^{\prime}(1)$$ | e(x) |
| $$\mathbf{Y}_{\mathbf{x}}$$ | z(x) |
因此,用修改后的术语,$$z(x)-e(x)=\alpha+(\beta-1)^2\frac{c}{2}+\beta g(x)$$, 意味着在z - e 和 g之间存在线性关系。采用如上述相同的逻辑,也可以将z(i) - e(i) 表达为α, β, c 和 g(i)的类似等式。
拟合步骤的不同形式
这里列出的模型的标准版本使用了近期生育率数据来确定生育模式的形状,并参考(所选择的)平均子女数的数据点来设置生育率水平。该模型还有其他的形式以不同的方式来相对强调一组输入数据。这里介绍的一种就仅仅使用了近期生育率数据。
单F-点形式强调的是近期生育率,并使用这些数据来设置模型中的生育率形状和水平。因此,只有在缺乏平均子女数数据,或者不希望平均子女数数据影响模型拟合时才使用单F-点形式。因此,这个形式只是使用了冈珀茨关联模型来平滑所观察到的生育率。
冈珀茨关联模型的另一个形式只使用平均子女数数据。该形式用于从队列子女数的增加来估算生育率。还有另一个版本,即修正的冈珀茨关联模型,它利用两次普查或调查的数据来估算调查间隔期的生育率。
标准的建构
布斯标准
布斯标准模式的推导细节见布斯(1984)的论文。与这个标准模式及其在冈珀茨关联模型应用相关的重要方面包括,第一、该标准模式旨在应用于中高生育率水平的人口;第二、该标准模式是从由科尔-特拉塞尔生育模型产生的众多生育模式中推导得出的,因此受到科尔-特拉赛尔模型的约束(在大多数情况下,这些约束并不重要)。
本章所用的标准模式和布斯发表的标准模式并不完全相同。首先,扎巴(1981)的标准模式在低于15岁时与布斯的略有不同,以更好地模拟较小年龄上的生育模式。包容这些特点,有可能完全重建扎巴(1981)和思劳格特、布拉斯、埃尔德里奇等(1994)所提出的列表系数。此处所用的标准模式对于未移位系数来说是一致的。当必需移位时,微小差异会出现,源于原始的布斯标准模式已经被内插。扎巴(1981)通过在F(x), F(x + 1),,F(x + 2)的连续值之间进行内插,计算F(x + 1/2),F(x + 3/2)等等的值。然而,鉴于冈比特值的转换会将F(x)线性化,因此更好的做法是,对含半岁年龄的F(x)的冈比特值Y(x)进行内插,然后通过合适的反冈比特值来计算F(x + 1/2),F(x + 3/2)等的值。
其它标准模式的构建
正如前面提到的那样,布斯标准模式是专门用于中高生育率水平的国家。在低生育率水平国家或者生育率模式迥异的国家,应用冈珀茨关联模型需要其他标准。这里简单介绍一下如何推导其他替代标准模式。
构建任何标准模式的基本方法需要一套F(x),将F(x)转换成冈比特值Y(x),然后通过在等式(3)和(4)中已建立的关系得出$$\phi_{x}(1)$$, $$\phi_x^{\prime}(1)$$和 $$\phi_x^{\prime\prime}(1)$$的值。根据这些值,再计算 z(), e() 和 g()。如上所述,对于一个给定的标准模式,$$\phi_x^{\prime\prime}(1)$$的值在年龄15至30岁之间基本恒定,因此使用(年龄组15-19岁,20-24岁和25-29岁)三个值的平均值可以估算常数项c。
要建立一个新的标准模式,应该从一个准确的年龄别生育率系列,$$f^s(x)$$,开始。使用传统的人口分析,可以定义等价的累积量为$$F^s(x)=\int_0^af^s(a)da$$。
在大多数情况下,$$f(a)$$是不可积函数,所以要使用数值计算方法来近似算出积分。以递归方式,使用复合梯形逼近法可得,$$F^s(x)\approx F^s(x-1)+\frac{1}{2}(f^s(x-1)+f^s(x))$$。由此,冈比特值$$z(x)$$可被计算出来,$$z(x)=-\ln(-\ln(F(x))$$。
使用等式4中泰勒展开式的属性,e(x) 和g(x)可以被界定,且其表达式可被推导。z(i), g(i) 和 e(i)的值也可以用类似方式被界定,唯一的扩展是要求导出与F(x)相关联的子女数常量。任何给定的年龄组[x, x + n) 的子女数由下式给出:
$$_nP_x=\int_x^aF(a)da$$。
该等式也可以使用复合梯形逼近法则进行估算。
更多的阅读材料
除了前面提到的文献外,其他有关冈珀茨关联模型的文献是比较匮乏的。尽管部分原因是因为本方法是在《手册十》出版之后才被提出的(布斯1984),但是如何应用该模型的系统阐述只出现在手册SIAP中(思劳格特、布拉斯、埃尔德里奇等1994)。本方法的其他形式也被应用于世界各国的许多场合。
例如,由美国人口普查局(1997年)编写的PASEX套件工作表提供了本模型的一个简化版本,强制用户使用只有2个P-点和2个F-点,或者3个P-点和3个F-点,来拟合直线,而很少考虑所选数据点之间的内部一致性。马拉维国家统计局在分析2008年人口普查生育率数据中采用了这种方法。鉴于对于所有年龄小于40岁的妇女,这些数据有高度的一致性,该报告中的结果(TFR= 6.0)与示例中的结果并没有实质性差异。可是,对于质量不高的数据,不应该理所当然地认为这些结果之间存在一致性。
参考文献
Other than the source material referred to already, literature on the relational Gompertz model is sparse. While this is no doubt due in part to its being described (Booth 1984) shortly after the appearance of Manual X, a coherent exposition of how to apply the model appeared only in the SIAP manual (Sloggett, Brass, Eldridge et al. 1994). The method has been applied in numerous situations around the globe, although not in the form described here.
The PASEX suite of spreadsheets prepared by the US Census Bureau (1997), for example, offers a somewhat simplified version of the model, forcing the user to fit the straight lines to P and F using either just 2 P- points and 2 F- points, or 3 of each, with little regard for the internal consistency of the points chosen. This is the route adopted by the Malawian National Statistics Office in their analysis of fertility data from the 2008 Census. Given the high degree of consistency in these data for all women aged less than forty, the results presented in that report (TFR = 6.0) do not differ in any meaningful way from those presented in the worked example. With less-well behaved data, such congruence of results between the applications should not be taken for granted.
Booth H. 1980. "The estimation of fertility from incomplete cohort data by means of the transformed Gompertz model." Unpublished PhD thesis, London: University of London.
Booth H. 1984. "Transforming Gompertz' function for fertility analysis: The development of a standard for the relational Gompertz function", Population Studies 38(3):495-506. doi: https://dx.doi.org/10.2307/2174137
Brass W. 1978. The relational Gompertz model of fertility by age of woman. London: Centre for Population Studies, London School of Hygiene and Tropical Medicine.
Sloggett A, W Brass, SM Eldridge, IM Timæus, P Ward and B Zaba (eds). 1994. Estimation of Demographic Parameters from Census Data. Tokyo: Statistical Institute for Asia and the Pacific.
US Census Bureau. 1997. Population Analysis Spreadsheets for Excel. Washington, D.C: US Bureau of the Census. https://www.census.gov/population/international/software/pas Accessed: 17 October 2024.
Zaba B. 1981. Use of the Relational Gompertz Model in Analysing Fertility Data Collected in Retrospective Surveys. Centre for Population Studies Research Paper 81-2. London: Centre for Population Studies, London School of Hygiene & Tropical Medicine.
书籍遍历链接: 冈珀茨关联模型
Suggested citation
Moultrie TA. 2013. The relational Gompertz model. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/relational-gompertz-model.