假想世代消亡法
可用数据:多次普查数据
期望得到的数据:成年人死亡率
方法:假想世代消亡法
方法描述
贝纳特和堀内 (1981, 1984)拓展了估算相对于人口数而言的死亡人数申报的完整程度的普莱斯顿-科尔法。这个方法后来被称为假想世代消亡法(SEG)。简单来说,这些方法立足于这样一种观测,即一个封闭的人口中,某一时点a 岁年龄的存活人口数一定会等于该队列在此时点后死亡的人口数。假想世代消亡法的核心内容是,如果未来年龄别的人口增长的影响能被确定,那么一个队列未来的死亡数就可被当前a岁以上各年龄上的死亡人数所替代。最简单的例子就是一个静止(生命表)人口中,年龄a岁以上的未来死亡数等于当时的a岁以上的死亡数。稍复杂的一种情况是,人口是一个稳定人口(成年期各年龄上的人口数每年以固定增长率r增长的一个人口),并且没有迁移。在这种情况下,如果申报的死亡人数准确,那么未来t 年后年龄a岁的死亡人数将等于当前年龄a岁的死亡人数乘以\(e^{rt}\) 。这其实就是普莱斯顿-科尔法的模型基础。
更一般的情况是,人口是一个非稳定人口,而若用\(e^{\int_a^x r(y,t)\,dy}\)替代\(e^{rt}\),其中r(y,t)为时间t年龄y岁的人口的增长率,则以上的等同关系再次成立。
如果时间t上被申报的死亡人数在各成年年龄上都存在相同程度的死亡人数漏报c, 那么队列未来的死亡数的低估程度就都是相同的。因此,可以用从任一时期的死亡数估算的队列未来死亡数的总和除以同期的人口数来估算死亡申报数的完整率。而死亡率的估算则是将每个成年人年龄组申报的死亡人数除以c,再将此结果除以根据用于估算部分出生率和部分死亡率的人口所估算的历险人口数。
数据要求和假定
所需数据列表
• 两个时点(通常为两次人口普查)上, 分五岁组以及开放年龄组A+(A尽可能地高)的女性(或男性)人口数。(参见下文有关使用调查数据而非普查数据的注意事项)
• 两次普查或调查期间的分五岁组以及开放年龄组A+女性(或男性)的死亡人数。
重要假定
• 每次普查中所有的年龄组的覆盖面相同。
• 最低年龄(通常为15岁)以上的所有年龄上的死亡人数申报的完整率相同。
• 所研究人口无人口迁移。虽然这种方法可以考虑迁移因素,但足够准确的净迁移数很少 有。对国家层面的人口来说,国际净迁移规模通常较小,可以忽略。但在迁移规模较大的情况下,需要在解释结果和确定覆盖率的时候考虑到迁移因素。
准备工作和初步检查
在使用本方法之前,至少需要在以下几方面对数据质量进行检查:
人口的年龄结构
人口的性别结构
死亡人口的年龄结构
死亡人口的性别结构
如果申报的死亡不是发生在两次普查期之间,那么需要估算两次普查间隔期内的死亡人数。若有年度的生命登记数据,那么需要将普查间隔期的第一年和最后一年的死亡人数进行分配。如果有两次普查各自调查时点前一年内家庭户的死亡申报人数,那么需要用内插法来估算普查间隔期的死亡数(使用随附的Estimating deaths电子工作簿)。
假想世代消亡法在计算中使用年龄别人口增长率。如果在两次普查登记中的完整率在所有年龄上都按一个恒定比率变化,那么这种年龄别增长率将被低估一个固定值,δ。广义增长平衡法直接估算了这种偏差。而假想世代消亡法没有直接估算δ值,但非零的δ值将导致死亡的完整率估计值随着年龄的增长呈线性趋势。因此,可以通过寻找所选年龄区间之内的每个年龄上的固定的普查覆盖面估计值对δ进行迭代估算。
注意事项和提示
在使用这一方法之前,需要特别注意下列内容。
正如下文所解释的那样,在解释和估算过程中需要考虑死亡数据的来源(生命登记数据、普查中家庭户申报的死亡数、或者医疗机构的记录)。然而,因死亡数据来源不同而产生的偏差对死亡申报完整率估计值的影响,在使用假想世代消亡法时要比使用广义增长平衡法时来得大。
如果将这一方法应用于国家内部的各区域间的分析,人口迁移通常会成为一个更大的问题。
在决定用来确定δ(一次普查相对于另一次普查的覆盖面)的年龄范围时,会有如下问题:对于相同的数据,由广义增长平衡法求得的截距是否就是δ的最佳估计(如下文所解释的那样,如果死亡申报完整率因退休而出现下降,该截距就是δ的最佳估计)?由于本方法假定人口没有迁移,而30或35岁以下的人口的流动性较大,那么是否应将此年龄段上的人口从分析中予以剔除?
确定用来估计完整率的年龄范围。通常地,若存在较大规模的未被统计的人口迁移,年龄范围可能要剔除年轻成年人;若申报的老年人死亡数比年轻成年人少,或者存活老年人和死亡老年人的年龄申报的准确性不同,年龄范围可能也要剔除老年人。
确保Excel中的规划求解程序能正常运行(即,可得出一个合理的结果)。规划求解程序偶尔会给出一个明显较低的结果。在这种情况下,最好在正确的方向上手动调整δ,并从这个新的初始值运行规划求解程序。
确保开放年龄组的平均预期寿命的估计值是合理的。通常,老年人的数据匮乏且特别容易出错。因此,根据这些数据估算的预期寿命可能不可信(通常是高估了预期寿命)。开放组的最低年龄越大,误差的影响就越小。
若死亡申报完整率低于60%,那么其估计值的不确定性就较大。在解释结果时应谨慎考虑。
在使用本方法时,若只有一次普查的人口年龄分布和家庭户死亡数据,则可考虑使用普查时点之前或之后的抽样调查中的相关数据。然而,因一些尚未得到充分研究的原因,这种不同数据来源的组合很少给出令人满意的结果。
方法应用
虽然在技术上这种方法可以应用于单岁年龄组数据,但因所处理的数据常受年龄误报的影响,因此实际上通常使用五岁组数据。由于大多数数据都以这种形式公布,为了方便起见,本章的电子工作表的设计就是针对五岁组数据的。然而,正如布莱克尔(1988)所展示的那样,如果这种分组无法消除对年龄数字申报偏好的影响,那么就需改变将偏好的年龄作为起始年龄的分组法,转而使用将这些年龄居中的其他五岁组的分组法。
步骤 1:如果没有现成数据,则估算两次调查间隔期的死亡申报人数
倘若有年度生命登记数据,那么在间隔期第一年和最后一年,按照两次调查各自平均的实地调查日期之前或之后的时间占该年度的份额比例来分配死亡人数。除非死亡人数的年龄模式变化很快,否则这种做法将不会对结果产生影响。
如果缺少两次调查间隔期内的死亡人数,但该间隔期处于有死亡人数数据的两个时期之间 (例如,每次调查中都含有一个有关上一年内本家庭户死亡人数的问题),那么就可以使用Estimating deaths电子工作表来估计死亡数。这张电子工作表根据其他两个时期的死亡人数来估算两个时点之间的死亡人数。要使用这张电子工作表,需要两个时期(时期1和时期2)分五岁组的死亡人数,每个时期的起止日期,以及所要估算死亡人数的那个时期的起止时间。
步骤 2:估算调整了迁移和不同普查覆盖面后的增长率
调整了迁移和不同普查覆盖面后的年龄别增长率可以根据两次普查人口数和普查间隔期分年龄组的迁移数估算得出,如下所示:
\[{}_{5}r_x=\frac{\ln\left({}_{5}N_x(t_2)/{}_{5}N_x(t_1)\right)}{t_2-t_1}-\frac{{}_{5}NM_x}{(t_2-t_1)\left({}_{5}N_x(t_1)\times{}_{5}N_x(t_2)\right)^{1/2}}+\delta\],
其中,\({}_{5}N_x(t)\)为时间t年龄在x岁和x+5岁之间的人口数,\({}_{5}NM_x\)为年龄在x岁和x+5岁之间的净迁移数(迁入减迁出),t1 和 t2是两次普查的时间。δ为一次普查相对于另一次普查而言的登记完整率的修正系数,它要么被设定为等于从广义增长平衡法得出的估计值,要么如下文所解释的,通过迭代来求解得到。
步骤 3:估算65岁至年龄A岁每隔五岁年龄上的平均预期寿命
此步骤可以通过以下几种方式之一来完成:
如果有可靠的估计数,选择一个独立来源的估计值。可能的数据来源包括前人的研究或诸如《世界人口展望》(联合国人口司2011)等的人口预测。
使用广义增长平衡法得出的估算值。本章随附的工作簿示例了如何运用该方法输出这类估计值。
用10-39岁与40-59岁年龄组的死亡申报数的比率($${}_{30}D_{10}/{}_{20}D_{40}$$)(通过比较)来确定西部模型生命表的水平,并从中选取相应的平均预期寿命的估计值。本章随附的工作簿示例了如何运用该方法输出这类估计值。遗憾的是,由于西部模型生命表不能反映艾滋病死亡率,这种方法不适用于艾滋病高发的国家。
4) 设定一个合理的初始值,如西部模型生命表中得到的估计值(尽管在某些情况下,这种方法可能不适用于艾滋病高发的国家),或由一个独立来源的数据得到的估计值,通过迭代计算得到平均预期寿命。然后估计其完整率,即从随附工作簿的Life expectancies 电子表格中复制平均预期寿命,将这些值粘贴到随附工作簿的Method电子工作表中并重新估计其完整率。若有必要,不断重复以上步骤直至预期寿命的变化变得不再显著为止。遗憾的是,即使是不完整率被校正以后,如果仍有理由怀疑死亡率在较高年龄组被低估(例如,如果存在明显的年龄高报现象,或在较高年龄组存在相对更高的申报不完整率),那么这种方法还是会高估平均预期寿命,从而高估申报完整率的整体水平。
步骤 4:基于死亡申报数估算达到年龄x岁的人口数和年龄x至x+4岁的人口数
死亡申报期间,达到x岁的人口数可以通过死亡申报数估算如下:
\[\hat{N}_x=\hat{N}_{x+5}\exp\left(5\,{}_{5}r_x\right)+{}_{5}D_x\exp\left(2.5\,{}_{5}r_x\right)\]
和
\[\hat{N}_A={}_{\infty}D_A\left[\exp\left({}_{\infty}r_A e_A\right)-\frac{\left({}_{\infty}r_A e_A\right)^2}{6}\right]\],
其中A为开放年龄组的起始年龄,nrx为年人口增长率, eA为年龄A上的平均预期寿命。
死亡申报期间,年龄x至x + 4岁的人口数可通过五年内达到年龄x岁的人口数来估算,公式如下:
\[{}_{5}\hat{N}_x=2.5\left(\hat{N}_x+\hat{N}_{x+5}\right)\]。
步骤 5:基于普查人口估算两次普查间年龄x至x+4岁的人口数
死亡申报期间年龄x至x+4岁的人口数可基于人口普查数据,将两次普查人口中该年龄组人口数的几何平均数乘以两次普查间隔期的长度(按年计算),估算如下:
\[{}_{5}N_x=(t_2-t_1)\left({}_{5}N_x(t_1)\times{}_{5}N_x(t_2)\right)^{1/2}\]。
步骤 6:计算基于死亡人数与基于普查人口数得出的两套估算值的比率
基于申报的死亡人数获取的估计值和基于普查人口数获取的估计值,可以求出两套比率。第一套比率是五岁年龄组上的比率,可直接计算。第二套是从年龄x至开放年龄组A岁的比率,其中达到x至A–1岁的人口数可视为x至A–5岁区间各个五岁组人口数的累计, 即
\[{}_{A-x}\hat{N}_x=\sum_{a=x,5}^{A-5}{}_{5}\hat{N}_a\]。
步骤 7:估算死亡申报的完整率
为了确定死亡申报完整率的水平,首先需要确定是否有必要根据普查登记的完整率来对增长率进行调整。关于比率图的解释将在下文更详细地讨论。但实质上,增长率根据人口普查相对完整率而需要调整的幅度(δ),就是使分年龄比率分布得最水平的那个幅度。Method电子工作表作了设置使规划求解(数据、规划求解、求解)能在用户指定年龄范围内找到一个δ,从而使各年龄比率与其平均值的绝对离差最小。
可以将从广义增长平衡法应用于相同数据得出的截距a用作δ的初始值。如果δ的这个初步估计值在整个成年人年龄组产生一套水平分布的比率,但在较高年龄组比率显著下移,这可能表明较高年龄组的完整率有所下降。这可能是因为人们退休后从市区迁到登记完整率较低的农村地区,或者因为由于家庭某一成员死亡致使家庭解体而产生的死亡漏报。在这种情况下,不去设置产生一套水平分布比率的增长率,而使用最初选择的δ就尤为重要。
如果要用迭代法同时求解δ和平均预期寿命,需将平均预期寿命的值从Life expectancies电子工作表粘贴到Method电子工作表中,产生一套新的δ值。这个过程可能需要重复两至三次,直到平均预期寿命没有显著变化为止。
最后,要决定用于确定完整率比率的年龄范围。如果在较高年龄组有一个显著向上的弯曲,这可能表示存在年龄高报,特别是可能存在死亡人口中的年龄高报。此时,需要尝试确定一个年龄作为开放年龄的下限,使其以下的年龄上的高报现象不明显。如果完整率在年龄低于35岁时就出现下滑,则可能表明存在未被统计的人口迁出。如果有这种嫌疑,那么在确定δ或者完整率时应剔除这些年龄。
完整率可通过五岁年龄组别的比率来估算。为了获得一个有统计说服力的估计值,可以加总中位数的50%以及这些比率的四分之三分位点和四分之一分位点各自的25%。
步骤 8:估算调整了死亡申报不完整率后的死亡率
为计算死亡率,首先需要对相对漏报的普查人口进行修正。如果δ小于0,这种修正可以通过将第一次普查人口数乘以\(\exp\left[-\delta(t_2-t_1)\right]\),以及将第二次普查人口数乘以1得出。若δ大小男,我觉得好像需将这些况下,不去龄组比率显著下移,这可能表明在于0,则相反。
调整的历险人年数PYLa(x,5)由经过修正过的人口数的几何平均数乘以普查间隔期的长度(按年计算)用下式得出:
\[\begin{aligned}PYL^{a}(x,5)&=(t_2-t_1)\left({}_{5}N_x(t_1)e^{-\delta(t_2-t_1)}\times{}_{5}N_x(t_2)\right)^{1/2}\quad \text{if }\delta<0,\\PYL^{a}(x,5)&=(t_2-t_1)\left({}_{5}N_x(t_1)\times{}_{5}N_x(t_2)e^{-\delta(t_2-t_1)}\right)^{1/2}\quad \text{if }\delta>0.\end{aligned}\]。
下一步需将死亡申报数除以申报完整率的估计值,c,以调整死亡数的不完整率,再将调整后的死亡数除以 PYLa(x,5)得出调整了死亡申报不完整率后的死亡率。公式如下所示:
\[{}_{5}m_x=\frac{{}_{5}D_x/c}{PYL^{a}(x,5)}\]。
如果退休年龄以上各年龄的完整率出现下滑,那么可以将这些年龄上各自的完整率来取代整体完整率c以改善对这些年龄上死亡率的估计的准确性。电子工作表中有一个选项反映了这一点。
技术上来说,由于对分子和分母做了同样的调整,忽略对某次普查较低的覆盖面 (相对于另一次普查而言的)所进行的调整仍然可以获得同样的死亡率估计值。然而,在这种情况下,所估算的死亡完整率是相对于两次普查的平均人口数而言的,忽略了某一指标的漏报是相对于另一指标而言的这一事实。
步骤 9:用罗吉特关联模型生命表进行平滑
由于年龄别比率会出现异常波动,因此需要对它们进行平滑处理。可以先找到一个与所研究人口死亡率分布具有相同形状的分性别的标准生命表,然后对其拟合一个布拉斯罗吉特关联函数,从而实现平滑。
本章随附的工作簿包含了一个电子工作表,其中可以通过一个罗吉特关联模型对基于调整过的死亡率生成的生命表进行拟合而得到一组平滑的死亡率。用户可从联合国模型生命表中的一般类别中或从普林斯顿四类模型生命表中选择一个标准生命表。这些生命表的罗吉特转换值以及艾滋病高发人口的模型生命表(提马亚斯 2004)都能在名为Models的电子工作表中找到。如果有理由认为某一生命表与所研究人口的成年人死亡率模式类似,这张电子工作表也允许用户输入该模型生命表的罗吉特转换值。
为拟合此模型,x岁的人在未来5年内的死亡概率5qx,可根据调整过的死亡率估算如下:
\[{}_{5}q_x=\frac{5\,{}_{5}m_x}{1+2.5\,{}_{5}m_x}\]。
据此,基准值l5=1的生命表可计算如下:
\[l_{x+5}=l_x\left(1-{}_{5}q_x\right)\]。
系数ɑ和β由拟合的罗吉特关联模型确定如下:
\[\gamma_x=\alpha+\beta\gamma_x^{s}\],
其中,
\[\gamma_x=0.5\ln\left(\frac{1-l_x}{l_x}\right)\]。
上标‘s’表示是来自标准生命表中的值。
通过运用系数ɑ和β,需要拟合的生命表就可由标准生命表估算如下:
\[\gamma_x^{fitted}=\alpha+\beta\gamma_x^{s}\]
和
\[l_x^{fitted}=\frac{1}{1+\exp\left(2\gamma_x^{fitted}\right)}\]。
可用该生命表推导平滑的死亡率,其过程如下所示:
\[{}_{5}m_x^{fitted}=\frac{l_x^{fitted}-l_{x+5}^{fitted}}{T_x-T_{x+5}}\]
和
\[{}_{\infty}m_x^{fitted}=\frac{l_x^{fitted}}{T_x}\],
其中,
\[ T_x=\sum_{x=x,5}^{\omega} \frac{5}{2} \left( l_x^{\mathrm{fitted}}+l_{x+5}^{\mathrm{fitted}} \right) \]
即
\[T_x=T_{x+5}+\frac{5}{2}\left(l_x^{fitted}+l_{x+5}^{fitted}\right)\]。
ω为最高年龄,即生命表中超过该年龄没有人存活。
如果对较大年龄的预期寿命感兴趣,则预期寿命可以使用以下公式计算:
\[e_x=\frac{T_x}{l_x}\]。
示例
本示例使用的男性人口数据来自南非2001年的人口普查和2007年的社区调查,人口死亡数据来源于南非2001至2007年的生命登记,净迁移估计数来自这两次调查中国外出生的人口数的变化减去估算的调查间隔期内移出南非的人数。本示例在SEG_SouthAfrica_ males工作簿中。
步骤 1:如果没有现成的死亡人数,则估算两次调查间隔期的死亡申报人数
表25.1列出了南非2001—2007年男性的死亡登记人数。
表25.1 计算两次普查时点之间的死亡人口,南非男性,2001-2007年
| 年龄组 | 2001年 | 2002–2006年 | 2007年 | 普查间隔期的合计 |
|---|---|---|---|---|
| 0–4 | 29,005 | 186,346 | 40,314 | 197,912 |
| 5–9 | 2,118 | 14,733 | 2,854 | 15,566 |
| 10–14 | 1,745 | 10,535 | 2,233 | 11,207 |
| 15–19 | 4,470 | 23,857 | 4,860 | 25,473 |
| 20–24 | 8,931 | 51,588 | 10,875 | 54,960 |
| 25–29 | 16,834 | 96,705 | 18,405 | 102,802 |
| 30–34 | 20,892 | 137,355 | 28,245 | 145,588 |
| 35–39 | 21,068 | 137,502 | 29,258 | 145,900 |
| 40–44 | 19,322 | 128,217 | 26,973 | 135,936 |
| 45–49 | 17,881 | 113,891 | 24,761 | 121,010 |
| 50–54 | 16,883 | 104,508 | 22,790 | 111,157 |
| 55–59 | 14,544 | 90,919 | 21,317 | 96,854 |
| 60–64 | 15,097 | 84,351 | 17,410 | 89,930 |
| 65–69 | 13,011 | 77,680 | 17,878 | 82,843 |
| 70–74 | 14,035 | 68,147 | 13,771 | 73,036 |
| 75–79 | 10,846 | 59,859 | 12,534 | 63,871 |
| 80–84 | 9,161 | 44,986 | 8,872 | 48,163 |
| 85+ | 7,602 | 43,233 | 10,009 | 46,196 |
2001年人口普查的标准时点是2001年10月10日零点。因为2007年社区调查发生在2月份的数周期间,所以我们可以假定其标准时点为2007年2月15日零点。这样的话,如果假定各日历年的死亡数都均匀分布,那么可以分配2001年和2007年的死亡人数,并将这些数据与2002至2006年的总数相加以获得在两次普查之间的总死亡人数。例如,20-24岁年龄组的死亡人数计算如下:
\[\frac{22+30+31}{365}\,8931+51588+\frac{31+14}{365}\,10875=54960\]。
步骤 2:估算调整了迁移和不同普查覆盖面后的增长率
减去了净迁入率并调整了普查覆盖率后的年龄别增长率示于表25.2第6列。这些增长率是基于表25.2第二和第3列中的人口数以及第5列中的净迁入数和δ(估算见下文)而来的,比如20—25岁年龄组的增长率计算如下:
\[{}_{5}r_{20}=\frac{\ln(2362519/2099417)}{5.3541}-\frac{14803}{5.3541(2099417\times2362519)^{1/2}}+(-0.00467)=0.0161\],
其中,5.3541是Excel软件中的YEARFRAC函数计算的2001年人口普查和2007年调查之间的间隔年数。
表25.2 人口增长率和从死亡人数估算得到的年龄达到 x岁 以及年龄x 岁和 x+5 岁之间的人口数, 南非男性,2001-2007年
| 年龄 $$x$$ | 时间$$t1$$上$$x$$至$$x+4$$岁的人口数 $${}_{5}N_{x}(t_{1})$$ | 时间$$t2$$上 $$x$$至$$x+4$$岁的人口数 $${}_{5}N_{x}(t_{2})$$ | 两次调查间$$x$$至$$x+4$$岁的死亡人数 $${}_{5}D_{x}$$ | 两次调查间$$x$$至 $$x+4$$岁的净迁入数$${}_{5}NM_{x}$$ | 两次调查间$$x$$至$$x+4$$岁的增长率$${}_{5}rx$$ | 估算的达到$$x$$岁的人口数 $$EST N_{x}$$ | 估算的$$x$$ 岁和$$x+5$$ 岁之间人口数 $$EST {}_{5}N_{x}$$ | |
|---|---|---|---|---|---|---|---|---|
| 0 | 2,223,006 | 2,505,744 | 197,912 | 10,605 | 0.0168 | |||
| 5 | 2,425,066 | 2,560,642 | 15,566 | 2,848 | 0.0053 | 2,304,653 | 11,334,968 | |
| 10 | 2,518,985 | 2,452,339 | 11,207 | 5,153 | -0.0101 | 2,229,335 | 11,405,753 | |
| 15 | 2,453,156 | 2,553,293 | 25,473 | 16,574 | 0.0016 | 2,332,967 | 11,556,063 | |
| 20 | 2,099,417 | 2,362,519 | 54,960 | 14,803 | 0.0161 | 2,289,459 | 10,871,687 | |
| 25 | 1,899,275 | 2,033,165 | 102,802 | 4,714 | 0.0076 | 2,059,216 | 9,851,950 | |
| 30 | 1,594,624 | 1,875,483 | 145,588 | 13,331 | 0.0242 | 1,881,564 | 8,529,425 | |
| 35 | 1,441,657 | 1,548,185 | 145,900 | 9,693 | 0.0074 | 1,530,206 | 7,153,512 | |
| 40 | 1,233,813 | 1,306,900 | 135,936 | 7,464 | 0.0050 | 1,331,199 | 6,238,580 | |
| 45 | 967,744 | 1,104,294 | 121,010 | 8,719 | 0.0184 | 1,164,233 | 5,276,384 | |
| 50 | 769,627 | 888,042 | 111,157 | 9,413 | 0.0199 | 946,320 | 4,242,847 | |
| 55 | 552,402 | 708,812 | 96,854 | 4,640 | 0.0405 | 750,818 | 3,191,145 | |
| 60 | 444,592 | 491,871 | 89,930 | 5,081 | 0.0122 | 525,640 | 2,332,526 | |
| 65 | 304,835 | 394,305 | 82,843 | 4,922 | 0.0407 | 407,371 | 1,662,114 | |
| 70 | 232,604 | 241,976 | 73,036 | 4,334 | -0.0007 | 257,475 | 1,106,744 | |
| 75 | 136,466 | 163,112 | 63,871 | 2,980 | 0.0249 | 185,223 | 721,856 | |
| 80 | 90,856 | 87,698 | 48,163 | 1,662 | -0.0148 | 103,519 | 412,486 | |
| 85 | 45,920 | 70,299 | 46,196 | 2,009 | 0.0683 | 61,475 | ||
步骤 3:估算65岁至年龄A岁每隔五岁年龄上的平均预期寿命
运用广义增长平衡法从相同数据中所得的估算结果示于表25.3第2列。
表25.2第4列中的10-39岁组与40-59岁组的死亡申报的比率为:
\[\frac{485930}{464957}=1.0451\]。
与之对应的男性普林斯顿西部模型生命表的平均预期寿命由内插法(根据工作簿的Life expectancies工作表中的表格)确定,并示于表25.3第3列。例如,65岁组的平均预期寿命为:
\[e_{65}=9.65+\frac{1.045-1.012}{1.062-1.012}(9.35-9.65)=9.452\]。
通过将西部模型生命表中的估计值作为初始值迭代求解增长率和平均预期寿命,得到增长率的估计值为-0.0066%(将在下文更详细地解释),最终的平均预期寿命估算值示于表25.3第4列。
表25. 3 不同数据来源的平均预期寿命,南非男性,2001-2007年
| 年龄 x | 广义增长平衡法 | 普林斯顿西部模型 | 迭代估算值 | 固定δ的广义增长平衡法 |
|---|---|---|---|---|
| 65 | 11.8 | 9.45 | 11.6 | 11.7 |
| 70 | 9.4 | 7.37 | 9.3 | 9.4 |
| 75 | 7.4 | 5.55 | 7.3 | 7.4 |
| 80 | 5.7 | 4.06 | 5.6 | 5.7 |
| 85 | 4.4 | 2.90 | 4.3 | 4.4 |
鉴于南非的艾滋病患病率较高,不能用随附工作簿的Life expectancies工作表中基于西部模型生命表得出的估计值来估算死亡申报的完整率。此外,如下文所述,55岁以后各年龄上的完整率不断下降,迭代得到的估计值可能不理想。因此,在本例中,δ值被设定等于将广义增长平衡法应用于同样数据时得到的截距a,其得到的预期寿命列于表25.3的第5列。
步骤 4:基于死亡申报数估算达到年龄x岁的人口数和年龄x至x+4岁的人口数
用开放年龄组为85+岁的各年龄组的死亡人数、表25.2第6列的增长率和表25.3第5列中85岁时的平均预期寿命4.347岁来估算两次普查之间达到x岁的人口数,结果示于表25.2第7列。例如,两次普查间隔期内达到80岁的人口数,利用开放年龄组85+岁人口的增长率0.0638和年龄80岁至85岁之间的人口增长率估算如下:
\[\hat{N}_{85}=46196\left[\exp(0.0638\times4.347)-(0.0638\times4.347)^2/6\right]=61475\],
\[\hat{N}_{80}=61475\exp(5\times(-0.0148))+48163\exp(2.5\times(-0.0148))=103519\]。
两次普查之间年龄x至x + 4岁的人口数,可通过表25.2第8列给出的死亡申报人数估算。例如,20岁至24岁的人口数计算如下:
\[{}_{5}\hat{N}_{20}=2.5(2289458.6+2059216.1)=10871687\]。
步骤 5:基于普查人口估算死亡申报期内年龄x至x+4岁的人口数
两次普查间,年龄x岁和x+5岁之间的人口数列于表25.4中的第2列。它是根据表25.2第二和第3列的人口数和以及两次普查的间隔年数来计算的。比如,20-24岁组的人数计算如下:
\[{}_{5}N_{20}=5.3540689(2099417\times2362519)^{1/2}=11923972\]。
表25.4 根据普查人口数估算的年龄x至x+4岁的人口数,基于死亡人数与基于普查人口数得出的两套估算值的比率, 南非男性,2001-2007年
| 确切年龄 $$x$$ | 观测到的$$x$$至$$x+4$$人口数 $${}_{5}N_{x}$$ | $$x$$至$$x+4$$岁人口数的完整率 $$C: {}_{5}N_{x}$$ | $$x$$至$$A+$$岁人口数的完整率 $$C: {}_{A–x}N_{x}$$ |
|---|---|---|---|
| 0 | 12,636,377 | ||
| 5 | 13,341,976 | 0.8496 | 0.8981 |
| 10 | 13,307,209 | 0.8571 | 0.9050 |
| 20 | 11,923,972 | 0.9118 | 0.9231 |
| 25 | 10,521,174 | 0.9364 | 0.9256 |
| 30 | 9,259,118 | 0.9212 | 0.9230 |
| 35 | 7,998,828 | 0.8943 | 0.9235 |
| 40 | 6,798,761 | 0.9176 | 0.9322 |
| 45 | 5,534,858 | 0.9533 | 0.9371 |
| 50 | 4,426,301 | 0.9586 | 0.9310 |
| 55 | 3,350,250 | 0.9525 | 0.9191 |
| 60 | 2,503,746 | 0.9316 | 0.9028 |
| 65 | 1,856,232 | 0.8954 | 0.8865 |
| 70 | 1,270,220 | 0.8713 | 0.8799 |
| 75 | 798,803 | 0.9037 | 0.8885 |
| 80 | 477,921 | 0.8631 | 0.8631 |
步骤 6:计算基于死亡申报数求得的估计值与基于普查人口数求得的估计值的比率
两次普查之间基于死亡申报人数(表25.2第8列)估算出的年龄在x岁和x+5岁之间的人口数与基于普查人数估算出的相应人口数的比率示于表25.4的第三和第4列中。例如,65岁的比率计算如下:
\[\frac{{}_{5}\hat{N}_{65}}{{}_{5}N_{65}}=\frac{1662114}{1856232}=0.8954\],
\[\frac{{}_{20}\hat{N}_{65}}{{}_{20}N_{65}}=\frac{1662114+1106744+721856+412486}{1856232+1270220+798803+477921}=0.8865\]。
步骤 7:估算死亡申报完整率
将δ设定为广义增长平衡法得出的截距会得出一系列的比率。尽管有着令人满意的水平分布,但在50岁以后出现随年龄增长而逐渐下降的现象(见图25.1)。因此,本例并没有用规划求解来估算δ值。
完整率的估计只用了25—64岁上的比率,从而在一定程度上避免几个最高年龄组上出现比率下降而引起的低估,尽管单个年龄上的波动对估计值的影响不大。其得出的完整率为94%,算式如下:
\[c=0.5\times0.9340+0.25(0.9203+0.9527)=0.9353=94\%\],
其中0.9340是表25.4第3列中的比率的中位数,0.9023为四分之一的百分位点,0.9527位为四分之三的百分位点。

步骤 8:估算调整了死亡申报不完整率后的死亡率
由于δ小于0,列于表25.5第2列中的第一次人口普查中的调整后的人口数是表25.2第2列中的登记人口数与exp(‑(‑0.00467) x 5.3541)的乘积。例如,年龄20岁调整后的人口数为:
\[2099417\times\exp\left[-(-0.00467\times5.3541)\right]=2152629\]
由于δ小于0,列于表25.5第3列中的第二次人口普查中的调整后的人口数就是表25.2第3列中的登记人口数。
下一步是用表25.2第4列中各年龄组申报的死亡人数除以完整率的估计值来调整死亡人数。这些调整后的值示于表25.5第4列。例如,调整后的20岁的死亡数是基于申报的死亡人数54,960用下式来求得的:
\[\frac{54960}{0.9353}=58764\]。
随着年龄增大,完整率可能出现下降,因此对65岁及以上的年龄选择分年龄的完整率。比如,70-75岁的死亡申报完整率调整后的死亡人口数计算如下:
\[\frac{73036}{0.8713}=83824\]。
表25.5第5列中调整后的存活人年数是表25.5中第二和三列人口数的几何平均数与两次普查间隔长度(本例中是5.3541)的乘积。对于年龄20岁的人而言,调整后的存活人年数为:
\[PYL(20,5)=5.354069(2152629\times2362519)^{1/2}=12074140\]。
死亡申报完整率调整后的死亡率(表25.5第6列)是将调整后的死亡人数除以调整后的存活人年数得出。例如,20-24岁年龄组的调整后的死亡率计算如下:
\[\frac{58764}{12074140}=0.0049\]。
表25. 5 计算调整的死亡率, 南非男性, 2001-2007年
| 确切年龄 $$x$$ | 时间$$t_1$$ 上$$x$$至$$x+4$$岁调整的人口数 $${}_{5}N_{x}(t_{1})$$ | 时间$$t_{2}$$ 上$$x$$至$$x+4$$岁调整的人口数 $${}_{5}N_{x}(t_{2})$$ | $$x$$至$$x+4$$岁调整的死亡人数 $${}_{5}D_{x}$$ | $$x$$至$$x+4$$岁调整的人年数 $$PYL(x,5)$$ | $$x$$至$$x+4$$岁调整的死亡率 $${}_{5}M_{x}$$ |
|---|---|---|---|---|---|
| 0 | |||||
| 5 | 2,486,532 | 2,560,642 | 16,644 | 13,510,001 | 0.0012 |
| 10 | 2,582,831 | 2,452,339 | 11,983 | 13,474,797 | 0.0009 |
| 15 | 2,515,334 | 2,553,293 | 27,236 | 13,568,508 | 0.0020 |
| 20 | 2,152,629 | 2,362,519 | 58,764 | 12,074,140 | 0.0049 |
| 25 | 1,947,414 | 2,033,165 | 109,919 | 10,653,675 | 0.0103 |
| 30 | 1,635,041 | 1,875,483 | 155,667 | 9,375,725 | 0.0166 |
| 35 | 1,478,197 | 1,548,185 | 156,001 | 8,099,564 | 0.0193 |
| 40 | 1,265,085 | 1,306,900 | 145,347 | 6,884,383 | 0.0211 |
| 45 | 992,273 | 1,104,294 | 129,387 | 5,604,563 | 0.0231 |
| 50 | 789,134 | 888,042 | 118,852 | 4,482,045 | 0.0265 |
| 55 | 566,403 | 708,812 | 103,560 | 3,392,442 | 0.0305 |
| 60 | 455,861 | 491,871 | 96,156 | 2,535,277 | 0.0379 |
| 65 | 312,561 | 394,305 | 92,518 | 1,879,609 | 0.0492 |
| 70 | 238,500 | 241,976 | 83,824 | 1,286,217 | 0.0652 |
| 75 | 139,925 | 163,112 | 70,679 | 808,863 | 0.0874 |
| 80 | 93,159 | 87,698 | 55,803 | 483,940 | 0.1153 |
| 85 | 47,084 | 70,299 | 53,524 | 308,032 | 0.1738 |
步骤 9:用罗吉特关联模型生命表进行平滑
用表25.5第6列中调整后的死亡率估算出的x岁男性在未来五年内的死亡概率,5qx,示于表25.6的第2列。例如,一个20岁的男性活到25岁前的死亡概率计算如下:
\[{}_{5}q_{20}=\frac{5\times0.0049}{1+2.5\times0.0049}=0.0240\]。
使用这些值估算的从x岁存活到x+5岁的五岁组的生命表存概活率示于表25.6中第3列。例如,从5岁活到25岁的存活比例计算如下:
\[l_{25}=0.9796(1-0.0240)=0.9560\]。
表25.6 用罗吉特关联模型生命表计算的平滑死亡率, 南非男性, 2001-2007年
| 确切年龄$$x$$ | 死亡概率 $${}_{5}q_{x}$$ | 条件存活概率 $$l_{x}/l_{5}$$ | 观测值的罗吉特值 $$Y(x)$$ | 艾滋病模型生命表的条件存活概率 $$l_{s}(x)$$ | 艾滋病模型生命表的条件死亡存活概率罗吉特值 $$Y_{s}(x)$$ | 拟合的罗吉特值$$Y(x)$$ | 拟合的存活概率概率 $$l(x)$$ | 累计生存人年数$$T(x)$$ | 预期寿命$$e(x)$$ | 平滑的死亡率 $${}_{5}m_{x}$$ |
|---|---|---|---|---|---|---|---|---|---|---|
| 0 | ||||||||||
| 5 | 0.0061 | 1 | 1.0000 | 1 | 51.206 | 51.2 | 0.0030 | |||
| 10 | 0.0044 | 0.9939 | -2.5433 | 0.9785 | -1.9081 | -2.0984 | 0.9852 | 46.243 | 46.9 | 0.0028 |
| 15 | 0.0100 | 0.9894 | -2.2705 | 0.9632 | -1.6326 | -1.7676 | 0.9717 | 41.351 | 42.6 | 0.0024 |
| 20 | 0.0240 | 0.9796 | -1.9350 | 0.9512 | -1.4853 | -1.5907 | 0.9601 | 36.521 | 38.0 | 0.0041 |
| 25 | 0.0503 | 0.9560 | -1.5395 | 0.9324 | -1.3120 | -1.3827 | 0.9408 | 31.769 | 33.8 | 0.0086 |
| 30 | 0.0797 | 0.9079 | -1.1444 | 0.8969 | -1.0818 | -1.1062 | 0.9014 | 27.164 | 30.1 | 0.0152 |
| 35 | 0.0919 | 0.8356 | -0.8128 | 0.8420 | -0.8365 | -0.8116 | 0.8352 | 22.822 | 27.3 | 0.0200 |
| 40 | 0.1003 | 0.7588 | -0.5731 | 0.7794 | -0.6311 | -0.5650 | 0.7559 | 18.845 | 24.9 | 0.0235 |
| 45 | 0.1091 | 0.6827 | -0.3831 | 0.7148 | -0.4593 | -0.3588 | 0.6721 | 15.275 | 22.7 | 0.0239 |
| 50 | 0.1243 | 0.6082 | -0.2199 | 0.6560 | -0.3228 | -0.1948 | 0.5962 | 12.104 | 20.3 | 0.0230 |
| 55 | 0.1418 | 0.5326 | -0.0653 | 0.6048 | -0.2127 | -0.0626 | 0.5313 | 9.285 | 17.5 | 0.0255 |
| 60 | 0.1732 | 0.4571 | 0.0861 | 0.5530 | -0.1064 | 0.0650 | 0.4676 | 6.788 | 14.5 | 0.0335 |
| 65 | 0.2191 | 0.3779 | 0.2493 | 0.4918 | 0.0163 | 0.2124 | 0.3954 | 4.631 | 11.7 | 0.0502 |
| 70 | 0.2802 | 0.2951 | 0.4354 | 0.4119 | 0.1781 | 0.4066 | 0.3072 | 2.874 | 9.4 | 0.0718 |
| 75 | 0.3586 | 0.2124 | 0.6553 | 0.3178 | 0.3819 | 0.6513 | 0.2137 | 1.572 | 7.4 | 0.1013 |
| 80 | 0.4475 | 0.1362 | 0.9235 | 0.2173 | 0.6408 | 0.9622 | 0.1274 | 0.719 | 5.6 | 0.1480 |
| 85 | #N/A | 0.0753 | 1.2542 | 0.1201 | 0.9959 | 1.3887 | 0.0586 | 0.255 | 4.3 | 0.2097 |
条件存活概率的罗吉特转换值示于表25.6第4列。例如,l20的罗吉特转换值计算如下:
\[\gamma_{20}=0.5\ln\left(\frac{1-0.9796}{0.9796}\right)=-1.9350\]。
基于e0 = 50 岁时的艾滋病模型生命表的条件存活概率(表25.6第5列)的罗吉特转换值示于表25.6第6列。正如图25.2所示,艾滋病模型生命表对该数据的拟合效果欠佳,但还是优于那些不考虑艾滋病影响的其他任何模型生命表。

用表25.6第4列和第6列中罗吉特转换值在用户所选择年龄范围内(本例中为45岁和80岁)拟合直线,截距α和斜率β的值分别为0.1928和1.2008。
这些系数随后被用于条件模型生命表的罗吉特转换,从而生成表25.6第7列中的拟合的罗吉特值。例如,20岁时,拟合的罗吉特值计算如下:
\[\gamma_{20}^{fitted}=0.1928+1.2008\times(-1.4853)=-1.5907\]。
这些值随后被用于生成表25.6第8列中拟合的生存函数。例如,20岁时的生存函数计算如下:
\[l_{20}^{fitted}=\frac{1}{1+\exp\left(2\times(-1.5907)\right)}=0.9601\]。
根据拟合的生存函数可以计算表25.6第9列中的条件生存人年数,Tx。用这些条件生存人年数便可求得表25.6第11列中的平滑的死亡率。例如,80岁的条件生存人年数和80-84岁组的平滑的死亡率分别为:
\[T_{80}=0.255+\frac{5}{2}(0.1274+0.0586)=0.719\]
\[{}_{5}m_{80}^{fitted}=\frac{0.1274-0.0586}{0.719-0.2655}=0.1480\]。
表25.6第10列中的平均预期寿命是用第9列的数字除以第8列的数字。例如,65岁的平均预期寿命为:
\[\frac{4.631}{0.3954}=11.71\]。
诊断、分析和解释
核查和验证
完整率的估计值是94%。对这一结果进行的第一种核查是将其与异性的完整率估计值进行对比。比如,将上文针对男性阐述的同样方法应用于同时期的女性数据(名为SEG_SouthAfrica_females工作表),得到的完整率为93%。以往研究(多灵顿, 莫尔特里和提马亚斯2004)也得到了类似的估计值。这些结果如此接近,足够证实估算的有效性。
对估算结果的第二种核查是将其与用广义增长平衡法得出的结果(GGB_South Africa_males工作表)相比。后一种方法求得的5至84岁年龄组死亡人数申报的完整率为92%,这再一次验证了上述估算结果的有效性。
第三种核查是将多种死亡率关键指标的估算值同其他来源求得的估算值进行对比,比如该国以往的估计值或《世界人口展望》中的估算值(联合国人口司2011)。死亡申报完整率调整后的15至60岁之间的成年人死亡概率的估计值为51.9%,而《世界人口展望》中2000至2005年时期的该指标的估计值为52.9%,这也表明没有足够理由来怀疑估算的结果。
有趣的是,基于同样的年龄区间,将普莱斯顿-科尔法应用于这些数据(将两次调查时点上人口数的均数作为这个时期的期中人口数),得到完整率的估计值为84%。将用以确定δ的数据的年龄下限提高至35岁,得到完整率的估计值为86%,仍然略低于上述的94%。
解释
对完整率估计值的检查(图25.1)表明,死亡申报的完整率在年龄55岁似乎随龄增长而逐步下降,这与退休后人口从城市地区迁往登记申报率较低的农村地区的现象相关。由于这些估计值通过使用由广义增长平衡法估计的δ值而获得,并且退休后人口从城市迁往农村是完全有可能的,因此通过降低δ来得出一组更为水平的估计值是不合适的。
由于估算过程中考虑了迁移因素,年轻年龄组上完整率的下降可能是由于较大年龄组上出现的相反方向的迁移,即年轻人从农村地区迁往城市去寻找工作。因此,让这些年龄段上的完整率来过分地影响整体完整率是不正确的。
各年龄上\({}_{5}N_x\)的比率平滑性取决于普查和调查中的人口数而非死亡人口数。因此,这组数据缺乏平滑性可能是因为普查或调查中某些特定年龄组上的人口数存在相对多的漏报和误报。
其他一些与方法有关的问题
死亡申报数的数据来源
一般地,死亡数据有两种类型的问题:一类是导致所有年龄上的调查覆盖面本应相同但实际上却不足或过度的问题。这类问题正是本方法旨在解决的。另一类是导致不同年龄具有不同覆盖面的问题。此类问题能使估计值失真。虽然处理不同来源的死亡数据的一般方法和原理都基本相同,但不同来源的死亡数据会产生不同的偏差,从而可能影响对结果的解释。这些差异虽可由特定的示例阐明,但是一般来说,需要留意死亡数据中的下列偏差。
1)生命登记
如果城乡(或其他类似的代理变量)之间的人口比例随龄变化存在显著不同,且城市地区死亡申报数的完整率明显高于农村地区,那么完整率与年龄无关的假定很可能不成立。这是因为当一部分人因退休从城市迁移到农村时,50岁后完整率会大幅下降。如果忽略这一点,这种对假定的违反很可能会导致对整体完整率水平的低估。
2)家庭户申报的死亡人数
该类数据存在四个潜在问题:
• 如果因一个关键人物(如养家糊口的人)的死亡造成较大比例的家庭解散,那么这类人的死亡漏报就会违反完整率不随年龄改变的假定。如果某些年龄组上相当一部分的死亡比例来自非家庭户的人群(例如,住在敬老院的人群),则违反假定的情况可能会更加严重。然而,这一问题在大多数发展中国家并不普遍。
• 当青年人离家到城市工作时,他们可能被多个家庭(或没有一个家庭)当作成员,他们的死亡可能会被多次申报(或根本不被申报),从而违反完整率是不随年龄改变的假定。在这种情况下,在确定完整率时,可以忽略某一特定年龄以下的数据点以减少影响。
• 参考周期误差:由于对死亡人数申报的具体时段常常是不清楚的,更不用说确切的死亡日期了,因此死亡申报时有可能存在漏报和重报。如果假定这些误报与死者的年龄无关,这种失真会在估计完整率时被考虑,从而对死亡率估计的影响不大。
•参照时期只是普查间隔期内的一小部分。例如,家庭户通常只申报在普查时点前一年的死亡人数。这样一个较短的参考时期不仅可能导致明显的随机波动,而且还存在这样一个问题,即参考期起始时点上的人口数未知。示例中演示了如何来处理这一问题。原则上,如果有第一次普查时家庭户申报的死亡人数,就可以如以上讨论的那样,用这两套死亡数据来估算普查间隔期内的死亡人数。然而,因这一问项在2010年普查周期之前较少使用,分析人员可能只有一套死亡数据。在这种情况下,若普查间隔期内死亡率的年龄模式没有较大的变化,分析人员可计算普查前一年的年龄别死亡率,并将其乘以普查间隔期内的历险人年数以获得这一时期的死亡估计数。如果有理由怀疑间隔期内的死亡率变化很快(比如受艾滋病影响),那么这种方法有可能会低估或高估死亡水平,因此就不建议使用死亡人数分配法。
3)医疗机构中的死亡登记数
这种来源的数据质量好坏鲜为人知。然而,可以预期,完整率将取决于搜集数据的卫生服务部门的分布。在许多发展中国家,这种部门很可能集中在城市地区。同理,如果城市人口与农村人口的比例随年龄而不同,那么完整率就不能被假定为与年龄无关。当然,也可能存在某些特定因素影响着医疗机构中的死亡登记数,如果这些因素很显著且与年龄相关,则可能会进一步违反完整率在所有年龄上不变的假定。
在所有这些情况下,都应避免试图通过调整δ来得出一套水平序列比率的法,且需要确保将那些比率存在失真的年龄在估计c的年龄范围中予以剔除。
一般的诊断解释
在实践中,如果假定被违反,\({}_{5}\hat{N}_x/{}_{5}N_x\)和 \({}_{A}\hat{N}_x/{}_{A}N_x\)两个序列都会受到影响。但在本方法下,大多数典型的对假定的违反都会产生与预期水平线的比较独特的偏离。在某些特定情况下,这些偏离的方式是可解释的。举例如下:
• 普查的相对覆盖面的错误估计:如果δ过高,随着年龄的增长,数据点序列会以近乎直线的方式向下偏离完整率,反之亦然。这一点可通过检查下列的等式(1)而得以确认。此种效果对\({}_{5}\hat{N}_x/{}_{5}N_x\)的影响比对\({}_{A}\hat{N}_x/{}_{A}N_x\)更大。
• 年龄的高报:通常而言,亲属在申报死亡者的死亡年龄时的高报现象比存活者申报自身年龄时的高报现象要更严重。这将导致一个不断上升的数据序列,在开始时难以察觉,而直到高报起始年龄时,才会出现急剧上升的趋势。这种现象也可以通过检查下列的等式(1)而得以确认,这是因为年龄高报不仅会导致老年人死亡数量在较高年龄组的增加,而且较高年龄组内部的死亡人数的错位也会导致那些死亡数被乘上了一个更大的指数项,尽管这种影响不大。提高特定年龄以上的死亡登记的完整率也会产生同样的效果。但是,在实践中似乎尚未有这方面的证据(普莱斯顿、科尔、特拉赛尔等 1980)。
• 人口估计中的年龄误报和年龄别误登:这可通过在年龄区间上的一个不规则的序列来展示。由于\({}_{5}\hat{N}_x\)是一个累计值,它往往与人口的年龄分布高度吻合。因此,如果出现锯齿线,那么出现的峰值就很可能与人口数的重报有关,而出现的谷值则很可能与人口数的漏报有关。如果这些波动与年龄无关,将不会对完整率的估计值有重大影响。但如果这些偏差是系统性的,比如在某一年龄以下存在未被统计的人口迁移,那么在估算完整率中剔除这些点可能会更好。
运用普查或调查中家庭户申报的死亡人数的实例
下面的例子使用了SEG_SouthAfrica_males 和SEG_SouthAfrica_females 两个工作簿中的现成数据,只是用2001年人口普查和2007年社区调查中家庭户申报的上一年的死亡人数替代了生命登记中的死亡人数。这些数据列在表25.7中。
表25.7 家庭户申报的普查/调查前一年内的死亡人数, 南非
| 2001年普查 | 2007年 社区调查 | |||
|---|---|---|---|---|
| 年龄组 | 男性 | 女性 | 男性 | 女性 |
| 0-4 | 35,873 | 32,096 | 48,322 | 44,418 |
| 5-9 | 3,868 | 3,155 | 4,505 | 5,216 |
| 10-14 | 2,590 | 2,284 | 3,442 | 3,259 |
| 15-19 | 5,628 | 5,122 | 8,246 | 7,878 |
| 20-24 | 10,976 | 13,246 | 16,360 | 21,702 |
| 25-29 | 17,787 | 19,727 | 27,551 | 35,840 |
| 30-34 | 20,038 | 18,292 | 34,832 | 42,576 |
| 35-39 | 19,816 | 15,521 | 38,061 | 34,809 |
| 40-44 | 17,417 | 12,124 | 33,604 | 28,823 |
| 45-49 | 15,840 | 10,105 | 27,829 | 20,973 |
| 50-54 | 15,077 | 9,144 | 28,223 | 18,891 |
| 55-59 | 12,781 | 7,755 | 22,868 | 13,118 |
| 60-64 | 13,428 | 10,367 | 18,775 | 14,912 |
| 65-69 | 11,820 | 10,195 | 17,532 | 14,298 |
| 70-74 | 11,885 | 10,809 | 14,879 | 14,645 |
| 75-79 | 8,794 | 8,393 | 12,966 | 14,151 |
| 80-84 | 7,484 | 9,371 | 9,204 | 12,063 |
| 85+ | 7,115 | 12,389 | 11,735 | 18,178 |
在普查时点(2001年10月10日零点)和调查时点(假定为2007年2月15日零点)之间死亡的人数是用两个工作簿Estimating deaths_SouthAfrica_males_hhd 和 Estimating deaths_SouthAfrica_females_hhd 估算出来的。
利用从广义增长法得到的普查覆盖面的相对完整率的估计值(δ),将假想世代消亡法应用于男性数据(在SEG_SouthAfrica_males_hhd工作簿中),其结果表明这些死亡估算数与用生命登记数据得到的结果相似。不过前者得到的15-60岁的死亡概率45q15为53.9%,略高于后者得到的结果。将假想世代消亡法应用于女性数据(在SEG_SouthAfrica_females_hhd工作簿中),其结果表明家庭户申报的女性死亡完整率远低于用生命登记数据得到的结果。前者估算的15-60岁的死亡概率45q15为49.3%,远高于用从生命登记数据得到的42%(相对于男性的死亡概率而言也不太可能)。
当用家庭户申报的女性死亡人数估算死亡完整率时,本方法的结果并不理想。究其原因,可以比较表25.8中由家庭户申报的该时期的死亡数与生命登记系统中调整了不完整程度后的期望死亡数。不难看出,家庭户申报的女性死亡数的完整率在55岁以后随年龄不断下降,这可能是因为去世女性通常是这些家庭的户主,而她们的死亡导致了家庭的解体。
也有迹象表明30岁以下的男性和25岁下的女性的死亡人数的申报过高。
表25.8 从家庭户的死亡申报数中估算的死亡数与期望死亡数的比值,南非
| 男性 | 女性 | |||||
|---|---|---|---|---|---|---|
| 年龄组 | 申报数 | 期望数 | 比率 | 申报数 | 期望数 | 比率 |
| 0-4 | ||||||
| 5-9 | 22,683 | 16,979 | 134% | 22,995 | 14,575 | 158% |
| 10-14 | 16,462 | 12,224 | 135% | 15,173 | 10,349 | 147% |
| 15-19 | 38,013 | 27,784 | 137% | 35,666 | 26,874 | 133% |
| 20-24 | 74,934 | 59,946 | 125% | 95,993 | 84,611 | 113% |
| 25-29 | 124,403 | 112,129 | 111% | 152,718 | 154,437 | 99% |
| 30-34 | 150,792 | 158,796 | 95% | 166,488 | 170,680 | 98% |
| 35-39 | 159,016 | 159,137 | 100% | 137,837 | 141,399 | 97% |
| 40-44 | 140,172 | 148,269 | 95% | 111,910 | 115,746 | 97% |
| 45-49 | 120,016 | 131,988 | 91% | 85,284 | 93,408 | 91% |
| 50-54 | 118,989 | 121,242 | 98% | 76,941 | 81,793 | 94% |
| 55-59 | 97,977 | 105,641 | 93% | 57,353 | 72,131 | 80% |
| 60-64 | 88,088 | 98,089 | 90% | 69,220 | 78,877 | 88% |
| 65-69 | 80,451 | 90,359 | 89% | 67,007 | 86,099 | 78% |
| 70-74 | 72,827 | 79,663 | 91% | 69,536 | 93,404 | 74% |
| 75-79 | 59,632 | 69,665 | 86% | 61,942 | 88,314 | 70% |
| 80-84 | 45,365 | 52,533 | 86% | 58,410 | 77,084 | 76% |
| 85+ | 51,779 | 50,387 | 103% | 83,753 | 108,002 | 78% |
为了模拟只有最近的一次普查才询问了上一年死亡人数的情况,仅用2007年社区调查中家庭户申报的死亡人数来估算2001人口普查和2007年社区调查的间隔期内的每个年龄组的死亡数,其公式如下:
\[\frac{{}_{5}D_x(t_2)}{{}_{5}N_x(t_2)}(t_2-t_1)\left({}_{5}N_x(t_1)\times{}_{5}N_x(t_2)\right)^{1/2}\]。
将本章的方法应用于这些估算的死亡人数,得到男性15-60岁的死亡概率为58.1%,女性为55.6%。与前面的估算值不同,此次估算的是第二次人口普查或调查时点之前的上一年的死亡。鉴于艾滋病导致了这个时期死亡率的上升,上述估算的死亡率应高于整个时期的死亡率。然而,也可能正如所料,仅从某一年的死亡数中得出的估计值相当不可靠(特别是本例数据源自一次样本规模较小的调查),尤其是本例中的女性数据。其他的估计值(布拉德肖、多灵顿和劳布舍 2012)表明2006年修正的男性死亡概率应接近55%,女性应接近45%。
方法的详述
数理阐述
假想世代消亡法的基本思想最初由文森特(1951)提出,即在某个时点某个特定年龄的人口数必须等于该人口从那时起直至最后一个存活者死亡的总死亡数。该方法是普莱斯顿、科尔、特拉赛尔等人(1980)提出的方法的一般形式。后者需要所研究的人口是一个稳定人口。 根据假想世代消亡法,一个队列的人口用未来的死亡人口数可表述如下:
\[N(a,t)=\int_0^{\omega-a}D(a+s,t+s)\,ds\],
其中,\(N(a,t)\)代表在时间t上确切年龄a岁的人口数,\(D(a+s,t+s)\,ds\)代表时间t+s+ds在确切年龄a+s岁和确切年龄a+s+ds岁之间的死亡人数。
通过假定该时期的死亡率不变,并注意到任何年龄上的死亡数将按从时间t至t+s的间隔期内该年龄的累计的人口增长率增长,这些死亡数反过来可以从某一间隔期内的死亡登记数来估计,即
\[D(a+s,t+s)=D(a+s,t)e^{\int_0^s r(a+s,t+z)\,dz}\],
其中,\(r(a+s,t+z)\,dz\)代表在时间t+z至t+z+dz间隔期内年龄a+s岁的人口的年增长率。如果死亡率不随时间而改变,那么\(r(a+s,t+z)=r(a+s-z,t)\),因此
\[N(a,t)=\int_0^{\omega-a}D(a+s,t)e^{\int_0^s r(a+s-z,t)\,dz}\,ds\],
也可以写成
\(N(a,t)=\int_a^{\omega}D(x,t)e^{\int_a^x r(y,t)\,dy}\,dx\)。 (1)
因此,基于某一特定时间间隔内的死亡人数以及年龄别人口增长率,有可能推导出每个年龄上人口数。通过比较这些人口估计数与普查得到的估计数,可以估算得到相对于人口数而言的死亡人数的完整率。
方法实例
由于使用的数据一般会受到年龄误报的影响,因此实际上,通常使用的数据都是分五岁年龄组的。
由此,假定实际上有下列数据:时间t1到t2之间分五岁年龄组的死亡申报数\({}_{5}D_x^{r}\)以及开放年龄组A+的死亡人数\({}_{\infty}D_A^{r}\);时间t1和时间t2两个时点上分五岁年龄组的和开放组的相应的普查人口数\({}_{5}N_x^{r}(t)\)和\({}_{\infty}N_A^{r}(t)\)(其中t= t1或t2)。这些数据随后可用来计算\({}_{\infty}D_x^{r}\)和\({}_{\infty}N_x^{r}\),并且用\((t_2-t_1)\left({}_{5}N_{x-5}^{r}(t_1)\times{}_{5}N_x^{r}(t_2)\right)^{1/2}/5\)来近似估计\(N_x^{r}\),以及用\((t_2-t_1)\left({}_{\infty}N_x^{r}(t_1)\times{}_{\infty}N_x^{r}(t_2)\right)^{1/2}\)来近似估计\(\int_{t_1}^{t_2}{}_{\infty}N_x^{r}(t)\,dt\)。
正如贝纳特和堀内(1981)提议的那样,等式(1)的计算形式可以被推导为:
\(\hat{N}_x=\hat{N}_{x+5}\exp\left(5\,{}_{5}r_x\right)+{}_{5}D_x^{r}\exp\left(2.5\,{}_{5}r_x\right)\), (2)
其中Nx代表在时间t1和t2的两次普查之间达到x岁的人口数,5rx代表时间t1和t2之间年龄x至x+4岁的人口的平均年增长率。
贝纳特和堀内(1981,1984)建议运用分年龄组的增长率来改进对较大年龄的\(\hat{N}_x\)和开放年龄组上的\(\hat{N}_A\)的估计其中,A为开放年龄组的起始年龄。他们建议用下式估算\(\hat{N}_A\):
\[\hat{N}_A={}_{\infty}D_A^{r}\left[\exp\left({}_{\infty}r_A e_A\right)-\frac{\left({}_{\infty}r_A e_A\right)^2}{6}\right]\],
其中,\({}_{\infty}D_A^{r}\)为申报的A岁及以上年龄的死亡人数,\(e_A\)为年龄A岁的预期寿命。
他们也建议,为了允许非线性变化,尤其是在老年期的非线性变化,等式(2)可调整如下:
\[\hat{N}_x=\hat{N}_{x+5}\exp\left[5\,{}_{5}r_x\right]+{}_{5}\gamma_x\,{}_{5}D_x^{r}\exp\left[2.5\,{}_{5}r_x\right]\],
其中 ,
\[{}_{5}\gamma_x=1.00-2.26\,{}_{5}r_x\frac{{}_{5}D_x^{r}}{{}_{5}N_x}+0.218\,{}_{5}r_x-0.826({}_{5}r_x)^2\]。
除此之外,他们还建议,在60岁以上可以通过“假定一个五年期的稳定人口曲线,并相应计算该曲线下方的面积”近似估算\({}_{5}\hat{N}_x\)(贝纳特和堀内1981: 210)。然而,实际数据很少精确到允许以上操作的程度,而这样做也不太会提高完整率估计的准确性。
事实上,在某种程度上,为了校正年龄申报中的年龄尾数偏好,同时为了使死亡数据同习惯上按五岁年龄分组的人口数据相一致,通常需要计算\({}_{5}\hat{N}_x=2.5\left(\hat{N}_x+\hat{N}_{x+5}\right)\)。
此外,由于比率\({}_{5}\hat{N}_x/{}_{5}N_x\)(或甚至如贝纳特和堀内 (1981)所建议的比率\({}_{5}\hat{N}_{x-5}/{}_{10}N_{x-5}\))的序列因年龄误报和某些特定年龄区间的不同漏报而通常存在不平滑的情况,因此,通常假定在某一年龄以上(比如10岁)的各年龄上的申报比例大致相同。可以通过代表性年龄段上的\({}_{5}\hat{N}_x/{}_{5}N_x\)值的平均值或中位数来估算这个固定的比例c(如果必要的话,可基于两次普查不同的完整率对各年龄组的增长率进行调整之后再估算)。通过对年龄组的增长率乘以一个从申报的人口数得到的固定因子δ而产生一个的比率\({}_{5}\hat{N}_x/{}_{5}N_x\) “水平序列”,这就实现了对两次普查的各自的完整率的考虑。
要得到这一结果,假定\({}_{\infty}N_x^{r}(t_1)=k_1{}_{\infty}N_x(t_1)\)且\({}_{\infty}N_x^{r}(t_2)=k_2{}_{\infty}N_x(t_2)\),
那么,
\[{}_{5}r_x^{r}\equiv\ln\left(\frac{{}_{\infty}N_x^{r}(t_2)}{{}_{\infty}N_x^{r}(t_1)}\right)/t=\ln\left(\frac{k_2{}_{\infty}N_x(t_2)}{k_1{}_{\infty}N_x(t_1)}\right)/t={}_{5}r_x+\ln\left(\frac{k_2}{k_1}\right)/t={}_{5}r_x-\delta\],
其中,
\[\delta=\ln\left(\frac{k_1}{k_2}\right)/t\]。
因此,\(1-\delta\cdot t\)(其中t是间隔期的长度)反映了被用于估算各年龄组增长率的两个人口估计值之间的完整率的差异。
\({}_{5}\hat{N}_x/{}_{5}N_x\)序列比率通常与\({}_{A}\hat{N}_x/{}_{A}N_x\)(其中,\({}_{A-x}\hat{N}_x=\sum_{a=x}^{A-5}{}_{5}\hat{N}_a\))序列比率一起作图。后者趋于更加稳定且有助于对数据的解释。
方法的拓展
如果年龄登记准确且没有违反每个年龄上的普查覆盖面相同的假定(这种情况的可能性不大),那么本方法可通过一个将年龄x+n岁及以上的人口数和死亡率剔除后的剪辑版,来处理死亡申报完整率只在一个有限年龄区间(x至x+n岁)上不变的情况。这种调整可以被应用于诸如生命登记数据,其中若人们在城镇退休之后迁往农村,则退休年龄以后各年龄上的完整率会下降。这种调整也可用于家庭户的死亡申报,其中家庭中最后一位成年人的死亡而导致家庭的解体会导致对死亡的漏报。不过,除非x+n足够大,否则这种方法不可能非常有效。广义增长平衡法的类似调整更简单且可能更有效。
更多地阅读材料
有关本方法对常见数据错误和假定违反的敏感度的分析相当有限。读者可以参考以下文献。希尔、尤和蔡(2009)分析了无艾滋病影响下的死亡分布方法的假定,而多灵顿和提玛亚斯(2008)分析了一个显著受到艾滋病影响的人口。然而,穆雷、拉惹勒南、马克斯等 (2010)运用随机模拟对这些方法进行了评估,他们,发现由于有关迁移的假定可能不合理,这些方法都是不特别可靠。
参考文献
Bennett NG and S Horiuchi. 1981. "Estimating the completeness of death registration in a closed population", Population Index 47(2):207-221. doi:
http://dx.doi.org/10.2307/2736447
Bennett NG and S Horiuchi. 1984. "Mortality estimation from registered deaths in less developed countries", Demography 21(2):217-233. doi:
http://dx.doi.org/10.2307/2061041
Blacker J. 1988. An Evaluation of the Pakistan Demographic Survey. Karachi: Pakistan Federal Bureau of Statistics.
http://dx.doi.org/10.2307/2061041
Bradshaw D, RE Dorrington and R Laubscher. 2012. Rapid Mortality Surveillance Report 2012. Cape Town: South African Medical Research Council.
http://www.mrc.ac.za/bod/ RapidMortality2011.pdf
Dorrington RE, TA Moultrie and IM Timæus. 2004. Estimation of mortality using the South African 2001 census data. Monograph 11. Centre for Actuarial Research, University of Cape Town.
http://www.commerce.uct.ac.za/care/Monographs/Monographs/Mono11.pdf
Dorrington RE and IM Timæus. 2008. "Death Distribution Methods for Estimating Adult Mortality: Sensitivity Analysis with Simulated Data Errors, Revisited," Paper presented at Population Association of America 2008 Annual Meeting. New Orleans, Louisiana, 17-19 April.
Hill K, D You and Y Choi. 2009. "Death distribution methods for estimating adult mortality: Sensitivity analysis with simulated data error", Demographic Research 21(Article 9):235-254. doi:
http://dx.doi.org/10.4054/DemRes.2009.21.9
Murray CJL, JK Rajaratnam, J Marcus, T Laakso and AD Lopez. 2010. "What can we conclude from death registration? Improved methods for evaluating completeness", PLoS Med 7(4):e1000262. doi:
http://dx.doi.org/10.1371/journal.pmed.1000262
Preston SH, AJ Coale, J Trussell and M Weinstein. 1980. "Estimating the completeness of reporting of adult deaths in populations that are approximately stable", Population Index 46:179-202. doi:
http://dx.doi.org/10.2307/2736122
Timæus IM. 2004. "Impact of HIV on mortality in Southern Africa: Evidence from demographic surveillance," Paper presented at Seminar of the IUSSP Committee "Emerging Health Threats" HIV, Resurgent Infections and Population Change in Africa. Ougadougou, 12-14 February.
UN Population Division. 2011. World Population Prospects: The 2010 Revision, Volume I: Comprehensive Tables. New York: United Nations, Department of Economic and Social Affairs, ST/ESA/SER.A/313.
http://esa.un.org/unpd/wpp/Documentation/pdf/WPP2010_Volume-I_Comprehensive-Tables.pdf
Vincent P. 1951. "La mortalite des vieillards", Population 6:182-204. doi:
http://dx.doi.org/ 10.2307/1524149
书籍遍历链接: 假想世代消亡法
Suggested citation
Dorrington RE. 2013. Synthetic extinct generations methods. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/synthetic-extinct-generations-methods.