广义增长平衡法
可用数据:多次普查数据
期望得到的数据:成年人死亡率
方法:增长平衡法
方法描述
希尔(1987)将在用布拉斯增长平衡法估算相对于人口数而言的死亡申报的完整率时对所研究人口作的必须是稳定人口的假定,放宽了一个没有迁移的非稳定人口。这种拓展可用于以下场合,即分析人员有两次人口普查中各年龄组的人口数以及两次人口普查间隔期间内的各年龄组的死亡人数。根据两次人口普查中的其他信息,可以估计年龄别增长率来取代人口稳定增长的假定。然而,这种方法还是要假定申报的死亡比例和人口普查登记的完整率在各成年人年龄段都相同,且申报的数据准确。另外,一般来说,该方法假定所研究人口是没有迁移的,尽管该方法在有数据的情况下可以考虑迁移因素。
在所有封闭人口中,\(r(x+)=b(x+)-d(x+)\),其中,部分出生率\(b(x+)\)为x岁的人口在x岁及x岁以上的比例,部分死亡比率\(d(x+)\)为年龄在x岁及x岁以上人口的死亡率。在这个人口中,若各年龄上的死亡漏报程度相同,那么\(b(x+)-r(x+)=d^{r}(x+)/c\),其中\(d^{r}(x+)\)为基于死亡登记数估算的x岁及以上年龄人口的死亡率,c为申报的死亡人数占总死亡数的比例。实际上,用来估算r(x+)的人口普查登记数可能并不完整,但假定各个年龄上的漏报程度相同便可以通过对\(b(x+)-r(x+)\)和\(d^{r}(x+)\)数据点所拟合的直线的斜率来估算c。这样,死亡率可估算如下,即将各年龄组申报的死亡人数除以c,再将这些数字除以估算的历险人数。此外,作为此过程的副产品,完整性较差的人口普查数也可以被调整以确保死亡数和人口登记数值之间的相互一致性,虽然这种调整未必准确。
数据要求和假定
所需数据列表
• 两个时点(通常为两次人口普查)上分五岁组以及开放年龄组A+(A尽可能地高)的女性(或男性)的人口数(请参阅使用调查数据而非普查数据的注意事项)
• 两次普查或调查期间的分五岁组以及开放年龄组A+的女性(或男性)的死亡人数。
重要假定
• 每次普查中所有的年龄的覆盖面相同。
• 最低年龄(5岁或15岁)以上的所有年龄上的死亡申报的完整率相同
• 所研究人口无人口迁移。虽然这种方法可以考虑迁移因素,但很少会有足够准确的净迁移数。对国家层面的人口来说,国际净迁移规模通常较小可以忽略。但在迁移规模较大的情况下,需要在解释结果和估算完整率时考虑迁移因素。
准备工作和初步检查
在使用本方法之前,至少需要在以下方面检查数据的质量:
• 人口的年龄结构
• 人口的性别结构
• 死亡人口的年龄结构
• 死亡人口的性别结构
如果申报的死亡发生在两次人口普查的间隔期之外的一段时期,那么需要估算两次普查间隔期内的死亡人数。倘若有年度生命登记数据,那么需要将普查间隔期的第一年和最后一年的死亡人数进行分配。如果有两次普查各自调查时点前一年内家庭户的死亡申报人数,那么需要用内插法来估算普查间隔期的死亡数(使用随附的“Estimating deaths”电子工作簿)。
注意事项和提示
在使用这一方法之前,需要特别注意下列内容。
正如下文所述,解释和估算过程需要考虑到如下的死亡数据来源(生命登记数据、普查中家庭户申报的死亡数、或者医疗机构的记录)。然而,因死亡数据来源不同而产生的偏差对死亡完整率估计值的影响,在使用增长平衡法估算性时要比使用假想世代消亡法时来得小。
• 如果将本方法应用于国家内部的各区域间的分析,人口迁移通常会成为一个更大的问题。
• 在确定被用于拟合部分出生率和部分死亡率的直线并估算完整性的年龄范围时,会有如下问题。如果存在年龄高报现象,如何选择最佳的开放年龄组?退休后可能发生从城市到登记不完善的农村地区的迁移,从而导致死亡完整性会随年龄增长而下降,那么如何处理在直线上方的较大年龄上的数据点?由于本方法假定没有人口迁移,而30或35岁以下人口的流动性较大,那么是否应剔除此年龄段上的人口?
• 若死亡申报的完整率低于60%,那么估计值的不确定性就较大,在解释结果时应谨慎考虑。
• 在使用本方法时,若只有一次普查的人口年龄分布和家庭户死亡数据,则可考虑使用普查时点之前或之后的抽样调查中的相关数据。然而,因一些尚未得到充分研究的原因,这种不同数据来源的组合很少给出令人满意的结果。
方法应用
虽然在技术上这种方法可以应用于单岁年龄组数据,但因所处理的数据常受年龄误报影响,因此实际上通常使用五岁组的数据。由于大多数数据都以这种形式公布,为了方便起见,本章的电子工作表的设计就是针对五岁组数据的。然而,正如布莱克尔(1988)所展示的那样,如果这种分组无法消除年龄对数字申报偏好的影响,那么就需改变将偏好的年龄作为起始年龄的分组法,转而使用将这些年龄居中的其他五岁组的分组法。
步骤 1:如果没有现成数据,则估算两次调查间隔期的死亡申报人数
倘若有年度生命登记数据,那么在间隔期第一年和最后一年,按照两次调查各自平均的实地调查日期之前或之后的时间占该年度的份额比例来分配死亡人数。除非死亡人数的年龄模式变化很快,否则这种做法将不会对结果产生影响。
如果缺少两次调查间隔期内的死亡人数,但该间隔处于有死亡人数数据的两个时期之间(例如,每次调查中都含有一个有关上一年内本户死亡人数的问题),那么就可以使用Estimating deaths电子工作表来估计死亡数。这张电子工作表根据其他两个时期的死亡人数来估算两个时点之间的死亡人数。要使用这张电子工作表,需要两个时期(时期1和时期2)分五岁组的死亡人数,每个时期的起止日期,以及所要估算死亡人数的那个时期的起止日期。
步骤 2:从高龄到低龄累计人口数量、死亡人数和迁移人数
要估算部分出生率和部分死亡(和迁移)率,需要计算x岁及以上年龄的累计人口数和死亡人数(和净迁移数量)。在累计人口数时,用下列公式
\[N(x+)=\sum_{y=x}^{A-5}{}_{5}N_y+{}_{\infty}N_A\],
其中A是开放年龄组的起始年龄。
类似的公式也可用于来计算x岁及以上年龄的累计死亡人数,D(x+)。当拥有这些数据时(尽管实际中的可能性不大),类似的公式可用于计算x岁及以上的累计的净迁移数,NM(x+)。在迁移数量未知的情况下,此列设为0(或空白),且如下文所述,本方法应用时会考虑到这个忽略。
步骤 3:计算历险人年数,PYL(x+)
为了估算部分出生率和部分死亡率(如果有净迁移的数据,也包括迁移率),需要估算历险人年数。公式如下:
\[PYL(x+)=(t_2-t_1)\left({}_{\infty}N_x(t_1)\times{}_{\infty}N_x(t_2)\right)^{1/2}\],
其中 t1是第一次普查的时间,t2 是第二次人口普查的时间。
步骤 4:计算人口中达到x岁的人口数,N(x)
估计人口中x岁的人口数(即开放年龄组x+岁中的“新生”人口)时,可将一个队列在t1和t2之间的人口数的几何平均数除以5,再乘以普查间隔以年为单位的时间长度。公式如下:
\[N(x)=\frac{t}{5}\left({}_{5}N_{x-5}(t_1)\times{}_{5}N_x(t_2)\right)^{1/2}\],
步骤 5:计算部分出生率b(x+)和部分死亡率d(x+),以及由迁移率i(x+)校正的部分增长率 r(x+)。
部分出生率和部分死亡率由下列公式估算:
\[b(x+)=\frac{N(x)}{PYL(x+)}\],
\[d(x+)=\frac{D(x+)}{PYL(x+)}\],
减去部分迁移率后的部分增长率可以由下列公式计算:
\[r(x+)-nm(x+)=\frac{{}_{\infty}N_x(t_2)-{}_{\infty}N_x(t_1)-NM(x+)}{PYL(x+)}\]。
步骤 6:b(x+) - r(x+) + nm(x+) 与d(x+)作图,检查确定用来拟合直线的年龄范围。
将年龄的下限设为5岁、上限设为A-1岁开始,其中A为开放年龄组的起始年龄。检查诊断图并确定拟合该直线的年龄范围。如果死亡年龄中的年龄高报比存活人口中的年龄高报更严重,那么在图中右边(较高年龄)的数据点将会随年龄的增加逐步落在直线下方。这表明年龄区间的上限年龄应该下调——以五岁为一个单位逐渐下调直到年龄高报的影响消失。另外,如果最后几个年龄组的绝对残差过大(如,超过0.01),那么需要降低最高年龄以防止这些数据点过度影响直线斜率。如果人口中的年龄高报程度与死亡人口中的年龄高报程度相同,那么年龄高报将不会对斜率及死亡申报的完整性产生影响,但这些高报年龄上的死亡率会偏低。
如果图中较小年龄的数据点(左边),特别是15岁到30岁之间的点,明显地偏离所拟合直线,且分析中不包含任何迁移数据,那么这似乎表明存在明显的迁移效应(除非各年龄漏报比例不同)。这种情况下,应根据最佳的直线拟合,提高用于使拟合直线的数据点的年龄区间下限至30岁或35岁。
步骤 7:拟合直线并估算完整率c
为估算相对于人口数而言的死亡人数申报的完整率,可以通过对 b(x+) – r(x+) + i(x+) 与d(x+)作图,用正交回归估算拟合这些数据点的直线的系数,公式如下:
\[ b = \frac{\sigma_y}{\sigma_x} = \frac{ \frac{1}{n-1} \sum_{i=1}^{n} (y_i-\mu_y)^2 }{ \frac{1}{n-1} \sum_{i=1}^{n} (x_i-\mu_x)^2 } \]
以及
\[a=\mu_y-b\mu_x\],
其中,\(b\)是直线的斜率,a是它的截距,yi代表b(x+)-r(x+)+i(x+), xi 代表d(x+), \(\mu_y\)和\(\mu_x\)分别代表两个序列的平均数。
将所有数据点拟合直线之后,可检查各点与直线的拟合效果以及残差以选定最佳年龄范围来确定死亡申报完整率。下文会详细讨论如何操作,但是任何残差值的绝对值超过1%的数据点必须剔除。然后,再根据这些点重新拟合一条直线,并确定新的a和b值。一般来说,不建议在一个明显有年龄偏好的人口中用尾数为0的年龄作为开放年龄组的起点年龄。
死亡人数申报的完整率c,由a和b的值如下得出。因 \(a=\frac{\ln(k_1/k_2)}{t_2-t_1}\), \(b=\frac{k_1/k_2}{c}\), 所以\(\frac{k_1}{k_2}=e^{a(t_2-t_1)}\)。通过假定k1和k2两者中较大者为1,便可估算出c。
因此,如果假定k2=1, 则\(\frac{k_1}{k_2}\)<1, 于是 \(k_1=e^{a(t_2-t_1)}\),从而\(c=\frac{e^{a(t_2-t_1)}}{b}\)。如果假定k1=1, 则\(\frac{k_1}{k_2}\)>1, 于是 \(k_2=e^{-a(t_2-t_1)}\),从而\(c=\frac{e^{-a(t_2-t_1)}}{b}\)。
步骤 8:估算调整了死亡申报不完整性后的死亡率
为了便于计算死亡率,首先需要对有漏报的普查人口数进行修正。这是通过用第一次普查的人口数除以k1以及用第二次普查的人口数除以 k2来实现的。
下一步,用申报的死亡人数除以完整率的估算值c,来对死亡人数的漏报进行调整。
调整过的历险人年数PYLa(x,5)是基于漏报修正后的人口数用前面阐述的几何平均法进行估算的。公式如下:
\[PYL^{a}(x,5)=(t_2-t_1)\left({}_{5}N_x(t_1)/k_1\times{}_{5}N_x(t_2)/k_2\right)^{1/2}\]。
接下来需要调整死亡率。用申报的死亡人数除以完整率的估算值c,再除以PYLa(x,5),从而得出调整了死亡人数申报不完整率后的死亡率。公式如下:
\[{}_{5}m_x=\frac{{}_{5}D_x/c}{PYL^{a}(x,5)}\]。
从技术上来说,忽略调整因子k1/k2仍然可以获得同样的死亡率估计值(因分子和分母做了同样的调整)。然而,在这种情况下,所估算的死亡完整率是相对于两次普查的平均人口数而言的,忽略了某一指标的漏报是相对于另一指标而言的这一事实。
步骤 9:用罗吉特关联模型生命表进行平滑
由于年龄别比率会出现异常波动,因此需要进行平滑处理。这种平滑可以通过找到一个与所研究人口死亡率分布具有相同形状的分性别的标准生命表,并对其拟合一个布拉斯罗吉特关联函数来实现。
本章随附的工作簿包含了一个电子工作表。在这里,分析人员可以通过一个罗吉特关联模型对基于调整过的死亡率生成的生命表进行拟合而得到一组平滑的死亡率。用户可从联合国模型生命表中的一般类别中或从普林斯顿四类模型生命表中选择一个标准生命表。这些生命表的罗吉特转换值以及艾滋病高发人口的模型生命表(提马亚斯 2004)都能在名为“Models”的电子工作表中找到。如果有理由认为某一生命表与所研究人口的成年人死亡率模式类似,这张电子工作表也允许用户输入这个模型生命表的罗吉特转换值。
为拟合此模型,x岁的人在未来5年内的死亡概率5qx,可根据调整过的死亡率估算如下:
\[{}_{5}q_x=\frac{5\,{}_{5}m_x}{1+2.5\,{}_{5}m_x}\]。
基于此,基准值l5=1的生命表可计算如下:
\[l_{x+5}=l_x(1-{}_{5}q_x)\]。
系数ɑ和β由拟合的罗吉特关联模型确定如下:
\[\gamma_x=\alpha+\beta\gamma_x^{s}\],
其中
\[\gamma_x=0.5\ln\left(\frac{1-l_x}{l_x}\right)\],
上标‘s’表示是来自标准生命表中的值。
通过运用系数ɑ和β,需要拟合的生命表就可由标准生命表估算如下:
\[\gamma_x^{fitted}=\alpha+\beta\gamma_x^{s}\]
和
\[l_x^{fitted}=\frac{1}{1+\exp\left(2\gamma_x^{fitted}\right)}\]。
可用该生命表推导平滑的死亡率,其过程如下所示:
\[{}_{5}m_x^{fitted}=\frac{l_x^{fitted}-l_{x+5}^{fitted}}{T_x-T_{x+5}}\]
和
\[{}_{\infty}m_x^{fitted}=\frac{l_x^{fitted}}{T_x}\],
其中,
\[ T_x = \sum_{x=x,5}^{\omega} \frac{5}{2} \left( l_x^{fitted} + l_{x+5}^{fitted} \right) \]
即
\[T_x=T_{x+5}+\frac{5}{2}\left(l_x^{fitted}+l_{x+5}^{fitted}\right)\]。
ω为最高年龄,即生命表中,超过该年龄没有人存活。
示例
本示例使用的男性人口数据来自南非2001年的人口普查和2007年的社区调查,人口死亡数据来源于2001至2007年的生命登记,净迁移估计数来自这两次调查中国外出生的人口数的变化减去估算的调查间隔期内移出南非的人数。本示例在GGB_SouthAfrica_males工作簿中。
步骤 1:如果没有现成的死亡人数,则估算两次调查间隔期的死亡申报人数。
表24.1列出了南非2001—2007年男性的死亡登记人数。
表24.1 计算两次普查时点之间的死亡人口, 南非男性,2001-2007年
| 年龄 | 2001年 | 2002–2006年 | 2007年 | 两次普查间的合计 |
|---|---|---|---|---|
| 0–4 | 29,005 | 186,346 | 40,314 | 197,912 |
| 5–9 | 2,118 | 14,733 | 2,854 | 15,566 |
| 10–14 | 1,745 | 10,535 | 2,233 | 11,207 |
| 15–19 | 4,470 | 23,857 | 4,860 | 25,473 |
| 20–24 | 8,931 | 51,588 | 10,875 | 54,960 |
| 25–29 | 16,834 | 96,705 | 18,405 | 102,802 |
| 30–34 | 20,892 | 137,355 | 28,245 | 145,588 |
| 35–39 | 21,068 | 137,502 | 29,258 | 145,900 |
| 40–44 | 19,322 | 128,217 | 26,973 | 135,936 |
| 45–49 | 17,881 | 113,891 | 24,761 | 121,010 |
| 50–54 | 16,883 | 104,508 | 22,790 | 111,157 |
| 55–59 | 14,544 | 90,919 | 21,317 | 96,854 |
| 60–64 | 15,097 | 84,351 | 17,410 | 89,930 |
| 65–69 | 13,011 | 77,680 | 17,878 | 82,843 |
| 70–74 | 14,035 | 68,147 | 13,771 | 73,036 |
| 75–79 | 10,846 | 59,859 | 12,534 | 63,871 |
| 80–84 | 9,161 | 44,986 | 8,872 | 48,163 |
| 85+ | 7,602 | 43,233 | 10,009 | 46,196 |
2001年人口普查的标准时点是2001年10月10日零点。因2007年社区调查发生在2月份的数周期间,所以我们可以假定其标准时点为2007年2月15日零点。这样的话,如果假定各日历年的死亡数都均匀分布,那么可以分配2001年和2007年的死亡人数,并将这些数据与2002至2006年的总数相加以获得在两次普查之间的总死亡人数。例如,20-24岁年龄组的死亡人数计算如下:
\[\frac{22+30+31}{365}\times8931+51588+\frac{31+14}{365}\times10875=54960\]。
步骤 2:从高龄向低龄累计人口数量、死亡人数和迁移数量
从最高年龄向下累计人口数量、死亡人数和迁移人数(见表24.2)
表24.2 计算累计人口数,死亡人口数、迁移人数,南非,男性,2001-2007
| 年龄 $$x$$ | 时间$$t_1$$上$$x$$至$$x+4$$岁的人口数 $${}_{5}N_x(t_{1})$$ | 时间$$t_2$$上 $$x$$至$$x+4$$岁的人口数 $${}_{5}N_x(t_2)$$ | 两次调查间$$x$$至 $$x+4$$岁的死亡人数 $${}_{5}D_x$$ | 两次调查间x至x+4岁的净迁入数 $${}_{5}NM_x$$ | 时间$$t_1$$上$$x+$$岁的人口数 $$P1(x+)$$ | 时间$$t_2$$ 上$$x+$$岁的人口数 $$P2(x+)$$ | 两次调查之间$$x+$$岁的死亡人数 $$D(x+)$$ | 两次调查期间x+岁的净迁移人数 $$NM(x+)$$ |
|---|---|---|---|---|---|---|---|---|
| 0 | 2,223,006 | 2,505,744 | 197,912 | 10,605 | 21,434,045 | 23,348,679 | 1,568,404 | 128,946 |
| 5 | 2,425,066 | 2,560,642 | 15,566 | 2,848 | 19,211,039 | 20,842,935 | 1,370,492 | 118,341 |
| 10 | 2,518,985 | 2,452,339 | 11,207 | 5,153 | 16,785,973 | 18,282,293 | 1,354,926 | 115,492 |
| 15 | 2,453,156 | 2,553,293 | 25,473 | 16,574 | 14,266,988 | 15,829,955 | 1,343,719 | 110,339 |
| 20 | 2,099,417 | 2,362,519 | 54,960 | 14,803 | 11,813,832 | 13,276,662 | 1,318,246 | 93,766 |
| 25 | 1,899,275 | 2,033,165 | 102,802 | 4,714 | 9,714,415 | 10,914,143 | 1,263,286 | 78,963 |
| 30 | 1,594,624 | 1,875,483 | 145,588 | 13,331 | 7,815,140 | 8,880,977 | 1,160,484 | 74,249 |
| 35 | 1,441,657 | 1,548,185 | 145,900 | 9,693 | 6,220,516 | 7,005,495 | 1,014,896 | 60,918 |
| 40 | 1,233,813 | 1,306,900 | 135,936 | 7,464 | 4,778,859 | 5,457,310 | 868,996 | 51,225 |
| 45 | 967,744 | 1,104,294 | 121,010 | 8,719 | 3,545,046 | 4,150,410 | 733,060 | 43,761 |
| 50 | 769,627 | 888,042 | 111,157 | 9,413 | 2,577,302 | 3,046,116 | 612,050 | 35,042 |
| 55 | 552,402 | 708,812 | 96,854 | 4,640 | 1,807,675 | 2,158,074 | 500,893 | 25,629 |
| 60 | 444,592 | 491,871 | 89,930 | 5,081 | 1,255,273 | 1,449,261 | 404,039 | 20,989 |
| 65 | 304,835 | 394,305 | 82,843 | 4,922 | 810,681 | 957,391 | 314,108 | 15,908 |
| 70 | 232,604 | 241,976 | 73,036 | 4,334 | 505,846 | 563,086 | 231,266 | 10,986 |
| 75 | 136,466 | 163,112 | 63,871 | 2,980 | 273,242 | 321,110 | 158,229 | 6,652 |
| 80 | 90,856 | 87,698 | 48,163 | 1,662 | 136,776 | 157,998 | 94,359 | 3,672 |
| 85 | 45,920 | 70,299 | 46,196 | 2,009 | 45,920 | 70,299 | 46,196 | 2,009 |
步骤 3:计算历险人年数PYL(x+)
计算历险人年数需要估算两次调查之间的时间长度。这可以通过使用Excel电子工作表中的YEARFRAC函数基于普查标准时间的日期计算出来。加总天数除以365会得出一个略微不同的估算值(5.3507 年),但这对完整率的估算的影响很小。
历险人年数列在表24.3的第2列。历险人年数是根据表24.2中第2、3列的累计数计算出来的。例如,20岁人口的历险人年数计算如下:
\[PYL(20+)=5.3541\left(2099417\times2362519\right)^{1/2}=67053861\]。
步骤 4:计算研究人口中达到x岁的人数,N(x)
人口中达到x岁的人数列在表24.3中的第3列。比如,达到20岁的人数是根据表24.1中第2、3列的人口数量估算的:
\[N(20)=\frac{5.3541}{5}\left(2518985\times2553293\right)^{1/2}=2577889\]。
表24.3 计算累计的人口数、死亡数和迁移数, 南非男性, 2001-2007年
| 年龄 | 历险人年数$$PYL(x+)$$ | 人口数 $$N(x)$$ | 部分出生率 $$b(x+)$$ | $$r(x+)-i(x+)$$ | 部分死亡率 $$d(x+) = X$$ | $$b(x+)-r(x+) +i(x+) = Y$$ | $$a+bx$$ | 残差 $$y-(a+bx)$$ |
|---|---|---|---|---|---|---|---|---|
| 0 | 119,775,275 | #N/A | 0.00000 | -0.0047 | ||||
| 5 | 107,136,837 | 2,554,810 | 0.02385 | 0.01413 | 0.01279 | 0.00972 | 0.0093 | 0.0004 |
| 10 | 93,793,458 | 2,611,355 | 0.02784 | 0.01472 | 0.01445 | 0.01312 | 0.0111 | 0.0020 |
| 15 | 80,461,835 | 2,715,670 | 0.03375 | 0.01805 | 0.01670 | 0.01570 | 0.0135 | 0.0022 |
| 20 | 67,053,861 | 2,577,889 | 0.03845 | 0.02042 | 0.01966 | 0.01803 | 0.0168 | 0.0013 |
| 25 | 55,129,886 | 2,212,329 | 0.04013 | 0.02033 | 0.02291 | 0.01980 | 0.0203 | -0.0005 |
| 30 | 44,604,915 | 2,020,991 | 0.04531 | 0.02223 | 0.02602 | 0.02308 | 0.0237 | -0.0006 |
| 35 | 35,344,071 | 1,682,498 | 0.04760 | 0.02049 | 0.02871 | 0.02712 | 0.0266 | 0.0005 |
| 40 | 27,342,320 | 1,469,826 | 0.05376 | 0.02294 | 0.03178 | 0.03082 | 0.0300 | 0.0008 |
| 45 | 20,537,160 | 1,249,916 | 0.06086 | 0.02735 | 0.03569 | 0.03352 | 0.0343 | -0.0007 |
| 50 | 15,001,678 | 992,684 | 0.06617 | 0.02891 | 0.04080 | 0.03726 | 0.0398 | -0.0026 |
| 55 | 10,574,924 | 790,897 | 0.07479 | 0.03071 | 0.04737 | 0.04408 | 0.0470 | -0.0029 |
| 60 | 7,221,483 | 558,171 | 0.07729 | 0.02396 | 0.05595 | 0.05334 | 0.0564 | -0.0030 |
| 65 | 4,716,866 | 448,343 | 0.09505 | 0.02773 | 0.06659 | 0.06732 | 0.0680 | -0.0006 |
| 70 | 2,857,463 | 290,826 | 0.10178 | 0.01619 | 0.08093 | 0.08559 | 0.0836 | 0.0020 |
| 75 | 1,585,932 | 208,577 | 0.13152 | 0.02599 | 0.09977 | 0.10553 | 0.1041 | 0.0014 |
| 80 | 787,071 | 117,144 | 0.14884 | 0.02230 | 0.11989 | 0.12654 | 0.1261 | 0.0005 |
| 85 | 304,201 |
步骤 5:计算部分出生率b(x+)和死亡率d(x+),以及由迁移率i(x+)校正的部分增长率r(x+)
部分出生率和死亡率分别列在表24.3中的第4和第6列。部分出生率和部分死亡率是根据表24.3中第3列的部分出生人数和表24.2中第8列的部分死亡人数估算出来的。例如,20岁时的部分出生率和部分死亡率计算如下:
\[b(20+)=\frac{2577889}{67053861}=0.03845\],
\[d(20+)=\frac{1318246}{67053861}=0.01966\]。
部分增长率减去部分净迁移率的差值列在表24.3中的第5列。例如,20岁时的这个差值是由表24.3第2和3列给出的累计人口数和表24.2最后一列的累计净迁移数计算而得的:
\[r(20+)-i(20+)=\frac{13276662-11813832-93766}{67053861}=0.02042\]。
步骤 6:对b(x+) - r(x+) + nm(x+) 与d(x+)作图,检查该图以确定拟合直线的年龄范围
为了绘制此图并使得直线拟合所有的数据点,需要设定年龄下限为5岁,年龄上限为84岁(因为这些数据的开放年龄区间是85+岁)。基于b(x+) - r(x+) + i(x+)值与d(x+)值的作图示于图23.1中。
对图24.1的图形诊断表明,这些点均落在所拟合直线的附近,说明几乎所有的迁移均被考虑了。因此,没有理改变直线拟合的年龄范围。正如所料,提高年龄下限对所估计的92%的完整率的影响非常小。同样地,即使这个结果可能在一定程度上受到老年期申报完整率下降的影响(参见第25章《假想世代消亡法》对这些数据的应用),剔除最后一个或最后两个数据点(即降低用于拟合数据的年龄上限)所估算的值不会受到较大影响。然而,剔除更多的数据点将使完整率达到令人难以接受的水平,这揭示数据(很可能是人口数)远没有达到完美。

步骤 7:拟合该直线并估算完整率c
图24.1中的数据点所拟合直线的系数如下:
\[b=\frac{\sigma_y}{\sigma_x}=\frac{0.03483}{0.03193}=1.0907\],
\[a=0.0427-1.0878\times0.045=-0.00626\]。
普查中人口登记的相对完整率估算如下:
\[\frac{k_1}{k_2}=\exp(-0.00467\times5.3541)=0.9753\],
由此可见,若k2>k1,所以当我们假定k2 = 1时,那么k1 = 0.9753(即,第一次普查的完整率比第二次普查低2.5%)。
死亡人数的申报完整率c为92%(相对于2007年的登记数而言),计算如下:
\[c=\frac{\exp(-0.004675\times5.3541)}{1.0907}=0.9175\]。
步骤 8:估算调整了死亡申报不完整性后的死亡率
在第一次普查中被调整的人口数是将表24.2第2列中的登记人口数除以k1。例如,调整后20岁的人口数为:
\[\frac{2099417}{0.9753}=2152629\]。
第二次普查中调整的人口数是将表24.2第3列中的登记人口数除以k2。因假定 k2 = 1,这些数据与表24.2第3列中的数据相同。
接下来,将表24.2第4列中各年龄组申报的死亡人数除以(死亡人数)申报完整率来调整死亡人数。这些调整的死亡数列在表24.4的第4列。例如,调整后20岁的死亡人数是根据申报的死亡人数54960通过下式得到的:
\[\frac{54960}{0.9175}=59946\]。
调整的历险人年数(表24.4中的第5列)是表24.4第2和3列中的人口数的几何平均数乘以两次普查之间的时间长度。在本例中,时间长度为5.3541年。调整后20岁人口的历险人年数为:
\[PYL(20,5)=5.3541\left(2152629\times2362519\right)^{1/2}=12074140\]。
因死亡人数申报不完整性而调整的死亡率(表24.4中的第6列)是将调整后的死亡人数除以调整后的历险人年数。例如,调整后的20—24岁的年龄组的死亡率计算如下:
\[\frac{59946}{12074140}=0.0050\]。
表24. 4 计算调整的死亡率, 南非男性,2001-2007年
| 年龄 | 调整后的 第一次普查人口数 $${}_{5}N_x(t_1)$$ | 调整后的第二次普查人口数 $${}_{5}N_x(t_2)$$ | 调整后的 死亡数 $${}_{5}D_x$$ | 调整后的历险人年数$$PYL(x,5)$$ | 调整后的死亡率 $${}_{5}m_{x}$$ |
|---|---|---|---|---|---|
| 0 | |||||
| 5 | 2,486,532 | 2,560,642 | 16,979 | 13,510,001 | 0.0013 |
| 10 | 2,582,831 | 2,452,339 | 12,224 | 13,474,797 | 0.0009 |
| 15 | 2,515,334 | 2,553,293 | 27,784 | 13,568,508 | 0.0020 |
| 20 | 2,152,629 | 2,362,519 | 59,946 | 12,074,140 | 0.0050 |
| 25 | 1,947,414 | 2,033,165 | 112,129 | 10,653,675 | 0.0105 |
| 30 | 1,635,041 | 1,875,483 | 158,796 | 9,375,725 | 0.0169 |
| 35 | 1,478,197 | 1,548,185 | 159,137 | 8,099,564 | 0.0196 |
| 40 | 1,265,085 | 1,306,900 | 148,269 | 6,884,383 | 0.0215 |
| 45 | 992,273 | 1,104,294 | 131,988 | 5,604,563 | 0.0236 |
| 50 | 789,134 | 888,042 | 121,242 | 4,482,045 | 0.0271 |
| 55 | 566,403 | 708,812 | 105,641 | 3,392,442 | 0.0311 |
| 60 | 455,861 | 491,871 | 98,089 | 2,535,277 | 0.0387 |
| 65 | 312,561 | 394,305 | 90,359 | 1,879,609 | 0.0481 |
| 70 | 238,500 | 241,976 | 79,663 | 1,286,217 | 0.0619 |
| 75 | 139,925 | 163,112 | 69,665 | 808,863 | 0.0861 |
| 80 | 93,159 | 87,698 | 52,533 | 483,940 | 0.1086 |
| 85 | 47,084 | 70,299 | 50,387 | 308,032 | 0.1636 |
步骤 9:用罗吉特关联模型生命表进行平滑
由表24.4第6列中的调整后的死亡率估算出的x岁男性在未来5年内死亡的概率5qx列在表24.5的第2列。例如,一位20岁的男性在25岁之前的死亡概率为:
\[{}_{5}q_{20}=\frac{5\times0.005}{1+2.5\times0.005}=0.02452\]。
生命表中利用这些调整的死亡概率估算的由年龄5岁活到在x+5岁的存活比例列在表25.5中的第3列。比如,25岁的存活比例为:
\[l_{25}=0.9792(1-0.02452)=0.9552\]。
表24.5 利用罗吉特关联模型生命计算平滑的死亡率, 南非男性,2001-2007年
| 确切年龄 $$x$$ | 死亡概率 $${}_{5}q_x$$ | 条件存活概率 $$l_x/l_5$$ | 观测值的罗吉特值 $$Y(x)$$ | 艾滋病模型生命表的条件存活概率 $$l^s(x)$$ | 艾滋病模型生命表的条件死亡存活概率罗吉特值 $$Y^s(x)$$ | 拟合的罗吉特值$$Y(x)$$ | 拟合的存活概率概率 $$l(x)$$ | 累计生存人年数$$T(x)$$ | 预期寿命 $$e(x)$$ |
|---|---|---|---|---|---|---|---|---|---|
| 0 | |||||||||
| 5 | 0.0063 | 1 | 1.0000 | 1 | 50.898 | 0.0033 | |||
| 10 | 0.0045 | 0.9937 | -2.5333 | 0.9785 | -1.9081 | -2.0551 | 0.9839 | 45.938 | 0.0029 |
| 15 | 0.0102 | 0.9892 | -2.2605 | 0.9632 | -1.6326 | -1.7292 | 0.9695 | 41.055 | 0.0025 |
| 20 | 0.0245 | 0.9792 | -1.9250 | 0.9512 | -1.4853 | -1.5550 | 0.9573 | 36.238 | 0.0043 |
| 25 | 0.0513 | 0.9552 | -1.5293 | 0.9324 | -1.3120 | -1.3500 | 0.9370 | 31.502 | 0.0089 |
| 30 | 0.0812 | 0.9062 | -1.1339 | 0.8969 | -1.0818 | -1.0777 | 0.8962 | 26.919 | 0.0157 |
| 35 | 0.0936 | 0.8326 | -0.8019 | 0.8420 | -0.8365 | -0.7875 | 0.8285 | 22.608 | 0.0204 |
| 40 | 0.1022 | 0.7546 | -0.5616 | 0.7794 | -0.6311 | -0.5446 | 0.7482 | 18.666 | 0.0237 |
| 45 | 0.1112 | 0.6775 | -0.3711 | 0.7148 | -0.4593 | -0.3414 | 0.6644 | 15.134 | 0.0241 |
| 50 | 0.1267 | 0.6021 | -0.2072 | 0.6560 | -0.3228 | -0.1799 | 0.5890 | 12.001 | 0.0230 |
| 55 | 0.1445 | 0.5259 | -0.0518 | 0.6048 | -0.2127 | -0.0497 | 0.5248 | 9.216 | 0.0254 |
| 60 | 0.1764 | 0.4499 | 0.1005 | 0.5530 | -0.1064 | 0.0760 | 0.4621 | 6.749 | 0.0332 |
| 65 | 0.2146 | 0.3705 | 0.2649 | 0.4918 | 0.0163 | 0.2212 | 0.3912 | 4.616 | 0.0497 |
| 70 | 0.2682 | 0.2910 | 0.4452 | 0.4119 | 0.1781 | 0.4125 | 0.3047 | 2.876 | 0.0709 |
| 75 | 0.3543 | 0.2130 | 0.6535 | 0.3178 | 0.3819 | 0.6536 | 0.2130 | 1.582 | 0.0998 |
| 80 | 0.4269 | 0.1375 | 0.9180 | 0.2173 | 0.6408 | 0.9598 | 0.1279 | 0.730 | 0.1459 |
| 85 | #N/A | 0.0788 | 1.2293 | 0.1201 | 0.9959 | 1.3799 | 0.0595 | 0.261 | 0.2070 |
基于e0 = 50岁时的艾滋病模型生命表的条件存活概率 (表24.5第5列)的的罗吉特转换值(表24.5中的第6列)。从图24.2可看出,艾滋病模型生命表对该数据的拟合效果欠佳,但还是优于那些不考虑艾滋病影响的其他任何模型生命表。

系数ɑ和β为拟合直线的截距和斜率。该直线是基于所选年龄区间(本例为45至80岁)上的数据点的罗吉特转换值拟合而成的(表24.5第4和6列)。两个系数的值分别为 0.2019和 1.1828。
这些系数然后被应用于条件模型生命表的罗吉特转换从而生成表24.5第7列中得拟合的罗吉特值。例如,20岁时,拟合的罗吉特值计算如下:
\[\gamma_{20}^{fitted}=0.2019+1.1828(-1.4853)=-1.555\]。
这些值然后又被用来生成表24.5第8列中拟合的生存函数。例如,20岁时的生存函数计算如下:
\[l_{20}^{fitted}=\frac{1}{1+\exp\left(2(-1.555)\right)}=0.9573\]。
表24.5第9列中列出了条件历险人年数Tx是由该拟合的生命表计算得出的,并且这些数据随后用于得出表24.5第10列中的平滑的死亡率。例如,80岁时的数值为
\[T_{80}=0.261+\frac{5}{2}(0.1279+0.0595)=0.7299\],
\[{}_{5}m_{80}^{fitted}=\frac{0.1279-0.0595}{0.7299-0.261}=0.1459\]。
诊断、分析和解释
核查和验证
完整率的估计值是92%。对这一结果进行的第一种核查是将其与异性的完整率估计值进行对比。比如,将上文针对男性阐述的同样方法应用于同时期的女性数据(名为GGB_SouthAfrica_females工作表),得到的完整率为89%。以往研究(多灵顿, 莫尔特里和提马亚斯2004)也得到了类似的估计结果。这些结果如此接近,足够证实估算的有效性。
对估算结果的第二种核查是将其与用假想世代消亡法得出的结果(SEG_SouthAfrcia_males 工作簿)相比。后一种方法求得的5至84岁年龄组死亡人数申报的完整率为94%,这再一次验证了上述估算结果的有效性。
第三种核查是将多种死亡率关键指标的估算值同其他来源求得的估算值进行对比,比如该国以往的估计值或《世界人口展望》中的估算值(联合国人口司2011)。死亡申报完整率调整后的15至60岁之间的成年人死亡概率的估计值为52.3%,而《世界人口展望》中2000至2005年时期的该指标的估计值为52.9%,这也表明没有足够理由来怀疑估算的结果。
有趣的是,基于同样的年龄区间,将布拉斯广义增长平衡法应用于这些数据(将两次调查时点上人口数的均数作为这个时期的期中人口数),得到完整率的估计值为85%。将拟合直线的年龄下限提高至35岁,得到完整率的估计值为88%,仍然略低于上述的92%。
解释
如上所述,在确定拟合直线的年龄范围时,将开放年龄组从85+岁逐一下调至75+岁都得出了几乎相同的死亡人数申报的完整率。然而,当开放年龄组下调至70+岁时,得到的死亡人数申报的完整率为100%,65+岁时为105%,60+岁时为108%。即使人口普查和调查中的男性人口数存在低估,这种低估也很有可能集中在年轻的成年人群体,而不太可能如此大,以至于在同人口数的完整率相比时死亡人数的完整率高于100%。而且,在其他条件相同的情况下,开放年龄组的年龄越小,其完整率估算值的可靠性越小。因此,较高年龄的开放组所得到的较低的完整率的估算值更好。
其他一些与方法有关的问题
死亡申报数的数据来源
一般地,死亡数据有两种类型的问题:一类是导致所有年龄上的调查覆盖面本应相同但实际上却不足或过度的问题。这类问题正是本方法旨在解决的。另一类是导致不同年龄具有不同覆盖面的问题。此类问题能使估计值失真。虽然处理不同来源的死亡数据的一般方法和原理都基本相同,但不同来源的死亡数据会产生不同的偏差,从而可能影响对结果的解释。这些差异虽可由特定的示例阐明,但是一般来说,需要留意死亡数据中的下列偏差。
1) 生命登记
如果城乡(或其他类似的代理变量)之间的人口比例随龄变化存在显著不同,且城市地区死亡申报数的完整率明显高于农村地区,那么完整率与年龄无关的假定很可能不成立。这是因为当一部分人因退休从城市迁移到农村时,50岁后完整率会大幅下降。如果忽略这一点,这种对假定的违反很可能会导致对整体完整率水平的低估。
2)家庭申报的死亡人数
该类数据存在四个潜在问题:
• 如果因一个关键人物(如养家糊口的人)的死亡造成较大比例的家庭解散,那么这类人的死亡漏报就会违反完整率不随年龄改变的假定。如果某些年龄组上相当一部分的死亡比例来自非家庭户的人群(例如,住在敬老院的人群),则违反假定的情况可能会更加严重。然而,这一问题在大多数发展中国家并不普遍。
• 当青年人离家到城市工作时,他们可能被多个家庭(或没有一个家庭)当作成员,他们的死亡可能会被多次申报(或根本不被申报),从而违反完整率是不随年龄改变的假定。在这种情况下,在确定完整率时,可以忽略某一特定年龄以下的数据点以减少影响。
• 参考周期误差:由于对死亡人数申报的具体时段常常是不清楚的,更不用说确切的死亡日期了,因此死亡申报时有可能存在漏报和重报。如果假定这些误报与死者的年龄无关,这种失真会在估计完整率时被考虑,从而对死亡率估计的影响不大。
• 参照时期只是普查间隔期内的一小部分。例如,家庭户通常只被要求申报在普查时点前一年的死亡人数。这样一个较短的参照时期不仅可能导致明显的随机波动,而且还存在这样一个问题,即参照期起始时点上的人口数未知。示例中演示了如何来处理这一问题。但如果有第一次普查时家庭户申报的死亡人数,就可以如以上讨论的那样,用这两套死亡数据来估算普查间期内的死亡人数。然而,因这一问项在2010年普查周期之前较少使用,分析人员可能只有一套死亡数据。在这种情况下,若普查间隔期内死亡率的年龄模式没有较大的变化,分析人员可计算普查前一年的年龄别死亡率并将其乘以普查间隔期内的历险人年数以获得这一时期的死亡估计数。如果有理由怀疑间隔期内的死亡率变化很快(比如受艾滋病影响),那么这种方法有可能会低估或高估死亡水平,因此就不建议使用死亡人数分配法。
3)医疗机构中的死亡登记数
这种来源的数据质量好坏鲜为人知。然而,可以预期,完整率将取决于搜集数据的卫生服务部门的分布。在许多发展中国家,这种部门很可能集中在城市地区。同理,如果城市人口与农村人口的比例随年龄而不同,那么完整率就不能被假定为与年龄无关。当然,也可能存在某些特定因素影响着医疗机构中的死亡登记数,如果这些因素很显著且与年龄相关,则可能会进一步违反完整率在所有年龄上不变的假定。
运用普查或调查中家庭户申报的死亡人数的实例
下面的例子使用了与GGB_SouthAfrica_males 和GGB_SouthAfrica_females 两个工作簿中的现存数据,只是将2001年人口普查和2007年社区调查中家庭户申报的上一年的死亡数替代了生命登记中的死亡人。这些数据列在表24.6中。
表24.6 家庭户申报的发生在普查/调查前一年内死亡人数, 南非
| 2001 年普查 | 2007 年社区调查 | |||
|---|---|---|---|---|
| 年龄组 | 男性 | 女性 | 男性 | 女性 |
| 0-4 | 35,873 | 32,096 | 48,322 | 44,418 |
| 5-9 | 3,868 | 3,155 | 4,505 | 5,216 |
| 10-14 | 2,590 | 2,284 | 3,442 | 3,259 |
| 15-19 | 5,628 | 5,122 | 8,246 | 7,878 |
| 20-24 | 10,976 | 13,246 | 16,360 | 21,702 |
| 25-29 | 17,787 | 19,727 | 27,551 | 35,840 |
| 30-34 | 20,038 | 18,292 | 34,832 | 42,576 |
| 35-39 | 19,816 | 15,521 | 38,061 | 34,809 |
| 40-44 | 17,417 | 12,124 | 33,604 | 28,823 |
| 45-49 | 15,840 | 10,105 | 27,829 | 20,973 |
| 50-54 | 15,077 | 9,144 | 28,223 | 18,891 |
| 55-59 | 12,781 | 7,755 | 22,868 | 13,118 |
| 60-64 | 13,428 | 10,367 | 18,775 | 14,912 |
| 65-69 | 11,820 | 10,195 | 17,532 | 14,298 |
| 70-74 | 11,885 | 10,809 | 14,879 | 14,645 |
| 75-79 | 8,794 | 8,393 | 12,966 | 14,151 |
| 80-84 | 7,484 | 9,371 | 9,204 | 12,063 |
| 85+ | 7,115 | 12,389 | 11,735 | 18,178 |
在普查时点(2001年10月10日零点)和调查时点(假定为2007年2月15日零点)之间死亡的人数是用两份电子工作簿Estimating deaths_SouthAfrica_males_hhd 和 Estimating deaths_SouthAfrica_females_hhd 估算出来的。
将广义增长平衡法应用于男性数据(在GGB_SouthAfrica_males_hhd工作簿中),结果表明这些死亡估算数与用生命登记数据得到的完整率相似。不过前者得到的15-60岁的死亡概率45q15为54.3%,略高于用后者得到的结果。将广义增长平衡法应用于女性数据(在GGB_SouthAfrica_females_hhd工作簿中),结果表明家庭户申报的女性死亡完整率远低于用生命登记数据得到的结果。前者估算的15-60岁的死亡概率45q15为50.3%,也远高于(相对于男性的死亡概率而言,其可能性不大)用生命登记数据得到的42%。
当用家庭户申报的女性死亡人数估算死亡完整率时,本方法的结果并不理想。究其原因,可以比较表24.7中的由家庭户申报的该时期的死亡数与生命登记系统中调整了登记不完整率后的期望死亡数。不难看出,家庭户申报的女性死亡数的完整率在55岁以后随年龄不断下降,这可能是因为去世女性通常是这些家庭的户主,而她们的死亡导致了家庭的解体。
也有迹象表明30岁以下的男性和25岁下的女性的死亡人数的申报过高,可能是因为他们的死亡被多个家庭重复申报了。
表24.7 从家庭户的死亡申报数中估算的死亡数与期望死亡数的比值,南非
| 男性 | 女性 | ||||||
|---|---|---|---|---|---|---|---|
| 年龄组 | 申报数 | 期望数 | 比率 | 申报数 | 期望数 | 比率 | |
| 0-4 | |||||||
| 5-9 | 22,683 | 16,979 | 134% | 22,995 | 14,575 | 158% | |
| 10-14 | 16,462 | 12,224 | 135% | 15,173 | 10,349 | 147% | |
| 15-19 | 38,013 | 27,784 | 137% | 35,666 | 26,874 | 133% | |
| 20-24 | 74,934 | 59,946 | 125% | 95,993 | 84,611 | 113% | |
| 25-29 | 124,403 | 112,129 | 111% | 152,718 | 154,437 | 99% | |
| 30-34 | 150,792 | 158,796 | 95% | 166,488 | 170,680 | 98% | |
| 35-39 | 159,016 | 159,137 | 100% | 137,837 | 141,399 | 97% | |
| 40-44 | 140,172 | 148,269 | 95% | 111,910 | 115,746 | 97% | |
| 45-49 | 120,016 | 131,988 | 91% | 85,284 | 93,408 | 91% | |
| 50-54 | 118,989 | 121,242 | 98% | 76,941 | 81,793 | 94% | |
| 55-59 | 97,977 | 105,641 | 93% | 57,353 | 72,131 | 80% | |
| 60-64 | 88,088 | 98,089 | 90% | 69,220 | 78,877 | 88% | |
| 65-69 | 80,451 | 90,359 | 89% | 67,007 | 86,099 | 78% | |
| 70-74 | 72,827 | 79,663 | 91% | 69,536 | 93,404 | 74% | |
| 75-79 | 59,632 | 69,665 | 86% | 61,942 | 88,314 | 70% | |
| 80-84 | 45,365 | 52,533 | 86% | 58,410 | 77,084 | 76% | |
| 85+ | 51,779 | 50,387 | 103% | 83,753 | 108,002 | 78% | |
为了模拟只有最近的普查才询问上一年死亡人数的情况,仅用2007年社区调查中家庭户申报的死亡人数来估算2001人口普查和2007年社区调查间隔期内的每个年龄组的死亡数。其公式如下:
\[\frac{{}_{5}D_x(t_2)}{{}_{5}N_x(t_2)}(t_2-t_1)\left({}_{5}N_x(t_1)\times{}_{5}N_x(t_2)\right)^{1/2}\]。
将本章的方法应用于这些估算的死亡人数,得到男性15-60岁的死亡概率为58.6%,女性为57.8%。与前面的估算值不同,此次估算的是第二次人口普查或调查时点之前的上一年的死亡。鉴于艾滋病导致了这个时期死亡率的上升,上述估算的死亡率应高于整个时期的死亡率。然而,也可能正如所料,仅从某一年的死亡数中得出的估计值相当不可靠(特别是本例数据源自一次样本规模较小的调查),尤其是本例中的女性数据。其他的估计值(布拉德肖、多灵顿和劳布舍 2012)表明2006年修正的男性死亡概率应接近55%,女性应接近45%。
方法的详述
数理阐述
广义增长平衡法遵循的逻辑与布拉斯增长平衡法相同(布拉斯 1975),这种逻辑来源于卡瑞尔(1958)的研究,后者提出了由死亡人数的年龄分布来估算死亡率的方法。这种方法基于一个人口(为便于解释,假定没有人口迁移)的人口平衡方程中所体现的人口变化要素之间的关系。在这一人口中,t2时点的人口数是t1时点的人口数加上t1至 t2之间的出生人数减去t1至t2之间的死亡人数。也就是,\({}_{\infty}N_0(t_2)={}_{\infty}N_0(t_1)+B-D\),其中B 和 D分别为时间t1至 t2之间的出生人数和死亡人数。这个方程可以推广到任何x岁及以上年龄的人口,只要我们有t1至 t2之间的一个达到x岁的人口数(即通过年龄的增加而进入该年龄区间的人口数),\(N_x\),以及t1至 t2之间x岁及以上年龄的死亡人数,\({}_{\infty}D_x\)。于是
\({}_{\infty}N_x(t_2)={}_{\infty}N_x(t_1)+N_x-{}_{\infty}D_x \tag{1} \)
如果改写等式(1)为
\[{}_{\infty}N_x(t_2)-{}_{\infty}N_x(t_1)\]=\(N_x-{}_{\infty}D_x\),
再除以时间t1至 t2之间的历险人年数\(\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt\), 该等式可用率来表示,即
$$r(x+)=b(x+)-d(x+) \tag{2} $$
其中,
\[r(x+)=\frac{{}_{\infty}N_x(t_2)-{}_{\infty}N_x(t_1)}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\],
\[b(x+)=\frac{N_x}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\],
\[d(x+)=\frac{{}_{\infty}D_x}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\]。
b(x+)和d(x+)分别称为部分出生率和部分死亡率。
这些关系仅适用于以下情况,即t1至t2之间有完整且准确的分年龄出生记录和死亡记录,以及t1时点和t2时点上的分年龄人口数。
现在假定,只有一部分死亡被申报(各年龄被申报比例相同),且只有一部分人口在普查中进行了登记(各年龄登记比例相同,但各次普查登记比例不同)。进一步假定我们没有\({}_{\infty}N_x(t_1)\),\({}_{\infty}N_x(t_2)\)和\({}_{\infty}D_x\)的值,而只有申报的数据\({}_{\infty}N_x^{r}(t_1)\),\({}_{\infty}N_x^{r}(t_2)\)和\({}_{\infty}D_x^{r}\)。这样 \({}_{\infty}N_x^{r}(t_1)=k_1{}_{\infty}N_x(t_1)\), \({}_{\infty}N_x^{r}(t_2)=k_2{}_{\infty}N_x(t_2)\)以及\({}_{\infty}D_x^{r}=c{}_{\infty}D_x\)。
然后,如果我们用近似值
\[r(x+)\approx\frac{\ln\left({}_{\infty}N_x^{r}(t_2)/{}_{\infty}N_x^{r}(t_1)\right)}{t_2-t_1}\],
\[N_x\approx(t_2-t_1)\frac{\left({}_{n}N_{x-n}(t_1)\times{}_{n}N_x(t_2)\right)^{1/2}}{n}\],
\[\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt\]\(\approx(t_2-t_1)\left({}_{\infty}N_x(t_1)\times{}_{\infty}N_x(t_2)\right)^{1/2}\),
那么,
\[r(x+)=r^{r}(x+)+\frac{\ln(k_1/k_2)}{t_2-t_1}\],
其中,
\[r^{r}(x+)=\]\(\frac{\ln\left({}_{\infty}N_x^{r}(t_2)/{}_{\infty}N_x^{r}(t_1)\right)}{t_2-t_1}\),
\[b(x+)=b^{r}(x+)=\frac{(t_2-t_1)\left({}_{n}N_{x-n}^{r}(t_1)\times{}_{n}N_x^{r}(t_2)\right)^{1/2}/n}{(t_2-t_1)\left({}_{\infty}N_x^{r}(t_1)\times{}_{\infty}N_x^{r}(t_2)\right)^{1/2}}\],
\[d(x+)=\left(\frac{\sqrt{k_1k_2}}{c}\right)d^{r}(x+)\],
其中,
\[d^{r}(x+)=\frac{{}_{\infty}D_x^{r}}{(t_2-t_1)\left({}_{\infty}N_x^{r}(t_1)\times{}_{\infty}N_x^{r}(t_2)\right)^{1/2}}\]。
等式(2)也变成,
\[r^{r}(x+)+\frac{\ln(k_1/k_2)}{t_2-t_1}=b^{r}(x+)-d^{r}(x+)\left(\frac{\sqrt{k_1k_2}}{c}\right)\],
即
\[b^{r}(x+)-r^{r}(x+)=a+b\,d^{r}(x+)\]
其中,
\[a=\frac{\ln(k_1/k_2)}{t_2-t_1}\], \(b=\frac{\sqrt{k_1k_2}}{c}\)。
假定其中一次登记质量较好的普查的覆盖面为100%,并假定\(k_1\)和\(k_2\)中较大的一个为1,则从以上公式中可得出\(k_1\),\(k_2\)和c。
直线的拟合
可以从两个方面来确定对部分出生率和死亡率拟合的直线是否最佳,即选择确定斜率和截距的合适方法和数据点。
我们不推荐使用不加权的最小二乘法来拟合直线,因为这种方法赋予不可靠的奇异值,尤其是较大年龄上的奇异值,过大的权重。因此,建议使用统计上更可靠的方法来拟合直线,比如,‘均数’直线(即由年龄范围前一半的数据点生成的纵轴和横轴的均数和由后半一的数据点生成的纵轴和纵轴的均数连线的直线)或'修正均数'直线(即与均数直线法原理相同,但数据点均数是基于加权而求得的。这种加权主要是处理不太可靠,通常是极端值的数据点)。这些方法在《手册十》中有详细的说明书(联合国 1983:144-145)。另一种方法在《联合国成年人死亡率手册》中有详细阐述(联合国人口司 2002年:105-110)。该方法类似于'均数'直线法, 但是它是将数据点分割点为三等份1,并利用第一组数据点和第三组数据点的中位值来确定直线。
巴特(2002)指出,每一种方法都有其缺点,并建议正交回归是处理年龄误报的最佳方法,因为由部分出生率或部分死亡率哪个作为因变量无关紧要。这反映了从直线到横轴的垂直距离和到纵轴的水平距离(通过使得正交残差平方和(ORSS)最小化,\(\sum_i\frac{x_i^2y_i^2}{x_i^2+y_i^2}\))。使用该方法,死亡申报的完整率c,被估算为部分死亡率的标准偏差与部分出生率的标准偏差的比率。截距就是部分出生率的平均值减去的除以c的部分死亡率的平均值。所附工作簿中的布拉斯增长平衡法的应用示例就是使用的这种方法。
局限性
本方法比假想世代消亡法较少受到年龄误报的影响。不过,死亡年龄高报是常见倾向(相对于普查中登记的人口而言),这会在图上体现为高报年龄段各数据点落在拟合的直线下方。通过将开放年龄组下调到能够消除这种影响的年龄,这种情况可以得到解决。
本方法不允许有人口迁移。迁移有可能影响年轻的成年人口(主要是20岁至35岁),但对主要发生在老年期的死亡数来说,影响较小。人口迁入的漏报往往会降低斜率,从而导致死亡登记覆盖面的高估和对死亡率的低估。人口迁出的漏报会产生相反的效果。
分析人员常常缺乏普查间隔期内分年龄的净迁移的可靠估计数。在这种情况下,分析人员可按如下原则操作。如果迁移规模较大且未知以及30岁以上各年龄上的数据点接近成一条直线分布,分析人员可以通过对年龄35岁及以上的数据点拟合直线来估算完整率。如果迁移规模较小,一些人口学家主张将拟合直线的数据点下调至5岁以减少人口迁移漏报的影响。这种主张基于以下假定,即因5-14岁间的死亡率较低,这些年龄上死亡申报的完整率与老年期死亡申报的完整率之间的任何差异都不可能导致死亡率较大程度上的失真。其他学者(希尔, 尤和蔡2009)建议,假定迁移规模不大,可将本方法估算得到的完整率与将假想世代消亡法应用于相同数据所估算得到的完整率求平均,而得到一个改良的估计值。尽管使用这些调整法比简单地忽略迁移可能得到较好的估计值,但遗憾的是,对这些方法所估算的完整率的准确性的研究甚少。
死亡登记的完整率随着年龄的波动性很可能导致数据点之间出现曲线变化。因此,本方法的优点之一就是,如果连续相邻年龄组的数据点都近似落在一条直线上,那么假定完整率在每个年龄上都相同是比较合理的。然而,当只有一些但不是全部数据点位于一条直线上时,确定应该排除哪些点的一个方法是,计算每个连续的开放年龄组的人口的增长率,而后选择增长率\(r_{a+}\)比较一致的那些年龄组所对应的数据点。
除上述提及的一些例外情况外,本方法最大的不足可能在于,对部分出生率和部分死亡率的图的诊断是有局限性的。
拓展
如果年龄登记准确且每个年龄上的普查覆盖面相同,那么本方法可通过限定平衡方程的年龄范围来处理死亡申报完整率只在年龄x岁至x+n岁区间上2恒定的情况。这种情况下,等式(2)会变成
\[{}_{n}r_x=b(x+)-{}_{n}d_x-b((x+n)+)\]
其中,
\[{}_{n}r(x)=\frac{{}_{n}N_x(t_2)-{}_{n}N_x(t_1)}{\int_{t_1}^{t_2}{}_{n}N_x(t)\,dt}\],
\[b(x+)=\frac{N_x}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\],
\[{}_{n}d(x)=\frac{{}_{n}D_x}{\int_{t_1}^{t_2}{}_{n}N_x(t)\,dt}\]。
基于观测值的类似的回归方程的左侧变成 \(b^{r}(x+)-b^{r}((x+n)+)-{}_{n}r_x^{r}\)。
或许因发展中国家的数据缺乏足够精确,以上这种替代方法的在实践中被应用的很少。
更多的阅读材料
有关本方法对常见数据错误和假定违反的敏感度的分析相当有限。读者可以参考以下文献。希尔,尤和蔡(2009)分析了无艾滋病影响下的死亡分布方法的假定,而多灵顿和提玛亚斯(2008)分析了一个显著受到艾滋病影响的人口。然而,穆雷, 拉惹勒南, 马克斯等 (2010)运用随机模拟对这些方法进行了评估,他们认为这些方法并非特别可靠。然而,迄今为止,他们的研究对这些方法应用的影响相当有限,可能是因为他们对仿真过程和方法缺乏详细的阐述,也可能是因为在仿真中的对迁移的假定过高。
参考文献
Bhat M. 2002. "General Growth Balance method: A reformulation for populations open to migration", Population Studies 56(1):23-34. doi:
http://dx.doi.org/10.1080/00324720213798
Blacker J. 1988. An Evaluation of the Pakistan Demographic Survey. Karachi: Pakistan Federal Bureau of Statistics.
Bradshaw D, RE Dorrington and R Laubscher. 2012. Rapid Mortality Surveillance Report 2012. Cape Town: South African Medical Research Council.
http://www.mrc.ac.za/bod/ RapidMortality2011.pdf
Brass W. 1975. Methods for Estimating Fertility and Mortality from Limited and Defective Data. Chapel Hill,NC: Carolina Population Centre.
Carrier NH. 1958. "A note on the estimation of mortality and other population characteristics, given death by age", Population Studies 12(2):149-163. doi:
http://dx.doi.org/10.2307/2172187
Dorrington RE, TA Moultrie and IM Timæus. 2004. Estimation of mortality using the South African 2001 census data. Monograph 11. Centre for Actuarial Research, University of Cape Town.
http://www.commerce.uct.ac.za/care/Monographs/Monographs/Mono11.pdf
Dorrington RE and IM Timæus. 2008. "Death Distribution Methods for Estimating Adult Mortality: Sensitivity Analysis with Simulated Data Errors, Revisited," Paper presented at Population Association of America 2008 Annual Meeting. New Orleans, Louisiana, 17-19 April.
Hill K. 1987. "Estimating census and death registration completeness", Asian and Pacific Census Forum 1(3):8-13, 23-24.
http://hdl.handle.net/10125/3602.
Hill K, D You and Y Choi. 2009. "Death distribution methods for estimating adult mortality: Sensitivity analysis with simulated data error", Demographic Research 21(Article 9):235-254. doi:
http://dx.doi.org/10.4054/DemRes.2009.21.9
Murray CJL, JK Rajaratnam, J Marcus, T Laakso and AD Lopez. 2010. "What can we conclude from death registration? Improved methods for evaluating completeness", PLoS Med 7(4):e1000262. doi:
http://dx.doi.org/10.1371/journal.pmed.1000262
Timæus IM. 2004. "Impact of HIV on mortality in Southern Africa: Evidence from demographic surveillance," Paper presented at Seminar of the IUSSP Committee "Emerging Health Threats" HIV, Resurgent Infections and Population Change in Africa. Ougadougou, 12-14 February.
UN Population Division. 1983. Manual X: Indirect Techniques for Demographic Estimation. New York: United Nations, Department of Economic and Social Affairs, ST/ESA/SER.A/81.
http://www.un.org/esa/population/techcoop/DemEst/manual10/manual10.html
UN Population Division. 2002. Methods for Estimating Adult Mortality. New York: United Nations, Department of Economic and Social Affairs, ESA/P/WP.175.
http://www.un.org/esa/population/ techcoop/DemEst/methods_adultmort/methods_adultmort.html
UN Population Division. 2011. World Population Prospects: The 2010 Revision, Volume I: Comprehensive Tables. New York: United Nations, Department of Economic and Social Affairs, ST/ESA/SER.A/313.
http://esa.un.org/unpd/wpp/Documentation/pdf/WPP2010_Volume-I_Comprehensive-Tables.pdf
书籍遍历链接: 广义增长平衡法
Suggested citation
Dorrington RE. 2013. The Generalized Growth Balance Method. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/generalized-growth-balance-method.