布拉斯增长平衡法
可用数据:单次普查数据
期望得到的数据:成年人死亡率
方法:增长平衡法
方法描述
布拉斯增长平衡法(布拉斯 1975)是首个被后人称之为死亡人数分布法的方法。该方法用来估算某一人口的死亡申报完整率。该方法假定某一观测人口是一个封闭且数据申报准确的稳定人口(即,不同时间上的年龄结构不变(至少在成年人年龄段如此),每年以恒定的速率r增长的人口),其年增长率r等于出生率b减去死亡率d。 类似的关系也适用于x岁及以上年龄的人口,即,\(r=b(x+)-d(x+)\)。这里,“部分”出生率,\(b(x+)\),被界定为x岁的人口占x岁及以上年龄人口的比例,而部分死亡率,\(d(x+)\),是指x岁及以上年龄人口的死亡率。在这个人口中,若每个年龄上死亡人数的漏报程度相同,则\(b(x+)=r+d^r(x+)/c\),其中\(d^r(x+)\)为基于死亡登记数估算的x岁及以上年龄人口的死亡率,c为申报的死亡人数占总死亡数的比例。研究者可以通过对\(b(x+)\)和\(d^r(x+)\)数据点所拟合直线的斜率来估算c。由于儿童死亡申报数的完整率(完整程度)通常不同于成年人,因此这样的估计通常仅限于成年人年龄组。死亡率的估计可通过将各年龄组申报的死亡人数除以c,并将这些数字再除以历险人口的估计数得到(历险人口估计数可用于估计部分出生率和部分死亡率)。
本方法是更一般意义上的广义增长平衡法的一个特例。广义增长平衡法需要已知两个时点上的人口估计数,但并不要求观测人口是一个稳定人口。读者可参考第24章《广义增长平衡法》以获得更详细的信息。本手册中,本章可作为当仅已知一个时点上的人口估计数时供考虑的一种方法。
所需数据和假定
所需数据列表
• 一个特定时期内,各五岁年龄组和开放年龄组A+(A尽可能地高)的女性(男性)死亡人数。
• 死亡人数所对应(或接近)的时期内,各五岁组和开放年龄组A+的女性(男性)人数。
重要假定
• 人口是一个稳定人口,尽管这种假定可以适当放宽(见下文)。
•最低年龄(通常为15岁)以上所有年龄上的死亡申报的完整率相同。
• 没有人口迁移,尽管当净迁移率相对于死亡率而言较小时,或者当按年龄分布的移民估计数准确到可以满足平衡方程的要求时(这种情况非常之少),这个假设可以放宽。
准备工作和初步检查
应用这种方法之前,分析人员应至少在以下几方面检查数据的质量:
人口的年龄结构,
人口的性别结构,
死亡人口的年龄结构,
死亡人口的性别结构。
注意事项和提示
应用这种方法时,分析人员必须特别注意以下几方面:
解释和估算过程需要考虑到不同的死亡数据来源(如,生命登记数据、普查中家庭户申报的死亡数或卫生部门登记的死亡数)。然而,在用增长平衡法估算时,因死亡数据来源不同对估算死亡完整率产生的影响要比用假想世代消亡法估算时来得小。
如果将本方法应用于国家内部各区域间的分析,人口迁移通常会成为一个更大的问题。
在确定用于拟合部分出生率和部分死亡率的直线并估计完整率的年龄范围时,会有如下问题。如果存在年龄高报现象,如何选择最佳的开放年龄组?退休后可能发生从城市到登记不完善的农村地区的迁移,从而导致死亡完整率会随年龄增长而下降,那么如何处理在直线上方的较大年龄组上的数据点?由于本方法假定没有人口迁移,而30或35岁以下人口的流动性较大,那么是否应将此年龄段上的人口从分析中予以剔除?
若死亡申报的完整率小于60%,那么估计值的不确定性就较大,使用本方法时应谨慎。
方法的应用
步骤 1:从高龄到低龄累计人口数和死亡人数
为了估计部分出生率和部分死亡率,需要计算某一特定年份t、x岁及以上年龄的累计人口数和死亡人数。在累计人口数时,用下列公式:
\(N(x+)=\sum_{y=x}^{A-5}{}_5N_y+{}_{\infty}N_A\),
其中,A为开放年龄组的起始年龄。
类似的公式也可用来计算x岁及以上年龄的累计死亡人数,D(x+)。
步骤 2:计算历险人年数,$$PYL(x+)$$
为估计部分出生率和部分死亡率,我们需要估计历险人年数。可用下式估算:
\(PYL(x+)=t\cdot N(x+)\),
其中,t为估算死亡人数时所对应的时间长度。
步骤 3:计算人口中到达$$x$$岁的人口数,$$N(x)$$
估计x岁的人口数(即开放年龄组x+岁中的“新生”人口)时,可将两个相邻年龄组(五岁组)的人口数的几何平均数除以5,再乘以死亡申报数所对应的以年为单位的时间长度。公式如下,
\(N(x)=\frac{t}{5}\left({}_5N_{x-5}\times{}_5N_x\right)^{1/2}\)。
步骤 4:计算部分“出生” $$b(x+)$$率和部分死亡率$$d(x+)$$
估算部分出生率和部分死亡率的公式分别为:
\(b(x+)=\frac{N(x)}{PYL(x+)}\) 和 \(d(x+)=\frac{D(x+)}{PYL(x+)}\) 。
步骤 5:作图、拟合直线以及估计完整率,$$c$$
为估计相对于人口而言的死亡申报数的完整率,可以先基于$$d(x+)$$对$$b(x+)$$相向作图,并用正交回归估算这些点所拟合直线的系数,公式如下,
\[ b=\frac{\sigma_y}{\sigma_x} = \frac{ \frac{1}{n-1}\sum_{i=1}^{n}(y_i-\mu_y)^2 }{ \frac{1}{n-1}\sum_{i=1}^{n}(x_i-\mu_x)^2 } \]
和
\(a=\mu_y-b\mu_x\)
其中,$$b$$为该直线的斜率,$$a$$为截距,$$y_i$$代表$$b(x+)$$,$$x_i$$代表$$d(x+)$$,\(\mu_y\)和\(\mu_x\)分别代表了两组数的均数。
对所有点进行直线拟合后,需检查各个点的分布与该直线相关的程度以及残差,以决定用于确定死亡申报完整率的最佳年龄范围。 如何决定该年龄范围将在下面详述,但任何残差绝对值大于1%的点都应排除。排除之后再对剩余点进行重新拟合,从而确定a和b的新值。
死亡申报完整率,$$c$$,则可通过$$a$$和$$b$$的数值获得
\(c=\frac{1}{b}\exp\left[-a\left(t_m-t_c\right)\right]\),
其中,$$t_c$$为普查时点,$$t_m$$为死亡申报数所对应时间区间的中点。这个公式的假定是,若普查是在死亡申报数所对应的时间区间中点举行,那么斜率的倒数可以用来估算死亡申报的完整率。为校正普查时点与死亡登记数所对应时间区间的中点的差异,我们需要将完整率的估计值乘以普查人口数与时间$$t_m$$上的人口估计数的比值,即\(\exp\left[-a\left(t_m-t_c\right)\right]\)。这里,分析人员要假定所研究人口是一个年均增长率为\(a\)的稳定人口。
步骤 6:估算调整了死亡申报不完整性后的死亡率
为便于计算死亡率,首先需要将普查人口数乘以\(\exp\left[-a\left(t_m-t_c\right)\right]\)来估算在死亡登记数所对应时间区间中点上的各五岁年龄组的人口数。
下一步需将死亡申报数除以申报完整率的估计值$$c$$,来调整申报不完整的死亡数。历险人年数的估算是由$$t_m$$时点的人口估计数乘以死亡申报数所对应时间的长度,$$t$$。这样,调整了死亡申报不完整性后的死亡率就可用如下公式估算:
\[{}_5m_x= \frac{{}_5D_x/c} {t\times {}_5N_x\exp\left[a\left(t_m-t_c\right)\right]}\]
由于分子(通过$$c$$的估计值而得到)及分母同时包含了调整因子\(\exp\left[-a\left(t_m-t_c\right)\right]\),省略这个调整因子仍会得到相同的死亡率。但若时点$$t_m$$的人口数与普查时点$$t_c$$的人口数相同,那么死亡申报完整率则不会受到这个因素影响。
步骤 7:用罗吉特关联模型生命表进行平滑
由于年龄别比率会出现异常波动,需要对它们进行平滑处理。这种平滑可以通过找到一个与所研究人口死亡率分布具有相同形状的分性别的标准生命表,并对其拟合一个布拉斯罗吉特关联函数来实现。
本章所随附的工作簿包含了一个电子表格。在这里,分析人员可以通过一个罗吉特关联模型对基于调整过的死亡率生成的生命表进行拟合而得到一组平滑的死亡率。用户可以从联合国模型生命表中的一般类别中或从普林斯顿四类模型生命表中选择一个标准。如果有理由认为某一生命表更接近于所研究人口的成年人死亡率模式,则可以用该生命表作为标准生命表。
为拟合这个模型,$$x$$岁的人在未来5年内的死亡概率,$${}_5q_x$$,可根据调整过的死亡率估算如下,
\({}_5q_x=\frac{5\,{}_5m_x}{1+2.5\,{}_5m_x}\)。
基于此, 基准值$$l_5 = 1$$的生命表可计算如下,
\(l_{x+5}=l_x(1-{}_5q_x)\),
系数α和β由拟合的罗吉特关联模型确定如下,
\(\gamma_x=\alpha+\beta\gamma_x^s\),
其中,\(\gamma_x=0.5\ln\left(\frac{1-l_x}{l_x}\right)\),而上标s则表示标准生命表中的值。
通过运用系数α和β,需要拟合生命表就可由标准生命表估算如下,
\(\gamma_x^{\mathrm{fitted}}=\alpha+\beta\gamma_x^s\)和\(l_x^{\mathrm{fitted}}=\frac{1}{1+\exp\left(2\gamma_x^{\mathrm{fitted}}\right)}\)。
平滑过的死亡率可用该生命表推导如下,
\({}_5m_x^{\mathrm{fitted}}=\frac{l_x^{\mathrm{fitted}}-l_{x+5}^{\mathrm{fitted}}}{T_x-T_{x+5}}\)和\({}_{\infty}m_x^{\mathrm{fitted}}=\frac{l_x^{\mathrm{fitted}}}{T_x}\),
其中,\(T_x=\sum_{x=x,5}^{\omega}\frac{5}{2}\left(l_x^{\mathrm{fitted}}+l_{x+5}^{\mathrm{fitted}} \right)\),即\(T_x=T_{x+5}+\frac{5}{2}\left(l_x^{\mathrm{fitted}}+l_{x+5}^{\mathrm{fitted}}\right)\),ω为最高年龄,生命表中,超过该年龄没有人存活。
示例
本例使用萨尔瓦多1961年人口普查中女性人口数据和萨尔瓦多日历年份1961年生命登记中的死亡数据。本示例可在名为BGB_El Salvador工作簿中找到。1961年人口普查标准时点为5月5日和6日之间的午夜,所以在工作表Introduction中输入的普查日期为1961年5月6日。
步骤 1:从高龄向低龄累计人口数、死亡人数和迁移人数
从高龄向低龄累计人口数和死亡人数(见表20.1)。
表20.1 计算累计的人口数和死亡人数,萨尔瓦多1961年人口普查
| 年龄 | $${}_5N_x$$ | $${}_5D_x$$ | $$N(x+)$$ | $$D(x+)$$ |
|---|---|---|---|---|
| 0-4 | 214,089 | 6,909 | 1,274,253 | 13,652 |
| 5-9 | 190,234 | 610 | 1,060,164 | 6,743 |
| 10-14 | 149,538 | 214 | 869,930 | 6,133 |
| 15-19 | 125,040 | 266 | 720,392 | 5,919 |
| 20-24 | 113,490 | 291 | 595,352 | 5,653 |
| 25-29 | 91,663 | 271 | 481,862 | 5,362 |
| 30-34 | 77,711 | 315 | 390,199 | 5,091 |
| 35-39 | 72,936 | 349 | 312,488 | 4,776 |
| 40-44 | 56,942 | 338 | 239,552 | 4,427 |
| 45-49 | 46,205 | 357 | 182,610 | 4,089 |
| 50-54 | 38,616 | 385 | 136,405 | 3,732 |
| 55-59 | 26,154 | 387 | 97,789 | 3,347 |
| 60-64 | 29,273 | 647 | 71,635 | 2,960 |
| 65-69 | 14,964 | 449 | 42,362 | 2,313 |
| 70-74 | 11,205 | 504 | 27,398 | 1,864 |
| 75+ | 16,193 | 1,360 | 16,193 | 1,360 |
步骤 2:计算历险人年数,$$PYL(x+)$$
由于死亡登记数所对应的时间是一年,历险人年数(表20.2第2列)就是普查中的累计人口数(即表20.1的第4列),这是因为该值乘1保持不变。
步骤 3:计算达到年龄$$x$$岁的人数,$$N(x)$$
达到x岁的人数示于表20. 2的第3列。例如,70岁人数可按如下公式估算:
\(N(70)=\frac{1}{5}\left(14964\times11205\right)^{1/2}=2589.8\) 。
步骤 4:计算部分出生率$$b(x+)$$和部分死亡率$$d(x+)$$
表20.2第4和第5列给出了部分出生率和部分死亡率。例如,当年龄为20岁时,
\(b(20+)=\frac{23825}{595352}=0.0400\),\(d(20+)=\frac{5653}{595352}=0.0095\)。
表20.2 计算历险人年数、x岁人口数、部分出生率、部分死亡率和残差,萨尔瓦多1961年人口普查
| 年龄 | $$PYL(x+)$$ | $$N(x)$$ | $$b(x+)$$ | $$d(x+) = X$$ | $$b(x+) = Y$$ | $$a+bx$$ | 残差 $$y-(a+bx)$$ | |
|---|---|---|---|---|---|---|---|---|
| 0-4 | 1,274,253 | 0.00000 | 0.03097 | |||||
| 5-9 | 1,060,164 | 40,362 | 0.03807 | 0.00636 | 0.03807 | 0.03782 | 0.00026 | |
| 10-14 | 869,930 | 33,733 | 0.03878 | 0.00705 | 0.03878 | 0.03856 | 0.00022 | |
| 15-19 | 720,392 | 27,348 | 0.03796 | 0.00822 | 0.03796 | 0.03981 | -0.00185 | |
| 20-24 | 595,352 | 23,825 | 0.04002 | 0.00950 | 0.04002 | 0.04119 | -0.00117 | |
| 25-29 | 481,862 | 20,399 | 0.04233 | 0.01113 | 0.04233 | 0.04294 | -0.00061 | |
| 30-34 | 390,199 | 16,880 | 0.04326 | 0.01305 | 0.04326 | 0.04501 | -0.00175 | |
| 35-39 | 312,488 | 15,057 | 0.04818 | 0.01528 | 0.04818 | 0.04741 | 0.00077 | |
| 40-44 | 239,552 | 12,889 | 0.05380 | 0.01848 | 0.05380 | 0.05085 | 0.00295 | |
| 45-49 | 182,610 | 10,259 | 0.05618 | 0.02239 | 0.05618 | 0.05506 | 0.00112 | |
| 50-54 | 136,405 | 8,448 | 0.06193 | 0.02736 | 0.06193 | 0.06040 | 0.00153 | |
| 55-59 | 97,789 | 6,356 | 0.06500 | 0.03423 | 0.06500 | 0.06779 | -0.00279 | |
| 60-64 | 71,635 | 5,534 | 0.07725 | 0.04132 | 0.07725 | 0.07542 | 0.00183 | |
| 65-69 | 42,362 | 4,186 | 0.09881 | 0.05460 | 0.09881 | 0.08970 | 0.00911 | |
| 70-74 | 27,398 | 2,590 | 0.09452 | 0.06803 | 0.09452 | 0.10415 | -0.00963 | |
| 75+ | 16,193 |
步骤 5:作图、拟合直线以及估计完整率,$$c$$
为了绘制此图并使得直线拟合所有的数据点,需首先设定年龄下限为5岁,年龄上限为A–1岁。其中,A表示开放年龄组的起始年龄(本例中为75岁)。图20.1 显示了基于b(x+)对d(x+)相向绘制的图。对这些数据点拟合的直线的系数估算如下,
\(b=\frac{\sigma_y}{\sigma_x}=\frac{0.020547}{0.019103}=1.0756\),
\(a=0.05686-1.0756\times0.02407=0.031\)。
对图20.1的图形诊断表明,除了最后(最右侧)的两个数据点外,其余数据点都分布在拟合直线的周围且没有发生较大规模的迁移。虽然最后这两个点的残差刚好落在1%的允许范围内,且我们可以使用93%的完整率, 但是将这两个点剔除后来重新估算完整率仍不失为一个有用的验证。
死亡申报数的完整率,c,可由a和b用下式来获得:
\[ c= \frac{1}{1.0759} \exp\left[-0.031(1961.50-1961.34)\right] = \frac{1}{1.0759}e^{-0.031\times 0.16} \approx 92.51\% \]

剔除最后两个点(即将年龄上限设定为64岁)将生成图20.2中的诊断图,并得到完整率的估计值为89%。这足以表明,剔除最后两个点并不是必需的。仅剔除最后一个点,完整率的估计值将发生较大变化(降至82%),且左侧一些点的拟合度有所降低。这表明此做法可能不是最好的。一般来说,不建议在一个有年龄数字偏好的人口中用尾数为零的年龄作为开放年龄。

步骤 6:估算调整了死亡申报不完整性后的死亡率
死亡登记数所对应时间区间中点上的人口数,可通过用两个时点之间的估计增长率3.1%对普查人口数进行调整而得。这些调整后的估计值在表20.3的第2列。例如,15-19岁年龄组的人口估计数为:
\({}_5N_{15}(t_m)=125040\times\exp[0.031(1961.50-1961.34)]=125040e^{0.031\times0.16}=125662.3\)。
下一步是用各年龄组申报的死亡人数除以完整率的估计值来调整申报不完整的死亡人数。这些调整后的值示于表20.3第3列。例如,调整后的15-19岁组的死亡人数是基于申报的死亡人数266(示于表20.1第3列)用下式求得的,
\(\frac{266}{0.9251}=287.5\)。
调整后的历险人年数(表20.3的第4列)是死亡登记人数所对应的时间区间中点的人口数(表20.3第2列)乘以这些死亡登记数所对应的时间长度(年数)。本例的时间长度为一年。
死亡申报数调整后的死亡率(表20.3第5列)是用调整后的死亡人数除以调整后的历险人年数求得的。例如,调整后的15-19岁组的死亡率的计算方法如下,
\(\frac{287.5}{125662}=0.0023\)。
表20.3 计算调整后的死亡率,萨尔瓦多1961年人口普查
| 年龄 | 调整后的 $${}_5N_x(tm)$$ | 调整后的$${}_5D_x$$ | 调整后的$$PYL(x,5)$$ | 调整后的$${}_5m_x$$ |
|---|---|---|---|---|
| 0–4 | ||||
| 5–9 | 191,181 | 659 | 191,181 | 0.0034 |
| 10–14 | 150,282 | 231 | 150,282 | 0.0015 |
| 15–19 | 125,662 | 288 | 125,662 | 0.0023 |
| 20–24 | 114,055 | 315 | 114,055 | 0.0028 |
| 25–29 | 92,119 | 293 | 92,119 | 0.0032 |
| 30–34 | 78,098 | 340 | 78,098 | 0.0044 |
| 35–39 | 73,299 | 377 | 73,299 | 0.0051 |
| 40–44 | 57,225 | 365 | 57,225 | 0.0064 |
| 45–49 | 46,435 | 386 | 46,435 | 0.0083 |
| 50–54 | 38,808 | 416 | 38,808 | 0.0107 |
| 55–59 | 26,284 | 418 | 26,284 | 0.0159 |
| 60–64 | 29,419 | 699 | 29,419 | 0.0238 |
| 65–69 | 15,038 | 485 | 15,038 | 0.0323 |
| 70–74 | 11,261 | 545 | 11,261 | 0.0484 |
| 75+ | 16,274 | 1,470 | 16,274 | 0.0903 |
步骤 7:用罗吉特关联模型生命表进行平滑
用调整后的死亡率估算出的x岁女性在未来五年内的死亡概率,5qx,示于表20.4的第2列。例如,一个15岁的女性活到20岁前死亡的概率计算如下,
\({}_5q_{15}=\frac{5\times0.00229}{1+2.5\times0.00229}=0.0114\)。
从5岁存活到x+5岁的生命表存活比例示于表20.4中第3列。例如,从5岁活到20岁的存活比例计算如下,
\(l_{20}=0.9754(1-0.0114)=0.9643\)。
表20.4用罗吉特关联模型生命表计算平滑的死亡率,萨尔瓦多1961年人口普查
| 年龄$$x$$ | 死亡概率$${}_5q_x$$ | 条件存活概率$$l_x/l_5$$ | 观测值 的罗吉特值$$Y(x)$$ | 普林斯顿西部模型 中生存人数$$l^s(x)$$ | 普林斯顿西部模型的罗吉特值$$Y_s(x)$$ | 拟合的 罗吉特值$$Y(x)$$ | 拟合的 尚存人数$$l(x)$$ | 累计生存人年数$$T(x)$$ | 平滑的死亡率$${}_5m_x$$ |
|---|---|---|---|---|---|---|---|---|---|
| 0 | |||||||||
| 5 | 0.0171 | 1 | 1.0000 | 1 | 61.957 | 0.0025 | |||
| 10 | 0.0077 | 0.9829 | -2.0258 | 0.9890 | -2.2506 | -2.1978 | 0.9878 | 56.987 | 0.0018 |
| 15 | 0.0114 | 0.9754 | -1.8394 | 0.9805 | -1.9585 | -1.9153 | 0.9788 | 52.071 | 0.0027 |
| 20 | 0.0137 | 0.9643 | -1.6477 | 0.9681 | -1.7060 | -1.6710 | 0.9658 | 47.209 | 0.0035 |
| 25 | 0.0158 | 0.9511 | -1.4836 | 0.9519 | -1.4928 | -1.4649 | 0.9493 | 42.421 | 0.0039 |
| 30 | 0.0216 | 0.9361 | -1.3419 | 0.9337 | -1.3226 | -1.3003 | 0.9309 | 37.721 | 0.0045 |
| 35 | 0.0254 | 0.9159 | -1.1938 | 0.9132 | -1.1766 | -1.1590 | 0.9104 | 33.118 | 0.0051 |
| 40 | 0.0314 | 0.8926 | -1.0588 | 0.8899 | -1.0447 | -1.0314 | 0.8872 | 28.624 | 0.0061 |
| 45 | 0.0407 | 0.8646 | -0.9269 | 0.8628 | -0.9194 | -0.9103 | 0.8606 | 24.254 | 0.0076 |
| 50 | 0.0522 | 0.8294 | -0.7906 | 0.8299 | -0.7925 | -0.7875 | 0.8285 | 20.031 | 0.0105 |
| 55 | 0.0765 | 0.7861 | -0.6507 | 0.7863 | -0.6514 | -0.6511 | 0.7862 | 15.994 | 0.0146 |
| 60 | 0.1122 | 0.7259 | -0.4870 | 0.7289 | -0.4946 | -0.4995 | 0.7308 | 12.202 | 0.0222 |
| 65 | 0.1493 | 0.6445 | -0.2974 | 0.6490 | -0.3074 | -0.3184 | 0.6540 | 8.740 | 0.0339 |
| 70 | 0.2158 | 0.5482 | -0.0968 | 0.5427 | -0.0856 | -0.1039 | 0.5517 | 5.725 | 0.0545 |
| 75 | #N/A | 0.4299 | 0.1411 | 0.4062 | 0.1898 | 0.1625 | 0.4194 | 3.297 | 0.0871 |
| 80 | #N/A | #N/A | #N/A | 0.2545 | 0.5373 | 0.4986 | 0.2695 | 1.575 | 0.1370 |
| 85 | #N/A | #N/A | #N/A | 0.1201 | 0.9956 | 0.9419 | 0.1320 | 0.571 | 0.2084 |
存活比例的罗吉特转换值示于表20.4第4列。例如,l20的罗吉特转换值计算如下,
\(\gamma_{20}=0.5\ln\left(\frac{1-0.9643}{0.9643}\right)=-1.6477\)。
在$$e_0=60$$时,普林斯顿西部女性模型生命表的存活比例示于表20.4第5列,其罗吉特转换的结果示于表20.4第6列。如图20.3中所示,除最小的年龄组外,西部模型对数据的拟合性良好。

系数α和β分别为用表20.4第4列和第6列中罗吉特转换值在用户所选择年龄范围内(本例中为5岁和75岁)拟合的直线的截距和斜率,其值分别为0.0211和0.9672。
这些系数随后被用于条件模型生命表的罗吉特转换,从而生成表20.4第7列中的拟合的罗吉特转换值。因此,例如,对于20岁时的拟合的罗吉特转换值计算如下,
\(\gamma_{20}^{\mathrm{fitted}}=-0.0211+0.9672\times(-1.7060)=-1.671\)。
这些值随后被用于生成表20.4第8列中的拟合的生存函数。例如,20岁时的生存函数计算如下,
\(l_{20}^{\mathrm{fitted}}=\frac{1}{1+\exp\{2\times(-1.671)\}}=0.9658\)。
根据拟合的生存函数可以计算表20.4第9列中的累计生存人年数,Tx。用这些累计人年数便可求得表20.4第10列中的平滑的死亡率。例如,80岁的Tx值和80-84岁组的平滑的死亡率分别为,
\(T_{80}=0.577+\frac{5}{2}(0.2695+0.132)=1.575\),
\({}_5m_{80}^{\mathrm{fitted}}=\frac{0.2695-0.132}{1.575-0.571}=0.137\)。
诊断、分析和解释
核查和检验
上面的例子源自《手册十》(联合国人口司1983)。《手册十》中,使用本方法和普雷斯顿-科尔法得到的完整率估计值均约为83%。这些估计值与运用本方法所得结果(93%)之间的差异主要归因于用于拟合直线的方法和拟合中所包含的数据点的不同。BGB_El Salvador工作簿中使用的是正交回归法,而《手册十》使用的是只包含60岁之前各点的“分组均数”法,和“修正的均数”法--从而有效地剔除了最后一个数据点的影响。这种差别表明,由于回归结果受到极端值的影响很大,可以考虑剔除本例数据中的最后两个数据点。然而,如上所述,使用正交回归来拟合直线时,剔除极端数据点的效果并不特别明显。
解释
在决定拟合直线的“年龄上限”时,往往随之产生一个问题,即剔除了某一个数据点,可能使完整率的估计值产生较大的变化。例如,若选择年龄组70+为开放年龄组,其诊断图如图20.4所示,其完整率的估计值为82%。该诊断图本身并不表明这种拟合比使用年龄组65+为开放年龄组来得差。这种情况下,应多选择几个开放年龄组,分别计算完整率的估计值,并选择其中一个接近多数估计值的或在估计值中选择中位数作为最终的完整率估计值。本例中,当开放年龄组为60+时,其完整率为91%。这些结果表明该人口死亡申报数的完整率大约为90%。然而,如上所述,一般地,我们不建议在有年龄数字尾数偏好的人口中用零结尾的年龄作为开放年龄组。

其他一些与方法有关的问题
死亡申报数的数据来源
一般地,死亡数据有两种类型的问题:一类是那些导致所有年龄上的调查覆盖面本应相同,但实际上却不足或过度的问题。这类问题正是本方法旨在解决的。另一类导致不同年龄具有不同覆盖面的问题。此类问题能使估计值失真。虽然对不同来源的死亡数据的处理,其一般方法和原理都基本相同,但不同来源的数据会产生不同的偏差,从而可能影响对结果的解释。这些差异虽可由特定的示例阐明,但一般来说,需要留意死亡数据中的下列偏差。
1)生命登记
如果城乡(或合适的代理变量)之间分年龄的人口比例显著不同且城市地区死亡申报数的完整率明显高于农村地区,当一部分人因退休从城市迁移到农村时,那么50岁后完整率的大幅下降很可能不符合完整率与年龄无关的假定。如果忽略此因素,这种对假定的违反很可能导致整体完整率水平的低估。
2)普查/调查中的家庭死亡数申报
此类数据存在三个潜在问题:
如果较大一部分家庭因一个关键人物(如唯一一个养家糊口的人)的死亡而解散,那么这类人的死亡漏报就会破坏完整率不随龄改变的假定。如果某些年龄组上相当一部分的死亡比例来自不居住在家庭户的人群(例如,住在敬老院的人群),违反假定的情况可能会更加严重。然而,这一问题在大多数发展中国家并不普遍。
当青年人离开他们成长的家到城市地区工作时,他们可能被视为多个家庭(或没有家庭)的成员,他们的死亡可能会被多次申报(或根本不申报),从而同样地违反完整率是不随龄改变的假定。在这种情况下,在确定完整率时,可以剔除某一特定年龄以下的数据点以减少影响。
参考周期误差:由于对死亡人数申报的具体时段常常不明了,更不用说确切的死亡日期了,因此死亡申报时有可能存在漏报和重报。如果这与死者的年龄无关,这种失真会在估计完整率时被考虑,从而对死亡率估计的影响不大。
3)医疗机构中的死亡登记数
这种来源的数据的质量好坏鲜为人知。然而,可以预期,完整率将取决于搜集到该数据的卫生服务部门的分布。在许多发展中国家,这种部门很可能集中在城市地区。同理,如果城市人口与农村人口的年龄分布不同,那么完整率就不能被认为与年龄无关。当然,也可能由于某些主要因素影响着死亡登记数,如果这些因素很重要且与年龄相关,则可能违反完整率在所有年龄上恒定的假定。
在所有这些情况下,较大年龄组上的数据点将逐渐位于拟合直线的上方,从而导致对完整率的低估。尽管仍会存在一定程度的低估,通过剔除开放年龄组的数据点来确定所拟合的直线,可使完整率的估计有所改善。
方法的详述
数学解释
布拉斯增长平衡法仅仅是简单的广义增长平衡法的一个特例,即假定了x+岁的人口增长率为r(x+),且在各年龄都保持恒定,可是对本案例的描述有助于理解这类方法。
布拉斯增长平衡法(布拉斯,1975)可追溯到卡瑞尔(1958)首先提出的由死亡人数的年龄分布来估计死亡率的一种方法。该方法是基于一个没有迁移的人口中的人口平衡方程所体现的人口变化要素之间的关系。在这样的一个人口中,t2时点的人口数是t1时点的人口数加上t1至 t2之间的出生人数减去t1至t2之间的死亡人数。也就是,\({}_{\infty}N_0(t_2)={}_{\infty}N_0(t_1)+B-D\),其中B 和 D分别为时间t1至 t2之间的出生人数和死亡人数。这个方程可以推广到任何x岁及以上年龄的人口,只要我们有t1至 t2之间的一个达到x岁的人口数(即通过年龄的增加而进入该年龄区间的人口数),\(N_x\),以及t1至 t2之间x岁及以上年龄的死亡人数,\({}_{\infty}D_x\)。于是,
\({}_{\infty}N_x(t_2)={}_{\infty}N_x(t_1)+N_x-{}_{\infty}D_x \tag{1} \)
如果改写等式1为\({}_{\infty}N_x(t_2)-{}_{\infty}N_x(t_1)=N_x-{}_{\infty}D_x\),再除以时间t1至 t2之间的历险人年数,该等式可用率来表示,即
\(r(x+)=b(x+)-d(x+) \tag{2} \)
其中,
\(r(x+)=\frac{{}_{\infty}N_x(t_2)-{}_{\infty}N_x(t_1)}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\),\(b(x+)\approx\frac{N_x}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\)及\(d(x+)\approx\frac{{}_{\infty}D_x}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\)。
\(b(x+)\)和\(d(x+)\)通常分别称为部分出生率和部分死亡率。
这些关系仅适用于以下情况,即t1至 t2之间有完整且准确的分年龄出生记录和死亡记录,及t1至 t2时点上的分年龄人口数。
现在假定,除了死亡申报不完整外,其余所有的数据都是准确的,并且(至少在一特定年龄以上,通常限于成年人年龄),存在一个与死亡年龄无关的各年龄上均相同的死亡申报比例,c,那么,\({}_{\infty}D_x={}_{\infty}D_x^r/c\),其中,\({}_{\infty}D_x^r\)表示x岁及以上年龄的死亡人数。公式2则变为,\(r(x+)=b(x+)-d^r(x+)/c\),其中,\(d^r(x+)=\frac{{}_{\infty}D_x^r}{\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt}\)。
如果我们进一步假定人口是稳定的,每年以恒定的速率r增加,那么该等式可以重新整理为:\(b(x+)=r+kd^r(x+)\)。因此,如果对所有的点\(\left(b(x+),d^r(x+)\right)\)拟合一条直线,其截距即为增长率r的估计值,其斜率k的倒数,即为死亡人数申报的完整率的估计值,c。
各年龄组的死亡率\({}_5m_x\),可估算如下,
\[ {}_5m_x = \frac{{}_5D_x^r/c} { \displaystyle \int_{t_1}^{t_2} {}_{\infty}N_x(t)\,dt } \]
方法的实施
假定在实际中有如下数据:从时点t1至t2各年的五岁年龄组的死亡申报数\({}_5D_x^r\)和开放年龄组A的死亡申报数\({}_{\infty}D_A^r\),该时间区间中点上各个年龄组的人口数\({}_5N_x\)和开放年龄组的人口数\({}_{\infty}N_A\)。利用这些数据就可用来计算\({}_{\infty}D_x^r\)和\({}_{\infty}N_x\),并近似估算\(N_x=({}_5N_{x-5}+{}_5N_x)/10\)或\(N_x=\left({}_5N_{x-5}\cdot{}_5N_x\right)^{1/2}/5\)和\(\int_{t_1}^{t_2}{}_{\infty}N_x(t)\,dt={}_{\infty}N_x(t_2-t_1)\)。
若没有在该时间区间中点上的人口数,而只有在其它某一时点上(比如t) 的人口数,那么就用该时点上的人口数代入公式。唯一的区别在于,得到的完整率的估计值将是对应于时点t上的人口而言,而不是该时间区间中点上的人口而言。换句话说,假定人口是稳定的, \({}_{\infty}N_x(t)={}_{\infty}N_x e^{r\left(t-\frac{t_1-t_2}{2}\right)}\),并且对应于该人口的完整率为\(c e^{r\left(t-\frac{t_1-t_2}{2}\right)}\),那么经该完整率校正后的死亡申报数除以\({}_{\infty}N_x(t)\)而求得的死亡率将与用时间区间中点上的人口数所估算出的值一样。
直线的拟合
可以从两个方面来确定对部分出生率和部分死亡率拟合的直线是否最佳,即选择确定斜率和截距点的合适方法和数据点。
我们不推荐使用不加权最小二乘法来拟合直线,因为这种方法赋予较大年龄过大的权重,从而导致不可靠的结果。因此,建议使用统计上更可靠的方法来拟合直线,比如 '均数'直线(即由年龄范围前一半的数据点生成的纵轴和横轴的均数和由后一半的数据点生成的纵轴和横轴的均数连成的直线)或“修正均数'直线(即与均数直线法原理相同,但数据点均数是基于加权而求得的。这种加权主要是处理不太可靠,通常是极端值的数据点)。这些方法在《手册十》中有详细的说明书(联合国 1983:144-145)。另一种方法在《联合国成年人死亡率手册》中有详细阐述(联合国人口司 2002年:105-110)。该方法除了将数据点分割为三等份1和将第一组数据点和第三组数据点的均值用其中位数替代外,类似于'均数'直线法。
巴特(2002)指出,每一种方法都有其缺点,并建议正交回归是处理年龄误报的最佳方法,因为由部分出生率或部分死亡率何者作为因变量无关紧要。这反映了从直线到横轴的垂直距离和到纵轴的水平距离(通过使得正交残差平方和(ORSS)最小化,\(\sum_i \frac{x_i^2y_i^2}{x_i^2+y_i^2}\))。使用该方法,死亡申报的完整率c,被估算为部分死亡率的标准偏差与部分出生率的标准偏差的比率。截距就是部分出生率的平均值减去除以c的部分死亡率的平均值。所附工作簿中的布拉斯增长平衡法的应用示例就是使用的这种方法。
局限性
以上所阐述的并被用于所附工作簿示例中的方法存在局限性。主要在于,这种方法假定人口是一个没有迁移且稳定的人口。当这些条件在较大程度上不符合时,不应该使用这种方法。撇开不恰当的应用示例不谈,基于相同的年龄范围,用这种方法(数据示于GGB_South Africa_males工作簿中)来估算南非2001年人口普查和2007年人口普查替代调查之间死亡人数申报的完整率(两次调查区间中点的人口数用两个调查的平均数来代替)得出的结果为85%。而将拟合直线的最低年龄提高到35岁时,完整率提高为88%,可是仍低于使用布拉斯广义增长平衡法得到的92%。
本方法比普雷斯顿-科尔法较少受到年龄误报的影响。特别是,比如,死亡申报时通常存在的年龄高报倾向(相对于普查中登记的死亡年龄)将使图中在高报年龄范围内的数据点向右侧倾斜(即低于拟合直线)。这个问题可以在本方法中通过确定拟合时应该包括哪些点而得以校正。然而,该方法更容易受到因死亡率迅速下降而导致人口不稳定所带来的影响(马丁 1980)。这种情况下,本方法往往会低估完整率,因为模型会将较低的死亡率"解释为"漏报的增加(即更陡峭的斜率)。而模拟结果显示(拉沙德 1978),死亡率的缓慢稳步改善(正如一些没有流行病、饥荒和战争的发展中国家所发生的情况)所引起的偏差是相当小的。
至于生育率的变化对本方法造成的影响,鉴于这些变化的发生至今才不过15年,它们对本方法几乎没有影响,这是因为这些变化主要影响那些最小的年龄组。
迁移有可能影响年轻的成年人口(主要是20岁至35岁),但对主要发生在老年期的死亡数来说,影响较小。未被统计的人口迁入往往会降低斜率,从而导致死亡登记覆盖面的高估和对死亡率的低估。未被统计的人口迁入会产生相反的效果。一些人口学家主张将拟合直线的数据点下降到5岁以减少未被统计的人口迁移的影响。这种主张的前提是,因5-14岁间的死亡率较低,这些年龄上死亡申报的完整率与老年期死亡申报的完整率之间的任何差异都不可能导致死亡率较大程度上的失真。但是,这种调整能否很大程度上消除偏差是值得怀疑的。
相反地,可以选择35岁及以上年龄的数据点来拟合直线以消除迁移的影响。然而,较大年龄上的数据质量更成问题,从而会降低完整率估计的可靠性。虽然使用这些调整方法可能会比简单地忽略迁移得到更好的估计结果,但遗憾的是,很少有人对这些调整方法得到的完整率估计的准确性进行研究。
技术上而言,如果有可靠的年龄别净迁移数据,就可以通过在拟合直线时用b(x+) – i(x+)来替代部分出生率 b(x+),其中,i(x+)是净迁移。然而,实际应用中,很少会有足够可靠的年龄别净迁净来确保方法的准确性。
死亡登记的完整率随龄增长而出现的波动性很可能导致数据点之间出现曲线变化。因此,本方法的优点之一就是,如果相邻年龄组的数据点都近似落在一条直线上,那么假定完整率在每个年龄上都相同是比较合理的。然而,当只有一些但不是全部数据点位于一条直线上时,确定拟合直线时应该排除哪些点的一个方法是计算每个连续的开放年龄组的人口的增长率,而后选择增长率\(r_{a+}\)比较一致的那些年龄组所对应的数据点。
除上述提及的一些例外情况,本方法最大的不足可能是缺少对部分出生率与部分死亡率相向图的诊断。特别地,对一个稳定人口由于高达11%的HIV/ AIDS患病率影响而导致死亡率增加的情况进行模拟,在所绘制的诊断图中这些人为的数据点会落在一条直线上,但完整率将被低估,即使拟合的数据点只包括45岁及以上的人口。这里值得借鉴的是,如果数据点并不落在同一条直线上,数据就存在问题; 但是若数据点确实都落在一条直线上,也不能肯定对完整率和覆盖面的估计是准确的。
拓展
如果有准确的数据和一个可靠、独立的r的估计值(而且人口是稳定的),那么就可以修订等式(2)来估计c(x+),而每个开放年龄组的完整率估算如下,\(c(x+)=\frac{{}_{\infty}D_x^r}{N_x-r\,{}_{\infty}N_x}\)。然而,实际中很难找到一个足够稳定的人口而且其年龄申报的数据质量也足够准确,来应用这一方法。
更多的阅读材料
鉴于本方法是更一般意义上的广义增长平衡法的一个特例,建议读者们参考该方法的相关章节以了解更多内容。
参考文献
Bhat M. 2002. “General Growth Balance method: A reformulation for populations open to migration”, Population Studies. 56(1):23–34.
http://dx.doi.org/10.1080/00324720213798
Brass W. 1975. Methods for Estimating Fertility and Mortality from Limited and Defective Data. Chapel Hill, NC: Carolina Population Centre.
Carrier NH. 1958. “A note on the estimation of mortality and other population characteristics, given death by age”, Population Studies. 12:149–163.
http://dx.doi.org/10.2307/2172187
Martin LG. 1980. “A modification for use in destabilized populations of Brass’s Technique for estimating completeness of death registration”, Population Studies. 34:381–395.
http://dx.doi.org/10.2307/2175194
Rashad HM. 1978. “The estimation of adult mortality from defective registration data.” Unpublished PhD thesis, London: University of London.
UN Population Division. 1983. Manual X: Indirect Techniques for Demographic Estimation. New York: United Nations, Department of Economic and Social Affairs, ST/ESA/SER.A/81.
http://www.un.org/esa/population/techcoop/DemEst/manual10/manual10.html
UN Population Division. 2002. Methods for Estimating Adult Mortality. New York: United Nations, Department of Economic and Social Affairs, ESA/P/WP.175.
http://www.un.org/esa/population/techcoop/DemEst/methods_adultmort/methods_adultmort.html
书籍遍历链接: 布拉斯增长平衡法
Suggested citation
Dorrington RE. 2013. The Brass Growth Balance Method. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/brass-growth-balance-method.