由生育史调查数据直接估算儿童死亡率
可用数据:调查数据
期望得到的数据:儿童死亡率
方法:直接方法
在本章中,我们着重介绍使用完全生育史或截尾生育史数据来估算儿童死亡率。这些数据的主要特征是,每条生育信息都记录了出生日期、存活状况以及(如果死亡)死亡时的年龄。分析这些数据通常使用生命表的方法。关于儿童死亡率的间接估算和通过最近出生孩子的存活状况估算儿童死亡率分别参见第16章和第18章。
数据要求和假定
所需数据
对于每位育龄期妇女(在一些特定文化背景下,该信息的搜集仅限于已婚妇女):
• 每个活产孩子的名字
• 每个孩子的出生年份和月份
• 孩子的性别(可选)
• 孩子是否目前仍存活
• 如果孩子已经死亡,死亡时的年龄(在人口和健康调查项目中,如果死亡发生在出生后的28天以内,死亡年龄以天数记入;如果发生在1岁到23个月之间,则以月数记入;如果发生在以后的时间,则以年数记入)。
重要假定
• 存活的孩子和死亡的孩子的信息申报的准确度相似。
• 出生日期和死亡年龄的申报相当准确。
• (无论因为死亡还是迁移),人口中儿童的死亡风险和母亲的存活率没有相关性。
注意事项和提示
对直接搜集到的数据的处理有两种风险。第一、因调查只对存活的母亲询问了详细的生育史,所以有出现存活者偏差的风险。如果可以预见,与这些存活的母亲相比,调查前已死亡的母亲可能有着不同的生育力或她们的子女有着不同的死亡率,那么得出的估计值就有存在明显偏差的风险。存活者偏差的各个方面已在第15章中有所讨论。
第二、如果对那些搜集了详细生育史数据的妇女设置年龄上限,那么截尾偏差就会随着追溯期延长而更加显著。如果在数据搜集中将年龄上限定为49岁,那么对于调查的十年前,就仅有当时年龄39岁或以下妇女的信息可用。因此,这样的数据所估算的较早时期的儿童死亡率,将越来越多地基于更年轻妇女的经历。这就可能会导致测量偏差,因为这种截尾会导致更年轻妇女的第一孩生育被过度代表;也就意味着,这种估算有可能越来越多地高估了较早时期的儿童死亡率。一些证据表明,这种高估可以被回忆偏差(以及对那些死亡时间久远的儿童的选择性漏报)导致的低估所抵消。
数据评估和数据分析
不论数据是如何被搜集的,也不论访问员的培训和监督的情况如何,认真的数据质量核查是任何分析的重要的步骤 1。所有数据都会存在错误,这些错误可能有多种来源,例如调查员偷工减料或者受访者根本不知道问题的正确答案。下面的每一节,在介绍分析方法之前,都首先讨论数据评估的技术。这些评估技术检查数据本身的内部一致性以及与同一人口其他数据的外部一致性。应当注意的是,数据存在错误并不一定意味着该数据不能被分析。重要的是,要知道这些错误的程度,并且在解释结果时将它们考虑在内。
完整生育史:数据质量评估
全面数据质量评估的步骤 1是要检查缺失值的程度。在一份完整生育史中,出现缺失值可能有几种原因。例如,原始抽样框中的家庭户出现缺失。此外,受访家庭户中符合条件的妇女可能因为无法接受访谈而出现数据缺失。另外,由于受访妇女不知道孩子的出生日期,孩子是否还活着,或者(如果孩子已经死亡)孩子的死亡年龄,完整生育史的个别问项也可能缺失。这就需要对可能受到这些错误影响的事件的比例进行检查。缺失值可能在数据清理过程中被插补过了,但插补值应该被标记。没有缺省值不应被当作数据质量好的证据,反而可以被看作是一个警示:在一些调查中,调查员和监督员在培训中被要求避免缺失值,而在这种情况下,数据可能或多或少地被调查员篡改了。
数据质量评估的第二个步骤是通过检查汇总结果来发现数据的异常。数据的异常最常见于出生性别比,活产婴儿的年度分布,以及死亡年龄。在没有干预的情况下,人口的出生性别比例一般是每100名女性对应100〜106名男性。出生性别比在此范围之外,可能表明数据有错误。对于在调查前较长时间出生的队列,其性别比的增加可能说明数据有错,即对较长时期以前出生的女婴存在漏报。
如果没有重大影响的事件,分日历年份的生育数分布通常比较平滑,因为虽然生育的季节性差异比较普遍,但这不会影响到年度出生数。通过计算“出生比率”可以识别可能存在的错误,这个比率被定义为:
$ \frac{2B_t}{B_{t-1} + B_{t+1}} $,
其中,Bt是在给定年份t中申报的出生人数。人口和健康调查数据中常见的一个错误被称为“生育转移”。人口和健康调查搜集了大量的某些截止日期(通常为调查五年前的那个日历年份的1月1日)以来出生孩子的附加数据。可能是为了减少需要回答的问题数量,调查中经常发生将该年度出生的孩子申报为出生在上一年。这就导致了截止日期之后的那一年的出生数的减少,以及之前那一年的出生数增多。出生比率会凸显这个错误,因为出生比率在截止日期之后那一年将会很低,而在之前那一年会很高。很多时候,相比存活的孩子,生育转移在申报的死亡孩子中更明显,所以推荐分别计算存活孩子和死亡孩子的出生比率。
类似地,死亡年龄申报中的数据异常可以通过死亡比率来识别,即在年龄x 上的死亡人数与年龄(x – 1) 和(x + 1)上的平均死亡人数的比率。在人口和健康调查数据中,通常在出生后的第7天存在过多死亡人数,而出生后的第14天以及出生后的第12个月也存在相对程度较轻的过多死亡人数。
人口和健康调查在调查报告中一般会公布汇总(国家)层面的数据质量指标(通常在附录C中)。如果要进行国家以下层面的分析,则要重新计算这些指标。
上述的数据质量指标测量了数据的内部可信度。然而,数据即使内部合理,仍然有可能是错误的。还应该通过与相同人口的其他调查相比较来评估数据质量。队列比较特别有效,例如将一次调查中30-34岁妇女申报的平均曾生子女数,与五年后另一次调查中35-39岁妇女申报的平均曾生子女数相比较。类似的比较也可用于平均死亡孩子数。分单个日历年份的出生数序列也可以在重叠时期进行比较,尽管我们需要记住,调查时年龄为15-49岁的妇女的生育史数据中,过去的出生数越来越被截尾所影响。
完整生育史:计算出生队列的儿童死亡率指标
死亡概率是广泛使用的儿童死亡率指标。婴儿死亡率(IMR)(近似地,婴儿死亡率传统上被界定为一年内的婴儿死亡数除以这一年的出生数,该值非常接近于1q0)是指到确切1岁时死亡的概率,1q0。而5岁以下儿童死亡率(U5MR)是指到5岁之前的死亡的概率,5q0。严格地说,概率的测量要基于真实队列,尽管大多数生命表是从年龄-时期死亡率来计算特定时期的假想队列的指标。

从完整生育史数据计算队列的概率是非常简单的。例如,在调查前12至23个月出生的队列的婴儿死亡率就是1岁前的死亡人数除以出生人数。同样,出生在调查前5至9年出生的人的5岁以下儿童死亡率就是他们中死于确切年龄5岁之前的人数除以这些出生总人数。图17.1显示了出生于2001年7月的队列在1岁前死亡的年龄队列概率的列克西斯图(绿色),以及2002日历年中五个月大的孩子的年龄-时期的死亡率(蓝色矩形,与在本节后面使用的示例相关)。
表17.1使用马拉维2004年人口和健康调查的数据,显示了在调查前的12-23个月的出生队列在1岁之前的年龄-队列死亡概率以及在调查前5-9年的出生队列在五岁之前的年龄-队列死亡概率的相关数字和计算。
表 17.1 队列的婴儿死亡率和五岁以下儿童死亡率的计算,马拉维2004年人口和健康调查
| 出生的时期 | ||
|---|---|---|
| 调查前12–23月 | 调查前60–119月 | |
| 出生数 | 2,229 | 7,178 |
| 其中在12个月内死亡的人数 | 143 | |
| 其中在五年内死亡的人数 | 1,568 | |
| 儿童死亡率指标 | 1q0 | 5q0 |
| 队列估计值 (‰) | 64.2 | 218.4 |
| 注: 数据为加权数; 不包含访谈月份内发生的事件。 | ||
需要注意的是,这些队列值无法提供有关时期的解释。以5岁以下儿童死亡率(U5MR)为例,队列概率反映了调查前十年中平均每一年的死亡风险。还要注意的是,年龄x岁的死亡概率只能对距调查至少x年前出生的队列才能计算。这些问题都限制了队列测量的价值,因为就目的而言,大多数分析人员和政策制定者更关注时期测量。
完整生育史:时期儿童死亡率的计算
计算时期儿童死亡率指标需要使用假想队列的概念。计算狭窄年龄范围上以及特定日历时期内的死亡率,要以列克西斯图的矩形中的事件和历险时间为基础。使用标准模式中的人口要素关系(参照,例如普莱斯顿,休维莱和吉洛特 2001),并对每个矩形中的死亡分布做出一定程度的假定,这些死亡率可以被转换成隐含的概率。最后,死亡概率被依次应用到一个假想的出生队列来计算每个年龄x的存活曲线l(x),从而可以很容易地推导出死亡概率。
使用完整生育史数据可以很容易地进行这些生命表的计算。如果遵循了人口和健康调查的标准做法来搜集数据——因出生的年月和死亡时的年龄(多少年、多少月和多少天)与年龄有关——那么,在列克西斯图的年龄-时期矩形中,死亡就可以比较明确地被定位。(出生日期和死亡年龄信息不准确会一定程度上模糊死亡的定位,但其影响取决于矩形的大小。)我们在这里介绍一个方法。该方法是基于对直到五岁的单个日历年的年龄别死亡率(年龄-时期率)的计算。将其扩展到其他时期是很简单的。假定数据为人口和健康调查的标准格式,即出生日期被记录为世纪月代码格式,而死亡年龄被记录为天数、月数或年数。必须要有单位记录数据。年龄所使用的单位是月。因此,基本计算中,年龄别死亡率是以年龄的月数和日历年数为基础的。这些率被转换为相应的每个月的死亡概率,再被转换为存活概率,并且根据所需的年龄范围(通常至5岁)连接在一起。计算的关键是将死亡人数和历险时间分配到一个日历年中的单个年龄月。
数据操作
需要人口和健康调查中生育数据的四个变量:
1) b3,世纪月代码格式的出生日期;
2) b5,孩子是否存活;
3) b6,死亡年龄,其中第一个数字代表单位(1指天数;2指月份数;3指年数),而第二个和第三个数字代表该单位上的值; 以及
4) v005,样本的权重,其单位为百万。
需要注意,不要使用变量b7,即(以月份为单位计算的)死亡年龄。这个变量不适合于本方法,因为在死亡年龄被记录为年数的情况下,'计算的'月份实际上是年龄区间的下限;也就是说,如果死亡年龄被记录为“3年”,那么以月份单位的插补的死亡年龄就是36个月。使用这样的变量将导致死亡时间的系统性错位。
方法的应用
步骤 1:处理死亡年龄并估计出生日期及死亡年龄
我们需要将死亡的发生时间具体到某年某月。因为没有确切的生育日期(仅仅有世纪月代码格式的数据),而且一般也没有一个确切的死亡年龄(除了新生儿死亡),所以需要插补出生日期和死亡年龄。这个插补可以使用随机数来进行。
使用一个真实的随机数生成器来获得这些随机数显然并不好,因为这种做法缺乏可重复性。此外,“真实的”随机会造成精确的虚假印象。作为一个替代方案,我们从人口和健康调查数据常规变量中建立插补计算中的假随机数。基于访谈的星期(人口和健康调查数据中的 v016)和家庭数(v002)建立新变量,从而将记录分配到小数位是很容易的。(选中这些变量是因为它们和儿童死亡率之间不太可能相关)。这些新变量的值在0,1 ... 到9的范围中。将每个值除以10,再加上0.05,就得到两个相同分布的变量,random1和random2,其取值范围为0.05,0.15,...,到0.95。
这样的话,如果访谈当月的出生被剔除了,将random1加到b3(孩子出生日期的世纪月代码)就可以直接插补出生日期(dob,以月份为单位)。插补死亡年龄(以月份为单位)的方法取决于“单位”。对于“单位”= 1(即死亡年龄以天数测量)的情况,死亡年龄(aad)可以被估算为,(变量值+ random2)/ 31(对于以天数测量的死亡年龄,这种插补没有必要,这里的介绍是为了在描述上有所对应); 对于“单位”= 2,死亡年龄为,变量值+ random2;对于“单位”= 3,死亡年龄为,(变量值+ random2)× 12。
步骤 2:在目标年份中定位死亡事件时间
对于每一个年龄月上的死亡率来说,事件就是调查期间在这个年龄上的死亡。步骤 1已对以月份为单位的死亡年龄进行了插补。死亡日期dod是由插补的出生月份dob加上插补的死亡年龄aad得到的。如果插补的死亡年龄在年龄范围内并且插补的死亡日期在调查期间内,那么我们就获得了一个相关事件。
步骤 3:推导历险时间
历险时间的计算虽然复杂,但是比较直接。调查的年龄范围是指我们需要测量死亡率的那些(以合适的单位定义的)年龄。定义年龄范围的下限为xl,上限为xh。
调查时期是指我们需要估计死亡率的那个时间段,即t2 – t1,其中,t2为调查时期的结束日期而t1为开始日期。这个指标的度量单位和年龄范围的单位相同。
我们用图17.2的粗线所定义的年龄和时期来测量死亡率。

分年龄和时期的个体生命历程,由图中斜线表示(如常规的列克西斯图一样)。这里展示了五种可能出现的情况,即标签(a) 至 (e)。这个空间中的任何个体的位置都可以通过他们在t1时的年龄xt1来确定。进一步地,任何t1时年龄为x的人,如果她或他在t2前没有死亡,那么t2时其年龄为xt2 = xt1 +(t2 – t1)。我们定义在调查期间规定年龄范围内发生死亡的个体的死亡年龄为xd。每种情况对历险时间的相对贡献由表17.2中的算法决定。
表17.2 确定历险时间的算法
| 情况 | 描述 | 规则 | 调查期间存活者的历险时间 | 死亡者的历险时间 (当死亡发生在调查期间) |
|---|---|---|---|---|
| (a) | 在t1时年龄大于xh | xt1 > xh | 0 | 0 |
| (b) | 在t1时年龄在xl 和xh之间;在调查期间年龄达到xh | xl < xt1 < xh xt1 + (t2 - t1) > xh | xh - xt1 | xd - xt1 |
| (c) | 在调查期间年龄达到xl 和xh | xl > xt1 xt1 + (t2 - t1) > xh | xh - xl | xd - xl |
| (d) | 在调查期间年龄达到xl,但没有达到xh | xl > xt1 xl < xt1+(t2 - t1) < xh | xt1 + (t2 - t1) > xl | xd - xl |
| (e) | 在调查期间年龄没有达到xl | xt1 + (t2 - t1) < xl | 0 | 0 |
使用这些规则可来用确定个人和群体在调查期间指定年龄范围的历险时间,即死亡率的分母。将发生在调查期间指定年龄范围的死亡人数加总可以得到死亡率的分子。
步骤 4:加权并累计死亡事件和历险时间
在标准的人口和健康调查的数据文件中,样本权重变量为v005。这个变量的平均值为1,000,000。为了避免出现巨大的样本量(及过于狭窄的置信区间),建议首先调整权重为(v005/1,000,000)。我们称此新变量为wgt。死亡率可以通过计算调查的N个儿童中每一个儿童对总的事件数量和总的历险时间的贡献来计算。在某一时期j年龄x到x +1(以月份为单位)的年龄别死亡率是
$M(x, j) = \frac{\sum\limits_{i=1}^N D(i, x, j) \cdot wgt(i)}{\sum\limits_{i=1}^N E(i, x, j) \cdot wgt(i)}$,
其中,D(i,x,j)是一个二分变量,测量孩子i在年度j年龄x上是否死亡(如果死亡则取值为1,否则为0),E(i,x,j)是孩子i在年度j年龄x上的历险时间,wgt(i)是孩子i的样本权重(其平均值为1.0)。
步骤 5:从年龄别死亡率计算死亡概率
步骤 4计算出的死亡率是基于每个年龄月上的历险。因此,为了从死亡率推导出一个时期的死亡概率,有必要采用标准公式。鉴于我们已经作出了一些简化的假定,而且所处理的年龄范围比较狭窄,因此假定死亡在年龄范围的每个月均匀分布是合理的。q(x, j)可计算为,
$q(x,y) = \frac{ \frac{M(x,y)}{12} }{( 1 + \frac{M(x,y)}{24} )}$。
而从出生到任何年龄的存活概率可以通过将各个月份的存活概率(即1 - q(x,j))连接起来获得。例如,
$5q_0^j = 1 - \prod\limits_{x=0}^{59} (1 - q(x, j))$。
示例
如上所述,从生育史数据直接估算儿童死亡率要使用每单元的记录数据,而不是汇总数据列表。作为示例,我们使用来自一次人口和健康调查的部分记录,即2004年马拉维人口和健康调查中2002年五个月大的孩子的死亡数据。只有2001年7月1日到2002年7月31日之间出生的孩子,才可能经历2002年时年龄为五个月的死亡风险(2001年7月1日之前出生的孩子在2002年开始时年龄将达到6个月以上,而2002年7月31日之后出生的孩子在2002年时年龄不到5个月)。示例中只显示了相关的记录,也就是那些出生在世纪月代码1218和1230(2001年7月至2002年7月)之间的孩子。实践中,也要排除那些年龄不到五个月就死亡的孩子,但是这里先将这些孩子包括进来,以展示如何在计算中排除他们。
表3显示了2004年马拉维人口和健康调查中50个记录的关键变量。请注意,这些都是出生记录,而不是妇女记录。
表17.3 直接估算儿童死亡率的基本生育史数据
| 记录编号 | 世纪月格式的出生日期b3 | 孩子是否存活b5 | 死亡年龄 b6 | 样本权重v005 |
|---|---|---|---|---|
| 1 | 1223 | yes | . | 469061 |
| 2 | 1223 | yes | . | 469061 |
| 3 | 1222 | no | 107 | 469061 |
| 4 | 1224 | yes | . | 469061 |
| 5 | 1223 | yes | . | 469061 |
| 6 | 1218 | no | 205 | 469061 |
| 7 | 1230 | yes | . | 2171218 |
| 8 | 1225 | yes | . | 704240 |
| 9 | 1230 | yes | . | 704240 |
| 10 | 1224 | yes | . | 704240 |
| 11 | 1224 | no | 202 | 704240 |
| 12 | 1221 | yes | . | 1106470 |
| 13 | 1225 | yes | . | 1106470 |
| 14 | 1224 | no | 205 | 1106470 |
| 15 | 1221 | yes | . | 1106470 |
| 16 | 1221 | yes | . | 1106470 |
| 17 | 1218 | no | 205 | 1106470 |
| 18 | 1229 | yes | . | 3900164 |
| 19 | 1230 | yes | . | 1247934 |
| 20 | 1224 | yes | . | 1247934 |
| 21 | 1226 | no | 201 | 1247934 |
| 22 | 1221 | yes | . | 537170 |
| 23 | 1218 | yes | . | 537170 |
| 24 | 1227 | yes | . | 537170 |
| 25 | 1226 | yes | . | 537170 |
| 26 | 1224 | yes | . | 1095220 |
| 27 | 1230 | no | 205 | 1594776 |
| 28 | 1225 | yes | . | 1594776 |
| 29 | 1221 | yes | . | 1594776 |
| 30 | 1225 | yes | . | 1594776 |
| 31 | 1229 | no | 208 | 1538303 |
| 32 | 1223 | yes | . | 1538303 |
| 33 | 1220 | yes | . | 1538303 |
| 34 | 1226 | yes | . | 1538303 |
| 35 | 1225 | yes | . | 1538303 |
| 36 | 1220 | yes | . | 1538303 |
| 37 | 1224 | no | 205 | 1538303 |
| 38 | 1228 | yes | . | 1538303 |
| 39 | 1219 | yes | . | 3789587 |
| 40 | 1228 | yes | . | 2011510 |
| 41 | 1223 | no | 302 | 2011510 |
| 42 | 1220 | yes | . | 2011510 |
| 43 | 1220 | yes | . | 2011510 |
| 44 | 1221 | yes | . | 686252 |
| 45 | 1228 | no | 201 | 686252 |
| 46 | 1229 | yes | . | 2451926 |
| 47 | 1219 | yes | . | 2451926 |
| 48 | 1219 | yes | . | 1043244 |
| 49 | 1224 | yes | . | 1043244 |
| 50 | 1230 | no | 205 | 1043244 |
步骤 1:处理死亡年龄并估计出生日期及死亡年龄
如上所述,通过推导的随机数random1和random2,得到修正的出生日期dob'和修正的死亡年龄aad'。死亡日期dod'由dob'和aad'加总得出,示于表17.4第10列。
步骤 2:在目标年份中定位死亡事件时间
与时期相关的死亡事件发生在世纪月代码1224与1235之间。因此,表17.4中的第3,第6,第31和第41号记录中的死亡是不相关的,因为它们被认为没有发生在2002年。第11和第45号记录的死亡也不相关,因为孩子的死亡年龄分别是两个月(第11号)和一个月(第45号),因此并没有经历年龄五个月的死亡风险。
步骤 3:推导历险时间
表17.5计算了这些记录的历险时间。所使用的规则示于“情景”一列中。对于那些调查期间仍存活的和在此期间死亡的孩子,其历险时间的计算结果示于接下来的两列中。
表17.4 推导插补的出生日期,死亡年龄和死亡日期,马拉维2004年人口和健康调查(50个样本)
| 记录编号 | 世纪月格式的出生日期b3 | 孩子是否存活b5 | 死亡年龄b6 | 样本权重v005 | 随机数random1 | 随机数random2 | 出生日期dob' | 死亡年龄aad' | 死亡日期dod' |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 1223 | yes | . | 469061 | 0.55 | 1223.55 | |||
| 2 | 1223 | yes | . | 469061 | 0.85 | 1223.85 | |||
| 3 | 1222 | no | 107 | 469061 | 0.15 | 0.05 | 1222.15 | 0.28 | 1222.43 |
| 4 | 1224 | yes | . | 469061 | 0.25 | 1224.25 | |||
| 5 | 1223 | yes | . | 469061 | 0.25 | 1223.25 | |||
| 6 | 1218 | no | 205 | 469061 | 0.05 | 0.45 | 1218.05 | 5.45 | 1223.5 |
| 7 | 1230 | yes | . | 2171218 | 0.55 | 1230.55 | |||
| 8 | 1225 | yes | . | 704240 | 0.55 | 1225.55 | |||
| 9 | 1230 | yes | . | 704240 | 0.25 | 1230.25 | |||
| 10 | 1224 | yes | . | 704240 | 0.35 | 1224.35 | |||
| 11 | 1224 | no | 202 | 704240 | 0.55 | 0.75 | 1224.55 | 2.75 | 1227.3 |
| 12 | 1221 | yes | . | 1106470 | 0.45 | 1221.45 | |||
| 13 | 1225 | yes | . | 1106470 | 0.75 | 1225.75 | |||
| 14 | 1224 | no | 205 | 1106470 | 0.85 | 0.25 | 1224.85 | 5.25 | 1230.1 |
| 15 | 1221 | yes | . | 1106470 | 0.35 | 1221.35 | |||
| 16 | 1221 | yes | . | 1106470 | 0.45 | 1221.45 | |||
| 17 | 1218 | no | 205 | 1106470 | 0.95 | 0.65 | 1218.95 | 5.65 | 1224.6 |
| 18 | 1229 | yes | . | 3900164 | 0.45 | 1229.45 | |||
| 19 | 1230 | yes | . | 1247934 | 0.65 | 1230.65 | |||
| 20 | 1224 | yes | . | 1247934 | 0.65 | 1224.65 | |||
| 21 | 1226 | no | 201 | 1247934 | 0.75 | 0.85 | 1226.75 | 1.85 | 1228.6 |
| 22 | 1221 | yes | . | 537170 | 0.65 | 1221.65 | |||
| 23 | 1218 | yes | . | 537170 | 0.85 | 1218.85 | |||
| 24 | 1227 | yes | . | 537170 | 0.95 | 1227.95 | |||
| 25 | 1226 | yes | . | 537170 | 0.85 | 1226.85 | |||
| 26 | 1224 | yes | . | 1095220 | 0.95 | 1224.95 | |||
| 27 | 1230 | no | 205 | 1594776 | 0.15 | 0.65 | 1230.15 | 5.65 | 1235.8 |
| 28 | 1225 | yes | . | 1594776 | 0.15 | 1225.15 | |||
| 29 | 1221 | yes | . | 1594776 | 0.85 | 1221.85 | |||
| 30 | 1225 | yes | . | 1594776 | 0.05 | 1225.05 | |||
| 31 | 1229 | no | 208 | 1538303 | 0.65 | 0.85 | 1229.65 | 8.85 | 1238.5 |
| 32 | 1223 | yes | . | 1538303 | 0.45 | 1223.45 | |||
| 33 | 1220 | yes | . | 1538303 | 0.15 | 1220.15 | |||
| 34 | 1226 | yes | . | 1538303 | 0.55 | 1226.55 | |||
| 35 | 1225 | yes | . | 1538303 | 0.95 | 1225.95 | |||
| 36 | 1220 | yes | . | 1538303 | 0.45 | 1220.45 | |||
| 37 | 1224 | no | 205 | 1538303 | 0.25 | 0.85 | 1224.25 | 5.85 | 1230.1 |
| 38 | 1228 | yes | . | 1538303 | 0.35 | 1228.35 | |||
| 39 | 1219 | yes | . | 3789587 | 0.35 | 1219.35 | |||
| 40 | 1228 | yes | . | 2011510 | 0.15 | 1228.15 | |||
| 41 | 1223 | no | 302 | 2011510 | 0.65 | 0.55 | 1223.65 | 30.6 | 1254.25 |
| 42 | 1220 | yes | . | 2011510 | 0.35 | 1220.35 | |||
| 43 | 1220 | yes | . | 2011510 | 0.25 | 1220.25 | |||
| 44 | 1221 | yes | . | 686252 | 0.95 | 1221.95 | |||
| 45 | 1228 | no | 201 | 686252 | 0.85 | 0.35 | 1228.85 | 1.35 | 1230.2 |
| 46 | 1229 | yes | . | 2451926 | 0.25 | 1229.25 | |||
| 47 | 1219 | yes | . | 2451926 | 0.05 | 1219.05 | |||
| 48 | 1219 | yes | . | 1043244 | 0.85 | 1219.85 | |||
| 49 | 1224 | yes | . | 1043244 | 0.95 | 1224.95 | |||
| 50 | 1230 | no | 205 | 1043244 | 0.35 | 0.35 | 1230.35 | 5.35 | 1235.7 |
对于存活年龄达到6个月的孩子,那些出生在月份1219至1229的孩子对所分析的年龄-时期贡献了整整一个月的历险时间(即从正好5个月至正好6个月),因此1号记录(出生于1223.55)贡献了整整一个月的历险时间;出生于月份1218的孩子将贡献(dob - 1218)个月的历险时间,因此23号记录(出生于1218.85)贡献了0.85个月的历险时间;出生于月份1230的孩子将贡献(1231 - dob)个月的历险时间,因此7号纪录贡献了1231 - 1230.55= 0.45个月的历险时间;出生于月份1219至1229而出生以后第五个月死亡的孩子将贡献(aad - 5)个月的历险时间,因此死亡发生于出生后5.25个月的14号记录贡献了0.25个月的历险时间。
表17.5 推导历险时间来估算儿童死亡率,马拉维2004年人口和健康调查(50个样本)
| 历险时间 | 加权后的 | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| 记录 编号 | 出生日 期 dob'
| 死亡年 龄 aad' | 死亡日 期 dod' | 样本权 重 v005
| 情景 | 幸存 者 | 死亡 者 | 历险 时间 | 死亡 人数 |
| 1 | 1223.55 | 469061 | c | 1 | 0.469 | ||||
| 2 | 1223.85 | 469061 | c | 1 | 0.469 | ||||
| 3 | 1222.15 | 0.25 | 1222.4 | 469061 | N/A | N/A | N/A | 0.000 | |
| 4 | 1224.25 | 469061 | c | 1 | 0.469 | ||||
| 5 | 1223.25 | 469061 | c | 1 | 0.469 | ||||
| 6 | 1218.05 | 5.45 | 1223.5 | 469061 | N/A | N/A | N/A | 0.000 | |
| 7 | 1230.55 | 2171218 | d | 0.45 | 0.977 | ||||
| 8 | 1225.55 | 704240 | c | 1 | 0.704 | ||||
| 9 | 1230.25 | 704240 | d | 0.75 | 0.528 | ||||
| 10 | 1224.35 | 704240 | c | 1 | 0.704 | ||||
| 11 | 1224.55 | 2.75 | 1227.3 | 704240 | c | 1 | 0.704 | ||
| 12 | 1221.45 | 1106470 | c | 1 | 1.106 | ||||
| 13 | 1225.75 | 1106470 | c | 1 | 1.106 | ||||
| 14 | 1224.85 | 5.25 | 1230.1 | 1106470 | c | 0.25 | 0.277 | 1.106 | |
| 15 | 1221.35 | 1106470 | c | 1 | 1.106 | ||||
| 16 | 1221.45 | 1106470 | c | 1 | 1.106 | ||||
| 17 | 1218.95 | 5.65 | 1224.6 | 1106470 | b | 0.6 | 0.664 | 1.106 | |
| 18 | 1229.45 | 3900164 | c | 1 | 3.900 | ||||
| 19 | 1230.65 | 1247934 | d | 0.35 | 0.437 | ||||
| 20 | 1224.65 | 1247934 | c | 1 | 1.248 | ||||
| 21 | 1226.75 | 1.85 | 1228.6 | 1247934 | c | 1 | 1.248 | ||
| 22 | 1221.65 | 537170 | c | 1 | 0.537 | ||||
| 23 | 1218.85 | 537170 | b | 0.85 | 0.457 | ||||
| 24 | 1227.95 | 537170 | c | 1 | 0.537 | ||||
| 25 | 1226.85 | 537170 | c | 1 | 0.537 | ||||
| 26 | 1224.95 | 1095220 | c | 1 | 1.095 | ||||
| 27 | 1230.15 | 5.65 | 1235.8 | 1594776 | d | 0.65 | 1.037 | 1.595 | |
| 28 | 1225.15 | 1594776 | c | 1 | 1.595 | ||||
| 29 | 1221.85 | 1594776 | c | 1 | 1.595 | ||||
| 30 | 1225.05 | 1594776 | c | 1 | 1.595 | ||||
| 31 | 1229.65 | 8.85 | 1238.5 | 1538303 | c | 1 | 1.538 | ||
| 32 | 1223.45 | 1538303 | c | 1 | 1.538 | ||||
| 33 | 1220.15 | 1538303 | c | 1 | 1.538 | ||||
| 34 | 1226.55 | 1538303 | c | 1 | 1.538 | ||||
| 35 | 1225.95 | 1538303 | c | 1 | 1.538 | ||||
| 36 | 1220.45 | 1538303 | c | 1 | 1.538 | ||||
| 37 | 1224.25 | 5.85 | 1230.1 | 1538303 | c | 0.85 | 1.308 | 1.538 | |
| 38 | 1228.35 | 1538303 | c | 1 | 1.538 | ||||
| 39 | 1219.35 | 3789587 | c | 1 | 3.790 | ||||
| 40 | 1228.15 | 2011510 | c | 1 | 2.012 | ||||
| 41 | 1223.65 | 32.35 | 1256 | 2011510 | c | 1 | 2.012 | ||
| 42 | 1220.35 | 2011510 | c | 1 | 2.012 | ||||
| 43 | 1220.25 | 2011510 | c | 1 | 2.012 | ||||
| 44 | 1221.95 | 686252 | c | 1 | 0.686 | ||||
| 45 | 1228.85 | 1.35 | 1230.2 | 686252 | c | 1 | 0.686 | ||
| 46 | 1229.25 | 2451926 | c | 1 | 2.452 | ||||
| 47 | 1219.05 | 2451926 | c | 1 | 2.452 | ||||
| 48 | 1219.85 | 1043244 | c | 1 | 1.043 | ||||
| 49 | 1224.95 | 1043244 | c | 1 | 1.043 | ||||
| 50 | 1230.35 | 5.35 | 1235.7 | 1043244 | d | 0.35 | 0.365 | 1.043 | |
| 总和 | 59.317 | 6.389 | |||||||
步骤 4:加权并累计死亡事件和历险时间
计算死亡率之前的最后一步是应用死亡和历险时间的样本权重,然后对加权后的死亡和历险时间求和。表17.5的第6列和第7列显示了幸存者和相关死亡者的历险时间,而第8列和第9列分别对第6列和第7列乘以样本权重v005/1,000,000。这样的话,年龄别死亡率M(5,2002)就可以由加权后的死亡人数的总和除以加权后的历险时间的总和来计算得出:
$M(x, j) = \frac{\sum\limits_{i=1}^N D(i, x, j) * wgt(i)}{\sum\limits_{i=1}^N E(i, x, j) * wgt(i)} = \frac{6.389}{59.317} = 0.1077$ 。
步骤 5:从年龄别死亡率计算死亡的概率
步骤 4计算出的死亡率是基于每个年龄月上的历险。因此,为了从死亡率推导出一个时期的死亡概率,有必要采用标准公式。鉴于我们已经作出了一些简化的假定,而且所处理的年龄范围比较狭窄,因此假定死亡在年龄范围的每个月均匀分布是合理的,即使对出生的第一个月也是如此。q(x)可计算如下:
$q(5,2002) = \frac{ \frac{M(5,2002)}{12} }{( 1 + \frac{M(5,2002)}{24}) } = \frac{ \frac{0.1077}{12} }{ (1 + \frac{0.1077}{24}) } = \frac{0.008975}{1 + 0.004488} = 0.008935$
一旦计算出所有的q(x,j),接着可以将它们转化为对应的存活概率,连接在一起就得到了从出生到任何年龄上的存活概率和死亡概率。
如果要计算超过一个日历年以上的时期的死亡率和死亡概率,步骤 4中的加权后的总和要根据需要跨年加总,而步骤 5保持不变。
需要注意的是,这里描述的步骤和人口和健康调查所使用的不同。人口和健康调查中的方法是直接计算假想队列的概率(鲁茨坦和罗哈斯 2003)。其计算分八个年龄组,即新生儿组,1-2个月组,3-5个月组,6-11个月组,以及1-4岁组。对于每个年龄范围,时期的死亡数都来自出生日期和死亡年龄,而历险人数则是在此期间进入该年龄范围的孩子人数的近似值。这个近似值是在该期间进入年龄范围和离开年龄范围(或者如果存活,将会离开年龄范围)的孩子的总人数,加上在该期间进入年龄范围但在该期间之后会离开年龄范围的孩子的一半人数,再加上在该期间之前就进入年龄范围但会在该期间离开的孩子的一半人数。
无论采用哪个方法,都需要完整生育史的个体层面数据。尽管计算可以根据详细列表来操作,但是这样做非常繁琐,因此这里强烈推荐使用合适的计算机程序。
解释
儿童死亡率直接估算法的主要特点是信息来自被调查家庭户中的存活妇女,这一点在解释结果时必须牢记,因为这里存在受访者选择性偏差的风险。尤其是,出生于某一社区的孩子,当母亲不再生活在该社区时,其孩子死亡的事件就不会被纳入测量。如果这类孩子的死亡率高于那些母亲仍然生活在该社区的孩子的死亡率,儿童死亡率就会被低估。这种偏差的最严重的形式可能发生在社区中存在高水平的艾滋病患病率的情况,因为在没有广泛抗逆转录病毒治疗的情况下,这样的患病率将导致母亲和儿童的存活之间出现强的正相关关系(参见第15章“艾滋病对儿童死亡率估算方法的影响”的内容)。实际上,在任何人群中,母亲和儿童的存活之间都基本会存在一定的正相关关系。偏差可能还有其他来源。例如,高人口迁入率将导致妇女申报在别处出生并长大的存活儿童,而高人口迁出率则将掩盖那些在该社区出生并长大的儿童。虽然不可能事先知道这些偏差的方向或幅度,但是分析人员需要牢记这些偏差的潜在影响。如果调查时外出没在社区的妇女无法被当面访谈而其孩子可能经历不同的死亡风险,或者如果部分地因为孩子经历了不同的死亡风险而无法被当面访谈,那么无回答的情况可能也会成为一个问题。
拓展:截尾生育史
截尾生育史:数据质量评估
相比完整生育史,截尾生育史所提供的数据质量检查的机会比较少,因为申报事件的时间序列被设计成截尾的形式。如果按照时期来截尾,申报的事件应该代表了所覆盖的时期,而如果按照事件数目来截尾,那么申报的事件仅代表调查前相当短的一段时间内的所有事件,这就使评估事件的时间序列变得复杂了。
如同完整生育史,步骤 1应该是核查数据的缺失值。步骤 2应检验出生的性别比和死亡年龄的堆积。
因为没有截尾点之前出生日期的详细信息,直接评估出生转移是不可能的,但是可以进行间接评估。一个截尾生育史应该会首先搜集概括生育史数据。因此,对于按调查时的年龄来分组的妇女,通过减去截尾生育史申报的出生数和孩子死亡数,可以在调查时点(通过概括生育史)和截尾点(只能大致计算死亡数)计算出生数和孩子死亡数。出生数的计算是准确的,但是只能近似计算孩子死亡数,这是因为对截尾点之前出生的孩子来说,概括生育史申报的一些死亡数发生在截尾点之后。但一般来说,由于儿童死亡率的风险随着年龄增长而迅速下降,这类额外死亡的人数非常小。因此,数据质量评估要比较截尾点前和截尾点后出生的孩子的(按调查时点母亲年龄分组的)死亡比例。
前者比例一般会大于后者,这里有两个原因。首先,孩子的历险时间较短。其次,如果儿童死亡率随着时间而下降,孩子也会相应经历较低的年龄别死亡风险。但是,如果系统地忽略截尾以后时期死亡的孩子,或者如果孩子在概括生育史中被申报了,却没被申报为在该时期已出生,那么两者的比率将会被数据误差所夸大。如果拥有同一人口较早或较晚的时期上的完整生育史数据,我们可以估计出一个合理的无误差的比率。表17.6显示了蒙古国三次生殖健康调查的数据,一次在1998年,搜集了完整生育史数据,而另外两次分别在2003年和2008年,只搜集了截尾生育史数据。1998年的完整生育史数据被用来计算一个特定的(用于比较的)截尾日期之前和之后所出生的孩子的死亡比例,并与从2003年和2008年截尾生育史数据计算出的比例相比较。可以看出,截尾生育史的比率比完整生育史的比率大几倍,这是死亡儿童从截尾后时期转移出来的有力证据。如果没有所考察的国家的相关的基线数据,正如在这里的1998年生殖健康调查,那么比率大于3应被视为死亡儿童在最近时期可能被遗漏的证据。
表17.6 出生在截尾点之前和之后的死亡孩子比例,蒙古国1998年、2003年和2008年生殖健康调查
| 年龄组 | 1998生殖健康调查 (完整生育史) | 2003生殖健康调查 (截尾生育史) | 2008生殖健康调查 (截尾生育史) | ||||||
|---|---|---|---|---|---|---|---|---|---|
| 死亡孩子比例 | 比率 | 死亡孩子比例 | 比率 | 死亡孩子比例 | 比率 | ||||
| 之前 | 之后 | 之前 | 之后 | 之前 | 之后 | ||||
| 20-24 | 0.106 | 0.07 | 1.5 | 0.222 | 0.035 | 6.3 | 0.052 | 0.041 | 1.2 |
| 25-29 | 0.14 | 0.061 | 2.3 | 0.122 | 0.036 | 3.4 | 0.083 | 0.024 | 3.5 |
| 30-34 | 0.128 | 0.082 | 1.6 | 0.117 | 0.022 | 5.4 | 0.081 | 0.015 | 5.3 |
| 35-39 | 0.072 | 0.064 | 1.1 | 0.12 | 0.025 | 4.7 | 0.097 | 0.01 | 10.2 |
| 40-44 | 0.119 | 0.068 | 1.8 | 0.15 | 0.051 | 3 | 0.095 | 0.01 | 9.6 |
| 45-49 | 0.213 | 0 | * | 0.066 | 0.048 | 1.4 | 0.119 | 0 | * |
截尾生育史:计算队列的儿童死亡率指标
从截尾生育史计算队列的死亡概率遵循与完整生育史相同的原则:对于在调查前至少x年前出生的规定队列,年龄x上的死亡概率计算为死亡孩子数除以曾生孩子数。但是,正如图17.1的列克西斯图所表明的,这里有一个重要的区别,即x的值被截尾日期所限制。例如,如果截尾日期是调查前5年,那么就没有一个出生队列经历过5岁之前的全部风险,而且经历了2岁之前的全部风险的队列也仅限于那些出生在调查之前2、3、和4年的孩子。因此,推导死亡率指标的年龄范围是有局限性的。
截尾生育史:计算时期儿童死亡率指标
从截尾生育史计算时期的儿童死亡率的指标的基本方法遵循与完整生育史相同的原则:计算特定时期的年龄别比率,然后将其转换成在连续年龄上的死亡概率,再将这些概率应用于一个假想出生队列来创建生命表。但是,以这种方式分析截尾生育史也有计算队列指标时所面临的同样问题,即随着年龄增长,样本和历险时间变得越来越受限制。例如,如果截尾点是调查前5年,那么3岁和4岁的测量所依靠的样本就很少,从而产生较大的抽样误差。
参考文献
Croft, Trevor N., Allen, Courtney K., Zachary, Blake W., et al. 2023. Guide to DHS Statistics. Rockville, Maryland, USA: ICF. https://www.dhsprogram.com/Data/Guide-to-DHS-Statistics/index.cfm
Preston SH, P Heuveline and M Guillot. 2001. Demography: Measuring and Modelling Population Processes. Oxford: Blackwell.
书籍遍历链接: 由生育史调查数据直接估算儿童死亡率
Suggested citation
Hill K. 2013. Direct estimation of child mortality from birth histories. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/direct-estimation-child-mortality-birth-histories.