巴德里校正法

可用数据:单次普查法

期望得到的数据:生育率

方法:评估方法

方法描述

如果普查员或被访者没有对未育妇女的曾生子女数填报“0”而留下空白,那么生育数据就会产生误差。巴德里校正法就是用来纠正这类误差的一种方法。即使普查员在搜集数据时明知正确答案应该是“0”,但只要没有填写"0", 那些被错误地留为空白的答案也将在数据处理过程中被编码为“缺失”或者“未知”。巴德里校正法能够将生育数“缺失”的妇女区分成两部分,即生育数确实未知的妇女和那些实际上未育但却被留下空白答案的妇女。这种区分是在总体水平上而非个体水平上完成的。

所需数据和假定

巴德里校正法需要分母亲年龄组的生育数,其中也包括了生育信息缺失的妇女数(缺失可能是由于答案被留为空白,或者包含超出范围的编码,或者编码为没有回答或拒绝回答)。

该方法假定,在数据搜集过程中,各个年龄都有同一固定比例的妇女实际上未报终身生育率/生育数。而这个比例就是生育数未知妇女比例与实际上未曾生育但被错误记录为生育数未申报的妇女比例的差。

注意事项和提示

该方法假定生育数未知妇女的比例和未育妇女的比例呈线性关系。如果这种线性关系存在,那么用来计算平均生育数的分母应该调整,即剔除那些(经校正后)生育数仍然未知的妇女。这里隐含一个假定,即生育数未知妇女与和生育数已知的同龄妇女之间的生育数分布一致。

在生育信息缺失比例较大而需要加以校正,但又不能用巴德里校正法的情况下(比如,没有分母亲年龄组的数据或者线性关系的假定不成立),生育数未知的妇女则应该包含在计算平均生育数的分母里。这隐含地假定了这类妇女的生育数为0(即生育数未知妇女的生育数为0)。当然,这将导致平均生育数被低估,因为并不是所有生育数未知的妇女都未曾生育过。

方法的应用

我们定义$$ N_{i}={}_{5}N_{a} $$为某一人口中年龄组为 i 的妇女人数,\(a = 15, 20, …, 45,i= a/5-2\)。这样,$$ N_{1} $$就是15-19岁妇女的人数。我们定义$$ {N_{i, j}}. $$为年龄组为 i 而生育数为 j 的妇女人数,$$ {N_{i, u}}. $$为年龄组为 i 而生育数未知的妇女人数。

步骤 1:确定每个年龄组中 a)生育数未知 和 b)未育妇女的比例

从普查数据中获取年龄组为$i$,曾生子女数为 j的妇女人数,$N_i$,$j$。 对每一年龄组,生育数缺失的数据(即空白和无效编码)应该与生育数未报的数据加总生成$N_i$,$u$。这样,年龄组为$i$而生育数未知的妇女比例为,

$$ U_{i}=\frac{N_{i, u}}{N_{i}} $$

年龄组为$i$,未育(生育数为0) 妇女的比例则由下式给出,

$$ Z_{i}=\frac{N_{i,0}}{N_{i}} $$

如果$U_i$数值很小(每个年龄组均少于2%),那么不必要进行校正。在这种情况下,平均子女数的计算则基于假定生育数未知妇女与生育数已知的同龄妇女之间的生育数分布一致,并在分母中剔除那些生育数未知的妇女。因此,如果$P_i$代表年龄组为i的妇女的平均生育数,那么

$$ P_{i}=\frac{\sum_{j=0}^{\omega} j^{*}N_{i,j}}{\sum_{j=0}^{\omega} N_{i,j}} $$

如果生育数未知的妇女比例超过2%,那么应该进一步判断是否可以进行校正。

步骤 2:将 ($Z_i$, $U_i$)各点作图来评估数据是否应校正

按照巴德里校正法的要求,($Z_i$, $U_i$) 各点在坐标图上应该分布或近似地分布在一条直线上。有些时候,在最低或最高年龄组的分布可能有弯曲。如果弯曲仅仅发生在较高年龄组,即使弯曲程度很高,剔除最高的一个或者两个年龄组后,利用剩余数据来拟合的直线也是可以接受的。这是因为该方法对低年龄段生育数未知的比例影响最大。可是如果弯曲在较低年龄段中更为显著,那么不应该使用校正方法。这是因为若剔除15-24岁的数据点,这些年龄组的平均生育数将只能用回归外推来获取,由此可能造成这些年龄组的校正失真。

如果即使剔除了一个或两个最高年龄的数据点,各点之间仍不存在一个较强的线性关系,那么则不应该使用校正方法。这种情况下,最好假定所有生育数未知的妇女都是未曾生育的,并把她们包括在平均生育数计算的分母中

$$ P_{i}=\frac{\sum_{j=0}^{w} j^{*}N_{i,j}}{N_{i}} \tag{1} $$

最后的分析报告应该注明以上的处理方法,并指出平均生育数很有可能因此被低估。

步骤 3:确定数据最佳拟合直线的斜率和截距

基于所选取的数据点,求线性回归$$ U_{i}=\beta+\gamma Z_{i} $$就可以找到拟合直线的斜率($y$)和截距($\beta$ ) 。截距($\beta$)为各个年龄组中生育数实际上未知而非误报妇女的比例的估计值。该值与年龄无关。

步骤 4:对未曾生育和生育数未报妇女的校正人数估算

在年龄组i中,未曾生育的妇女的校正比例由下式表示:$$ Z_{i}^{*}=Z_{i}+U_{i}-\beta $$。也就是说, 在各个年龄组中,未育妇女的校正比例是登记为未育的妇女比例,加上该年龄组中生育数未知的妇女比例,再减去估算得出的实际上未报生育数的妇女比例。校正后的年龄组i中的未育妇女人数由下式得出,$$ N_{i,0}^{*}=N_{i}\times Z_{i}^{*} $$;因此,校正后的年龄组i中的生育数未报的妇女人数由下式得出,$$ N_{i, n}^{*}=N_{i} \times \beta $$。在生育数大于0(j>0)的情况下,$$ N_{i,j}^{*} $$保持不变。

步骤 5: 计算平均生育数

如果数据已经经过巴德里校正法处理,那么平均生育数应由下式给出

$$ P_{i}=\frac{\sum_{j=0}^{w} j^{*}N_{i,j}^{*}}{(1-\beta) N_{i}} \tag{2} $$

此等式假定,年龄组i中那些从分母中被剔除,其生育数未知的妇女,Ni,与同年龄组中生育数已知的妇女拥有同样的平均生育数。

解释及检验

$\beta$的数值显示了实际上生育数未知的妇女比例。因此,$\beta$的值越大表明数据质量就越差。

该方法偶尔可能具有相反的效果,即对某年龄组校正后,发现生育数未知的妇女人数被低估了,而未育妇女人数则被高估了。当 $\beta$ >$U_i$ 时,这种情况就会发生。若真是这样,该年龄组则不应使用校正方法。

示例

所附的工作表展示了巴德里校正法,其所用数据为从国际微观样本系列整合共享数据库获取的肯尼亚1989年人口普查数据。原始数据见表4.1。

表4.1 普查时点的分母亲年龄的生育数,肯尼亚1989年人口普查

 母亲年龄组 (i)
生育数15-1920-2425-2930-3435-3940-4445-49
 1234567
0597,560198,60059,40023,12014,58011,0409,560
1134,700224,66083,14026,14013,6209,4607,740
238,120202,300120,94038,34019,18013,2409,280
311,120126,500150,50053,88028,02017,00012,440
46,82059,700146,50073,28037,34021,40014,800
51,74033,720102,30087,72048,14028,98018,560
6012,48058,98083,58056,52035,26026,280
70057,18091,80056,24041,26028,640
800064,74056,56042,70032,920
9000040,78039,48033,000
10000026,84032,24027,920
11000014,92022,84021,920
1200008,28014,66014,720
1300003,7407,9008,920
1400002,1804,0804,900
1500001,2602,1002,860
1600009601,2001,540
1700005206801,000
180000420520620
190000140340380
200000160300280
210000240160280
2200004010060
230000202080
240000602080
25000060400
260000604080
270000804060
280000204040
29000020040
300000340440360
生育数未知402,780147,54061,92031,58020,24015,42012,960
总计1,192,840 1,005,500 840,860 574,180 451,580 363,000 292,320 

从表4.1可看出,该数据已经经过了调整,年龄小于35岁的妇女没有过高的生育数记录。在数据准备阶段的这个调整,比在第3章《分孩次数据评估》中所提到的经验法则还要严格:20-24岁妇女的生育数被限制在6个或更少(而不是8个),25-29岁妇女的生育数被限制在7个(而不是12个),30-34岁妇女的生育数被限制在8个(而不是15个)。然而对于35岁及以上的妇女,一些看似不合理的较高生育数仍被保留。因此,还可以对表中那些斜体数据作进一步地细微调整,即把35-39岁组中19及以上的生育数转为缺失值,40-44岁组中23及以上的生育数转为缺失值,45-49岁组中26及以上的生育数转为缺失值。
在展示校正方法之前,"Introduction"工作表中有一个设定选项,可以将不合理的生育数转为“生育数未知”。

步骤 1:确定每个年龄组中 a)生育数未知 和 b)未育的妇女比例

表4.2呈现的是调整后的数据,以及计算得到的各年龄组中生育数未知和未育的妇女比例。

表4.2 调整后的生育数据以及计算得到的各年龄组中生育数未知和未育的妇女比例,肯尼亚1989年人口普查

 母亲年龄组(i)
生育数15-1920-2425-2930-3435-3940-4445-49
 1234567
0597,560198,60059,40023,12014,58011,0409,560
1134,700224,66083,14026,14013,6209,4607,740
238,120202,300120,94038,34019,18013,2409,280
311,120126,500150,50053,88028,02017,00012,440
46,82059,700146,50073,28037,34021,40014,800
51,74033,720102,30087,72048,14028,98018,560
6012,48058,98083,58056,52035,26026,280
70057,18091,80056,24041,26028,640
800064,74056,56042,70032,920
9000040,78039,48033,000
10000026,84032,24027,920
11000014,92022,84021,920
1200008,28014,66014,720
1300003,7407,9008,920
1400002,1804,0804,900
1500001,2602,1002,860
1600009601,2001,540
1700005206801,000
180000420520620
1900000340380
2000000300280
2100000160280
220000010060
2300000080
2400000080
250000000
生育数未知402,780147,54061,92031,58021,48016,06013,540
总和1,192,840 1,005,500 840,860 574,180 451,580 363,000 292,320 
Ui0.3380.1470.0740.0550.0480.0440.046
Zi0.5010.1980.0710.0400.0320.0300.033

该数据中,生育数未知妇女的比例较高,15-19岁组的比例为$$ \left( \frac{402,780}{1,192,840} = 0.338 \right) $$,20-24岁组的比例为0.147,更高年龄组中的比例虽然不突出但也相对较高。未育妇女比例 ($Z_i$) 从在最小年龄组中的约50%迅速下降到育龄期结束时的约3%。基于以上这些观察,可进一步探讨是否可以应用巴德里校正法。

步骤 2:将 ($Z_i$, $U_i$)作图来评估数据

图4.1显示了$Z_i$ 和 $U_i$ 各点在坐标图中的分布(用钻石点表示)。拟合直线也显示在图中。拟合过程中被剔除的点在图中则被标示为空心的钻石点。

图4.1巴德里校正法的拟合直线, 肯尼亚1989年人口普查
图4.1巴德里校正法的拟合直线, 肯尼亚1989年人口普查

如图所示,标注的各点之间存在明显的线性关系,在使用巴德里校正法时,可包括所有这些点。

步骤 3:确定最优拟合直线的斜率和截距

基于被校正法所包括的点,求线性回归$$ U_{i}=\beta+\gamma Z_{i} $$,得出截距(β)值为0.02745。这表示数据中大约2.7%的妇女其生育数可被认定为属于真正的缺失。

步骤 4:对未育妇女数和生育数未知妇女数的校正估算

未育妇女的校正人数由下式求得$$ N_{i,0}^{*}=N_{i}\left(Z_{i}+U_{i}-\beta\right) $$。同时,如表4.3所示,各年龄组中生育数未知妇女的校正人数,由各年龄组人数乘以β得出。
例如,20-24岁的生育数未知妇女的人数被校正为0.02745 × 1,005,500 = 27,603。15-19岁未育妇女的校正人数为,1,192,840× (0.501 + 0.338 – 0.027)=967,594。

表4.3 分年龄的对未育和生育数未知妇女人数的校正估算,肯尼亚1989年人口普查

母亲年龄组 (i)生育数未知妇女的校正人数未育妇女的校正人数
15–19 (1)32,746967,594
20–24 (2)27,603318,537
25–29 (3)23,08498,236
30–34 (4)15,76338,937
35–39 (5)12,39723,663
40–44 (6)9,96517,135
45–49 (7)8,02515,075


步骤 5:计算平均生育数


使用巴德里校正法之后,校正后的平均生育数可由等式(2)求得。结果见表4.4。
 

表4.4  校正后的分年龄组的平均生育数,肯尼亚1989年人口普查

母亲年龄组 (i)平均生育数
15–19 (1)0.242
20–24 (2)1.525
25–29 (3)3.214
30–34 (4)4.760
35–39 (5)6.239
40–44 (6)7.120
45–49 (7)7.510

值得注意的是,相对于未经校正(且假定所有生育数未知的妇女的生育数均为0)的平均生育数,校正值将各年龄组的生育数都增加了一个常量,即$$ \frac{1}{1-\beta} $$。

巴德里方法的详细说明

巴德里1961年发表的论文对巴德里校正法作了详细的阐述。其基本观点如下,若 

  1)某一人口中,任何给定年龄未育妇女的比例和生育数未知妇女的比例存在线性关系;

  2)生育数事实上未知的妇女比例是一个独立于年龄的常数,那么

$$ U_{i}=\alpha Z_{i}^{*}+\beta \tag{3}$$

$\alpha Z^{*}_{i}$ 在这里是事实上未育而被误当成生育数未知的妇女比例,而β则是以常数存在的生育数事实上未知的妇女的比例。

因此,如果$\alpha Z^{*}_{i}$ 是事实上未育而被错误地分类为生育数未知的比例,那么$$ Z_{i}=Z_{i}^{*}-aZ_{i}^{*}=(1-a)Z_{i}^{*} $$。由此,

$$ Z_{i}^{*}=\frac{Z_{i}}{(1-a)} \tag{4}$$

将其代入公式(3)中,

$$ U_{i}-\beta=a Z_{i}^{*}=Z_{i}^{*}-Z_{i} $$,  

其中,$\gamma$ 为一个未育妇女被错误地分类为生育数未妇女知的几率。

因此,对$U_i$做$Z_i$的线性回归将得出$\beta$的估算值(以及 $\gamma$ 和 $\alpha$)。

从等式(3),我们也就可以得出$$ Z_{i}^{*}=N_{i,0}^{*}=U_{i}-\beta+Z_{i} $$, 并且推出 以及$$ U_{i}^{*}=\beta N_{i} $$。值得注意的是,尽管我们有两个等式来估算$Z_i$,可是只有当拟合完全精确时,这两个等式才会得出相同的$Z_i$。一般来说,我们更倾向使用等式(3),而不是等式(4),来进行校正。这是因为等式(3)基于$\beta$的拟合值(即生育数事实上未知妇女的估计比例),而不是缺少直观解释性的$\alpha$值。

推导出$Z^{*}_{i}$ 和 $U^{*}_{i}$的校正值以后,通过等式(2)可以计算平均生育数。

使用这个校正法时,应该注意确保每一个年龄组中未育妇女(即生育数为0的妇女)的校正人数少于在普查设定的参照期内未生育的妇女数。因此,校正后的$Z^{*}_{i}$可以被用来确定普查设定的参照期内没有生育的妇女的最少人数。

若在仅对已婚妇女询问了曾生子女数的情况下(这种情况比较罕见),本校正法还有另一个版本可用。该版本在《手册十》(联合国人口司 1983)的附录II中有详细说明。

参考文献

el-Badry MA. 1961. “Failure of enumerators to make entries of zero: errors in recording childless cases in population censuses”, Journal of the American Statistical Association 56(296):909–924. doi: https://dx.doi.org/10.1080/01621459.1961.10482134

UN Population Division. 1983. Manual X: Indirect Techniques for Demographic Estimation. New York: United Nations, Department of Economic and Social Affairs, ST/ESA/SER.A/81. https://www.un.org/development/desa/pd/sites/www.un.org.development.desa.pd/files/files/documents/2020/Jan/un_1983_manual_x_-_indirect_techniques_for_demographic_estimation.pdf

原文作者
汤姆·A·莫尔特里
Suggested citation

Moultrie TA. 2012. The el-Badry correction. In Moultrie TA, Dorrington RE, Hill AG, Hill K, Timæus IM and Zaba B (eds). Tools for Demographic Estimation. Paris: International Union for the Scientific Study of Population. https://demographicestimation.iussp.org/content/el-badry-correction.