甲、乙两个校对员彼此独立对同一本书的样稿进行校对,校完后,甲发现 a 个错字,乙发现 b 个错字,其中共同发现的错字有 c 个,试用矩估计给出如下两个未知参数的估计:(1) 该书样稿的总错字个数;(2) 未被发现的错字数。
甲、乙两个校对员彼此独立对同一本书的样稿进行校对,校完后,甲发现 $a$ 个错字,乙发现 $b$ 个错字,其中共同发现的错字有 $c$ 个,试用矩估计给出如下两个未知参数的估计: (1) 该书样稿的总错字个数; (2) 未被发现的错字数。
题目解答
答案
我们来逐步分析并解决这个题目。
题目理解
甲、乙两名校对员独立校对同一本书的样稿:
- 甲发现了 $ a $ 个错字;
- 乙发现了 $ b $ 个错字;
- 两人共同发现的错字有 $ c $ 个。
注意:这里的“共同发现”是指甲和乙都发现的错字数量,即交集为 $ c $。
我们要用矩估计法来估计:
- 该书样稿的总错字个数(记为 $ N $);
- 未被发现的错字数(即 $ N - (a \cup b) $,其中 $ a \cup b $ 是至少被一个人发现的错字数)。
解题思路
这是一个经典的捕获-再捕获(Capture-Recapture)模型的应用问题,常用于生态学中估计动物种群数量,在这里用于估计总错字数。
类比:捕获-再捕获模型
- 第一次“捕获”:甲校对,发现 $ a $ 个错字,标记(即“捕获并标记”);
- 第二次“捕获”:乙校对,发现 $ b $ 个错字,其中 $ c $ 个是甲也发现的(相当于“重捕”中标记个体数);
- 假设总体有 $ N $ 个错字。
在捕获-再捕获模型中,经典估计是:
$\frac{c}{b} \approx \frac{a}{N}
\quad \Rightarrow \quad
N \approx \frac{a b}{c}$
这是基于比例的思想:乙发现的错字中,有 $ c/b $ 的比例是甲也发现的,这应近似等于甲发现的比例 $ a/N $。
下面我们用矩估计法来严格推导。
矩估计法建模
设:
- 总错字数为 $ N $(未知参数,待估计);
- 每个错字被甲发现的概率为 $ p_1 $;
- 每个错字被乙发现的概率为 $ p_2 $;
- 甲、乙独立工作,所以发现是独立事件。
但我们这里不估计 $ p_1, p_2 $,而是直接对 $ N $ 做估计。
考虑期望:
- 甲发现的错字数:$ a \approx \text{Binomial}(N, p_1) $,期望为 $ \mathbb{E}[a] = N p_1 $;
- 乙发现的错字数:$ b \approx \text{Binomial}(N, p_2) $,期望为 $ \mathbb{E}[b] = N p_2 $;
- 两人共同发现的错字数:每个错字被两人同时发现的概率为 $ p_1 p_2 $,所以:
$\mathbb{E}[c] = N p_1 p_2$
现在我们有三个期望:
$\mathbb{E}[a] = N p_1, \quad \mathbb{E}[b] = N p_2, \quad \mathbb{E}[c] = N p_1 p_2$
用矩估计法,用样本矩代替总体矩:
- 用 $ a $ 估计 $ \mathbb{E}[a] $
- 用 $ b $ 估计 $ \mathbb{E}[b] $
- 用 $ c $ 估计 $ \mathbb{E}[c] $
于是有近似等式:
$a \approx N p_1, \quad
b \approx N p_2, \quad
c \approx N p_1 p_2$
将前两个代入第三个:
$c \approx N \cdot \left( \frac{a}{N} \right) \cdot \left( \frac{b}{N} \right) = \frac{a b}{N}$
解这个方程得:
$c \approx \frac{a b}{N}
\quad \Rightarrow \quad
N \approx \frac{a b}{c}$
(1) 总错字个数的矩估计
因此,总错字数 $ N $ 的矩估计为:
$\hat{N} = \frac{a b}{c}$
> 注意:这个估计基于独立性和均匀发现概率的假设,虽然现实中可能不完全成立,但这是矩估计下的合理推导。
(2) 未被发现的错字数的估计
未被发现的错字数 = 总错字数 $-$ 至少被一个人发现的错字数。
至少被一个人发现的错字数为:
$|A \cup B| = |A| + |B| - |A \cap B| = a + b - c$
因此,未被发现的错字数估计为:
$\hat{U} = \hat{N} - (a + b - c) = \frac{a b}{c} - (a + b - c)$
最终答案
(1) 该书样稿的总错字个数的矩估计为:
$\boxed{\hat{N} = \frac{a b}{c}}$
(2) 未被发现的错字数的矩估计为:
$\boxed{\hat{U} = \frac{a b}{c} - (a + b - c)}$
补充说明
- 这个估计方法在实际中被称为 Lincoln-Petersen 捕获-再捕获估计量,常用于种群估计,也适用于此类“遗漏估计”问题。
- 要求 $ c > 0 $,否则估计无意义(分母为零)。
- 假设甲、乙发现错字是独立的,且每个错字被发现的概率相同(虽然实际中可能有偏差,但这是矩估计的标准假设)。
✅ 解题完成。