题目
处理数据集中的缺失值一般采取以下方法____。A. 删除相关记录B. 替换为0C. 替换为Nan即可D. 用估计的数据填充
处理数据集中的缺失值一般采取以下方法____。
A. 删除相关记录
B. 替换为0
C. 替换为Nan即可
D. 用估计的数据填充
题目解答
答案
AD
A. 删除相关记录
D. 用估计的数据填充
A. 删除相关记录
D. 用估计的数据填充
解析
考查要点:本题主要考查数据预处理中缺失值的处理方法,需要明确常见处理策略及其适用场景。
解题核心思路:
- 删除法适用于缺失值占比小或数据质量要求高的场景,直接剔除含缺失值的记录。
- 填充法(如用均值、模型预测等)适用于无法删除且缺失值分布有一定规律的情况。
关键排除点:
- 替换为0可能破坏数据原有意义(如年龄为0不合理)。
- 替换为Nan仅是标记缺失值,未实际处理。
选项分析
A. 删除相关记录
适用场景:当缺失值占比低(如<5%)或记录缺失过多时,删除可避免偏差。
优点:操作简单,保证剩余数据完整性。
缺点:可能损失有效信息(如缺失值分布有偏)。
D. 用估计的数据填充
常见方法:
- 均值/中位数填充:适用于数值型数据且分布集中。
- 模型预测(如KNN、回归):利用其他特征预测缺失值。
优点:保留所有样本,减少信息损失。
缺点:可能引入偏差(如均值填充忽略数据分布)。
B. 替换为0
错误原因:若数据中0有意义(如年龄、销量),替换会歪曲实际含义。
C. 替换为Nan
错误原因:Nan本身是缺失值标记,未实际解决问题,仅重复原有状态。