客户画像表中少量“家庭人数”为空。团队先按地区、年龄段和住房类型找到特征最相近且字段完整的客户,再用该客户的家庭人数填补缺失值。这种方法属于()。
热卡填补从数据集中寻找与缺失记录最相似、字段完整的供体记录,再用供体的对应值进行填补。题干强调相似客户和完整记录,正是热卡方法的题眼。
选项分析
错误。题干明确保留记录并进行填补,没有删除。
正确。使用相似完整记录的值,是热卡填补的核心做法。
错误。均值填补不会为每条缺失记录寻找相似供体。
错误。格式标准化处理表示形式,不负责推定缺失值。
本题为什么容易错
热卡填补听起来生僻,其实逻辑很直观。容易错在只看到最终填了一个数,却忽略这个数来自相似记录,而不是全表统计量。
简短答案
从相似完整记录中取值填补缺失数据,属于哪种方法,正确答案是 B(热卡填补)。热卡填补从数据集中寻找与缺失记录最相似、字段完整的供体记录,再用供体的对应值进行填补。题干强调相似客户和完整记录,正是热卡方法的题眼。
易混淆概念对比表
| 概念 | 本题判断 | 区别要点 | 记忆提示 |
|---|---|---|---|
| 直接删除缺失记录 | 本题干扰项 | 错误。题干明确保留记录并进行填补,没有删除。 | 看到该词不要急着选,先判断是否真正解决题干问题 |
| 热卡填补 | 本题正确答案 | 正确。使用相似完整记录的值,是热卡填补的核心做法。 | 看到题干核心场景时优先联想到它 |
| 全表均值填补 | 本题干扰项 | 错误。均值填补不会为每条缺失记录寻找相似供体。 | 看到该词不要急着选,先判断是否真正解决题干问题 |
| 格式标准化 | 本题干扰项 | 错误。格式标准化处理表示形式,不负责推定缺失值。 | 看到该词不要急着选,先判断是否真正解决题干问题 |
本题易混淆选项怎么区分
- 直接删除缺失记录:错误。题干明确保留记录并进行填补,没有删除。
- 全表均值填补:错误。均值填补不会为每条缺失记录寻找相似供体。
- 格式标准化:错误。格式标准化处理表示形式,不负责推定缺失值。
知识点详解
缺失数据可根据原因、比例和业务影响选择删除、统计量填补、热卡填补、回归或其他模型方法。热卡填补会在当前数据集中选择与目标记录相似的完整记录作为供体,能保留较真实的取值形态,但结果依赖相似度变量、距离规则和供体质量。填补过程应记录方法与来源,并在建模或统计时考虑填补带来的偏差。
备考速记
热卡就是给缺失记录找一个最像的完整邻居。
数据清洗在数据清洗场景中的作用
数据清洗在本题中的核心价值,是解决“客户画像表中少量“家庭人数”为空。团队先按地区、年龄段和住房类型找到特征最相近且字段完整的客户,再用该客户的家庭人数填补缺失值。这种方法属于()”这个场景问题。复习时不要只背选项名称,还要理解它为什么适用于该场景,以及它能解决哪类安全、流程或管理问题。
同类题怎么考
- 根据相似记录取值判断热卡填补。
- 比较热卡填补与均值、回归等缺失值处理方法。
数据清洗在系统集成项目管理工程师软考中的考法
软考选择题通常不会只考概念定义,还会把数据清洗放到数据清洗场景中,要求判断它的作用、适用范围或与相近概念的区别。遇到这类题时,先抓住题干中的业务场景,再看哪个选项最能解决该场景下的核心问题。
解题思路
老师讲这类题时常说,热卡不是把所有空格都塞进同一个平均数,而是给这条记录找一个靠谱的邻居。题干先按多个特征找最相近客户,再借用对应字段,因此 B 最准确。
考点定位
看到相似对象、供体记录、邻近样本,优先考虑热卡填补;看到统一平均值才是均值填补。
易错提醒
- 相似条件选得过少,找到的供体与目标记录差异很大。
- 用目标字段本身参与寻找供体,造成信息泄漏。
- 填补后把推定值当成真实采集值,没有留下标记。
备考提示
- 把删除、均值、热卡、回归四种方法按值从哪里来做对照。
- 实际分析时保留缺失标记,评估填补是否改变原分布。
你可能还想了解
- 热卡填补和均值填补有什么区别?
- 热卡填补怎样选择供体记录?
- 填补后的数据为什么要保留标记?
本文小结
热卡填补从数据集中寻找与缺失记录最相似的完整供体,并借用其对应字段值。它比统一均值更具个体差异,但依赖供体质量。