题目
聚类的目的是()A. 进行数据分布及可视化B. 作为其他算法的预处理步骤C. 作为数据探索和分析,更好理解离群点、预测新数据类别等D. 有效进行监督学习
聚类的目的是()
A. 进行数据分布及可视化
B. 作为其他算法的预处理步骤
C. 作为数据探索和分析,更好理解离群点、预测新数据类别等
D. 有效进行监督学习
题目解答
答案
BC
B. 作为其他算法的预处理步骤
C. 作为数据探索和分析,更好理解离群点、预测新数据类别等
B. 作为其他算法的预处理步骤
C. 作为数据探索和分析,更好理解离群点、预测新数据类别等
解析
聚类是一种无监督学习方法,其核心目的是发现数据内在的分组结构。本题需明确聚类的主要应用场景和价值:
- 预处理步骤:聚类常用于数据预处理,如降维、简化后续算法输入。
- 数据探索与分析:通过聚类可识别数据分布规律、发现离群点、支持新数据的类别预测。
- 排除干扰项:注意区分聚类与数据可视化、监督学习的关联,避免混淆。
选项分析
选项A
数据分布及可视化
聚类可间接辅助数据可视化(如通过分组观察分布),但可视化并非聚类的直接目的,因此A不选。
选项B
预处理步骤
聚类常作为其他算法的预处理(如将高维数据分组后降维),简化后续分析,因此B正确。
选项C
数据探索与分析
聚类能帮助识别数据分组、理解离群点、预测新数据类别,属于其核心价值,因此C正确。
选项D
监督学习
监督学习依赖标签,而聚类是无监督方法,二者目标不同,因此D不选。