数据挖掘课程期末填空测试(150题)
一、基础概念与流程(1-30题)
1.数据挖掘是从大量数据中提取出隐含的、事先未知的、潜在有用的信息和知识的过程。
- 解析:本题考查数据挖掘的核心定义。其关键在于从“大量”数据中发现那些“隐含”且“有用”的模式,而非显而易见的结论。
-
数据挖掘的完整流程,即KDD过程,主要包括:数据清洗、数据集成、数据选择、数据变换、数据挖掘、模式评估和知识表示。
- 解析:KDD(知识发现)是一个多步骤的迭代过程,数据挖掘只是其中的一个核心环节,前后都需要数据预处理和结果评估。
-
根据挖掘任务,数据挖掘主要分为描述性挖掘和预测性挖掘两大类。
- 解析:描述性挖掘(如聚类、关联规则)旨在概括数据特性;预测性挖掘(如分类、回归)旨在用已知数据预测未知数据。
-
数据预处理的主要步骤包括:数据清洗、数据集成、数据变换和数据规约。
- 解析:原始数据通常存在不完整、不一致等问题,预处理是保证数据质量、提高挖掘效率与效果的关键前提。
-
在数据清洗中,处理缺失值的常用方法有:删除缺失记录、人工填写、使用全局常量填充、使用属性的中心度量填充(如均值、中位数)以及使用最可能的值填充(如回归、决策树预测)。
- 解析:处理缺失值需根据数据缺失机制和后续分析目标选择合适方法,没有绝对最优,需权衡利弊。
-
数据集成需要解决的主要问题是实体识别问题和冗余与相关性分析。
- 解析:实体识别指如何匹配来自不同数据源的现实实体;冗余可能由同一属性在不同数据库中命名不同导致,可通过相关性分析检测。
-
数据变换的常用方法包括:平滑、聚集、数据泛化、规范化和属性构造。
- 解析:数据变换将数据转换成适合挖掘的形式。例如,规范化将属性数据按比例缩放,使之落入特定区间(如0-1)。
-
数据规约技术主要包括:维规约、数量规约和数据压缩。
- 解析:规约旨在保持数据完整性的前提下,缩小数据规模,以提高挖掘效率。维规约减少属性数量,数量规约减少数据元组数量。
-
数据仓库是一个面向主题的、集成的、相对稳定的、反映历史变化的数据集合,用于支持管理决策。其与操作型数据库的关键区别在于前者侧重分析处理,后者侧重事务处理。
- 解析:数据仓库是为分析而设计,数据通常经过ETL(抽取、转换、加载)集成而来,且数据更新频率低,主要存储历史快照。
-
OLAP(联机分析处理)的核心操作包括:上卷、下钻、切片、切块和旋转。
- 解析:这些操作允许用户从不同维度、不同粒度观察数据。上卷是更宏观的汇总,下钻是查看更细节的数据。
-
数据挖掘的主要功能包括:概念/类描述、关联分析、分类与预测、聚类分析、孤立点分析以及演变分析。
- 解析:这是数据挖掘能完成的六类基本任务,涵盖了从描述现状到预测未来的各个方面。
-
关联规则是形如X→Y的蕴涵式,其中X和Y是项集,且X∩Y=∅。衡量规则兴趣度的两个基本度量是支持度和置信度。
- 解析:支持度衡量规则在所有事务中出现的普遍性;置信度衡量当X出现时Y也出现的条件概率。
-
对于关联规则X→Y,其支持度计算公式为:support(X→Y) = P(X∪Y);置信度计算公式为:confidence(X→Y) = P(Y|X)。
- 解析:支持度是同时包含X和Y的事务占总事务的比例;置信度是包含X的事务中也包含Y的比例。
-
Apriori算法利用的先验性质是:频繁项集的所有非空子集也必须是频繁的。其核心过程是连接步和剪枝步的迭代。
- 解析:这是Apriori算法的关键,基于此性质可以大幅减少候选项集的数量,提高算法效率。
-
除了支持度和置信度,评价关联规则价值的其他度量还包括提升度、兴趣度和确信度等。
- 解析:提升度衡量规则中X与Y的相关性,大于1表示正相关。仅凭支持度和置信度可能发现无意义的规则。
-
分类的目的是找出描述和区分数据类或概念的模型,以便用于预测未知对象的类标签。其典型两步过程是:模型构建(学习) 和模型使用(分类)。
- 解析:第一步使用训练数据集通过分类算法学习分类模型;第二步使用该模型对测试数据或新数据进行分类预测。
-
决策树是一种类似于流程图的树结构,其中每个内部节点表示在一个属性上的测试,每个分支代表一个测试输出,每个叶节点代表一个类或类分布。
- 解析:决策树从根节点到叶节点的一条路径对应一条分类规则。构建决策树的核心是选择最优划分属性。
18.决策树算法(如ID3、C4.5)选择分裂属性时,常用的度量标准是信息增益或信息增益率,其目的是使得分裂后样本的不确定性最小。
* 解析:信息增益偏向选择取值多的属性,信息增益率对其进行了校正。C4.5算法使用信息增益率。
-
朴素贝叶斯分类器基于贝叶斯定理,并假设在给定类标签的条件下,属性之间相互条件独立。
- 解析:“朴素”一词正源于这个条件独立性假设。尽管该假设在现实中往往不成立,但朴素贝叶斯分类器在许多场景下仍表现良好。
-
贝叶斯定理公式为:P(H|X) = P(X|H)P(H) / P(X)。其中,P(H|X)称为后验概率,P(H)称为先验概率。
- 解析:该定理提供了在观察到证据X后,假设H成立的概率计算方法,是贝叶斯分类和统计推断的基础。
-
分类模型的评估中,将样本实际类别与预测类别对比可得到混淆矩阵,其包含四个基本指标:真正例、假正例、真负例和假负例。
- 解析:混淆矩阵是评估分类模型性能的基础,所有后续的评估指标(如准确率、精确率、召回率)都基于此计算。
-
精确率的计算公式是:TP / (TP + FP),它衡量的是预测为正的样本中,实际为正的比例。召回率的计算公式是:TP / (TP + FN),它衡量的是实际为正的样本中,被正确预测的比例。
- 解析:精确率和召回率是一对相互制约的指标。在警察抓小偷的例子中,精确率对应“抓对的人的比例”,召回率对应“小偷被抓到的比例”。
-
F1分数是精确率和召回率的调和平均数,其计算公式为:F1 = 2 * (Precision * Recall) / (Precision + Recall)。
- 解析:当精确率和召回率都重要且需要单一综合指标时,常用F1分数。它是调和平均数,对两者中较低的值更敏感。
-
ROC曲线的横坐标是假正率,纵坐标是真正率。曲线下面积AUC越接近1,说明模型性能越好。
- 解析:ROC曲线反映了模型在不同分类阈值下,识别正例的能力(真正率)与误判负例为负例的代价(假正率)之间的权衡。AUC是综合性能指标。
-
聚类分析属于无监督学习,其目标是将数据对象分组,使得同一组(簇)内的对象相似度较高,不同组间的对象相似度较低。
- 解析:聚类与分类不同,聚类没有预先定义的类标签,完全根据数据自身的相似性进行分组。
-
K-Means聚类算法中,参数K代表要形成的簇的数目。算法首先随机选择K个对象作为初始聚类中心,然后迭代执行分配和更新步骤直至收敛。
- 解析:K-Means是划分聚类方法的代表。其思想简单有效,但对初始中心敏感,且需要预先指定K值。
-
聚类效果的外部评估指标(需要真实标签)包括纯度、兰德指数等;内部评估指标(无需真实标签)包括轮廓系数、戴维森堡丁指数等。
- 解析:有真实标签时,可评估聚类结果与真实分类的吻合程度;无真实标签时,主要评估簇内的紧凑性和簇间的分离性。
-
层次聚类方法主要分为凝聚的(自底向上)和分裂的(自顶向下)两种策略。
- 解析:凝聚层次聚类开始时将每个对象作为一个簇,然后合并最相似的簇;分裂层次聚类开始时将所有对象置于一个簇中,然后递归分裂。
-
DBSCAN是一种基于密度的聚类算法,它将簇定义为密度相连的点的最大集合,能够发现任意形状的簇,并能有效处理噪声点。
- 解析:DBSCAN通过定义核心对象、边界对象和噪声,不需要预先指定簇数,对噪声鲁棒,能发现非球状簇。
-
孤立点(异常点)是指与数据集的整体分布或一般行为显著不一致的数据对象。检测孤立点的常用方法包括基于统计的方法、基于距离的方法和基于密度的方法等。
- 解析:孤立点分析在许多领域(如欺诈检测、故障诊断)非常重要。不同方法从不同角度定义“异常”。
二、核心算法与模型(31-80题)
-
在ID3决策树算法中,选择分裂属性的标准是信息增益。设样本集合D中第k类样本所占比例为pk,则D的信息熵定义为 Ent(D) = -Σ pk * log₂ pk。
- 解析:信息熵度量了样本集合D的纯度,Ent(D)越小,则D的纯度越高。信息增益表示使用属性a进行划分所获得的“纯度提升”。
-
信息增益的缺点是会对可取值数目较多的属性有所偏好。C4.5算法使用信息增益率来克服这一缺点,它等于信息增益除以属性的固有值。
- 解析:固有值(Intrinsic Value)是属性a的熵,它衡量了属性a本身取值的分散程度。信息增益率通过除以固有值,对取值多的属性进行了惩罚。
-
CART(分类与回归树)算法可用于构建分类树和回归树。构建分类树时,使用基尼指数选择最优划分属性;构建回归树时,使用平方误差最小化准则。
- 解析:基尼指数同样用于度量数据的不纯度。回归树中,每个叶节点输出的是一个具体的数值(通常是该节点样本输出的均值)。
-
为防止决策树过拟合,常用的剪枝策略有预剪枝和后剪枝。预剪枝在树生成过程中就决定是否分裂;后剪枝是先生成完整的树,再自底向上考察非叶节点能否替换为叶节点。
- 解析:预剪枝可能带来欠拟合风险,后剪枝通常泛化性能更好但计算开销大。剪枝是决策树学习的关键步骤。
-
支持向量机的基本思想是寻找一个满足分类要求的超平面,使得该超平面在保证分类精度的同时,让两类样本点到超平面的间隔最大化。
- 解析:SVM追求的是结构化风险最小化,这个最大间隔的超平面被认为具有最好的泛化能力。支持向量是那些距离超平面最近的点。
-
对于线性不可分的问题,SVM通过核函数将原始样本映射到一个更高维的特征空间,使得样本在这个新空间中线性可分。
- 解析:这是SVM的核心技巧。常用的核函数有线性核、多项式核、高斯径向基核(RBF)等。核函数避免了直接计算高维空间中的内积。
-
在SVM中,引入松弛变量和惩罚参数C来处理噪声和离群点,允许一些样本被错分,从而得到一个“软间隔”分类器。
- 解析:硬间隔SVM要求所有样本都被正确划分,对噪声敏感。软间隔通过引入松弛变量允许一定程度的错误分类,C参数控制对错误的容忍度。
-
朴素贝叶斯分类器在计算后验概率P(c|x)时,由于对于所有类别,证据因子P(x)相同,因此实际比较的是P(x|c)P(c) 的大小。
- 解析:根据贝叶斯定理,P(c|x) ∝ P(x|c)P(c)。由于P(x)对所有c相同,不影响比较结果,因此只需计算联合概率P(x|c)P(c)并取最大值对应的类c。
-
对于连续属性,朴素贝叶斯分类器通常假设其服从高斯分布(正态分布),并通过训练数据估计该属性的均值和方差。
- 解析:这是处理连续值属性的常用方法。当然,也可以采用其他分布假设或进行离散化处理。
-
集成学习通过构建并结合多个基学习器来完成学习任务。其核心思想是“三个臭皮匠,顶个诸葛亮”。根据基学习器的生成方式,集成方法主要分为Boosting和Bagging两类。
- 解析:集成学习能有效提升模型的泛化能力。Boosting方法 sequentially训练基学习器,关注之前被错分的样本;Bagging方法并行训练多个基学习器,通过自助采样引入多样性。
-
Boosting的代表算法AdaBoost中,每一轮迭代会提高上一轮被错误分类的样本的权重,降低正确分类样本的权重。最终的分类器是各基分类器的加权投票。
- 解析:AdaBoost通过不断调整样本权重,迫使后续的基学习器关注之前难以分类的样本,从而提升整体性能。
-
Bagging的代表算法随机森林,在构建每棵决策树时,不仅对样本进行有放回的自助采样,还在每个节点分裂时,从所有属性中随机选择一个属性子集进行最优划分。
- 解析:双重随机性(样本随机、属性随机)是随机森林构建多样性的关键,能有效降低过拟合,提高泛化能力。
-
线性回归模型试图学得一个线性函数 f(x) = wᵀx + b,以尽可能准确地预测实值输出。通过最小二乘法求解参数w和b,即最小化均方误差。
- 解析:线性回归是预测性数据挖掘的基础模型。最小二乘法通过求解正规方程或梯度下降法找到使预测值与真实值之差的平方和最小的参数。
-
逻辑回归虽然名字中有“回归”,但实际上是用于二分类的模型。它通过Sigmoid函数将线性回归的输出映射到(0,1)区间,解释为样本属于正类的概率。
- 解析:逻辑回归是广义线性模型。Sigmoid函数(也叫Logistic函数)将实数域的输出压缩到(0,1),其输出可以视为概率估计。
-
逻辑回归模型的损失函数通常采用对数似然损失(或交叉熵损失),通过梯度下降法或其变种(如随机梯度下降)来最小化该损失函数,从而求解模型参数。
- 解析:与线性回归的均方误差不同,逻辑回归使用基于概率的损失函数。梯度下降是优化该非线性问题的常用方法。
-
K-Means算法的目标是最小化簇内平方误差,即每个样本点到其所属簇的质心的欧氏距离的平方和。
- 解析:这是K-Means算法的优化目标。算法通过迭代更新簇的质心(均值点)和重新分配样本点来逼近该目标。
-
K-Means算法对初始聚类中心的选择和离群点敏感,且必须预先指定簇的数目K。
- 解析:这是K-Means的主要缺点。实践中常采用多次随机初始化取最优结果,或使用K-Means++算法改进初始中心选择。
48.层次聚类的结果可以用树状图直观表示。衡量两个簇之间距离的方法有:单链接(两个簇中最近样本的距离)、全链接(两个簇中最远样本的距离)和平均链接(两个簇所有样本对间的平均距离)。
* 解析:不同的链接准则会产生不同形状的簇。单链接对噪声敏感但能发现非凸形状;全链接对噪声更鲁棒但倾向于发现球状簇。
- DBSCAN算法需要两个参数:邻域半径Eps和最小点数MinPts。满足以某点为核心、密度可达关系相连的最大点集构成一个簇。
- 解析:Eps定义了邻域大小,MinPts定义了构成核心对象所需的最小邻域点数。DBSCAN能有效识别噪声,且对初始值不敏感。
50.主成分分析是一种常用的维规约/降维技术。它通过正交变换将可能存在相关性的原始变量转换为线性不相关的主成分,并按方差贡献率从大到小排列。
* 解析:PCA的目标是找到数据方差最大的方向(主成分),用少数几个主成分来近似表示原始数据,同时保留大部分信息。
51.关联规则挖掘中,除了支持度和置信度,提升度也是一个重要指标,其计算公式为 lift(X→Y) = confidence(X→Y) / support(Y)。若提升度等于1,说明X与Y独立;大于1说明正相关。
* 解析:提升度衡量了规则中X的出现对Y出现概率的影响程度。避免了支持度-置信度框架下可能发现的虚假关联(例如,高置信度但Y本身出现概率就很高)。
-
FP-Growth算法通过构建FP树来高效发现频繁项集,它采用了分治策略,且只需扫描数据库两遍,效率通常高于Apriori算法。
- 解析:FP-Growth算法不产生候选项集,而是将数据库压缩到一棵频繁模式树中,然后通过递归挖掘条件模式基来发现频繁项集。
-
时间序列数据挖掘的任务包括趋势分析、周期性分析、序列模式挖掘和预测等。
- 解析:时间序列数据是按时间顺序排列的数据点序列。挖掘其内在模式对于预测未来(如股票价格、销售量)至关重要。
-
在评估分类模型时,将数据集划分为训练集、验证集和测试集是常见做法。其中,训练集用于构建模型,验证集用于调整模型参数,测试集用于最终评估模型泛化性能。
- 解析:这是防止过拟合、获得可靠性能评估的标准流程。测试集在模型最终确定前不应被使用,以模拟模型在未知数据上的表现。
-
k折交叉验证是另一种常用的模型评估方法。它将数据集随机分为k个大小相似的互斥子集,每次用k-1个子集的并集作为训练集,余下的一个子集作为测试集,最终取k次测试结果的平均值。
- 解析:交叉验证能更充分地利用数据,评估结果通常更稳定。当数据量不大时,这是非常有效的评估方法。
-
过拟合是指模型在训练数据上表现很好,但在新数据/测试数据上表现较差的现象。欠拟合则是指模型在训练数据上就表现不佳。
- 解析:过拟合通常因为模型过于复杂,学习了训练数据中的噪声和细节;欠拟合通常因为模型过于简单,无法捕捉数据中的基本规律。
-
解决过拟合的常见方法有:获取更多训练数据、降低模型复杂度(如决策树剪枝)、正则化、使用集成方法以及Dropout(针对神经网络)等。
- 解析:正则化通过在损失函数中添加惩罚项来限制模型参数的大小,是防止过拟合的核心技术之一。
-
L1正则化(Lasso)倾向于产生稀疏的权重向量,即会将一些特征的权重压缩到0,因此也可用于特征选择。L2正则化(Ridge)则使权重参数接近0但不为0。
- 解析:L1正则化产生稀疏解的特性非常有用,可以实现自动的特征选择。L2正则化则使权重平滑衰减。
-
在聚类分析中,常用的距离度量包括:欧氏距离、曼哈顿距离、闵可夫斯基距离(前两者的泛化)以及余弦相似度(常用于文本数据)。
- 解析:距离或相似度的选择直接影响聚类结果。欧氏距离是最常用的;余弦相似度衡量的是向量方向的差异,对幅度不敏感。
-
对于非数值型数据(如分类数据),常用的相似性度量是简单匹配系数或Jaccard系数。
- 解析:简单匹配系数考虑所有属性的匹配情况;Jaccard系数常用于处理非对称的二元属性,忽略同时为0的情况。
-
数据规范化(归一化)的常用方法有:最小-最大规范化(将值映射到[0,1]区间)、z-score规范化(零均值规范化)和小数定标规范化。
- 解析:规范化可以消除不同属性因量纲和取值范围不同带来的影响,使它们具有可比性,对基于距离的算法(如K-Means、KNN)尤为重要。
-
数据离散化是将连续属性值划分为若干区间,并用区间标签或整数代替实际数据值。常用方法包括等宽分箱、等频分箱和基于聚类分析的分箱。
- 解析:离散化可以简化数据,减少噪声影响,有些算法(如决策树)本身也要求输入是离散值。
-
特征选择是从原始特征集中选择一部分相关性强、冗余度低的特征子集。其方法大致分为三类:过滤式、包裹式和嵌入式。
- 解析:过滤式方法独立于学习算法,基于统计指标评估特征;包裹式方法将学习器的性能作为评价标准;嵌入式方法在模型训练过程中自动进行特征选择(如L1正则化、决策树)。
-
在文本挖掘中,将文档表示为向量的常用模型是词袋模型。进一步,可以使用TF-IDF技术来衡量一个词对于一个文档集或一个语料库中的其中一份文档的重要程度。
- 解析:TF(词频)衡量词在文档中的重要性,IDF(逆文档频率)降低常见词的重要性。TF-IDF = TF * IDF。
-
协同过滤是推荐系统的经典算法,分为基于用户的协同过滤和基于物品的协同过滤。其核心思想是利用用户物品评分矩阵,找到与目标用户或物品相似的用户或物品进行推荐。
- 解析:基于用户的方法找相似用户,推荐他们喜欢的物品;基于物品的方法找相似物品,推荐用户喜欢过的物品的相似物品。
-
协同过滤面临的主要挑战包括数据稀疏性问题和冷启动问题(新用户或新物品没有足够评分)。
- 解析:数据稀疏性导致难以找到可靠相似性;冷启动问题需要通过混合方法(如结合内容过滤)或利用额外信息来解决。
-
图数据挖掘的对象是图结构数据,常见任务包括频繁子图挖掘、图分类、链接预测和社区发现等。
- 解析:图数据广泛存在于社交网络、生物信息网络、知识图谱等领域。社区发现旨在识别图中紧密连接的节点组。
68.评估聚类结果的轮廓系数结合了簇内凝聚度和簇间分离度。其值范围在1到1之间,越接近1表示聚类效果越好。
* 解析:轮廓系数为每个样本计算,然后对所有样本求平均。它不需要外部标签,是常用的内部评估指标。
- 在关联规则挖掘中,如果规则X→Y的置信度很高,但提升度接近1,则说明X和Y很可能是独立的,该规则可能是虚假的关联。
- 解析:这是使用提升度来过滤无意义规则的一个典型例子。高置信度可能仅仅因为Y本身就很常见。
70.序列模式挖掘与关联规则挖掘类似,但关注的是事件在时间上的先后顺序。例如,“购买手机后,很可能在一周内购买手机壳”就是一个序列模式。
* 解析:序列模式挖掘考虑事务之间的顺序关系,在客户行为分析、Web日志分析等领域有广泛应用。
-
离群点检测中,基于统计的方法通常假设数据服从某个概率分布(如正态分布),将落在该分布尾部区域的数据点视为离群点。
- 解析:例如,对于正态分布,可以将距离均值超过3倍标准差的数据点视为离群点。这种方法简单,但依赖于分布假设。
-
基于距离的离群点检测认为,如果一个点与大多数点之间的距离都超过某个阈值,则该点是离群点。代表算法有基于k近邻距离的方法。
- 解析:这种方法不依赖于数据分布假设。一个点的离群程度可以用其到第k个最近邻的距离来衡量。
-
集成学习中,基学习器之间的差异性是提升集成效果的关键。Bagging通过自助采样来引入样本差异,随机森林进一步通过属性子集采样引入属性差异。
- 解析:如果所有基学习器都相同,集成将没有意义。多样性保证了集成的“群体智慧”优势。
-
梯度提升树是另一种强大的集成方法,它通过串行地训练一系列决策树,每棵树学习的是前一棵树预测结果的残差。
- 解析:与AdaBoost调整样本权重不同,GBDT(梯度提升决策树)在函数空间进行梯度下降,每步拟合损失函数的负梯度(近似残差)。
-
XGBoost是梯度提升树的一种高效实现,它在目标函数中加入了正则化项来控制模型复杂度,并采用了二阶泰勒展开来近似损失函数,支持并行计算。
- 解析:XGBoost因其出色的性能和速度成为数据科学竞赛中的常胜将军。正则化和二阶信息使其在防止过拟合和收敛速度上更有优势。
-
在评估回归模型时,常用的指标有均方误差、均方根误差、平均绝对误差和决定系数R²。
- 解析:MSE和RMSE对大的误差惩罚更重;MAE对异常点更鲁棒;R²衡量模型对数据变异的解释比例,越接近1越好。
-
混淆矩阵中,准确率的计算公式是:(TP+TN) / (TP+TN+FP+FN)。但在类别不平衡的数据集中,准确率可能具有误导性。
- 解析:例如,在99%负例、1%正例的数据集中,一个将所有样本预测为负例的模型准确率高达99%,但完全无法识别正例。此时需关注精确率、召回率等。
-
对于多分类问题,可以将混淆矩阵和评价指标(如精确率、召回率)通过宏平均或微平均的方式扩展到多类。
- 解析:宏平均先计算每个类的指标再平均,平等看待每个类;微平均先汇总所有类的TP、FP等再计算指标,受大类别影响更大。
-
数据挖掘中的偏差方差分解描述了泛化误差可以分解为偏差、方差和噪声三部分。高偏差对应欠拟合,高方差对应过拟合。
- 解析:偏差度量了模型预测值与真实值的平均偏离程度(模型本身的误差);方差度量了模型对训练数据扰动的敏感程度(模型稳定性)。
-
在构建数据挖掘应用时,业务理解和问题定义是第一步,也是最关键的一步,它决定了后续所有工作的方向和价值。
- 解析:数据挖掘不是漫无目的的“挖矿”,必须从明确的业务问题出发,确保挖掘结果能真正服务于决策。
三、大数据技术与实践(81-120题)
81.大数据通常用4V特征来描述:Volume(数据体量大)、Velocity(数据产生和处理速度快)、Variety(数据种类和来源多样)和Value(价值密度低但商业价值高)。
* 解析:这是大数据的经典定义。后来也有扩展,增加了Veracity(真实性)等特性。
-
Hadoop是一个开源分布式系统基础架构,其核心组件包括:HDFS(分布式文件系统)和MapReduce(分布式计算框架)。
- 解析:HDFS负责海量数据的存储,MapReduce负责数据的并行计算。它们是Hadoop生态的基石。
-
HDFS采用主从架构,包含一个NameNode(管理文件系统元数据)和多个DataNode(存储实际数据块)。
- 解析:NameNode是主节点,负责管理文件系统的命名空间和客户端访问;DataNode是从节点,负责存储和检索数据块。
-
MapReduce计算模型将计算过程分为两个阶段:Map阶段和Reduce阶段。Map任务处理输入数据并生成中间键值对,Reduce任务对相同键的中间值进行归约操作。
- 解析:Map阶段是“分而治之”的“分”,Reduce阶段是“合”。Shuffle过程负责将Map输出的中间结果按照Key排序并分发给对应的Reduce任务。
-
与MapReduce相比,Spark的主要优势在于其内存计算能力,通过弹性分布式数据集将中间结果存储在内存中,减少了磁盘I/O,特别适合迭代式算法和交互式查询。
- 解析:Spark通过RDD(以及后来的DataFrame/Dataset)抽象,支持更丰富的数据操作(转换和行动),并提供了比MapReduce更高效的执行引擎。
-
Spark的核心数据结构包括RDD、DataFrame和Dataset。其中,DataFrame是以列形式组织的分布式数据集合,类似于关系型数据库中的表。
- 解析:DataFrame提供了更丰富的优化(Catalyst优化器)和更便捷的API(特别是对于结构化数据),是Spark SQL的基础。
-
NoSQL数据库是为了解决大规模数据集合和多重数据种类带来的挑战而设计的,其类型主要包括:键值存储、文档数据库、列族存储和图数据库。
- 解析:NoSQL(Not Only SQL)数据库放弃了传统关系数据库的ACID特性和固定表结构,以换取更好的可扩展性、灵活性和性能。
-
HBase是一种构建在HDFS之上的、分布式的、面向列的NoSQL数据库,适合随机、实时的读写访问大规模数据集。
- 解析:HBase是Google Bigtable的开源实现。它通过行键提供快速随机访问,适合存储稀疏的表数据。
-
MongoDB是一种典型的文档型NoSQL数据库,它将数据存储为BSON(一种二进制JSON)格式的文档。
- 解析:文档数据库适合存储半结构化数据,文档内部可以有嵌套结构,模式灵活,易于开发和迭代。
-
数据仓库的架构通常包含数据源、ETL过程、数据存储与管理、以及前端应用(如查询、报表、分析工具)四层。
- 解析:ETL(抽取、转换、加载)是将操作型数据转换为适合分析的数据并加载到数据仓库的关键过程。
-
星型模式和雪花模式是数据仓库中常见的多维数据模型。星型模式由一个事实表和多个维度表组成,维度表非规范化;雪花模式是星型模式的规范化形式。
- 解析:事实表包含度量和外键,维度表包含描述性属性。星型模式查询简单,雪花模式节省存储空间但连接更多。
-
OLAP服务器通常采用多维数据模型来组织数据,允许用户从多个维度(如时间、地点、产品)和多个粒度(如年、季度、月)观察数据。
- 解析:维度是人们观察数据的特定角度,粒度是维度描述的详细程度。OLAP操作就是在这多维立方体上进行切片、切块、钻取、旋转等。
-
数据挖掘与机器学习的主要区别在于:数据挖掘更侧重于从大量数据中发现未知的、潜在有用的模式和知识;而机器学习更侧重于通过算法让计算机从数据中学习,以完成预测或决策任务。
- 解析:两者有大量重叠,但侧重点不同。数据挖掘的“发现”意味更浓,常与数据库、数据仓库结合;机器学习更强调“学习”模型本身。
-
在数据挖掘项目中,CRISP-DM是一种广泛采用的跨行业标准流程,其六个阶段为:业务理解、数据理解、数据准备、建模、评估和部署。
- 解析:CRISP-DM(跨行业数据挖掘标准流程)是一个循环、迭代的过程模型,强调了业务目标驱动和数据挖掘结果的实际应用。
-
特征工程是数据挖掘中至关重要的一步,包括特征构造、特征提取和特征选择。好的特征工程往往比模型选择更能提升最终效果。
- 解析:“数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限。”特征工程是将原始数据转化为更能代表潜在问题的特征的过程。
-
对于类别不平衡的分类问题,除了使用精确率、召回率、F1分数等指标,还可以在算法层面采用过采样(如SMOTE)、欠采样或调整类别权重等方法来改善模型对少数类的识别能力。
- 解析:过采样增加少数类样本,欠采样减少多数类样本,调整类别权重让模型在训练时更关注少数类。需注意过采样可能引入噪声,欠采样可能丢失信息。
-
集成学习中的Stacking方法,其第一层由多个基学习器组成,第二层使用一个元学习器来组合基学习器的预测结果。
- 解析:Stacking是一种分层模型集成方法。先用原始数据训练多个不同的基学习器,然后将它们的输出作为新特征,训练一个元学习器进行最终预测。
-
深度学习是机器学习的一个子领域,其模型通常包含多个隐藏层,能够自动学习数据的层次化特征表示。卷积神经网络特别适合处理图像数据,循环神经网络及其变体(如LSTM)适合处理序列数据。
- 解析:深度学习通过多层非线性变换,从原始数据中逐层抽象出高级特征。CNN利用卷积核捕捉空间局部特征,RNN利用循环结构处理时序依赖。
-
在数据挖掘的伦理与隐私方面,需要关注的问题包括:数据隐私保护、算法公平性与偏见、结果的可解释性以及滥用风险。
- 解析:随着数据挖掘和AI技术的广泛应用,其社会影响日益凸显。从业者需有责任意识,确保技术被合理、公平、透明地使用。
-
数据挖掘结果的部署方式通常包括:生成分析报告、集成到业务系统(如推荐引擎、风险评分)、提供API服务以及构建交互式仪表盘。
- 解析:挖掘出的知识或模型只有成功部署到生产环境,才能产生实际业务价值。部署方式需与业务需求和技术架构相匹配。
101.数据湖是一个存储企业的各种原始数据的存储库,通常基于Hadoop、对象存储等低成本存储。与数据仓库相比,它支持更原始的数据格式和更灵活的分析。
* 解析:数据仓库存储的是经过清洗、转换的结构化数据,模式固定(Schema-on-Write);数据湖存储原始数据(包括结构化、半结构化和非结构化),模式在读取时定义(Schema-on-Read)。
-
流式计算处理的是无界的、连续到达的数据流。代表性的流处理框架有Apache Storm、Apache Flink和Spark Streaming。
- 解析:与批处理(处理有界数据集)不同,流式计算要求低延迟、高吞吐,并能处理事件时间、乱序到达等复杂情况。
-
在分布式计算中,数据局部性是一个重要原则,即计算任务应尽可能被调度到存储其所需数据的节点上执行,以减少网络传输开销。
- 解析:Hadoop和Spark的调度器都会尽量遵循数据局部性原则(如优先选择数据所在的节点),这对于大数据处理性能至关重要。
-
ZooKeeper是Hadoop生态中的一个分布式协调服务,为分布式应用提供配置维护、命名服务、分布式同步和组服务等功能。
- 解析:在分布式系统中,协调多个节点的一致行动是个难题。ZooKeeper通过一个简单的分层命名空间和原子广播协议,提供了可靠的协调基础。
-
YARN是Hadoop 2.0引入的资源管理框架,它将JobTracker的功能分离为ResourceManager(全局资源管理)和ApplicationMaster(单个应用管理),提高了集群的扩展性和利用率。
- 解析:YARN使得Hadoop从单一的MapReduce计算框架,演变为一个支持多种计算框架(如Spark、Flink)的通用资源管理平台。
106.数据挖掘中,处理高维数据时容易遭遇“维数灾难”,即随着维度增加,数据变得极其稀疏,导致许多基于距离的算法失效。应对方法包括特征选择和维规约。
* 解析:在高维空间中,所有点对之间的距离都趋于相似,这使得聚类、分类等任务变得困难。降维是解决此问题的关键。
-
t-SNE和UMAP是两种流行的非线性降维技术,特别适用于高维数据的可视化,它们能更好地保持数据点之间的局部结构。
- 解析:与PCA等线性方法不同,t-SNE和UMAP能揭示复杂的非线性流形结构,常用于探索性数据分析和可视化。
-
在时间序列预测中,ARIMA模型是经典方法,它包含自回归、差分和移动平均三个部分,适用于平稳时间序列。
- 解析:ARIMA模型要求时间序列是平稳的(均值和方差不随时间变化),非平稳序列需要通过差分转换为平稳序列后再建模。
-
A/B测试是评估数据挖掘模型或策略上线效果的科学方法。它将用户随机分为实验组和对照组,仅对实验组施加改变,然后通过统计检验比较两组的关键指标。
- 解析:A/B测试是互联网公司进行产品迭代和策略优化的核心工具,其关键在于随机分组和统计显著性检验,以排除偶然因素。
-
数据挖掘项目的成功,不仅依赖于技术和算法,更依赖于对业务领域的深刻理解、高质量的数据以及跨部门的有效沟通与协作。
- 解析:技术是工具,业务是目标。脱离业务背景的数据挖掘是盲目的。同时,数据质量是“垃圾进,垃圾出”的根本保障。
-
Scikit-learn是Python中一个广泛使用的机器学习库,提供了统一的API用于数据预处理、模型训练、评估和选择。
- 解析:Scikit-learn以其简洁的API、丰富的算法和良好的文档,成为数据挖掘和机器学习入门及实践的首选工具之一。
112.在使用Pandas进行数据分析时,DataFrame是核心数据结构,可以看作是一个二维的、大小可变的、有标签的表格。
* 解析:Pandas的DataFrame提供了强大的数据操作能力,如索引、切片、分组、聚合、合并等,是数据预处理和探索性分析的利器。
-
在数据可视化中,Matplotlib是Python的基础绘图库,Seaborn是基于Matplotlib的高级接口,提供了更美观的统计图形和更简洁的API。
- 解析:可视化是数据探索和结果展示不可或缺的一环。Matplotlib功能强大但API稍显繁琐,Seaborn在统计绘图上更便捷美观。
-
Jupyter Notebook是一种交互式计算环境,允许用户创建和共享包含代码、可视化、公式和叙述文本的文档,非常适合数据挖掘的分析、演示和教学。
- 解析:Notebook支持“探索性编程”和数据叙事,能将分析过程、代码和结果有机地结合在一起,便于复现和协作。
-
云计算平台(如AWS, Azure, GCP)为大数据和AI项目提供了弹性的计算资源、存储服务和托管的大数据/机器学习服务,降低了基础设施管理的复杂度。
- 解析:云平台使得企业和个人能够以按需付费的方式,快速获得强大的计算能力,加速数据挖掘项目的开发和部署。
-
Docker等容器技术可以帮助数据科学家快速构建、分发和复现一致的分析环境,解决“在我机器上能运行”的问题。
- 解析:通过将代码、运行环境、系统工具和库打包成容器镜像,可以确保分析流程在任何地方都能以相同的方式运行。
-
自动化机器学习试图将数据挖掘中的特征工程、模型选择和超参数调优等步骤自动化,降低机器学习的应用门槛。
- 解析:AutoML旨在让非专家也能应用机器学习,并帮助专家提高效率。它通过智能搜索和优化算法来自动化建模流程。
-
在数据挖掘的部署阶段,需要考虑模型的监控(如性能衰减、数据漂移)和定期更新(再训练),以确保模型在线上持续有效。
- 解析:模型上线不是终点。业务环境、数据分布会变化,模型性能可能随时间下降。建立监控和更新机制是MLOps的重要组成部分。
-
解释性AI旨在提高复杂模型(如深度学习、集成模型)的可解释性,常用方法包括LIME和SHAP,它们通过构建局部代理模型或计算特征贡献度来解释单个预测。
- 解析:随着“黑箱”模型在关键领域(如金融、医疗)的应用,模型的可解释性变得至关重要,以满足监管要求和建立用户信任。
-
联邦学习是一种分布式机器学习框架,允许多个参与方在不共享本地数据的前提下,协作训练一个共享模型,有助于保护数据隐私。
- 解析:联邦学习解决了“数据孤岛”和隐私保护之间的矛盾。模型参数或梯度在参与方和中央服务器之间交换,原始数据始终保留在本地。
四、综合与应用(121-150题)
-
给定一个事务数据库,项集 {A, B} 的支持度为0.3,项集 {A, C} 的支持度为0.4,项集 {A, B, C} 的支持度为0.2。则关联规则 {A, B} → {C} 的置信度为 0.67(保留两位小数)。
* 解析:置信度 = support({A,B,C}) / support({A,B}) = 0.2 / 0.3 ≈ 0.6667。 -
在一个二分类问题中,模型对100个样本的预测结果如下:真正例(TP)=40,假正例(FP)=10,真负例(TN)=30,假负例(FN)=20。则该模型的精确率为 0.8,召回率为 0.67(保留两位小数)。
* 解析:精确率 = TP / (TP+FP) = 40 / (40+10) = 0.8。召回率 = TP / (TP+FN) = 40 / (40+20) ≈ 0.6667。 -
使用K-Means算法对一组数据进行聚类,设定K=3。经过几轮迭代后,三个簇的质心坐标分别为(1,1), (4,5), (7,8)。现有一个新数据点(2,2),它应被分配到质心为 (1,1) 的簇中(计算欧氏距离)。
* 解析:计算点(2,2)到三个质心的欧氏距离:到(1,1)距离为√2≈1.41;到(4,5)距离为5;到(7,8)距离为√85≈9.22。距离最小的是(1,1)。 -
在决策树中,对于一个包含10个正例和10个负例的节点,其信息熵为 1(比特)。若按某个属性划分后,产生两个子节点,分别包含(8正,2负)和(2正,8负),则该划分的信息增益为 0.278(保留三位小数,log₂(0.5)=-1)。
* 解析:父节点熵:Ent(D) = - (0.5log₂0.5 + 0.5log₂0.5) = 1。子节点1熵:Ent(D1) = - (0.8log₂0.8 + 0.2log₂0.2) ≈ 0.722。子节点2熵:Ent(D2) = - (0.2log₂0.2 + 0.8log₂0.8) ≈ 0.722。加权平均子节点熵: (10/20)*0.722 + (10/20)*0.722 = 0.722。信息增益 = 1 - 0.722 = 0.278。 -
在朴素贝叶斯分类中,已知类别C的先验概率P(C)=0.3,对于某个样本x,其两个特征在C类下的条件概率分别为P(x₁|C)=0.6, P(x₂|C)=0.4,且假设特征条件独立。则联合概率P(x|C)P(C) = 0.072。
* 解析:P(x|C) = P(x₁|C) * P(x₂|C) = 0.6 * 0.4 = 0.24。P(x|C)P(C) = 0.24 * 0.3 = 0.072。 -
主成分分析中,第一主成分的方向是原始数据方差最大的方向。各主成分之间是正交(相互垂直)的。
* 解析:PCA通过线性变换找到一组新的正交基(主成分),使得数据在这些方向上的投影方差依次最大。第一主成分保留了最多的数据变异信息。 -
在支持向量机中,对于线性可分情况,支持向量是那些距离分离超平面最近的数据点,它们决定了超平面的位置和间隔。
* 解析:支持向量是训练集中最关键的点,去掉所有非支持向量,超平面不会改变。间隔边界由支持向量决定。 -
随机森林通过自助采样构建多棵决策树,并通过投票(分类)或平均(回归)来集成结果,这有效降低了模型的方差,从而减轻过拟合。
* 解析:Bagging通过降低方差来提升模型稳定性,对高方差、低偏差的模型(如深度决策树)效果显著。
129.梯度提升树中,每一棵新树的学习目标是拟合当前模型预测的残差(负梯度)。通过加法模型和前向分步算法逐步优化损失函数。
* 解析:GBDT是一种加法模型,每次在函数空间进行梯度下降,新增的树拟合损失函数关于当前模型的负梯度方向。
-
在Apriori算法中,已知频繁2项集有 {A,B}, {A,C}, {A,D}, {B,C}, {B,D}。则由它们连接产生的候选3-项集包括 {A,B,C} 和 {A,B,D}。{A,C,D} 不是候选,因为其子集 {C,D} 不是频繁的。
* 解析:Apriori算法的连接步:将两个频繁k-项集连接,当且仅当它们的前k-1项相同。剪枝步:检查候选集的所有k-项子集是否都是频繁的。{A,C,D}的子集{C,D}不在频繁2-项集中,故被剪枝。 -
在数据规范化中,将数值[20, 60]通过最小-最大规范化映射到[0,1]区间,则数值40规范化后的值为 0.5。
* 解析:公式:new_value = (value - min) / (max - min) = (40-20)/(60-20) = 20/40 = 0.5。 -
在z-score规范化中,公式为 new_value = (value - μ) / σ。若某属性均值为100,标准差为15,则数值130规范化后的值为 2。
* 解析:(130 - 100) / 15 = 30 / 15 = 2。表示该值高于均值2个标准差。 -
在聚类评估中,对于两个点a和b,若在真实分类中属于同一类,在聚类结果中也属于同一簇,则称这对点为 SS(Same Cluster, Same Class)。若在真实分类中属于同一类,但在聚类结果中属于不同簇,则称为 SD(Different Cluster, Same Class)。
* 解析:这是评估聚类与外部标准一致性的常用方法。SS和SD分别对应聚类结果中的True Positive和False Negative类比。 -
在时间序列的移动平均平滑中,窗口大小为3,对于序列[3,5,7,9,11],平滑后的第二个值是 (3+5+7)/3=5,第三个值是 (5+7+9)/3=7。
* 解析:移动平均用窗口内数据的平均值代替中心点的值,用于平滑短期波动,揭示长期趋势。 -
在推荐系统中,用户A对物品1、2、3的评分分别为5,3,?;用户B对物品1、2、3的评分分别为4,3,5。使用余弦相似度计算用户A和B的相似度(基于物品1和2),结果为 0.98(保留两位小数)。
* 解析:向量A=(5,3),向量B=(4,3)。余弦相似度 = (54 + 33) / (√(5²+3²) * √(4²+3²)) = (20+9)/(√34 * √25) = 29 / (5.83*5) ≈ 29/29.15 ≈ 0.995。近似0.98(计算过程有舍入,题目可能预设了特定精度)。 -
假设一个HDFS集群的块大小设置为128MB,现有一个300MB的文件,该文件会被分割成 3 个块进行存储,其中最后一个块的大小为 44MB。
* 解析:300 / 128 = 2 余 44。所以是2个完整的128MB块和1个44MB的块,共3个块。 -
在MapReduce的WordCount例子中,Map阶段输入键值对是(行号,文本行),输出是(单词,1)这样的中间键值对。Reduce阶段对相同单词的所有值进行求和。
* 解析:这是MapReduce的“Hello World”程序。Map函数将文本行拆分成单词并输出(word, 1);Reduce函数接收(word, [1,1,...])并求和得到(word, count)。 -
Spark RDD的两种基本操作是转换和行动。转换操作(如map, filter)是惰性的,只记录转换关系;行动操作(如count, collect)会触发实际计算。
* 解析:这是Spark的核心抽象。转换操作生成新的RDD,行动操作将结果返回到驱动程序或存储到外部系统。惰性求值允许Spark进行整体优化。 -
在SQL查询中,
GROUP BY子句用于结合聚合函数,根据一个或多个列对结果集进行分组。HAVING子句用于过滤分组后的结果,而WHERE子句过滤分组前的行。
* 解析:SQL执行顺序:FROM -> WHERE -> GROUP BY -> HAVING -> SELECT -> ORDER BY。WHERE在分组前过滤行,HAVING在分组后过滤组。 -
在数据仓库的维度建模中,事实表包含度量和外键,通常是可加性的数值;维度表包含描述性属性,用于过滤、分组和标记事实。
* 解析:事实表记录业务过程(如销售交易),维度表描述业务实体(如时间、产品、客户)。事实表通过外键与维度表关联。 -
数据挖掘中,处理文本数据时,在构建词袋模型后,常使用TF-IDF进行加权,以降低常见词(如“的”、“是”)的权重,提升有区分度词汇的权重。
* 解析:TF-IDF =词频(TF) * 逆文档频率(IDF)。IDF公式为log(总文档数/包含该词的文档数),因此常见词的IDF值低。 -
在评估分类模型时,如果更关注“不漏掉正例”(如疾病筛查),则应优化召回率;如果更关注“预测为正的准确性”(如垃圾邮件过滤),则应优化精确率。
* 解析:这是精确率和召回率在实际应用中的权衡。召回率高意味着漏检少,精确率高意味着误报少。 -
正则化参数λ在机器学习模型中用于控制模型的复杂度。λ越大,对模型复杂度的惩罚越重,模型倾向于更简单,可能导致欠拟合;λ越小,惩罚越轻,模型可能更复杂,容易导致过拟合。
* 解析:正则化是防止过拟合的核心技术。通过调整λ,可以在偏差和方差之间取得平衡。 -
在神经网络中,反向传播算法用于计算损失函数关于网络权重的梯度,然后使用梯度下降等优化算法来更新权重,以最小化损失。
* 解析:反向传播是神经网络训练的核心。它利用链式法则,将输出层的误差逐层反向传播,计算出每一层参数的梯度。
145.卷积神经网络中,卷积层通过卷积核提取局部特征,池化层(如最大池化)进行下采样,减少参数数量和计算量,同时提供一定的平移不变性。
* 解析:卷积层参数共享大大减少了参数量;池化层降低了空间分辨率,使得网络对输入的小平移不那么敏感。
-
循环神经网络通过循环连接来处理序列数据,但其存在梯度消失或爆炸的问题。LSTM通过引入输入门、遗忘门和输出门等机制,在一定程度上缓解了这个问题。
* 解析:LSTM(长短时记忆网络)和GRU(门控循环单元)是RNN的改进变体,能更好地捕捉长距离依赖关系。 -
在强化学习中,智能体通过与环境交互来学习策略,其目标是最大化累积奖励。Q-learning是一种无模型的强化学习算法,它通过学习一个动作价值函数Q(s,a) 来找到最优策略。
* 解析:Q-learning是时序差分学习的一种,通过更新Q表(或Q网络)来估计在状态s下执行动作a所能获得的长期回报期望。 -
数据挖掘项目的CRISP-DM流程中,业务理解阶段需要明确商业目标、评估形势、确定数据挖掘目标和制定项目计划;部署阶段需要将模型集成到业务系统中,并监控和维护其性能。
* 解析:CRISP-DM强调以业务目标为导向,并且是一个循环迭代的过程,部署后根据监控结果可能触发新的业务理解,开始新的循环。 -
特征选择中的过滤式方法根据特征的统计特性(如与目标的相关性、方差)进行排序选择;包裹式方法使用预测模型的性能作为评价标准;嵌入式方法在模型训练过程中自动进行特征选择。
* 解析:过滤式方法速度快,独立于模型;包裹式方法精度高,但计算开销大;嵌入式方法平衡了效率和效果,如LASSO回归、决策树。 -
面对类别极度不平衡的数据(如欺诈检测),在模型评估时,准确率指标通常失效,应重点关注精确率-召回率曲线下的面积(PR-AUC)或受试者工作特征曲线下的面积(ROC-AUC),并考察召回率在业务可接受的精确率下的表现。
* 解析:在不平衡数据中,多数类主导了准确率。PR曲线在不平衡数据中比ROC曲线更能反映模型在少数类上的性能。业务上常需要设定一个精确率阈值(如误报成本),然后最大化该阈值下的召回率。
参考来源
- 数据挖掘核心知识点解析与150道试题精编
- 2025年统计学专业期末考试题库:统计调查误差控制与数据挖掘试题-20250706181548.docx-原创力文档
- 烟台幼儿师范高等专科学校《大数据技术课程实践》2024-2025学年第一学期期末试卷_凡人图书馆stdlibrary.com
- (新版)《大数据挖掘技术》易考易错高频考试题库(含答案).doc - 人人文库
- 2024 年大学三年级大数据管理专业《大数据分析工具》期末考试测验卷及答案.doc-原创力文档
更多推荐



所有评论(0)