新闻详情

新闻详情

首页 / 资讯中心 / 详情

数据挖掘第二章考点精讲:数据类型、统计描述与相似度计算全解析

发布时间:2026/10/1 1:47:28来源:尧图网络
数据挖掘第二章考点精讲:数据类型、统计描述与相似度计算全解析
如果你正在啃数据挖掘的教材大概率会对第二章的课后习题有一种“看着都会一做就错”的错觉。这一章在不同教材里名字略有差异最常见的是叫“认识数据”Data或者“数据预处理基础”在经典教材《数据挖掘概念与技术》Han Kamber里就是 Understanding Data。它没有后面分类、聚类、关联规则那些算法那么炫却是整个数据挖掘课程里最容易被低估的一章。我刚接触的时候也这么觉得数据类型谁不会看均值中位数不是初中就学过结果后来做实际项目比如组学数据挖掘、用户行为分析翻车最多的地方几乎全在这一章的基本功上。这篇东西就把第二章课后习题里最高频的几类题目拆开讲一遍包括概念题怎么判断、计算题怎么手算、应用题怎么组织答案并且我会把每一类题目背后的“真实项目对应物”告诉你。也就是你在 GEO 数据挖掘那种流程里看到的下载、质控、差异分析本质上都离不开这一章的知识。对于正在备考、正在做课程作业、或者刚入行想补基本功的人来说这篇应该能帮你少走不少弯路。1. 第二章课后习题到底在考什么先摸清知识地图1.1 经典教材第二章的知识模块有哪些不同学校的教材可能不同但绝大多数数据挖掘课程第二章的知识点都跑不出这四个板块。第一块是数据类型。把数据分成标称Nominal、有序Ordinal、区间Interval、比率Ratio四种尺度每一层有什么区别、能做什么运算是课后题最喜欢考的基础。第二块是数据质量。缺失值、噪声、离群点这三类问题怎么识别、怎么处理经常以案例题形式出现。第三块是数据描述的统计量。均值、中位数、众数、四分位数、方差、标准差再加上五数概括和箱线图这些几乎每套卷子都会出计算题。第四块是数据对象之间的相似度和相异度。欧氏距离、曼哈顿距离、闵可夫斯基距离、余弦相似度、Jaccard 系数期末必考也是后面聚类、近邻分类、推荐系统的地基。所以你看第二章看起来零散其实它是在建立一个基本框架你拿到一份数据首先要能说清楚它是哪种类型的质量怎么样有哪些统计特征对象之间怎么量化相似。后面所有算法都是在这个框架上长出来的。1.2 习题背后的设计逻辑是什么我最早复习的时候觉得课后题太碎后来带着学生做了一遍才发现这章的题目设计其实有一条很清晰的主线每一个概念都要让你“落到笔头”。比如数据类型辨析题表面上是让你填“标称/有序/区间/比率”实际是在考察你对“能做什么运算”的理解。考试成绩是区间还是比率邮编是标称还是有穷有序分数等级是有序还是标称这种题只要死记硬背定义就容易错但你只要抓住“能不能比大小、能不能加减、能不能乘除”这条线基本不会翻车。再比如五数概括计算题它就是逼你手推一遍箱线图的构造过程。因为后面做数据探索时你要解释一个分布长什么样、有没有离群点是不能只靠眼睛看的。我见过不少同学直接写代码跑出结果但原理说不清楚考试时就只能干瞪眼。还有相似度计算题它考察的其实是“选型能力”。给你一批用户评分、给你一批文档词频你要知道用哪种度量才合理。这一块如果学扎实了你在真实项目里就不会出现“明明应该用 Jaccard 却用欧氏距离把结果算瓢了”这种尴尬事。2. 高频题型逐个拆解从概念判断到计算应用2.1 数据类型辨析题标称、有序、区间、比率这类题通常是给一堆属性让你判断属于哪种尺度并说明理由。很多人靠背诵“颜色标称温度区间体重比率”这种碎片记忆一旦换个对象就不会了。我建议你记一套判断链条从上到下问三个问题。第一个问题这个属性的取值能不能比大小如果不能那就是标称比如颜色、性别、手机品牌、邮编。因为这里的值只是给类别起名做加减乘除都没有意义。第二个问题如果能比大小那么差值有没有绝对零点如果差值大小有意义但零点只是人为约定的那就是区间尺度。最典型的是摄氏温度20 度到 30 度的差值等于 40 度到 50 度的差值但“20 度比 10 度暖两倍”这句话是错的因为 0 度不是绝对的没有温度。第三个问题如果既能比大小差值的比例又有意义并且零点有意义那就是比率尺度。比如身高、体重、收入、答题耗时。0 厘米是真的没有长度40 公斤是 20 公斤的两倍。考试成绩稍微特殊一点不同教材处理不一样。我给的判断标准是考试分数通常视为区间尺度因为 0 分不意味着“知识的绝对零点”但如果你只是关心百分制的比例关系有些题目也会把分数当比率用。做题时以教材口径为准。有序尺度夹在中间它比标称多了顺序但差值的数值没有固定意义。比如成绩等级 A/B/C/D满意度“差/一般/好/非常好”你只知道 B 高于 C不能说 B 比 C 高多少。这类题的关键在于顺序可比较但是连续数值运算不行。2.2 数据质量分析题缺失、噪声、离群点怎么判断这种题一般给一个场景比如“某电商平台的用户年龄字段有 30% 空值且部分值明显超出合理范围请分析数据存在哪些质量问题并给出处理方案”。看起来是开放题其实考察的是三个概念的区分。缺失值就是某个属性没有被记录下来。它可能来自用户不愿填、系统故障、数据库迁移丢字段。处理思路无非是删除、填充、或者建模预测。但你不能一上来就删得先判断缺失机制。如果某个年龄缺失的人恰好全是高消费用户那删掉这些记录就会带来系统性偏差。考题里如果出现“缺失比例较高”这种话通常希望你先讨论删除的风险再考虑均值、中位数、众数填充更高级一点可以提 KNN 插补、回归插补甚至多重插补。噪声指的是数据里随机误差或测量故障引起的波动。比如传感器偶尔跳变、手误录入一个“年龄188”的合法但离谱的值。噪声的处理常见做法是分箱平滑、回归平滑、聚类检测不过第二章通常只要求知道如何去识别后面章节才展开讲。离群点则是“与大部分数据行为不一致”的对象。要注意离群点不一定是噪声它可能是真实存在但罕见的现象。比如信用卡交易里的异常大额消费可能意味着盗刷也可能真的是用户买了辆车。所以离群点识别之后要去结合业务判断是删除、修正还是单独建模分析。考试答题时你能把这个区别讲清楚基本就是得分点。2.3 统计描述计算题五数概括、IQR、Z-score 手算全过程这是第二章课后习题的“重头戏”我建议你至少手算一遍再拿软件验证一遍。下面用一个简单的例子走全流程。假设某次测验 10 名学生的成绩是45, 55, 62, 66, 72, 75, 78, 82, 90, 96第一步排序然后求五数概括。最小值 45最大值 96。中位数是第 (101)/25.5 个位置也就是第 5 和第 6 个数的平均即 (7275)/273.5。四分位数的算法课本里通常用位置法Q1 的位置在 (101)/42.75也就是第 2 和第 3 个数之间线性插值第 2 个数是 55第 3 个数是 62Q1 55 0.75×(62-55) 60.25。Q3 的位置在 3×(101)/48.25即第 8 和第 9 个数之间插值Q3 82 0.25×(90-82) 84。所以五数概括是 45, 60.25, 73.5, 84, 96。这里要注意四分位数的算法在不同软件里并不完全一致。比如 R 的 summary 函数默认用 type7 的线性插值SPSS 和 Excel 又各有各的规则。所以课后题里如果老师给了标准答案你先确认教材用的是位置法还是线性插值法别算完跟软件对不上就开始怀疑自己。得到 Q1 和 Q3 之后就能算 IQR也就是四分位距。IQR 84 - 60.25 23.75。然后常用 1.5×IQR 规则来判断离群点下限为 Q1 - 1.5×IQR 60.25 - 35.625 24.625上限为 Q3 1.5×IQR 84 35.625 119.625。这批成绩全部在上下限之间所以没有离群点。算均值是另一个考点。上面 10 个数的均值是 72.1它比中位数 73.5 略小说明数据左侧略长尾也就是偏低分的同学把均值拉下来了一点点。这种“均值和中位数对比”的角度就是简答题的得分点。Z-score 规范化也是高频题。公式是 z (x - μ) / σ。注意这里 μ 是这批数据的均值σ 是标准差。用刚才的数据均值 72.1总体标准差约 14.83样本标准差约 15.63。如果要把 66 分转成 z 分数按总体标准差算就是 (66 - 72.1) / 14.83 ≈ -0.41表示 66 分低于平均水平约 0.41 个标准差。很多同学会忽略教材到底用的是总体标准差还是样本标准差导致答案差一点。做题以教材公式为准但你要知道这两个公式各自的场景描述当前这批数据用总体从样本推断总体则用样本标准差。2.4 距离与相似度计算欧氏、曼哈顿、余弦、Jaccard这节是第二章的另一个大坑因为题目不难但容易算错、选错。先看距离。给定两个向量 x(1,2,3)y(4,5,6)欧氏距离是 sqrt((1-4)² (2-5)² (3-6)²) sqrt(999) ≈ 5.20。曼哈顿距离是 |1-4| |2-5| |3-6| 9。闵可夫斯基距离是这类距离的一般形式参数 h1 就是曼哈顿h2 就是欧氏h 趋于无穷时就是切比雪夫距离即各维度差的最大值这里就是 3。我实战里最常见的错误是数据维度量纲不同时直接算欧氏距离。比如一个维度是“年龄 0-100”另一个维度是“年薪 0-1000000”那年薪的差值会完全主导距离年龄这个维度等于白算。课后题虽然通常不给这种陷阱但考试应用题会问“这样计算是否合理为什么”你只要答出“量纲会影响距离权重需要先做规范化”分数就到手了。再看相似度。余弦相似度用来衡量两个向量方向的接近程度公式是向量内积除以模长乘积。拿刚才的 x 和 y 算分子 1×42×53×632分母 sqrt(14)×sqrt(77)≈32.83余弦相似度约 0.975。它被广泛用在文本、推荐、基因表达谱里因为它不关心向量长度只关心方向。一个常见的理解方式是两个用户买的东西重合度很高但一个用户总买 100 件、一个只买 5 件余弦相似度依然能反映出兴趣一致。Jaccard 系数适用于集合或二值数据。比如用户 A 购买的物品集合是 {牛奶, 面包, 鸡蛋}用户 B 的是 {面包, 黄油, 鸡蛋}交集是 {面包, 鸡蛋}并集是 {牛奶, 面包, 鸡蛋, 黄油}Jaccard 2/4 0.5。如果硬把这两个集合编码成向量再用欧氏距离结果为 sqrt(1001)≈1.414这只能告诉你两个向量不相等却完全看不出它们共享了两件关键商品。所以做推荐系统、做文本词项匹配、做基因集比较时Jaccard 往往比欧氏距离更有解释力。3. 课后习题在真实项目里的用法从GEO数据挖掘全流程说起3.1 数据下载后的第一步就是在做第二章的统计描述你可能觉得第二章习题做完了也就做完跟真实项目挂钩不大。但如果你接触过 GEO 数据挖掘就会明白我为什么说这一章是“整个分析流程的地基”。GEO 是公共芯片/测序数据库里面存着大量表达谱数据。很多人做 GEO 数据挖掘习惯一上来就找差异基因写代码跑 limma这是不对的。任何严格的数据挖掘流程数据下载之后第一件事永远是质控而质控做的正是第二章讲的事。你从 GEO 下载一个表达矩阵后通常会用 boxplot 画每个样本的表达量分布。这个箱线图本身就是五数概括的可视化每个样本一个箱子箱顶箱底是 Q1 和 Q3中间线是中位数须是上下边界点在须外就是离群样本。如果一个样本的中位数明显比其他样本低一大截说明这个样本可能存在质量问题轻则标准化重则剔除。再看缺失值。表达矩阵里经常会出现 NA有可能是探针未检出、芯片杂交失败、测序深度不够。很多人一上来就把含 NA 的基因全删掉但你要先统计每个样本的缺失比例如果某个样本缺失率超过 30%那问题大概率出在这个样本身上而不是这个基因本身。这就是第二章“区分缺失来源”的思路。还有样本相关性矩阵。计算所有样本两两之间的相关系数得到一张热图看起来是生信分析里的常规操作其实它就是你用第二章的相似度度量在做“样本级别的相似度分析”。如果同一组别的样本相关性很低或者有个样本和谁都不像那它就是表达谱层面的离群点需要重点关注。3.2 差异分析里的“距离思维”和“规范化思维”再往深走一步GEO 数据挖掘里的差异表达分析也离不开第二章的那些概念。差异分析之前为什么一般都要做 log2 变换因为表达量数据往往是偏态分布个别基因表达量极高会拉大均值和方差。log2 变换本质上是做一次“非线性规范化”让数据更接近对称分布这和第二章里讲的数据变换目的是完全一致的。更进一步如果你的芯片数据已经做了分位数标准化那相当于把每个样本的表达量分位数拉到同一水平消除批次效应和技术差异这也是“让数据可比”的一种标准化思路。而差异分析的统计模型比如 limma它背后的核心逻辑是估计每个基因的均值和方差然后根据“方差-均值关系”做调整。你听着是不是很熟就是第二章讲的“中心趋势度量”和“散布度量”的进阶版。先算每个基因在各组里的平均表达量和方差再用线性模型判断组间差异是否显著p 值就来自均值和方差的对比。所以如果你第二章统计描述那一节学得好理解 limma 的输出会顺畅得多。再看差异基因筛选常用到的 log2FC它本质上是两组均值的对数倍数变化。为什么要用对数因为基因表达量从 100 涨到 200 和从 1000 涨到 2000绝对变化量不同但倍数变化相同log2FC 分别为约 1 和约 1这样跨表达量水平比较才公平。这就是比率尺度思维在现实数据里最直接的应用。3.3 一个迷你全流程示例第二章知识怎么落到代码上我简单写一段 R 代码让你感受一下上面说的这些知识点是怎么连起来的。这不是完整的生信教程只是告诉你第二章习题的每个概念最后都会变成你项目里的一行代码。suppressMessages(library(GEOquery)) gse - getGEO(GSE12345, GSEMatrix TRUE, AnnotGPL TRUE)[[1]] expr - exprs(gse) # 1. 缺失值概览对应第二章数据质量分析 na_counts - colSums(is.na(expr)) print(na_counts) # 2. 箱线图对应五数概括与离群点检测 boxplot(expr, outline FALSE, las 2, main Sample expression distribution) # 3. 表达量均值/中位数比较判断是否需要 log2 row_median - apply(expr, 1, median, na.rm TRUE) summary(row_median) # 4. 样本相关性矩阵对应相似度度量 cor_mat - cor(expr, method pearson, use pairwise.complete.obs) heatmap(cor_mat)到了差异分析阶段就是 y 组别对应的设计矩阵然后 limma 拟合。你以为你在跑一个高级统计模型但其实模型的输入就是每个基因的均值和方差输出是差异倍数和 p 值这些都是第二章统计描述的延伸。所以每当我听到有人说“GEO 数据挖掘就是跑代码”的时候我都会觉得挺可惜因为真正让你能判断代码结果是否合理的不是会不会用 limma而是能不能看懂箱线图、看懂相关性矩阵、看懂离群样本背后的数据质量问题。4. 常见错题与避坑指南这些坑我也踩过4.1 四分位数算法差异导致结果对不上我见过不少同学课后作业算出的 Q1、Q3 和 R、Python 输出不一致然后怀疑人生。其实大概率不是算错而是算法定义不同。位置法常用 (n1)/4 来定 Q1 的位置然后线性插值而很多软件默认用 n/4 或者更复杂的 weighted average 方法。同样一组数据在 Excel 里用 QUARTILE.INC 和 QUARTILE.EXC 结果就可能不一样。我的建议是如果你是为了考试严格按教材的定义来如果你是为了做项目用软件输出为准但必须知道软件背后用的是哪种定义。因为不同算法得到的 IQR 会略有差别进而影响离群点判断你报告的离群点列表可能就差几个样本这在论文里是要写清楚方法的。4.2 z-score规范化到底用总体标准差还是样本标准差这是一个非常容易翻车的小题。大多数教材在介绍 z-score 时直接写 z(x-μ)/σ这里的 σ 通常指总体标准差也就是说分母除以 N。但如果你用 R 的 sd() 函数它默认计算的是样本标准差分母除以 N-1。于是有人会拿着 Excel 的结果和 R 的结果对不上。考试时以教材公式为准。如果是让你把一批给定的数据规范化通常不会特意区分按总体标准差算即可。但在实际项目里如果你是想用样本去估计总体的分布那就该用样本标准差。我的经验是做题按教材写代码时看帮助文档别默认所有函数都一回事。4.3 选错距离度量导致聚类结果一塌糊涂这是实战里最致命的一个问题。第二章课后题会让你算各种距离但你得清楚每种度量的适用场景。我记得有个朋友做文本聚类直接把词频向量丢进 KMeans用的欧氏距离结果聚类出来一片混乱。因为文本词频向量高维稀疏里面大量零值欧氏距离很容易被高频词带偏换成余弦相似度或者 Jaccard 之后效果立刻好了很多。反过来如果你要处理连续数值型特征比如用户的点击时长、消费金额、页面停留时间那欧氏距离、曼哈顿距离这些基于坐标差的度量更自然。核心判断标准是你的数据是稠密的数值向量还是稀疏的二值/计数向量前者优先考虑欧氏、曼哈顿、马氏距离后者优先考虑余弦、Jaccard、相关系数。课上可能不会把这个讲得很透但它决定了你后续聚类和推荐项目能不能做出合理结果。4.4 缺失值处理不是“删掉就行”第二章课后题只要出现缺失值很多人的第一反应就是“先把缺失行删掉”。这在一个数据集规模很大、缺失比例很小、缺失机制完全是随机的场景下可以接受但一旦缺失比例较高或者缺失机制与标签相关删除行就会引入偏差。我给你举个最简单的例子某调研数据里高收入人群回答敏感问题如负债、消费的意愿更低导致这些问题缺失更多。如果你随手把缺失行删掉剩下的样本里高收入人群占比会明显下降后续任何统计分析都会失真。所以答题时你要分层次低缺失率且完全随机可删除缺失率中等且有序用均值/中位数/众数填充缺失率较高且变量重要考虑构建模型预测缺失值或者使用多重插补。这样答简答题基本能拿满分实际项目里也同样少踩坑。5. 复习建议把第二章学成“肌肉记忆”5.1 三步复习法我给学生辅导这门课的时候一直推荐三步复习法。第一步是画概念地图。别急着刷题先拿出一张 A4 纸把“数据类型、数据质量、统计描述、相似度度量”四个板块写下来每个板块下再列出关键术语和公式。比如数据类型下有标称、有序、区间、比率对应能否比较、能否加减、能否乘除统计描述下有中心趋势均值、中位数、众数、散布极差、四分位距、方差、标准差、五数概括与箱线图。画完这张图你再做题时会发现很多题目其实是在问同一张地图上的知识。第二步是手算加代码验证。计算题只靠眼睛看没用一定要动手算完整流程。算完再用 R、Python 或者 Excel 验证一遍确认你理解的定义和软件默认定义是否一致。这个过程能帮你提前发现“四分位数算法不同”这类问题避免考场上懵掉。第三步是场景迁移。每做完一道题问自己一句这个题换成真实场景会出现在哪数据类型辨析对应建模前的特征选择IQR 离群点检测对应数据清洗余弦相似度对应推荐系统里的物品相似度计算z-score 规范化对应机器学习建模前的标准化。想清楚这一步第二章就不再是“课后习题”而是你整个数据挖掘方法论的起点。5.2 答题时容易被忽略的得分细节最后分享几个考试/作业里的得分细节。第一计算题一定要先写公式再代入数据。数据挖掘这门课很多时候是按步骤给分的你直接写个结果即使正确也可能扣过程分更别说算错的时候基本就是零分。第二数据规范化结果通常保留两位小数即可但中间步骤不要过早四舍五入否则累计误差会很明显。第三概念辨析题不要只写“标称”两个字要补一句“取值无序、不能运算”让答案形成完整的判断链条。第四应用题涉及处理方案时尽量分“先分析原因再选择方案最后评估效果”三段式层层递进比堆一堆名词要拿分。我自己带作业和辅导的过程中感触最深的一点是第二章的题目往往是整本书里最容易拿到满分的部分但也是最容易让人浮于表面的部分。很多人背下来几个概念就觉得学完了结果到了后面做聚类、做分类一遇到数据预处理就露馅。你愿意回头把这章吃透后面学算法等于站在了扎实的地基上。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

如何把 ESP32 变成 AI 语音助手:xiaozhi-esp32 完整指南 2026/10/1 2:41:19

如何把 ESP32 变成 AI 语音助手:xiaozhi-esp32 完整指南

如何把 ESP32 变成 AI 语音助手:xiaozhi-esp32 完整指南 【免费下载链接】xiaozhi-esp32 An MCP-based chatbot | 一个基于MCP的聊天机器人 项目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32 xiaozhi-esp32 是一个基于 MCP 协议的 ESP32 语…

阅读更多 →
基于Spring Boot的家政服务管理系统设计与实现-计算机毕设 附源码86802 2026/10/1 2:41:19

基于Spring Boot的家政服务管理系统设计与实现-计算机毕设 附源码86802

基于Spring Boot的家政服务管理系统第二章 相关技术介绍2.1 Spring BootSpring Boot是以约定优于配置为理念,以自动装配、起步依赖、内嵌容器为构建方式,形成一个可以独立运行的Web应用形态。其组件扫描和条件装配机制把通用能力下沉到框架层&#xff0c…

阅读更多 →
内网渗透基础教程:从主机发现到权限分析的完整实战流程 2026/10/1 2:41:13

内网渗透基础教程:从主机发现到权限分析的完整实战流程

一、引言:边界失守之后,真正的战场才刚开始 过去十年,红队的攻击重心发生了明显位移。随着 EDR 覆盖率提升、WAF 语义分析成熟、云上边界收敛,从外网直接打穿一家企业的成本越来越高。攻击者与防守方都逐渐接受一个事实&#xff1…

阅读更多 →
ng-table高级美化技巧:自定义单元格、数据行与表头模板的完整指南 2026/10/1 2:41:06

ng-table高级美化技巧:自定义单元格、数据行与表头模板的完整指南

ng-table高级美化技巧:自定义单元格、数据行与表头模板的完整指南 【免费下载链接】ng-table Simple table with sorting and filtering on AngularJS 项目地址: https://gitcode.com/gh_mirrors/ng/ng-table ng-table 是一款为 AngularJS 打造的轻量级表格增…

阅读更多 →
Windows提权必看:敏感信息搜索与配置文件挖掘实战 2026/10/1 2:41:06

Windows提权必看:敏感信息搜索与配置文件挖掘实战

拿到一个Windows低权限shell之后,最忌讳的事情就是一上来就翻内核漏洞。OSCP备考期间我打了大量靶机,Windows权限提升这条线里,真正让我少走弯路的,反而是最朴素的“搜索Windows的敏感信息”——多数时候,突破口根本不…

阅读更多 →
SpringBoot+MySQL实现学生财务管理系统:从建表到部署避坑指南 2026/10/1 2:41:06

SpringBoot+MySQL实现学生财务管理系统:从建表到部署避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉