所属成套资源:2026秋9上数学冀教版讲义与练习
冀教版(2024)第二十三章 数据分析与统计估计23.5 数据的分类优秀一课一练
展开 这是一份冀教版(2024)第二十三章 数据分析与统计估计23.5 数据的分类优秀一课一练,文件包含冀教版九年级数学上册_第二十三章_第5课时_数据的分类_讲义与练习_教师版docx、冀教版九年级数学上册_第二十三章_第5课时_数据的分类_讲义与练习_学生版docx等2份试卷配套教学资源,其中试卷共15页, 欢迎下载使用。
本课核心问题
面对一组数据,按什么原则、用什么方法把它分成几个层次,才能既合理又可计算?
一、学习目标
1. 理解数据分类的本质是按某种原则对数据进行分类,能举出生活中的分类实例
2. 掌握离差平方和的分解公式S²=S₁²+S₂²,理解组内差、组间差的含义,会计算一组数据的组内离差平方和
3. 掌握按组内差最小原则对数据进行二层次分组的完整步骤,并能解释其合理性
二、重点
• 离差平方和的分解:总离差平方和=组内差+组间差
• 按组内差最小原则分组的方法与步骤
三、难点
• 理解“总离差平方和不变,只需使组内差最小”,并说明为什么中位数分界不一定使组内差最小
学习支架
世界不同地区人均二氧化碳排放量(2019年)
8个地区人均二氧化碳排放量分布(对应图23.5-1)
8个数据的全部分组方案及组内差
31个省区市人均GDP频数分布(对应图23.5-2)
31个省区市人均GDP主要分组方案的组内差
四、知识要点
1. 数据分类的意义
在大数据分析中,对一组数据进行分类是重要的方法之一。例如:世界上的国家可以按某一指标分为发达国家与发展中国家;全体国民按人均收入分为高收入组、中等收入组与低收入组;初中生某项体能测试成绩分为优秀、合格与不合格。关键认识:这些分类本质上都是按照某种原则对数据进行分类。利用百分位数可以按一定的比例对数据进行分类;根据问题的要求,有时还需要按组内离差平方和最小的原则对数据进行分类——这就是本课要学习的方法。
2. 离差平方和的分解:总离差平方和=组内差+组间差
把一组数据x₁,x₂,…,xn分成两组:第一组x₁,x₂,…,xm,第二组xm₊₁,xm₊₂,…,xn(按大小顺序分组),两组数据的平均数分别为a和b,全体数据的平均数为x̄。总离差平方和S²=(x₁-x̄)²+(x₂-x̄)²+…+(xn-x̄)²可以分解为:S²=[(x₁-a)²+…+(xm-a)²]+[(xm₊₁-b)²+…+(xn-b)²]+m(a-x̄)²+(n-m)(b-x̄)²。记S₁²=(x₁-a)²+…+(xm-a)²+(xm₊₁-b)²+…+(xn-b)²,称为组内离差平方和(简称组内差);记S₂²=m(a-x̄)²+(n-m)(b-x̄)²,称为组间离差平方和(简称组间差)。关键公式:S²=S₁²+S₂²,即总离差平方和=组内差+组间差。
3. 分组原则:使组内差最小,组间差最大
一个合理的分组原则是使组内差达到最小,组间差达到最大。关键推理:由分解公式S²=S₁²+S₂²可知,总离差平方和S²只由数据本身决定,与如何分组无关。因此,要使组间差S₂²达到最大,只需使组内差S₁²达到最小。注意:以中位数为分界点把数据分为两组,只是一种直观的分组方法,它的组内差不一定最小。例如8个二氧化碳排放量数据按中位数8.0分界(两组各4个)时组内差为117.6,而把异常数据20.8单独分出一组(第一组7个)时组内差只有69.6。
4. 按组内差最小原则分组的步骤
第1步:把数据按从小到大排列。第2步:画出数轴或频数分布直方图,观察数据分布,寻找数据相对集中与相对分散的边界。第3步:以观察到的分界点把数据分成两组,计算组内差。第4步:每次把第一组的最后一个数据移入第二组(或把第二组的第一个数据移入第一组),重新计算组内差并进行比较。第5步:组内差最小的分组方案即为所求。注意:与其余数据差异很大的数据称为异常数据,如8个二氧化碳排放量数据中的20.8。异常数据常常会被单独分出一组,从而使组内差最小。例:31个省区市人均GDP数据共有30种可能分法。借助频数分布直方图发现前25个数据分布于4.5~10.5万元,后6个数据分布于10.5~19.5万元,先以10.5万元为分界点计算组内差,再逐步比较,最终确定第一组25个、第二组6个时组内差最小(104.1)。
五、典型例题
【例1】
“观察与思考”中8个地区的人均二氧化碳排放量(单位:t)如下表:非洲1.6,南亚和东南亚2.6,拉丁美洲4.8,中东7.4,东亚8.6,欧洲9.7,中亚和俄罗斯9.9,北美洲20.8。如果把这8个数据分成两个层次,你认为应该如何划分?请按组内差最小的原则说明。
【解答】①把8个数据按从小到大排列:1.6,2.6,4.8,7.4,8.6,9.7,9.9,20.8。②先看直观分法:中位数为(7.4+8.6)2=8.0。以中位数为分界点,两组各4个数据,由计算表知此时组内差为117.6。③从数轴上看,前7个数据集中在1.6~9.9之间,20.8远离其他数据,是一个异常数据。④列出所有可能的分组方案(按大小顺序连续划分,共7种),利用统计软件计算组内差:第一组7个、第二组1个:69.6;第一组6个、第二组2个:114.5;第一组5个、第二组3个:117.5;第一组4个、第二组4个:117.6;第一组3个、第二组5个:122.6;第一组2个、第二组6个:152.8;第一组1个、第二组7个:201.8。⑤比较可知:第一组7个、第二组1个时组内差69.6最小。结论:前7个地区(非洲、南亚和东南亚、拉丁美洲、中东、东亚、欧洲、中亚和俄罗斯)为一个层次,北美洲(20.8)单独为一个层次。
【点拨】当数据中出现远离其他数据的异常值时,把它单独分出一组往往能使组内差最小。直观观察(数轴、异常值)要与定量计算(组内差比较)互相验证。
【例2】
国家统计局发布的数据显示,2022年全国31个省、自治区、直辖市(不含港澳台地区,简称31个省区市)的人均GDP数据(单位:万元)为:19.03,17.99,14.44,12.68,11.92,11.85,10.19,9.65,9.21,9.07,8.60,8.29,7.37,7.36,7.36,7.09,6.98,6.88,6.86,6.78,6.66,6.21,6.17,6.07,5.84,5.70,5.53,5.23,5.22,5.11,4.50。按照组内离差平方和最小的原则,把这31个省区市的人均GDP分为两个层次。
【解答】①把31个数据由小到大排列。②画出频数分布直方图(图23.5-2):以2万元为组距,频数分布为——4.5~6.5万元10个,6.5~8.5万元10个,8.5~10.5万元5个,10.5~12.5万元2个,12.5~14.5万元2个,14.5~16.5万元0个,16.5~18.5万元1个,18.5~20.5万元1个。③观察图形:前25个数据分布于4.5~10.5万元的范围,后6个数据分布于10.5~19.5万元的范围。因此先以10.5万元为分界点,把数据分成两组并计算组内差。④再每次把第一组的最后一个数据移入第二组(或把第二组的第一个数据移入第一组),重新计算组内差并比较:第一组25个、第二组6个:104.1;第一组24个、第二组7个:110.3;第一组23个、第二组8个:118.7;第一组26个、第二组5个:117.7;第一组27个、第二组4个:126.2。⑤经比较,第一组25个、第二组6个时组内差104.1最小。结论:人均GDP小于10.5万元的25个省区市为一个层次,人均GDP大于10.5万元的6个省区市为另一个层次。
【点拨】数据较多时,先画频数分布直方图观察分布、确定分界点,再只比较分界点附近的几种方案,可以避免逐一计算全部30种分法。这种“先观察、后比较”的思路能大大减少计算量。
【例3】
把数据2,3,7,8分成两组,共有3种不同的分法。请先直观猜想哪种分法的组内差最小,再逐一计算每种分法的组内差并验证。
【解答】设第一组取排序后前m个数据(m=1,2,3)。①m=1:第一组{2},第二组{3,7,8},第二组平均数(3+7+8)3=6。组内差=(2-2)²+(3-6)²+(7-6)²+(8-6)²=0+9+1+4=14。②m=2:第一组{2,3},平均数2.5;第二组{7,8},平均数7.5。组内差=(2-2.5)²+(3-2.5)²+(7-7.5)²+(8-7.5)²=0.25+0.25+0.25+0.25=1。③m=3:第一组{2,3,7},平均数4;第二组{8}。组内差=(2-4)²+(3-4)²+(7-4)²+(8-8)²=4+1+9+0=14。比较:组内差最小的是m=2的分法,即{2,3}一组、{7,8}一组,组内差为1。
【点拨】计算组内差的关键步骤:先求每组平均数,再求各组内每个数据与组平均数的离差平方并求和,最后把两组的和相加。注意分组必须按大小顺序连续划分,n个数据只有n-1种分法。
同 步 练 习
★ 基础巩固
1. 全体国民按人均收入分为高收入组、中等收入组与低收入组,初中生某项体能测试成绩分为优秀、合格与不合格,这些本质上都是按照某种(________)对数据进行分类。
2. 称S₁²为组内离差平方和,简称(________);S₂²为组间离差平方和,简称(________)。
3. 把一组数据分成两组后,总离差平方和S²=(________)离差平方和+(________)离差平方和。
4. 在8个地区的人均二氧化碳排放量数据中,20.8与其他数据差异较大,是一个(________)数据。
5. 按组内离差平方和最小的原则,8个地区的人均二氧化碳排放量数据应分为:前7个数据一组,(________)单独一组,此时组内差为(________)。
6. 组内离差平方和等于各组数据与其各自组平均数的离差平方和之和。( )
7. 按组内差最小原则分组时,由于总离差平方和不变,组间差会同时达到最大。( )
8. 以中位数为分界点把数据分成两组,一定是组内差最小的分法。( )
9. 把数据2,6,8按第一组{2,6}、第二组{8}分组,求这组数据的组内离差平方和。
10. 把数据3,5,7按第一组{3}、第二组{5,7}分组,求组内离差平方和。
★★ 能力提升
11. 关于把一组数据分成两组,下列说法正确的是(________)。
A. 分组时数据可以任意组合,不必考虑大小顺序
B. 以中位数为分界点分组,组内差一定最小
C. 按组内差最小原则分组,通常先把数据按从小到大排列,再划分组界
D. 组间差的大小与如何分组无关
12. 把数据2,3,7,8分成两组,共有3种不同的分法。请先直观猜想哪种分法的组内差最小,再逐一计算验证。
13. 按照组内离差平方和最小的原则,把数据1,3,5,8,11分成两组,并通过计算进行验证。
14. 某市全民健身活动中心调查了10名超重人员的身体质量指数(单位:kg/m²),数据如下:26,28,39,30,36,30,28,32,38,37。请按照组内离差平方和最小的原则,将上面的身体质量指数分成两组,以便制订两种不同的健身方案。
★★★ 拓展延伸
15. 如果将31个省区市的人均GDP分为3个层次,应该如何划分?请结合频数分布直方图说明你的划分方案和理由。
31个省区市人均GDP频数分布
16. 在“观察与思考”的8个地区人均二氧化碳排放量数据中,如果把异常数据20.8暂时去掉,只对剩下的7个数据(1.6,2.6,4.8,7.4,8.6,9.7,9.9)按组内差最小原则分成两组,结果与包含20.8时有什么不同?请计算验证,并说明原因。
参 考 答 案
第1题:原则
【解析】教材指出:在大数据分析中,对一组数据进行分类是重要的方法之一,这些分类本质上都是按照某种原则对数据进行分类。[错因:知识]
第2题:组内差;组间差
【解析】教材术语:组内离差平方和简称组内差,组间离差平方和简称组间差。[错因:知识]
第3题:组内;组间
【解析】由离差平方和分解公式S²=S₁²+S₂²,总离差平方和等于组内离差平方和与组间离差平方和之和。[错因:理解]
第4题:异常
【解析】教材指出:前7个数据的差异相对不大,而20.8是一个异常数据。[错因:知识]
第5题:20.8;69.6
【解析】7种分法中,第一组7个、第二组1个时组内差69.6最小。[错因:计算]
第6题:√
【解析】这是组内离差平方和的定义:S₁²=(x₁-a)²+…+(xm-a)²+(xm₊₁-b)²+…+(xn-b)²。[错因:知识]
第7题:√
【解析】由S²=S₁²+S₂²,总离差平方和S²与分组方式无关,S₁²最小时S₂²最大。[错因:理解]
第8题:×
【解析】反例:8个二氧化碳数据按中位数8.0分界,两组各4个,组内差为117.6;而第一组7个、第二组1个的分法组内差只有69.6。[错因:理解]
第9题:组内差为8。第一组平均数=(2+6)2=4,第二组平均数=8;组内差=(2-4)²+(6-4)²+(8-8)²=4+4+0=8。
【解析】先求每组平均数,再求各组数据与组平均数的离差平方和并相加。[错因:计算]
第10题:组内差为2。第一组平均数=3,第二组平均数=(5+7)2=6;组内差=(3-3)²+(5-6)²+(7-6)²=0+1+1=2。
【解析】只有一个数据的组,离差平方和为0,注意不要漏算第二组两个数据的离差平方。[错因:计算]
第11题:C
【解析】A错,教材约定第一组取排序后最小的m个数据,n个数据只有n-1种分法;B错,中位数分界不一定使组内差最小(8个二氧化碳数据中4+4分法组内差117.6,而7+1分法为69.6);C对,先排序再划分组界是基本步骤;D错,组间差m(a-x̄)²+(n-m)(b-x̄)²依赖两组平均数,随分组方式改变,只有总离差平方和不随分组变化。[错因:方法]
第12题:组内差最小的是第②种分法,组内差为1:{2,3}一组,{7,8}一组。3种分法(m为第一组数据个数)逐一计算:①m=1:{2}与{3,7,8},组内差=0+(3-6)²+(7-6)²+(8-6)²=0+9+1+4=14;②m=2:{2,3}与{7,8},组内差=(2-2.5)²+(3-2.5)²+(7-7.5)²+(8-7.5)²=0.25+0.25+0.25+0.25=1;③m=3:{2,3,7}与{8},组内差=(2-4)²+(3-4)²+(7-4)²+0=4+1+9=14。
【解析】按大小排序后依次移动分界点列出全部分法,逐一计算组内差比较。直观猜想与计算结果一致:两个较小的数据、两个较大的数据各自聚成一组。[错因:计算]
第13题:组内差最小为12.5:{1,3,5}一组,{8,11}一组。排序后数据为1,3,5,8,11,第一组取最小的m个,逐一计算:①m=1:{1}与{3,5,8,11},第二组平均数6.75,组内差=0+(3-6.75)²+(5-6.75)²+(8-6.75)²+(11-6.75)²=36.75;②m=2:{1,3}与{5,8,11},组内差=(1-2)²+(3-2)²+(5-8)²+(8-8)²+(11-8)²=1+1+9+0+9=20;③m=3:{1,3,5}与{8,11},组内差=(1-3)²+(3-3)²+(5-3)²+(8-9.5)²+(11-9.5)²=4+0+4+2.25+2.25=12.5;④m=4:{1,3,5,8}与{11},组内差=10.5625+1.5625+0.5625+14.0625+0=26.75。
【解析】完整枚举所有分法后比较,不能只凭直观判断。组平均数不是整数时,离差平方保留小数计算。[错因:计算]
第14题:组内差最小为27:第一组6个、第二组4个。将数据由小到大排列:26,28,28,30,30,32,36,37,38,39。对m=1,2,…,9逐一计算组内差(可用计算器),部分结果:m=5时组内差为40.4,m=6时组内差为27.0,m=7时组内差为66.0,其余分法组内差均更大。第一组{26,28,28,30,30,32},平均数29;第二组{36,37,38,39},平均数37.5;组内差=(26-29)²+(28-29)²+(28-29)²+(30-29)²+(30-29)²+(32-29)²+(36-37.5)²+(37-37.5)²+(38-37.5)²+(39-37.5)²=9+1+1+1+1+9+2.25+0.25+0.25+2.25=27。所以身体质量指数较小的6人制订一套健身方案,较大的4人制订另一套方案。
【解析】10个数据共9种分法,按大小排序后逐一计算比较。组内差最小意味着同一方案内人员体质更接近,方案更有针对性。[错因:计算]
第15题:参考方案:在二层次划分的基础上再细分。由频数分布直方图可见,前25个数据集中在4.5~10.5万元之间,后6个数据在10.5万元以上且彼此分散(11.85,11.92,12.68,14.44,17.99,19.03)。可把后6个数据再分成两层:第一层次:人均GDP小于10.5万元(25个省区市);第二层次:人均GDP在10.5万~14.5万元之间(11.85,11.92,12.68,14.44,共4个);第三层次:人均GDP大于14.5万元(17.99,19.03,共2个)。理由:各层次之间差距明显,且每个层次内部数据接近。也可以选择8.5万元和10.5万元为界,把前25个数据再细分,答案不唯一。
【解析】开放题。合理的划分应使层内数据接近、层间差距明显,可参照直方图的疏密分布确定分界点;说出层次大小与分界值并给出理由即可。[错因:方法]
第16题:组内差最小为9.34:{1.6,2.6,4.8}一组,{7.4,8.6,9.7,9.9}一组。剩下的7个数据共6种分法(m为第一组数据个数):m=1:组内差≈42.45;m=2:组内差≈17.93;m=3:第一组{1.6,2.6,4.8},平均数3;第二组{7.4,8.6,9.7,9.9},平均数8.9,组内差=(1.6-3)²+(2.6-3)²+(4.8-3)²+(7.4-8.9)²+(8.6-8.9)²+(9.7-8.9)²+(9.9-8.9)²=1.96+0.16+3.24+2.25+0.09+0.64+1=9.34;m=4:组内差≈20.86;m=5:组内差≈36.1;m=6:组内差≈54.49。与包含20.8时的结果(前7个一组、20.8单独一组,组内差69.6)相比,去掉异常值后分组更均衡,组内差大幅下降。原因:20.8远离其他数据,把它单独分出一组能使组内差最小。这说明异常值会显著影响分组方案,分组前应先识别并处理异常数据。
【解析】本题综合运用组内差计算与异常值分析:同一组数据,异常值存在与否会改变最优分组方案;组内差越小,说明同一层内数据越接近。[错因:方法]序号
地区
人均二氧化碳排放量/t
1
非洲
1.6
2
南亚和东南亚
2.6
3
拉丁美洲
4.8
4
中东
7.4
5
东亚
8.6
6
欧洲
9.7
7
中亚和俄罗斯
9.9
8
北美洲
20.8
● 1.6、2.6
● 4.8
● 7.4、8.6
● 9.7、9.9
● 20.8
0
2
4
6
8
10
12
14
16
18
20
22
分组情况
组内差
第一组7个,第二组1个
69.6
第一组6个,第二组2个
114.5
第一组5个,第二组3个
117.5
第一组4个,第二组4个
117.6
第一组3个,第二组5个
122.6
第一组2个,第二组6个
152.8
第一组1个,第二组7个
201.8
分组情况
组内差
第一组25个,第二组6个
104.1
第一组24个,第二组7个
110.3
第一组23个,第二组8个
118.7
第一组26个,第二组5个
117.7
第一组27个,第二组4个
126.2
相关试卷
这是一份冀教版(2024)第二十三章 数据分析与统计估计23.5 数据的分类优秀一课一练,文件包含冀教版九年级数学上册_第二十三章_第5课时_数据的分类_讲义与练习_教师版docx、冀教版九年级数学上册_第二十三章_第5课时_数据的分类_讲义与练习_学生版docx等2份试卷配套教学资源,其中试卷共15页, 欢迎下载使用。
这是一份初中数学冀教版(2024)九年级上册(2024)23.4 数据的方差精品第4课时当堂检测题,文件包含冀教版九年级数学上册_第二十三章_第4课时_数据的方差_讲义与练习_教师版docx、冀教版九年级数学上册_第二十三章_第4课时_数据的方差_讲义与练习_学生版docx等2份试卷配套教学资源,其中试卷共16页, 欢迎下载使用。
这是一份初中数学冀教版(2024)九年级上册(2024)25.3 相似图形精品第3课时同步练习题,文件包含沪科版九年级数学上册_第二十一章_第2课时_二次函数yax²+bx+c的图象和性质第2课时_讲义与练习_教师版docx、沪科版九年级数学上册_第二十一章_第2课时_二次函数yax²+bx+c的图象和性质第2课时_讲义与练习_学生版docx等2份试卷配套教学资源,其中试卷共16页, 欢迎下载使用。
相关试卷 更多
- 1.电子资料成功下载后不支持退换,如发现资料有内容错误问题请联系客服,如若属实,我们会补偿您的损失
- 2.压缩包下载后请先用软件解压,再使用对应软件打开;软件版本较低时请及时更新
- 3.资料下载成功后可在60天以内免费重复下载
免费领取教师福利 



.png)
.png)
.png)






