2027年高考数学一轮复习学案 专题19 统计与成对数据的统计分析
展开 这是一份2027年高考数学一轮复习学案 专题19 统计与成对数据的统计分析学案主要包含了知能解读 01,知能解读 02,知能解读 03,重难点突破 01,重难点突破 02,易混易错 01,易混易错 02,易混易错 03等内容,欢迎下载使用。
理·思维导图:呈现教材知识结构,构建学科知识体系。
盘·基础知识:甄选核心知识逐项分解,基础不丢分。
【知能解读 01】随机抽样
【知能解读 02】用样本估计总体
【知能解读 03】成对数据的统计分析
破·重点难点:突破重难点,冲刺高分。
【重难点突破 01】频率分布直方图的计算
【重难点突破 02】非线性回归分析的求法
辨·易混易错:辨析易混易错知识点,夯实基础。
【易混易错 01】对统计图表中的概念理解不清,识图不准确
【易混易错 02】对样本数字特征认识不到位
【易混易错 03】求解独立性检验问题对2 的值理解不准确
点·方法技巧:点拨解题方法,练一题通一类
【方法技巧 01】应用随机数表法的两个关键点
【方法技巧 02】 解决分层抽样的常用公式
【方法技巧 03】统计图表
【方法技巧 04】百分位数的计算
【方法技巧 05】用样本的数字特征估计总体的数字特征
【方法技巧 06】判断相关关系的 2 种方法
【方法技巧 07】样本相关系数的计算
【方法技巧 08】线性回归分析问题的类型及解题方法
【方法技巧 09】决定系数与残差
【方法技巧 10】分类变量与列联表
【方法技巧 11】独立性检验的一般步骤
随机抽样
抽样调查
总体:统计中所考察对象的某一数值指标的全体构成的集合称为总体.
个体:构成总体的每一个元素叫做个体.
样本:从总体中抽取若干个个体进行考察,这若干个个体所构成的集合叫做总体的一个样本,样本中个体的数目叫做样本容量.
简单随机抽样
定义:一般地,设一个总体含有 N 个个体,从中逐个不放回地抽取 n 个个体作为样本( n N ),如果每次抽取时总体内的各个个体被抽到的机会都相等,就把这种抽样方法叫做简单随机抽样.这样抽取的样本,叫做简单随机样本.
两种常用的简单随机抽样方法
①抽签法:一般地,抽签法就是把总体中的 N 个个体编号,把号码写在号签上,将号签放在一个容器中,搅拌均匀后,每次从中抽取一个号签,连续抽取 n 次,就得到一个容量为 n 的样本.适用于总体个数较少的情况。
②随机数法:即利用随机数表、随机数骰子或计算机产生的随机数进行抽样.这里仅介绍随机数表法.随机数表由数字0 ,1, 2 ,…, 9 组成,并且每个数字在表中各个位置出现的机会都是一样的.适用于总体个数较多的情况,但是当总体容量很大时,需要的样本容量也很大时,利用随机数法抽取样本仍不方便.
简单随机抽样的特征(只有四个特点都满足的抽样才是简单随机抽样)
①有限性:简单随机抽样要求被抽取的样本的总体个数是有限的,便于通过样本对总体进行分析.
②逐一性:简单随机抽样是从总体中逐个地进行抽取,便于实践中操作.
③不放回性:简单随机抽样是一种不放回抽样,便于进行有关的分析和计算.
④等可能性:简单单随机抽样中各个个体被抽到的机会都相等,从而保证了抽样方法的公平.
分层抽样
定义:一般地,在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本,这种抽样方法叫做分层抽样.
分层抽样适用于已知总体是由差异明显的几部分组成的.
分层抽样问题类型及解题思路
①求某层应抽个体数量:按该层所占总体的比例计算.
②已知某层个体数量,求总体容量或反之求解:根据分层抽样就是按比例抽样,列比例式进行计算.
③分层抽样的计算应根据抽样比构造方程求解,其中“抽样比=样本容量=各层样本数量”
总体容量 各层个体数量
【注意】分层抽样时,每层抽取的个体可以不一样多,但必须满足抽取 ni
n Ni ( i 1, 2,, k )个个体(其
N
中i 是层数, n 是抽取的样本容量, Ni 是第i 层中个体的个数, N 是总体容量).
【真题实战】(2026·河北沧州·一模)第十五届全运会将于 2025 年 11 月 9 日至 21 日在广东举行.广东某
高中为调查该校学生对全运会的了解程度,利用分层随机抽样的方法从三个年级中抽取了 90 人进行了问卷
调查,其中高一、高二年级分别抽取了 24 人、30 人,且高三年级共有学生 1080 人,则该高中学生总数为人.
【答案】2700
【分析】由分层抽样的定义求得学校总人数.
【详解】由题意,高三年级中抽取了90 24 30 36 人,
设该高中三个年级的学生总数为n 人,由分层抽样的方法可知 36
90 ,解得n 2700 ,
即该高中学生总数为 2700 人.故答案为:2700.
1080n
用样本估计总体
频率分布直方图
频率、频数、样本容量的计算方法频率
①×组距=频率.
组距
② 频数 样本容量
=频率,频数=样本容量,样本容量×频率=频数.频率
③频率分布直方图中各个小方形的面积总和等于1.
频率分布直方图中数字特征的计算
①最高的小长方形底边中点的横坐标即是众数.
②中位数左边和右边的小长方形的面积和是相等的.设中位数为 x ,利用 x 左(右)侧矩形面积之和等于0.5 ,即可求出 x .
③平均数是频率分布直方图的“重心”,等于频率分布直方图中每个小长方形的面积乘以小长方形底边中点的横坐标之和,即有 x x1 p1 x1 p1 xn pn ,其中 xn 为每个小长方形底边的中点, pn 为每个小长方形的面积.
百分位数
定义:一组数据的第 p 百分位数是这样一个值,它使得这组数据中至少有 p 0 0 的数据小于或等于这个值,且至少有100 p 0 0 的数据大于或等于这个值.
计算一组 n 个数据的的第 p 百分位数的步骤
①按从小到大排列原始数据.
②计算i n p 0 0 .
③若i 不是整数而大于i 的比邻整数 j ,则第 p 百分位数为第 j 项数据;若i 是整数,则第 p 百分位数为
第i 项与第i 1 项数据的平均数.
四分位数:我们之前学过的中位数,相当于是第50 百分位数.在实际应用中,除了中位数外,常用的
分位数还有第 25 百分位数,第75 百分位数.这三个分位数把一组由小到大排列后的数据分成四等份,因此称为四分位数.
样本的数字特征
众数、中位数、平均数
①众数:一组数据中出现次数最多的数叫众数,众数反应一组数据的多数水平.
②中位数:将一组数据按大小顺序依次排列,把处在最中间位置的一个数据(或最中间两个数据的平均数)叫做这组数据的中位数,中位数反应一组数据的中间水平.
③平均数: n 个样本数据 x , x , , x 的平均数为 x x1 x2 xn ,反应一组数据的平均水平,公式
1 2nn
n
变形: xi nx .
i 1
标准差和方差
①标准差:标准差是样本数据到平均数的一种平均距离,一般用 s 表示.假设样本数据是 x1, x2 , , xn ,
x 表示这组数据的平均数,则标准差 s .
n
1 [(x x)2 (x x)2 (x x)2 ]
1
2
n
②方差:方差就是标准差的平方,即 s2 1 [(x x)2 (x x)2 (x x)2 ] .显然,在刻画样本数据
n12n
的分散程度上,方差与标准差是一样的.在解决实际问题时,多采用标准差.
【注意】标准差、方差描述了一组数据围绕平均数波动程度的大小.标准差、方差越大,则数据的离散程度越大;标准差、方差越小,数据的离散程度越小.反之亦可由离散程度的大小推算标准差、方差的大小.
③平均数、方差的性质:如果数据 x1 , x2 ,, xn 的平均数为 x ,方差为 s2 ,那么一组新数据 x1 b, x2 b,xn b 的平均数为 x b ,方差是 s2 .
一新数据 ax1 , ax2 ,, axn 的平均数为 ax ,方差是 a2s2 .
一组新数据 ax1 b, ax2 b,, axn b 的平均数为 ax b ,方差是 a2 s2 .
【真题实战】【多选】(25-26 高二上·宁夏吴忠·月考)某同学参加射击比赛,打了 8 发子弹,报靶数据如下:9,8,6,10,9,7,6,9(单位:环),则下列说法正确的是( )
A.这组数据的众数为 9B.这组数据的 40%分位数是 7.5
2
C.这组数据的极差是 4D.这组数据的标准差是
【答案】ACD
【分析】分别计算这组数据的众数、百分位数、极差、标准差逐项判断即可.
【详解】对于 A,由题意知这组数据的众数为 9,故 A 正确;
对于 B,这组数据从小到大为 6,6,7,8,9,9,9,10,由8 40% 3.2 知 40%分位数为 8,故 B 错误;
对于 C,这组数据的极差是10 6 4 ,故 C 正确;
1
对于 D,这组数据的平均数是 x
(6 6 7 8 9 9 9 10) 8 ,
8
方差是 s2 1 6 82 2 7 82 8 82 9 82 3 10 82 2 ,
8
2
所以这组数据的标准差是,故 D 正确.
故选:ACD
成对数据的统计分析
两个变量的线性相关
正相关:在散点图中,点散布在从左下角到右上角的区域,对于两个变量的这种相关关系,我们将它称为正相关.
负相关:在散点图中,点散布在从左上角到右下角的区域,两个变量的这种相关关系称为负相关.
线性相关关系、回归直线:如果散点图中点的分布从整体上看大致在一条直线附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线.
回归分析与回归方程
回归分析的定义:对具有相关关系的两个变量进行统计分析的一种常用方法.
最小二乘法:使得样本数据的点到回归直线的距离的平方和最小的方法叫做最小二乘法.
回归方程:对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程 ‸y b‸x a‸
的求法为
nn
(xi x)( yi y) xi yi nxy
n
n
2
2
2
b‸ i 1 i 1
(xi x)
i 1
xi
i 1
nx
a‸ y b‸ x
1 n1 n
其中, x n xi , y n yi ,( x , y )称为样本点的中心.
(3)相关系数
i 1
i 1
若相应于变量 x 的取值 xi ,变量 y 的观测值为 yi (1 i n) ,
nn
则变量 x 与 y 的相关系数 r
(xi x)( yi y)
n
(x x)( y y)2
2
i 1
i
n
i 1
i
i 1
xi yi nxy
n
x2 nx2y2 ny2
n
i 1
i
i 1
i
i 1 ,
通常用 r 来衡量 x 与 y 之间的线性关系的强弱, r 的范围为1 r 1 .
①当 r 0 时,表示两个变量正相关;当r 0 时,表示两个变量负相关.
② r 越接近1 ,表示两个变量的线性相关性越强; r 越接近0 ,表示两个变量间几乎不存在线性相关关系.当|r| 1 时,所有数据点都在一条直线上.
③通常当 r 0.75 时,认为两个变量具有很强的线性相关关系.
残差分析
对于预报变量 y ,通过观测得到的数据称为观测值 yi ,通过回归方程得到的 ‸y 称为预测值,观测值减去预测值等于残差, eˆi 称为相应于点(xi , yi ) 的残差,即有eˆi yi yˆi .
残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果以及判断原始数据中是否存
在可疑数据等,这方面工作称为残差分析.
n
残差图:通过残差分析,残差点 xi , eˆi 比较均匀地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越窄,说明模型拟合精确度越高;反之,不合适.
通过残差平方和Q ( y yˆ )2 分析,如果残差平方和越小,则说明选用的模型的拟合效果越好;反
ii
i 1
之,不合适.
n
( y yˆ )2
ii
n
相关指数:用相关指数来刻画回归的效果,其计算公式是: R2 1 i 1 .
( yi y )2
i 1
R2 越接近于1 ,说明残差的平方和越小,也表示回归的效果越好.
独立性检验
分类变量:变量的不同“值”表示个体所属的不同类别,像这类变量称为分类变量.
列联表:
①定义:列出的两个分类变量的频数表称为列联表.
y1
y2
总计
x1
a
b
a b
x2
c
d
c d
总计
a c
b d
n a b c d
②2×2 列联表:假设有两个分类变量 X 和 Y,它们的可能取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为 2×2 列联表)为 2×2 列联表
2
n(ad bc)2
2
独立性检验:计算随机变量
(a b)(c d )(a c)(b d ) 利用 的取值推断分类变量 X 和 Y 是否独
立的方法称为χ2 独立性检验.
【真题实战】(四川省宜宾市 2026 届高三一模考试数学试题)对具有线性相关关系的变量 x,y 有一组观
0.10
0.05
0.010
0.005
0.001
x
2.706
3.841
6.635
7.879
10.828
测数据 x , y i 1, 2,,8 ,其回归直线方程是 yˆ bˆx 1 ,且 x x
x x
2 y y
y y 8 ,
ii
则实数bˆ 的值是( )
412381238
A. 1
8
【答案】B
B. 1
4
C. 1
2
D.1
【分析】根据回归直线过样本中心点 x , y 列方程求解即可.
【详解】由 x1 x2 x3 x8 2 y1 y2 y3 y8 8 可知
x x1 x2 x3 x8 8 1, y y1 y2 y3 y8 4 1 .
88882
因为回归直线过样本中心点 x , y ,即1, 1 ,
2
将其坐标代入方程 yˆ bˆx 1 可得 1 bˆ1 1 ,解得bˆ 1 ,
4244
故选:B.
01 频率分布直方图的计算
由频率分布直方图进行相关计算需掌握的 2 个关系式
频率×组距=频率.组距
频数
样本容量
=频率,此关系式的变形为频数=样本容量,样本容量×频率=频数.
频率
利用频率分布直方图估计样本的数字特征的方法
中位数:在频率分布直方图中,中位数左边和右边的直方图的面积相等,由此可以估计中位数的值.
平均数:平均数的估计值等于每个小矩形的面积乘以矩形底边中点横坐标之和.
众数:最高的矩形的中点的横坐标.
【典例 1】【多选】(2026·河北沧州·一模)某科研单位对 Deepseek 的使用情况进行满意度问卷调查,在 1000 名用户的问卷(用户打分都在 50 分到 100 分之间)中随机抽取了 100 份,按分数进行分组(每组为左闭右开的区间),得到如图所示的频率分布直方图,则(同一组数据用该组区间的中点值为代表)( )
a 0.025
由样本数据可估计 1000 名用户中打分在 70 分以下的有 350 人
估计这 1000 名用户问卷的得分的80% 分位数为 85
估计这 1000 名用户问卷的得分的平均数为 75
【答案】ABC
【分析】对于 A,由各矩形面积为 1 可判断选项正误;对于 B,由 A 分析结合题意可判断选项正误;对于 CD,由频率分布直方图计算百分位数,平均数方法可得答案.
【详解】对于 A,由题可得0.01 a 0.035 0.02 0.0110 1 a 0.025 ,故 A 正确;
对于 B,由 A 分析,打分在70 分以下对应频率为:10 0.01 0.025 0.35 ,则对应人数为:1000 0.35 350 ,故 B 正确;
对于 C,前 3 个矩形面积之和为: 0.01 0.025 0.03510 0.7 0.8 ,前 4 个矩形面积之和为: 0.01 0.025 0.035 0.0210 0.9 0.8 ,
则80 0 0 分位数在80 到 90 之间,设为 x ,则 x 80 0.02 0.8 0.7 x 85 ,故 C 正确;
对于 D,平均数为:1055 0.01 65 0.025 75 0.035 0.0285 0.01 95
74.5 ,故 D 错误.故选:ABC
【典例 2】【多选】(24-25 高一下·湖南岳阳·期末)某学校为了调查学生在一周生活方面的支?情况,抽
?了一个容量为n 的样本,其频率分布直方图如图,其中支?在50, 60 元的学生有 45 人,则下列说法正确的是( )
样本中支?在50, 60元的频率为0.03
n 的值为 150
采用分层抽样从这 45 人中抽? 10 人,则在30, 50 中共需抽? 5 人
该校学生一周生活方面支?的第 75 百分位数大约是 52 元(精确到个位数)
【答案】BD
【分析】对于 A,利用频率分布直方图中所有矩形的面积之和为 1,可判断;对于 B,利用频率、频数以及样本总容量的关系可判断;对 C,计算?样本中支?在30, 50 的频率,结合分层抽样可判断;对 D,根据百分位数的定义计算.
【详解】对于 A,样本中支?在50, 60元的频率为1 0.01 0.024 0.03610 0.3 ,故 A 错误;
对于 B,由 A 知n 45 150 ,故 B 正确;
0.3
对于 C,样本支?在30, 50 的频率为0.024 0.03610 0.6 ,则在30, 50 中共需抽? 10 0.6150 20
45
人,故 C 错误;
对于 D 因为样本中支?在20, 50 的频率为0.7 ,所以第 75 百分位数位于区间50, 60内,记为 x ,
则 x 50 0.75 0.7 60 501 0.7
,解得 x 50
5 ,所以第 75 百分位数大约是 52 元,故 D 正确.
3
故选:BD.
02 非线性回归分析的求法
根据原始数据作出散点图;
根据散点图选择恰当的拟合函数;
作恰当变换,将其转化成线性函数,求线性回归方程;
在(3)的基础上通过相应变换,即可得非线性回归方程.
【典例 1】(24-25 高三上·福建厦门·月考)台州是全国三大电动车生产基地之一,拥有完整的产业链和突
?的设计优势某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近 5 年的年广告费 xi(单
位:百万元)和年销售量 yi (单位:百万辆)关系如图所示:
5555
2 2
令vi ln xi i 1, 2,, 5,数据经过初步处理得: yi 44 , vi 4.8 , xi x 10 , yi y 40.3 ,
i 1
555
i1
i 1
i 1
v v 2 1.612 , x x y y 19.5 , y y v v 8.06 .现有① y bx a 和② y n ln x m 两
i
i1
ii
i 1
ii
i 1
种方案作为年销售量 y 关于年广告费 x 的回归分析模型,其中 a,b,m,n 均为常数.
请从相关系数的角度,分析哪一个模型拟合程度更好?
根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求? y 关于 x 的回归方程,并预测年广告费为 6(百万元)时,产品的年销售量是多少?
nn
xi x yi yxi yi nxy
n
i1
xi x
2
n
i1
yi y
2
i
n
x nx
2
2
i
n
y ny
22
i1
i1
附:①相关系数r i1 i1 ,回归直线 ‸y a‸ b‸ x 中公式分别为
nn
xi x yi yxi yi nxy
bˆ i1 i1 , a‸ y b‸ x ;
n 2n 2 2
xi x
403
i1
xi
i1
nx
40.31.612
②参考数据:
8.06 ,
20.1, ln 5 1.6 , ln 6 1.8
【答案】(1)模型②的拟合程度更好 (2)13(百万辆)
【分析】(1)利用公式分别求?模型①和②的相关系数,结合相关系数的意义即可判断哪一个模型拟合程度更好;
(2)先利用最小二乘法求? y 关于 x 的回归方程,再令 x 6 ,即可得解..
【详解】(1)设模型①和②的相关系数分别为r1 , r2 ,
5
xi x yi y
19.519.5
5
i 1
xi x
2
5
i 1
y y
i
2
10 40.3
由题意可得: r1 i 1
20.1
0.97 ,
5
yi y vi v
8.068.06
5
i 1
yi y
2
5
i 1
v v
2
i
40.3 1.612
r2 i1 1, 8.06
所以 r1 r2 ,由相关系数的意义可得,模型②的拟合程度更好.
5
vi v yi y 8.06
5 2
(2)因为nˆ i1 5 ,
5
又由v 1 5
vi v
i 1
v 0.96 , y 1 5
1.612
y 8.8 ,
5
i
i1
i
i1
得m y 5v 8.8 0.96 5 4 ,
所以 y 5v 4 ,即回归方程为 y 5 ln x 4 ,当 x 6 时, y 5 ln 6 4 13 ,
因此当年广告费为 6(百万元)时,产品的销售量大概是 13(百万辆).
关卡 x
1
2
3
4
5
6
平均过关时间 y (单位:秒)
50
78
124
121
137
352
【典例 2】(2025·陕西西安·模拟预测)当下,大量的青少年沉迷于各种网络游戏,极大地毒害了青少年的身体健康.为了引导青少年抵制不良游戏,适度参与益脑游戏,某游戏公司开发了一款益脑游戏,在内测时收集了玩家对每一关的平均过关时间,如下表:
66
计算得到一些统计量的值为: ui 28.5 , xiui 106.05 ,其中, ui ln yi .
i1i1
若用模型 y aebx 拟合 y 与 x 的关系,根据提供的数据,求? y 关于 x 的经验回归方程;
甲参加一场闯关游戏,比赛共有 5 局,甲每局比赛获胜的概率为 p ,且每局比赛相互独立,记甲恰好获胜 3 次的概率为 f p ,求 f p 的最大值,并求?相应的概率 p0 .
参考公式:对于一组数据 xi , yi i 1, 2, 3,, n ,其经验回归直线 yˆ bˆx aˆ 的斜率和截距的最小二乘估计分
n
xi yi nx y
n
别为bˆ i1 , aˆ y bˆx .
i
x2 nx 2
i1
【答案】(1) y e0.36 x3.49
(2) f p
216 , p 3
max
62505
【分析】(1)先对 y aebx 两边分别取对数得到lny lna bx ,再根据题目中的数据代入公式去求即可;
5
(2)依题意 f p C3 p3 1 p2 0 p 1 ,利用导数求?函数的最大值,即可得解.
【详解】(1)因为 y aebx 两边取对数可得lny ln aebx lna lnebx ,即lny lna bx ,
1 6
6
令ui lnyi ,所以u bx lna ,由u ui 4.75 ,
i1
6
12222222
6
x 1 2 3 4 5 6 3.5 , xi 1 2 3 4 5 6
i1
91 .
6
xiui nxu
106.05 6 3.5 4.75
所以bˆ i1
0.36 ,
62291 6 3.52
xi nx
i1
又u bˆx lna ,即4.75 0.36 3.5 lna ,所以lna 3.49 ,所以a e3.49 .
所以 y 关于 x 的经验回归方程为 y e0.36x3.49 .
5
(2)甲每局比赛获胜的概率为 p ,则甲每局比赛失败的概率为1 p ,依题意可得 f p C3 p 3 1 p 2 10p 3 1 p 2 0 p 1 ,
则 f p 10 3p 2 1 p 2 2p 3 1 p 10p 2 1 p 3 5p ,
所以当0 p 3 时 f p 0 ,当 3 p 1时 f p 0 ,
55
所以 f p 在 0, 3 上单调递增,在 3 ,1上单调递减,
5 5
3 3 3 3 2
2163
所以 f pmax f 5 10 5 1 5
625 ,此时 p0 5 ;
对统计图表中的概念理解不清,识图不准确
辨析:求解统计图表问题,重要的是认真观察图表,发现有用信息和数据。对于频率分布直方图,应注意图中的每一个小矩形的面积是落在该区间上的频率,所有小矩形的面积和为 1,当小矩形等高时,说明频率相等,计算时不要漏掉其中一个.
【典例 1】(25-26 高一上·北京海淀·月考)空气质量指数是评估空气质量状况的一组数字,空气质量指数划分为[0, 50),[50,100),[100,150),[150, 200),[200, 250) 和[250, 300] 六档,分别对应“优”、“良”、“轻度污染”、“中
度污染”、“重度污染”和“严重污染”,六个等级.如图,是我市冬季某月连续 14 天的空气质量指数趋势图,则下列说法中正确的是( )
A.这 14 天中有 5 天空气质量为“中度污染” B.从第三天到第七天空气质量越来越好
C.这 14 天中空气质量指数的中位数为 196.5
D.连续三天中空气质量指数方差最小的是 5 日到 7 日
【答案】C
【分析】根据题意,由折线图分析数据,结合中位数的求法,逐一分析各个选项,即可得答案.
【详解】对于 A,这 14 天中有 4 天空气质量指数在150, 200 之间,则有 4 天为“中度污染”,故 A 错误;对于 B,从第三天到第七天空气质量先变好再变坏,故 B 错误;
对于 C,将 14 组数据从小到大排列: 80,83,138,155,157,165,179, 214, 214, 221, 243,
260, 263, 275 ,其中位数为 1 (179 214) 196.5 ,故 C 正确;
2
对于 D,5 日到 7 日的三天,数据波动比较大,则方差较大,
所以连续三天中空气质量指数方差最小不是 5 日到 7 日,故 D 错误.故选:C
【典例 2】(25-26 高二上·四川成都·期中)某机构对我国若干大型科技公司调查统计后,得到了芯片、软件两个行业从业者的年龄分布的饼图(图 1)和“90 后”从事这两个行业岗位的分布雷达图(图 2),则下列说法中一定正确的是( )
A.芯片、软件行业从事技术岗位的人中,“90 后”比“80 后”多
B.芯片、软件行业中从事技术和设计岗位的“90 后”人数和超过从事这两个行业总人数的 25%
C.芯片、软件行业从业者中,“90 后”占比不超过 50%
D.芯片、软件行业中,“90 后”从事市场岗位的人数比“80 前”从事这两个行业的总人数少
【答案】B
【分析】根据饼形图和“90 后”从事这两个行业岗位的分布雷达图的数据进行分析,逐项判断即可.
【详解】对于 A,芯片、软件行业从事技术岗位的人中,“90 后”人数占比为37%,占芯片、软件行业从业者的55% 37% ,
而芯片、软件行业从业者中“80 后”占总人数的40% ,但不知道从事技术岗位人数的比例,故无法确定两者人数的多少,所以选项A不一定正确;
对于 B,芯片、软件行业中从事技术、设计岗位的“90 后”人数占比为37% 13% 50% ,
55% 50% 25% 所以超过从事这两个行业总人数的25% ,所以选项B正确;
对于 C,从饼图可看?芯片、软件行业从业者中,“90 后”占比为55%,超过50%,所以选项 C 不正确;对于 D,芯片、软件行业中,“90 后”从事市场岗位的人数占比为14% ,
占芯片、软件行业从业者的55% 14% 7.7% ,“80 前”占比5%,所以选项D错误.故选:B.
对样本数字特征认识不到位
辨析:统计学的另一基本思想是通过科学合理地获取样本,再通过对样本数据的处理,用样本数字特征去估计总体的相应数字特征。对此我们要有一个辩证的理解,即有时会出现偏差,而解决这一问题的方法是适度增加样本容量,当样本容量越大,它对总体接近程度越大,可信度越高。
【典例 1】(25-26 高三上·上海浦东新·期末)某班一次数学小测验(百分制)后,老师为了奖励同学们平时认真学习,决定给每位同学的成绩加上 5 分作为过程性评价奖励.加分后,与原始分数相比,不会发生改变的是( )
A.平均数 B.中位数C.第 80 百分位数 D.方差
【答案】D
【分析】根据平均值、中位数、百分位数的概念判断 ABC,根据方差性质判断 D.
【详解】加分后,与原始分数相比,平均值,中位数,第 80 百分位数的数值都会发生改变,但根据方差的性质,一组数据同时加上相同的数后,方差大小不变.
故选:D.
【典例 2】(25-26 高三上·黑龙江·月考)某中学举办迎国庆歌咏比赛,邀请了七位评委,对一个选手打分后,得到一组互不相等的数据x1 , x2 , x3 , x4 , x5 , x6 , x7 ,去掉其中最高分与最低分得到的数据与原始数据一定相同的是( )
A.平均分 B.极差C.标准差D.中位数
【答案】D
【分析】根据平均数、极差、标准差、中位数的概念和运算法则,采用赋值法逐一分析判断选项正误.
【详解】选项 A:若 7 个数据为1, 2, 3, 5, 6, 7,8 ,原平均分为1 2 3 5 6 7 8 32 ,
77
去掉最高和最低分后平均分为
2 3 5 6 723
,
55
32 23 ,平均分不一定相同,故 A 错误;
75
选项 B:若 7 个数据为1, 2, 3, 5, 6, 7,8 ,原极差为8 1 7 ,去掉最高和最低分后极差为7 2=5 ,
7 5 ,极差不一定相同,故 B 错误;
选项 C: 若 7 个数据为1, 2, 3, 4, 5, 6, 7 ,则原数据平均数为 x 1 2 3 4 5 6 7 4 ,
17
标准差为
1 42 2 42 3 42 4 42 5 42 6 42 7 42 7
4
s1 2 ,
去掉最高和最低分后平均数为 x2
标准差为
2 3 4 5 6
5
4 ,
2 42 3 42 4 42 5 42 6 42 5
2
s2 ,
标准差不一定相同,故 C 错误;
选项 D:设 x1 x2 x3 x4 x5 x6 x7 ,则原始数据的中位数为 x4 ,
x2 , x3 , x4 , x5 , x6 的中位数也为 x4 ,
去掉其中最高分与最低分得到的数据与原始数据一定相同的是中位数,故 D 正确.故选:D.
03 求解独立性检验问题对2 的值理解不准确
n ad bc 2
辨析:构造一个随机变量2 a bc d a c b d ,其中 n a b c d 为样本容量.如果2
的观测值k⛩k0 ,就认为“两个分类变量之间有关系”;否则就认为“两个分类变量之间没有关系”.我们称这样的k0 为一个判断规则的临界值.
【典例 1】(25-26 高三上·天津和平·月考)下列说法错误的是( )
A.某校高一年级共有男女学生500 人,现按性别采用分层抽样的方法抽取容量为50 人的样本,若样本中男生有30 人,则该校高一年级女生人数是200
B.已知 y 关于 x 的回归直线方程为 yˆ 0.7 0.3x ,若 x 2 ,则 y 0.1
C.数据1,3,4,5,7,9,11,16 的第75 百分位数为9
D.根据分类变量 X 与Y 的成对样本数据,计算得到2 3.937 ,根据小概率 0.05值的独立性检验
x0.05 3.841 ,可判断 X 与 Y 有关联,此推断犯错误的概率不大于0.05
【答案】C
【分析】利用分层抽样计算判断 A;根据回归方程经过样本中心判断 B;求?第 75 百分位数判断 C;利用
独立性检验的思想判断 D.
【详解】对于 A,由抽样比为人,A 正确;
50 1 ,样本中女生有50 30 20 人,可得该校高一年级女生人数是
50010
20 200
1
10
对于 B,线性回归方程中,根据回归方程经过样本中心 x , y , y 关于 x 的回归直线方程为 yˆ 0.7 0.3x ,若 x 2 ,则 y 0.7 0.3x 0.7 0.3 2 0.1 ,B 正确;
对于 C,由8 75% 6 ,得第75 百分位数为 9 11 10 ,C 错误;
2
0.05
对于 D,由2 3.937 3.841 x,可判断 X 与Y 有关联,此推断犯错误的概率不大于0.05 ,D 正确.故选:C.
日落云里走夜晚天气
下雨
未下雨
?现
25
5
未?现
25
45
【典例 2】(2026 高三·全国·专题练习)千百年来,我国劳动人民在生产实践中根据云的形状、走向、速度、厚度、颜色等的变化,总结了丰富的“看云识天气”的经验,并将这些经验编成谚语,如“天上钩钩云,地上雨淋淋”“日落云里走,雨在半夜后”小波同学为了验证“日落云里走,雨在半夜后”,观察了地区 A 的 100 天日落和夜晚天气,得到如下22 列联表(单位:天),并计算得到2 19.05 ,下列小波对地区 A 天气的判断不正确的是( )
参考公式: 2
n ad bc2
a bc d a cb d
临界值参照表:
夜晚下雨的概率约为 1
2
0.1
0.05
0.01
0.005
0.001
xa
2.706
3.841
6.635
7.879
10.828
未?现“日落云里走”,夜晚下雨的概率约为 5
14
有 99%的把握判断“日落云里走”是否?现与夜晚天气有关 D.?现“日落云里走”,有 99%的把握判断夜晚会下雨
【答案】D
【分析】利用频率估算概率,结合观测值对照附表,对选项进行判断即可.
【详解】选项 A:根据列联表可知:100 天中有 50 天下雨,50 天未下雨,
因此夜晚下雨的概率约为 50 1 ,故选项 A 正确;
1002
选项 B:未?现“日落云里走”,夜晚下雨的概率约为 25 5 ,故选项 B 正确;
25 4514
0.01
选项 C:因为2 19.05 6.635 x,所以据小概率值 0.01的独立性检验,
可以认为“日落云里走”是否?现与夜晚天气有关,故选项 C 正确;
选项 D:依据小概率值 0.01 的独立性检验,可判断“日落云里走,雨在半夜后”的说法犯错误的概率小于 0.01,但不代表一定会下雨,故选项 D 错误.
故选:D
应用随机数表法的两个关键点
确定以表中的哪个数(哪行哪列)为起点,以哪个方向为读数的方向;
读数时注意结合编号特点进行读取.若编号为两位数字,则两位两位地读取;若编号为三位数字,则三位三位地读取,有超过总体号码或出现重复号码的数字舍去,这样继续下去,直到获取整个样本.
1.(24-25 高三上·辽宁·期末)某厂质检员利用随机数表对生产的 600 个产品进行抽样调查,先将这 600
个产品进行编号:001,002,003,…,600.从中抽取 120 个样本,下图是随机数表的第 2 行到第 3 行,
若从随机数表的第 2 行第 5 列开始从左向右读取数据,则得到的第 5 个编号是( )
【答案】C
【分析】根据随机数表的读法读?前 5 个符合的编号即可得解.
32 12 67 12
31
02
37 02 14
72
31
09
81 47 80
25
13
25
46 08
71 20 34 51
19
72
01 38 47
18
04
92
51 28 02
31
27
46
51 30
A.098
B.147
C.513
D.310
【详解】由题意可知得到的编号依次为 231,023,147,098,513,…,则得到的第 5 个编号是 513.故选:C.
2.(2024·陕西西安·一模)某高校对中文系新生进行体测,利用随机数表对 650 名学生进行抽样,先将 650
名学生进行编号,001,002,…,649,650.从中抽取 50 个样本,下图提供随机数表的第 4 行到第 6 行,若
从表中第 5 行第 6 列开始向右读取数据,则得到的第 6 个样本编号是( )
【答案】A
【分析】按照随机数表提供的数据,三位一组的读数,并取 001 到 650 内的数,重复的只取一次即可
【详解】从第 5 行第 6 列开始向右读取数据,第一个数为 253,第二个数是 313,
第三个数是 457,下一个数是 860,不符合要求,
下一个数是 736,不符合要求,下一个是 253,重复,
第四个是 007,第五个是 328,第六个数是 623,,故 A 正确.故选:A.
3.(2024·云南·二模)本次月考分答题卡的任务由高三 16 班完成,现从全班 55 位学生中利用下面的随机
数表抽取 10 位同学参加,将这 55 位学生按01, 02,, 55 进行编号,假设从随机数表第 1 行第 2 个数字开始
0627
4313
2432
5327
0941
2512
6317
6323
2616
8045
6011
1410
9577
7424
6762
4281
1457
2042
5332
3732
2707
3607
5124
5179
3014
2310
2118
2191
3726
3890
0140
0523
2617
由左向右依次选取两个数字,重复的跳过,读到行末则从下一行行首继续,则选?来的第 6 个号码所对应的学生编号为( )
A.51B.25C.32D.12
【答案】A
【分析】根据给定信息,利用随机数表抽样法规则,依次写?前 6 个符合要求的编号即可.
【详解】依题意,前 6 个编号依次为:31,32,43,25,12,51,
32 21 18 34 29
78 64 54 07 32
52 42 06 44 38
12 23 43 56 77
35 78 90 56 42
84 42 12 53 31
34 57 86 07 36
25 30 07 32 86
23 45 78 89 07
23 68 96 08 04
32 56 78 08 43
67 89 53 55 77
34 89 94 83 75
22 53 55 78 32
45 77 89 23 45
A.623
B.328
C.072
D.457
所以选?来的第 6 个号码所对应的学生编号为 51.故选:A
解决分层抽样的常用公式
先确定抽样比,然后把各层个体数乘以抽样比,即得各层要抽取的个体数.
抽样比=样本容量
总体容量
各层样本容量
=;
各层个体总量
层 1 的容量∶层 2 的容量∶层 3 的容量=样本中层 1 的容量∶样本中层 2 的容量∶样本中层 3 的容量. 1.(2025·云南·一模)在孟德尔两对相对性状的豌豆杂交实验中,子二代豌豆性状表现型及理论比例为: 黄色圆粒:黄色皱粒:绿色圆粒:绿色皱粒 9 : 3 : 3 :1.现研究人员计划从大量该代豌豆种子中,随机抽取 n 粒豌豆作为样本进行研究.若希望样本中黄色皱粒豌豆的理论(期望)数量为 30 粒,则样本量 n 应为( )
A.160B.190C.220D.250
【答案】A
【分析】根据分层抽样结合样本数量计算求解.
【详解】根据题意得,黄色皱粒豌豆所占总体比例为 3 ,所以样本量n 30 16 160 .
163
故选:A.
2.(2025·海南儋州·模拟预测)某电商平台在 2025 年 3 月对其用户进行了一项关于每月消费金额的调查.该
平台用户可分为普通会员、白银会员、黄金会员和钻石会员四个等级,各等级用户人数的比例为4 : 3 : 2 :1 .调查采用分层随机抽样,按照各等级用户人数比例抽取样本.已知样本中普通会员、白银会员、黄金会员、钻石会员的平均每月消费金额分别为 200 元、500 元、800 元、1200 元,则估计该平台用户的平均每月消费金额为( )
A.675 元B.510 元C.650 元D.460 元
【答案】B
【分析】根据分层抽样方法,计算样本均值,估计总体均值.
【详解】 x 200 4 500 3 800 2 1200 1 510 .
10101010
故选:B.
3.(2025·云南昆明·一模)在对某中学高三年级学生体重(单位:kg)的调查中,按男、女生人数比例用 分层随机抽样的方法抽取部分学生进行测量.已知抽取的男生有60 人,其体重的平均数和方差分别为65, 32 ,抽取的女生有40 人,其体重的平均数和方差分别为55,12 ,则估计该校高三年级学生体重的方差为( )
A. 24B. 27C. 48D. 54
【答案】C
【分析】根据分层随机抽样样本平均数公式和方差公式即可算?答案.
【详解】记总样本的平均数为 x ,则 x
60 65 40 55 61,
100100
所以总样本的方差 s2 60 32 61 652 40 12 61 55 2 48,
100 100
所以估计该校高三年级学生体重的方差为48 .故选:C.
统计图表
常见统计图表的特点与区别
扇形图:用于直观描述各类数据占总数的比例,易于显示每组数据相对于总数的大小.
条形图:主要用于直观描述不同类别或分组数据的频数和频率,适用于描述离散型数据.
直方图:主要用于直观描述不同类别或分组数据的频数和频率,直方图适用于描述连续型数据.
折线图:主要用于描述数据随时间的变化趋势.
4.(2025·四川成都·一模)三次产业增加值占国内生产总值的比重是衡量一个国家或地区经济发展阶段、产业结构优化程度以及未来经济发展潜力的重要指标、其中第一产业包括农业、林业、渔业等;第二产业涵盖制造业、建筑业等;第三产业则包括服务业、金融业、信息技术等.如图为我国 2020-2024 年三次产业增加值占国内生产总值比重的等高堆积条形图,则( )
A.2020-2024 年第一产业增加值占国内生产总值比重逐年递增 B.2020-2024 年第二产业增加值占国内生产总值比重的中位数为 36.9%
C.2020-2024 年第三产业增加值占国内生产总值比重的平均数为 55.1% D.2020-2024 年三次产业中增加值占国内生产总值比重极差最大的是第二产业
【答案】B
【分析】选项 A,依据表中数据求? 2020-2024 年第一产业增加值占国内生产总值比重,通过数据判断选项 A 错误;选项 B,利用中位数的定义得到结论;选项 C,求?平均数得解;选项 D,分别求?每个产业的极差,从而得解.
【详解】选项 A, 2020 年第一产业增加值占国内生产总值比重为100 55.5 36.9 7.6 ,
2021年第一产业增加值占国内生产总值比重为100 54.8 38.1 7.1,
2022 年第一产业增加值占国内生产总值比重为100 55.0 37.9 7.1 ,
2023年第一产业增加值占国内生产总值比重为100 56.3 36.8 6.9 ,
2024 年第一产业增加值占国内生产总值比重为100 56.7 36.5 6.8 ,
从数据上看,2020-2021 年第一产业增加值占国内生产总值比重递减,2021-2022 年第一产业增加值占国内生产总值比重持平,2022-2024 年第一产业增加值占国内生产总值比重递减,
故选项 A 错误;
选项 B,2020-2024 年第二产业增加值占国内生产总值比重依次为36.9, 38.1, 37.9, 36.8, 36.5 ,将这5 个数从小到大排列为36.5, 36.8, 36.9, 37.9, 38.1 ,则这5 个数的中位数为36.9 ,
故 2020-2024 年第二产业增加值占国内生产总值比重的中位数为 36.9%,故答案 B 正确; 选项 C,2020-2024 年第三产业增加值占国内生产总值比重依次为55.5, 54.8, 55.0, 56.3, 56.7 ,
55.5 54.8 55.0 56.3 56.7
则这5 个数的平均数为
5
55.66 ,
2020-2024 年第三产业增加值占国内生产总值比重的平均数为55.66%,故答案 C 错误;选项 D,2020-2024 年第一产业增加值占国内生产总值比重依次为7.6, 7.1, 7.1, 6.9, 6.8 ,这5 个数中的最小值为6.8 ,最大值为7.6 ,故极差为7.6 6.8 0.8 ,
2020-2024 年第二产业增加值占国内生产总值比重依次为36.9, 38.1, 37.9, 36.8, 36.5 ,这5 个数中的最小值为36.5 ,最大值为38.1,故极差为38.1 36.5 1.6 ,
2020-2024 年第三产业增加值占国内生产总值比重依次为55.5, 54.8, 55.0, 56.3, 56.7 ,这5 个数中的最小值为
54.8 ,最大值为56.7 ,故极差为56.7 54.8 1.9 ,
故 2020-2024 年三次产业中增加值占国内生产总值比重极差最大的是第三产业,故选项 D 不正确.
故选:B.
5.(24-25 高二下·广东阳江·月考)随着生活水平的不断提高,旅游已经成为人们生活的一部分.某地旅游部门从 2024 年到该地旅游的游客中随机抽取部分游客进行调查,得到各年龄段游客的人数比例和各年龄段
中自助游比例,如图所示,则估计 2024 年到该地旅游的游客中选择自助游的青年人占总游客人数的( )
A.45%B.30%C.13.5%D.13%
【答案】C
【分析】根据青年人的占比和青年人中选择自助游人数的占比可得答案.
【详解】设 2024 年到该地旅游的游客总人数为a ,则游客中青年人的人数为0.45a ,其中选择自助游的青年人的人数为0.45a 0.3 0.135a ,
所以估计 2024 年到该地旅游的游客中选择自助游的青年人占总游客人数的 13.5%.故选:C
6.(2025·四川成都·二模)居民消费价格指数(Cnsumer Price Index,简称 CPI),是度量一定时期内居民消费商品和服务价格水平总体变动情况的相对数,综合反映居民消费商品和服务价格水平的变动趋势和变动程度.下图是 2024 年 11 月 9 日国家统计局公布的 2024 年 10 月各类商品及服务价格同比和环比涨跌幅
本期数 去年同期数本期数 上期数
情况(同比 100% ,环比 100% ),下列结论正确的是( )
去年同期数上期数
A.2024 年 10 月份食品烟酒类价格低于 2023 年 10 月份食品烟酒类价格
B.2024 年 10 月份教育文化娱乐类价格低于 2024 年 9 月份教育文化娱乐类价格
C.2024 年 9 月份医疗保健类价格高于 2023 年 10 月份医疗保健类价格
D.2024 年 9 月份居住类价格高于 2023 年 10 月份居住类价格
【答案】C
【分析】根据题意逐一考查所给选项说法的正确性.
【详解】对于 A,由题可知,2024 年 10 月份食品烟酒类价格同比涨幅为2% ,
所以 2024 年 10 月份食品烟酒类价格高于 2023 年 10 月份食品烟酒类价格,故 A 错误;对于 B,由图可知,2024 年 10 月份教育文化娱乐类价格环比涨幅为0.2% ,
所以 2024 年 10 月份教育文化娱乐类价格高于 2024 年 9 月份教育文化娱乐类价格,故 B 错误;
对于 C,2024 年 10 月份医疗保健类价格环比涨幅为0.0% ,即 2024 年 10 月份医疗保健类价格等于 2024
年 9 月份医疗保健类价格,
又 2024 年 10 月份医疗保健类价格同比涨幅为1.1% ,
所以 2024 年 10 月份医疗保健类价格高于 2023 年 10 月份医疗保健类价格,故 C 正确;
对于 D,2024 年 10 月份居住类价格环比涨幅为0.0% ,即 2024 年 10 月份居住类价格等于 2024 年 9 月份居住类价格,
又 2024 年 10 月份居住类价格同比涨幅为0.1%,
所以 2024 年 10 月份居住类价格低于 2023 年 10 月份居住类价格,故 D 错误.故选:C.
7.(2024·四川德阳·模拟预测)中国人口14 亿人口中肠胃病患者高达1.2 亿,慢性胃炎发病率高达56%,消化性溃疡病发率也高达32% ,是全世界当之无愧的“胃病大国”.根据随机对22152 名青少年随机抽查,65.55%的青少年表示自己患有胃病, 22.18% 的青少年不清楚自己是否患有胃病,只有12.27% 明确自己没有胃病.肠胃病的严重程度,一般可体现在排便量、排便时长上. 某高中为了了解学生肠胃病占比和严重程度,对 2024 年高一高二学生单日单次的排便时长进行了统计(记排便10 分钟内为正常,排便10 20 分钟为轻度肠胃病,排便20 分钟以上为重度肠胃病),并将结果制成统计图(如图所示),若高一学生1000 人,高二学生1200人,占比百分数均保留整数,下列说法正确的是( )
高二学生的肠胃病人数比高一年级少
高一年级的各肠胃病区间人数占比都比高二年级少
高一年级重度肠胃病人数占比比高二年级少 D.高一肠胃质量参数比高二高(肠胃质量参数
【答案】C
非肠胃病人数
)
肠胃病人数
【分析】根据扇形统计图计算高一的肠胃病人数,各肠胃病区间人数占比,肠胃质量参数,再利用条形统计图确定高二学生的肠胃病人数,各肠胃病区间人数占比,肠胃质量常数,由此确定正确结论.
【详解】由扇形统计图可得高一年级肠胃病人数为1000 55% 550 ,高一年级的轻度肠胃病人数占比42% ,
高一年级重度肠胃病人数占比为13% ,
高一肠胃质量参数为 450 9 ,
55011
由条形统计图可得高二年级肠胃病人数为389 165 554 ,
高二年级的轻度肠胃病人数占比为 389
1200
32% ,
高二年级重度肠胃病人数占比为 165 11 14% ,
120080
高二肠胃质量参数为 646 323 1.17 ,
554277
所以高二学生的肠胃病人数比高一年级多,A 错误;
高一年级轻度肠胃病区间人数占比比高二年级高,B 错误;高一年级重度肠胃病人数占比比高二年级少,C 正确;
高一肠胃质量参数比高二低,D 错误;故选:C.
04 百分位数的计算
计算一组 n 个数据的的第 p 百分位数的步骤
①按从小到大排列原始数据.
②计算i n p 0 0 .
③若i 不是整数而大于i 的比邻整数 j ,则第 p 百分位数为第 j 项数据;若i 是整数,则第 p 百分位数为第i 项与第i 1 项数据的平均数.
8.(2025·江苏南通·模拟预测)一组从小到大排列的数据:1,2,3,4,6,8,x,18,22,23.若它们的
70 百分位数是中位数的两倍,则 x 的值为( )
A.10B.11C.12D.14
【答案】A
【分析】根据数据个数确定中位数和 70 百分位数的位置,再结合他们之间的关系求解 x 的值.
【详解】该组数中位数为 6 8 7 ,70 百分位数为 x 18 ,所以 x 18 7 2 ,故 x 10 .
222
故选:A.
9.(2025·广东江门·模拟预测)2025 年 1~8 月份广东省工业机器人、服务机器人、民用无人机、风力发电机组、太阳能电池、新能源汽车产品产量分别增长32.1%,17.3%, 54.7%, 43.3%,81.5%, 21.9% ,则该组数的70%分位数为( )
A. 81.5%B. 54.7%C. 43.3%D. 32.1%
【答案】B
【分析】应用百分位数的求法求数据的70% 分位数.
【详解】由题设6 70% 4.2 ,而数据从小到大为17.3%, 21.9%, 32.1%, 43.3%, 54.7%,81.5% ,所以该组数的70% 分位数为其中第 5 个数据,即54.7% .
故选:B
10.(2026·陕西西安·一模)从高三某班抽取 10 名同学,他们的数学成绩如下:95,90,71,76,85,88,
72,91,92,65(单位:分),则这 10 名同学数学成绩的第 70 百分位数是( )
A.90B.91C.90.5D.91.5
【答案】C
【分析】根据百分位数的计算即可求解.
【详解】先将这 10 个数从小到大排列:65,71,72,76,85,88,90,91,92,95,因为10 0.7 7 ,7 是整数,
故这 10 名同学数学成绩的第 70 百分位数是故选:C.
90 91
2
90.5 ,
11.(2025·贵州毕节·模拟预测)某中学共有3000 名学生,该校从全校学生中随机抽取200 名,统计他们2024
年阅读的书籍数量,由此来估计该校学生当年阅读书籍数量的情况,下列关于估计中正确的是( )
A.阅读量的众数估值为8 B.阅读量的中位数估值为6.5
C.阅读量的平均数估值为6.76
D.第70 百分位数为8.86
【答案】D
【分析】根据众数,中位数,平均数,百分位数相关知识可逐一求解.
【详解】对于A ,众数估值为 4 8 6 ,故A 错误;
2
对于B ,设中位数为 x ,则 x 在4,8 内,所以0.06 4 0.1 x 4 0.5 ,解得 x 6.6 ,故B 错误;对于C ,平均数 x 0.24 2 0.4 6 0.2810 0.0614 0.0218 6.88 ,故C 错误;
对于D ,设第70 百分位数为 y ,则 y 在8,12 内,所以0.06 4 0.1 4 0.07 x 8 0.7 ,解得 y 62 8.86 ,
7
故D 正确.故选: D .
05 用样本的数字特征估计总体的数字特征
利用样本的数字特征解决优化决策问题的依据
平均数反映了数据取值的平均水平;标准差、方差描述了一组数据围绕平均数波动的大小.标准差、方差越大,数据的离散程度越大,越不稳定;标准差、方差越小,数据的离散程度越小,越稳定.
用样本估计总体就是利用样本的数字特征来描述总体的数字特征.
12.(2025·重庆·模拟预测)某动漫社团为了调查本校学生对新上映电影的喜好程度, 对该校学生进行了满意度调查, 其中男生共调查了 600 人,女生共调查了 400 人,男生平均给分 4 分,方差为 1 ,女生平均给分 3 分,方差也为 1 . 则调研对象总体方差为( )
18
5
【答案】D
31
5
18
25
31
25
【分析】根据分层平均数求?总体平均数,然后根据分层方差和总体方差的关系求解可得.
【详解】记男生平均给分为 x ,方差为 s2 ,女生平均给分为 x ,方差为 s2 ,
1122
则 x 4, x 3,s 2 s 2 1 ,
1212
所以总体平均数 x
600x
400
x 3 4 2 3 18 ,
600 400 1600 400 2555
600
18 2
400
18 2 31
所以总体方差为 s2
1 4
1 3
.
600 400
5
600 400
5 25
故选:D
13.(2025·陕西西安·模拟预测)在从小到大依次排列的样本数据2 、8 、10 、a 、16 、20 中,已知中位数小于众数,则该组样本数据的平均数为( )
10B.11C.12D.13
【答案】C
【分析】根据题意可知, a 10 或16 ,结合题意可得?关于a 的不等式,即可得? a 的值,然后利用平均数
公式可求得结果.
【详解】由题意可知10 a 16 ,这组数据的中位数为
a 10
,
2
因为该组数据存在众数,故a 10 或16 ,则这组数据的众数为a ,
a 10
又这组数据的中位数小于众数,所以
2
a ,解得a 10 ,故a 16 ,
因此,这组数据的平均数为 2 8 10 16 16 20 12 .
6
故选:C.
14.(2025·贵州六盘水·模拟预测)已知甲组数据为3 , 5 ,12 ,14 ,17 ,乙组数据为4 , 6 ,18 , 20 ,则
甲、乙两组数据的平均数、极差及中位数中相等的是( )
A.平均数B.极差C.中位数D.都不相等
【答案】C
【分析】分别计算?两组数据的平均数、极差与中位数即可得.
3 5 12 14 17
【详解】甲组数据的平均数为
极差为17 3 14 ,中位数为12 ,
4 6 18 20
乙组数据的平均数为
4
5
12 ,
10.2 ,
极差为20 4 16 ,中位数为
6 18
2
12 ,
故甲、乙两组数据的中位数相等.故选:C.
15.(2025·河北沧州·模拟预测)已知 2025 年1 7 月全国房地产开发景气指数依次为
93.30, 93.75, 93.92, 93.82, 93.70, 93.59, 93.34 ,则这 7 个数据的中位数是( )
A.93.92B.93.87C.93.82D.93.70
【答案】D
【分析】将所给的数据按照从小到大顺序排列,按照中位数的定义即可判断.
【详解】这 7 个数据按照从小到大排列依次为93.30, 93.34, 93.59, 93.70, 93.75, 93.82, 93.92 ,中位数是第 4 个
数 93.70.
故选:D.
16.(2025·甘肃武威·模拟预测)某学校从高三某次联考中随机抽取了甲班 50 名、乙班 40 名学生的成绩.
已知甲班 50 名学生成绩的平均数为 112 分,方差为 8,乙班 40 名学生成绩的平均数为 94 分,方差为 8,则这 90 名学生成绩的方差为( )
A.8B.36C.64D.88
【答案】D
【分析】根据两组数据的均值和方差,利用方差合并公式计算可得.
【详解】设甲班 50 名学生成绩的平均数和方差分别为 x , s2 ,
11
乙班 40 名学生成绩的平均数和方差分别为 x , s2 ,
22
则 x 112 , s2 8 , x 94 , s2 8 ,
1122
所以这 90 名学生成绩的平均数为 x 1 50x 40x 1 50 112 40 94 104 ,
901290
则这 90 名学生成绩的方差为s2 50 s2 x x 2 40 s2 x x 2
90 11
5 8 (112 104)2 ] 4 8 94 1042 88 .
99
故选:D.
90 22
06 判断相关关系的 2 种方法
散点图法:如果所有的样本点都落在某一函数的曲线附近,变量之间就有相关关系.如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系;
相关系数法:利用相关系数判定,当|r|越趋近于 1 时,相关性越强
17.(24-25 高二下·辽宁丹东·期中)对两组数据进行统计后得到如图所示的散点图,下列结论不正确的是
( )
图 1、图 2 两组数据都具有线性相关关系
图 1 数据正相关,图 2 数据负相关
图 1 相关系数r1 小于图 2 相关系数 r2
图 1 相关系数和图 2 相关系数之和小于 0
【答案】C
【分析】根据散点图及相关性判断 AB,由相关系数性质判断 CD.
【详解】对 A,因为散点图都呈直线型,所以图 1、图 2 两组数据都具有线性相关关系,A 正确;
对 B,图 1 散点从左至右呈上升趋势,所以数据正相关,图 2 散点从左至右呈下降趋势,所以数据负相关,故 B 正确;
对 C,图 1 正相关,图 2 负相关,所以 C 不正确;对 D,因为图 2 相关程度更强,所以 D 正确.
故选:C.
18.(2025·安徽蚌埠·三模)医疗研究者会创建散点图来显示少女的体重指数(BMI)和身体脂肪百分比之间的相关关系,如图,下列说法正确的是( )
A.BMI 越大,脂肪百分比越大 B.BMI 越大,脂肪百分比越小 C.BMI 与脂肪百分比正相关 D.BMI 与脂肪百分比负相关
【答案】C
【分析】根据散点图的特征可得正确的选项.
【详解】由散点图可得 BMI 增大时,脂肪百分比或变大或变小,故 AB 错误;根据散点图的分布可得:BMI 于脂肪百分正相关,故 C 正确,D 错误;
故选:C.
07 样本相关系数的计算
样本相关系数 r 的统计含义及应用
由 r 的正、负可判断成对样本数据中两相关变量是正相关还是负相关;
可根据|r|的大小从量的角度判断成对样本数据是否具有线性相关性,进而可知能否用经验回归方程进行分析和预测;
当|r|≤0.25 时,即便求得了经验回归方程也没有任何统计意义.
x
3
4
5
6
7
y
16
20
25
28
36
19.(2025·天津·二模)小明研究温差 x (单位: C )与本单位当天新增感冒人数 y (单位:人)的关系,他记录了 5 天的数据:
由表中数据求得温差 x 与新增感冒人数 y 满足经验回归方程 yˆ bˆx 1,则下列结论不正确的是( )
A. x 与 y 正相关B.经验回归直线经过点(5, 25)
C.当 x 6 时,残差为 1.8D. bˆ 4.8
【答案】C
【分析】观察数据或者求得bˆ 0 ,可知正相关,从而判定 A;利用样本中心点在回归直线上,可以判定 B;求? bˆ 的估计值,进而计算残差,从而判定 CD.
【详解】选项 A:观察数据, x 增大时 y 也增大,说明正相关,故 A 正确;
选项 B: 易得ˉ, ˉ,样本中心点为5, 25,回归直线方程经过样本中心点,故 B 正确;
x 5y 25
对于 CD:将样本中心点坐标代入回归直线方程得
25 bˆ 5 1, bˆ 4.8, yˆ 4.8x 1 ,故 D 正确.
计算预测值 yˆ 4.8 6 1 29.8 ,实际值 y 28 ,残差e y yˆ 28 29.8 1.8 .
题目中残差为 1.8(未考虑符号),故 C 错误,故选:C
20.(2025·浙江金华·一模)近些年汽车市场发生了翻天覆地的变化,新能源汽车发展迅速,下表统计了 2021
年到 2024 年某地新能源汽车销量(单位:千辆)
n
xi x yi y
i
n
x x
2
i
n
y y
i1
i1
2
附:相关系数r i1 ;
年份
2021
2022
2023
2024
年份代号 x
1
2
3
4
销量 y
33
69
93
129
n
xi x yi y
i
回归方程 ‸y b‸ x a‸ 中斜率和截距的最小二乘法估计公式分别为b‸ i1 , ‸a y b‸ x,
44 2
xi yi 966, yi y
4896, 170 13.04
n
i1
x x2
i 1i 1
(1)试根据样本相关系数r 的值判断该地汽车销量 y 与年份代号 x 的线性相关性强弱( 0.75 r 1 ,则认为 y 与
x 的线性相关性较强, r 0.75 ,则认为 y 与 x 的线性相关性较弱);(精确到 0.001)
(2)建立 y 关于 x 的线性回归方程,并预测该地 2025 年的新能源汽车销量.
【答案】(1) y 与 x 具有较强的线性相关关系
(2) yˆ 31.2x 3 ,159 (千辆)
44 2i 1 2
【分析】(1)根据题干所给数据算? xi x yi y , xi x , yi y ,代入相关系数计算公式
计算即可;
i 1
i 14
(2)根据(1)算?的结果进一步算? bˆ ,再根据线性回归方程经过 x , y 计算aˆ ,最后把 x 5 代入回归直
线方程即可求解.
【详解】(1)已知n 4 , x 1, x 2, x 3, x 4 ,则 x 1 2 3 4 2.5 ,
y 33, y 69, y 93, y
12344
129 ,则 y 33 69 93 129 81 ,
1234
4
22222
4
44
222
xi
i1
1 2
4
3 4
1 4 9 16 30, 4x 2 4 2.52 25,所以 xi x
i 1
444
xi 4x
i 1
30 25 5 ,
已知 xi yi 966 ,故 xi x yi y xi yi 4x y xi yi 4x y 966 4 2.5 81 156 ,
i1
4
i 1
i 1
i 1
i
又 y y 2 4896 ,代入相关系数公式,
i1
n
xi x yi y
15615613
n
i 1
xi x
2
n
i 1
y y
i
2
5 4896
可得r i1 0.997 ,
12 17013.04
因为 r 0.997 0.75 ,所以 y 与 x 具有较强的线性相关关系.
4
xi x yi y
4 2
(2)根据bˆ i1 , ˆa y ˆbx,
xi x
i1
44
i
由(1)可知 x x y y 156 , x x 2 5 ,所以bˆ 156 31.2 ,
ii
i 1
i15
由aˆ y bˆx ,已知 x 2.5 , y 81 , bˆ 31.2 ,则aˆ 81 31.2 2.5 81 78 3 ,
月份代码
1
2
3
4
5
x
10
20
30
40
50
y
58
59
60
64
65
所以 y 关于 x 的线性回归方程为 yˆ 31.2x 3 ,将 x 5 代入线性回归方程 yˆ 31.2 5 3 159 (千辆). 21.(2025·甘肃武威·模拟预测)某高科技公司开发了一款 AI 学习机,为了解市场销售情况,该公司统计了过去 5 个月的月广告投入 x (单位:十万元)与该款学习机的月销量 y (单位:千台)的数据,如表所示.
求 x 和 y 的样本相关系数r ,并判断 y 与 x 是否具有较强的线性相关性;(结果精确到 0.01,若 r 0.75,则认为 y 与 x 具有较强的线性相关性)
求 y 关于 x 的经验回归方程,并估计月广告投入 600 万元时该款学习机的月销量;
该款学习机目前售价为 3000 元/台,为提升销量,经销该款学习机的某专卖店针对该款学习机推?了两
1
种促销方案.方案一:买一台立减 400 元;方案二:一次性购买两台可抽奖三次,每次中奖的概率均为 ,
3
且每次抽奖相互独立,中奖一次立减 600 元/台,中奖两次立减 800 元/台,中奖三次立减 1000 元/台,若三
次均未中奖,仍可享基础优惠 300 元/台.某家长准备在该店购买两台该款学习机,请从付款总金额数学期望的角度分析选哪种方案更优惠.
n
xi x yi y
n
参考公式:对于经验回归方程 yˆ bˆx aˆ , bˆ i1 , aˆ y b‸x ;样本相关系数
2
xi x
i1
n
xi x yi y
i
n
x x
2
n
y y
2
i1
i1
i
r i1 .
55 2
97
参考数据: xi x yi y 190 , yi y
38.8 ,
9.85 .
i 1i 1
【答案】(1)0.96, y 与 x 具有较强的线性相关性;
yˆ 0.19x 55.5 ;当 x 60 时, yˆ 66.9 千台;
选第二种方案更优惠,理由见解析.
【分析】(1)根据公式算?线性相关系数,并根据判断标准作?判断即可;
根据最小二乘法求得bˆ, aˆ ,进而求得 y 关于 x 的经验回归方程,代入 x 60 可得月广告投入 600 万元时,
该款学习机的月销量;
分别计算两种方案的付款期望,并比较大小,可得选第二种方案更优惠.
【详解】(1)由题可知, x
10 20 30 40 50
5
30 ,所以
10
5
5
i1
xi x
2
10
xi x yi y
5
x x
2
i1
i
5
y y
2
i1
i
所以r i1
190 190.96
10 10 38.8
19.7
0.75.
所以 y 与 x 具有较强的线性相关性.
5
xi x yi y190
5
由(1)知bˆ i1 0.19 .
2
xi x
i1
1000
因为 x 10 20 30 40 50 30 , y 58 59 60 64 65 61.2 ,
55
所以aˆ y b‸x 61.2 0.19 30 55.5 .
y 关于 x 的经验回归方程为 yˆ 0.19x 55.5 ,故当 x 60 时, yˆ 66.9 . 所以估计当月广告投入 600 万元时,该款学习机的月销量约为66.9 千台.
家长准备在该店购买两台该款学习机,选第二种方案更优惠.理由如下:
若采用方案一,可享受优惠400 2 800 (元);付款总金额数学期望为6000 800 5200 (元);
1
3
若采用方案二,记中奖次数为 X,则 X ~ B 3, .
2
3
P X 0
8 ; P X 1 C1
1 1 2 2
12 ;
3
3 33
27
27
1
3
21
P X 2 C2 1 2 6 ; P X 3 1 ;
3 33
3
27
27
记该家长购买两台学习机可享受优惠共为 Y 元,则 Y 的分布列如下:
所以 E Y 600 8 1200 12 1600 6 2000 1 30800 1140 (元).
2727272727
所以若采用方案二,付款总金额数学期望为6000 E Y 4860 (元).
Y
600
1200
1600
2000
P
8
27
12
27
6
27
1
27
因为4860 5200 ,所以选第二种方案更优惠.
22.(2025·广东深圳·模拟预测)按照《中华人民共和国环境保护法》的规定,每年生态环境部都会会同国家发展改革委等部门共同编制《中国生态环境状况公报》,并向社会公开发布.下表是 2017-2021 年五年《中
国生态环境状况公报》中酸雨区面积约占国土面积的百分比( yi %):
求 2017-2021 年年份代码 xi 与 yi 的样本相关系数(精确到 0.01);
预测 2026 年的酸雨区面积占国土面积的百分比.
n
xi x yi y
n
附:回归直线的斜率和截距的最小二乘法估计公式分别为: bˆ i1 , a‸ y b‸ x .
2
xi x
i 1
年份
2017 年
2018 年
2019 年
2020 年
2021 年
年份代码 xi
1
2
3
4
5
yi
6.4
5.5
5.0
4.8
3.8
样本相关系数r
n
xi x yi y
n
xi x
i 1
n
2
i 1
y y
2
i
i 1
,
36.4
6.
【答案】(1) 0.98
(2)0.97%
【分析】(1)由表中数据结合题中数据,求?相关数值,代入相关系数求r ,即可得?答案;
(2)根据(1)中求?的数据,得到回归直线方程;将 x 8 代入回归直线方程,即可预测 2026 年的酸雨
区面积占国土面积的百分比.
1 2 3 4 5
6.4 5.5 5.0 4.8 3.8
【详解】(1)由已知可得, x 3 , y 5.1,
55
由题可列下表:
xi x
-2
-1
0
1
2
yi y
1.3
0.4
-0.1
-0.3
-1.3
xi x
i 1
5
2
10
3.64
5
xi x yi y 5.9 ,
,
.
i1
yi y
i1
5
2
5
xi x yi y
36.4
5.95.9
5
i1
xi x
2
5
i1
yi y
2
r i1
6 0.98 .
5
xi x yi y 5.9
5 2
10
(2)由(1)知, bˆ i 1 0.59 , aˆ y bˆx 5.1 0.59 3 6.87 ,
xi x
i 1
所求经验回归方程为 ‸y 0.59x 6.87 .令 x 10 , y 0.97 ,
预测 2026 年的酸雨区面积占国土面积的百分比为 0.97%.
08 线性回归分析问题的类型及解题方法
线性回归分析问题的解题策略
利用公式,求出回归系数^;
利用经验回归直线过样本点的中心求系数^;
利用经验回归方程进行预测,把回归方程看作一次函数,将解释变量 x 的值代入,得到预测变量^的值.
年份代码 x
1
2
3
4
5
6
7
年产量 y/万台
28
32
36
40
a
b
c
23.(2025·云南昆明·模拟预测)下表为 2018 至 2024 年某手机品牌的年产量 y(单位:万台),其中 2018至 2024 年的年份代码 x 分别为 1 至 7.
已知 y 与 x 具有线性相关关系,由上述 7 组数据得到经验回归方程 yˆ 4.8x 25 ,则a b c 的值为( ).
A.165.4B.173.4C.182.5D.191.8
【答案】B
【分析】先求? x 4 ,又因为点 x , y 在经验回归直线上,得?即可计算求解.
【详解】由表中数据得 x 4 ,
因为点 x , y 在经验回归方程直线上,所以 y 4.8 4 25 44.2 ,
所以a b c 44.2 7 28 32 36 40 173.4 ,故选:B.
广告费用(万元)
4
2
3
5
销售额(万元)
49
26
39
54
24.(2025·河南新乡·模拟预测)某企业产品的广告费用与销售量的统计数据如表所示:根据表中各数据可得回归方程 yˆ bˆx aˆ ,其中bˆ 9.4 ,假设该企业广告费用为 6 万元时,则销售额为( )
A.63,6 万元B.65,5 万元C.67,7 万元D.72,0 万元
【答案】B
【分析】根据回归直线过定点(x , y ) 的性质,求?坐标,解?回归直线方程,计算结果即可.
4 2 3 5749 26 39 54
【详解】根据表格数据得 x , y 42 ,
424
∵回归中心 7 , 42 满足回归直线方程 yˆ bˆx aˆ ,其中bˆ,
2
9.4
42 9.4 7 aˆ ,解得aˆ 9.1,
2
于是回归方程为 yˆ 9.4x 9.1 ,令 x 6 ,得 yˆ 65.5 ,故选:B.
25.(2026·河北沧州·一模)某新能源汽车制造企业对某地区新能源汽车的销售情况进行了调研,数据如下:
已知 y 与 x 线性相关,求? y 关于 x 的经验回归方程,并估计该地区新能源汽车在 2026 年 3 月份的销量;
该企业为宣传推广新能源汽车,计划在宣传部门开展人工智能工具使用的培训.该次培训分为三期,每
2
时间
2025 年 3
月
2025 年 4
月
2025 年 5
月
2025 年 6
月
2025 年 7
月
2025 年 8
月
月份代码
x
1
2
3
4
5
6
销量 y / 千
辆
6
7
10
11
12
14
期培训的结果是否“优秀”相互独立,且每期培训中员工达到“优秀”标准的概率均为
3
少有两期培训达到“优秀”标准,才能使用人工智能工具.
.该企业规定:员工至
求甲、乙两名员工经过培训后,恰好只有一人能使用人工智能工具的概率;
该企业宣传部现有员工 100 人,引进人工智能工具后,需将宣传部的部分员工调整至其他部门,剩
余员工进行该次培训.已知开展培训前,员工每人每年平均为企业创造利润 3 万元,开展培训后,能使用
人工智能工具的员工预计每人每年平均为企业创造利润 6 万元,不能使用人工智能工具的员工预计每人每
年平均为企业创造利润还是 3 万元,本次培训费每人 1 万元.现要求培训后宣传部员工创造的年利润不低于调整前的年利润,预计最多可以调多少人到其他部门?
nn
xi x yi y xi yi nxy
参考公式:经验回归方程 y b‸x a‸ ,其中bˆ i1 i1 , a‸ y b‸ x .
n 2n22
xi x
i 1
66
xi nx
i 1
参考数据: x y 238, x 2 91 .
i ii
i1i1
【答案】(1) ‸y 1.6x 4.4 , 25.2 千辆
(2)(Ⅰ) 280 ; (Ⅱ)28
729
【分析】(1)首先求 x 和 y ,再代入经验回归方程的参考公式求bˆ 和aˆ ,即可求回归直线方程,再根据方程代入 x 13,即可求解估计值;
(2)(Ⅰ)首先求每位员工经过培训,能使用人工智能工具的概率,再代入独立重复概率公式,即可求解;
(Ⅱ)首先设宣传部调 x x N 人至其他部门,则参加培训的人数为100 x ,结合(Ⅰ)的求解过程,列
?调整后利润的式子,再列不等式,即可求解.
1 2 3 4 5 6
【详解】(1)由题意得 x 3.5 ,
6
6 7 10 1112 14
y 10 ,
6
6
xi yi 6xy238 6 3.5 10
所以b‸ i1 1.6 ,
622
91 6 3.52
xi 6x
i1
a‸ y b‸ x 10 1.6 3.5 4.4 ,
所以 y 关于 x 的经验回归方程为 ‸y 1.6x 4.4 ,当 x 13时, ‸y 1.613 4.4 25.2 ,
所以估计该地区新能源汽车在 2026 年 3 月份的销量是25.2 千辆.
(2)(Ⅰ)设“每位员工经过培训,能使用人工智能工具”为事件 A ,
2 0
1 3
2 1 220
所以 P A 1 C0 C1 ,
3 3 3
33 3 27
设甲、乙两名员工经过培训后,恰好只有一人能使用人工智能工具为事件 B ,
则 P B C1 20 7 280 .
22727729
设宣传部调 x x N 人至其他部门,则参加培训的人数为100 x ,
设为培训后能使用人工智能工具的人数,因此 E 20 100 x ,为培训后不能使用人工智能工具的
27
人数,因此 E 1 20 100 x ,
27
调整后年利润为 20 100 x 6 1 20 100 x 3 100 x 38 100 x 万元,
2727 9
令 38 100 x 100 3 ,解得 x 550 28.9 ,
919
所以最多可以调 28 人到其他部门.
xi
1
2
3
4
5
6
yi
38
40
43
45
50
54
26.(2025·四川成都·模拟预测)某语文报社为研究学生课外阅读时间与语文考试中的作文分数的关系,随机调查了本市某中学高三文科班 6 名学生每周课外阅读时间 x(单位:小时)与高三下学期期末考试中语文作文分数 y ,数据如下表:
根据上述数据,求?高三学生语文作文分数 y 与该学生每周课外阅读时间 x 的线性回归方程 y bˆx a‸ ,并预测某学生每周课外阅读时间为 7 小时时其语文作文成绩;
从这 6 人中任选 2 人,记为语文作文分数不小于 45 分的人的个数,求的分布列及期望.
nn
(xi x)( yi y) xi yi nxy6
参考公式: bˆ i1 i 1, ˆa y ˆbx,参考数据: x y 1001
nn2i i
(x x)2 x2 nx
i 1
ii
i1i 1
【答案】(1) y 3.2x 33.8 ;预测某学生每周课外阅读时间为7 小时时其语文作文成绩为56.2
(2)分布列见解析;数学期望为 1
【分析】(1)根据所给的公式计算对应的量 x , y ,,再代入公式求解b‸ , a‸ 可求得线性回归方程.再令 x 7
即可求得预测值.
(2)依题意列?的所有可能的值并计算?其概率,列?分布列,利用期望公式计算即可.
【详解】(1)根据表中数据,可得 x 1 (1 2 3 4 5 6) 3.5 ,
6
y 1 (38 40 43 45 50 54) 45 ,
6
6
xi yi 6 xy
1001 6 3.5 45
6
则b‸ i1 3.2 .
i1
2
x2
i6 x
91 6 3.52
a‸ y b‸ x 45 3.2 3.5 33.8 ,
故 y 关于 x 的线性回归方程为: y 3.2x 33.8 ,当 x 7 时, y 3.2 7 33.8 56.2 .
预测某学生每周课外阅读时间为7 小时时其语文作文成绩为56.2 .
(2)依题意,的可能值有0,1, 2 ,
C 21
C1 C13
C11
则 P( 0) 3 , P( 1) 33 , P( 2) 3 .
C
C
C
5
5
5
222
666
则的分布列为:
故的数学期望为 E() 0 1 1 3 2 1 1.
555
年份
自变量 x
新能源汽车产量 y(单位:万辆)
2014
1
7.8
2015
2
34
2016
3
52
2017
4
79
2018
5
127
27.(2025·浙江·一模)2014 年至 2025 年是我国新能源汽车飞速发展的时期,下表为 2014 年至 2023 年我国新能源汽车的年产量,按照表中数据,可用回归模型 yˆ bˆx2 aˆ 拟合自变量 x 与新能源汽车产量 y .
0
1
2
P
1
5
3
5
1
5
求自变量 x 与新能源汽车产量 y 的回归模型 yˆ bˆx2 aˆ ,并预测 2025 年我国新能源汽车年产量(其中bˆ ,
aˆ 以及预测年产量(单位:万辆)都保留 1 位小数且用bˆ 的 1 位小数近似值计算aˆ );
从 10 个年产量 y 的值中随机选取 3 个数据,求存在数据大于 300 的条件下,恰有 1 个数据小于 100 的概率.
n
xi x yi y
n
参考公式:一元线性回归模型 yˆ bˆx aˆ 中bˆ i1 , ˆa y ˆbx.
2019
6
124
2020
7
137
2021
8
354
2022
9
706
2023
10
959
i
i1
x x 2
1010
参考数据: 3852 148225, y 258, x 2y 191970, x 4 25333.
i ii
i1i1
【答案】(1) yˆ 8.8x 2 80.8 ,1186.4 万辆.
48
(2)
85
【分析】(1)令 z x2 ,得到 yˆ bˆz aˆ ,利用公式求得bˆ 和aˆ 的值,求得回归方程 yˆ 8.8x 2 80.8 ,令 x 12 ,求得 yˆ 1186.4 ,即可得到答案;
(2)设事件 A:3 个数据中存在数据大于 300,事件 B:3 个数据中恰有 1 个数据小于 100,分别求得事件
A 和 B 的样本点的个数,结合条件概率的计算公式,即可求解.
【详解】(1)由题意,令 z x2 ,故 yˆ bˆz aˆ 为一元线性回归模型,而12 22 102 385 ,即 z 38.5 ,
nn
zi z yi y zi yi nz y191970 385 258
所以bˆ i1 i1 8.8 ,
z z 2 z 2 nz 2
n
n
25333 14822.5
ii
i1i1
则aˆ y bˆz 258 8.8 38.5 80.8 ,所以 yˆ 8.8x 2 80.8 ,
令 x 12 ,可得 yˆ 1186.4 ,所以预测 2025 年我国新能源汽车年产量为 1186.4 万辆.
(2)设事件 A:3 个数据中存在数据大于 300,事件 B:3 个数据中恰有 1 个数据小于 100,
事件 A 的样本点个数: C3 C3 85 ,事件 AB 的样本点个数: C1 C2 C2 48 ,
107463
n AB 48
所以概率为 P B | A .
n A85
09 决定系数与残差
刻画回归效果的四种方法
残差图法:残差点比较均匀地落在水平带状区域内说明选用的模型比较合适.
n
残差平方和法:残差平方和 (yi-^ 2 越小,模型的拟合效果越好.
y)
i1
决定系数 R2 法:R2 越接近 1,表明模型的拟合效果越好.
样本相关系数.
100
28.(2025·四川成都·一模)一组样本数据(x , y ), i {1, 2, 3,,100} .其中 x 1895 , x
100
2 105 , y
970 ,
iti
i
i1
i
i1
求得其经验回归方程为: ‸y 0.02x ‸a ,残差为e‸ .对样本数据进行处理:xi ln(xi 1895) ,得到新的数据
i
(xi, yi ) ,求得其经验回归方程为: ‸y 0.42 x a‸ 2 ,其残差为 ‸ . e‸ , ‸ 分布如图所示,且
iii
12
1
e‸ N (0,2 ), ‸ N (0,2 ) ,则下列说法错误的是( )
A.样本 xi , yi 负相关B. a‸ 49.7
12
C.2 2
D.处理后的决定系数变大
【答案】C
【分析】利用回归方程系数判断 A;利用样本中心点计算判断 B;利用图像的波动性判断 CD.
1
【详解】对于 A,经验回归方程 ‸y 0.02x ‸a 中斜率0.02 0 ,则样本( xi , yi ) 负相关,A 正确;
对于 B,原样本均值: x 2 103, y 9.7 ,
由 y 0.02x a‸ ,得a‸ 9.7 0.02 2 103 49.7 ,B 正确:
11
对于 C,由图 1 的数据波动较大可得 ‸ 比e‸ 更集中,则2 2 ,C 错误;
ii21
对于 D,由图 1 的残差平方和较图 2 的残差平方和大知,处理后拟合效果更好,决定系数变大,D 正确.故选:C.
29.(2025·广东湛江·模拟预测)假设变量 x 与变量Y 的n 对观测数据为x1,y1 、x2 ,y2 、 、 xn , yn ,
Y bx e,
两个变量满足一元线性回归模型E e 0, D e 2
,则参数b 的最小二乘估计b‸ 为( )
n
xi yi
n
bˆ i1
i
y2
i1
n
xi yi
n
bˆ i1
i
x2
i1
n
x y
x x y y
bˆ
i i
n
x
i1i1
i
2y2
n
i
i1
ii
n
x x
2
i1
i
n
y y
2
i1
i
n
bˆ i1
【答案】B
nnnn
iii ii
【分析】令Q e2 y 2 2b x y b2 x2 ,利用二次函数的基本性质可得?当Q 取最小值时b‸ 的表达
i 1
式.
n
2
i 1
n
i 1
n
i 1
nnn
22 2222
【详解】令Q ei yi bxi yi 2bxi yi b xi yi 2b ixyi b ix ,
i 1
n
i 1
i 1
i 1
i 1
n
i 1
xi yi xi yi
x
x
当且仅当b‸ i1 时残差平方和最小,即bˆ 的最小二乘估计为b‸ i1 .
故选:B.
n
2
i
i1
n
2
i
i1
30.(2025·上海浦东新·二模)研究变量 x,y 得到一组成对数据 xi , yi , i 1, 2,, n ,先进行一次线性回归
1 n1 n
分析,接着增加一个数据 xn1, yn1 ,其中 xn1 n xi , yn1 n yi ,再重新进行一次线性回归分析,则
下列说法正确的是( )
i1
i1
A.变量 x 与变量 y 的相关性变强B.相关系数r 的绝对值变小 C.线性回归方程 y a‸x b‸ 不变D.拟合误差 Q 变大
【答案】C
【分析】由已知可得 x xn1 , y yn1 ,求?相关系数r ,即可判断 A,B 选项,再利用回归直线方程过样本中心点可判断 C 选项,D 利用残差平方和进行判断即可.
【详解】设变量 x,y 的平均数分别为 x , y ,
1 n1 n
则 x n xi , y n yi ,即 x xn1 , y yn1 ,
i 1
i1
可知新数据的样本中心点不变,仍为x, y ,
n1n
2n 2
则xi x xi x xn1 x xi x ,
i1
n12
yi y
i1
i1
in1
n y y y y 2
i1
i1
i
,
n y y 2
i1
n1nn
xi x yi y xi x yi y xn1 x yn1 y xi x yi y ,
i1
i1
n1
i1
n
则相关系数r
xi x yi y
i1
n1
x x
2 n1
i
y y
i1
i
2
i1
xi x yi y
x x y y
n
2 n
2
i1
i
i1
i
i1.
可知相关系数r 的值不变,变量 x 与变量 y 的相关性不变,故 A,B 错误;
n1
xi x yi y
n x x y y
ii
对于 C,因为b‸ i1 i1 ,所以b‸ 不变,
n1 2n 2
xi x
i1
xi x
i1
且线性回归方程过样本中心点x, y ,即b‸ , a‸ 均不变,所以线性回归方程 y a‸x b‸ 不变,故 C 正确;
n1
因为 xn1, yn1 即为样本中心点,即 y
yn1 ,
可知残差平方和 yi yi
不变,所以拟合误差 Q 不变,故 D 错误.
故选:C.
n1 2
i 1
31.(2025·天津宁河·模拟预测)下列说法中,正确的有( )
①回归直线 ‸y bˆx a‸ 恒过点x, y ,且至少过一个样本点:
②根据22列列联表中的数据计算得? k 2 6.635 ,而 P k 2 6.635 0.01,则有99% 的把握认为两个分类变量有关系,即有1% 的可能性使得“两个分类变量有关系”的推断?现错误;
③在做回归分析时,可以用决定系数 R2 刻画模型的回归效果,若 R2 越大,则说明模型拟合的效果越好;
➃某项测量结果服从正态分布 N 1, a2 ,若 P 5 0.81,则 P 3 0.19
A.1个B. 2 个C. 3 个D. 4 个
【答案】C
【分析】利用回归直线的特点可判断①;利用独立型检验可判断②;利用决定系数 R2 与模型拟合效果的关系可判断③;利用正态分布可判断➃.即可得?合适的选项.
【详解】对于①,回归直线 ‸y bˆx a‸ 恒过点x, y ,不一定过样本点,①错;
对于②,根据22 列列联表中的数据计算得? k 2 6.635 ,而 P k 2 6.635 0.01,则有99% 的把握认为两个分类变量有关系,
即有1% 的可能性使得“两个分类变量有关系”的推断?现错误,②对;对于③,在做回归分析时,可以用决定系数 R2 刻画模型的回归效果,若 R2 越大,则说明模型拟合的效果越好,③对;
对于➃,某项测量结果服从正态分布 N 1, a2 ,若 P 5 0.81,
则 P 3 P 5 1 P 5 0.19 ,➃对. 故选:C.
10 分类变量与列联表
分类变量的两种统计表示形式
等高堆积条形图:根据等高堆积条形图的高度差判断两分类变量是否有关联及关联强弱;
2×2 列联表:直接利用 2×2 列联表中的数据进行计算分析,用定量的方式判断两分类变量是否有关联及关联强弱.
32.(23-24 高二下·吉林白山·期末)暑假结束后,为了解假期中学生锻炼身体情况,学生处对所有在校学生做问卷调查,并随机抽取了 180 人的调查问卷,其中男生比女生少 20 人,并将调查结果绘制得到等高堆
积条形图.已知
2
n(ad bc)2
a bc d a c b d
,其中n a b c d , P 2 6.635 0.01,在被调查者
中,下列说法正确的是( )
A.男生中不经常锻炼的人数比女生中经常锻炼的人数多 B.男生中经常锻炼的人数比女生中经常锻炼的人多 8 人
C.经常锻炼者中男生的频率是不经常锻炼者中男生的频率的 1.6 倍左右
D.在犯错误的概率不大于 0.01 的条件下,可以认为假期是否经常锻炼与性别有关
【答案】BCD
【分析】根据男生比女生少 20 人,建立等式求?男生、女生的人数,建立列联表,利用列联表中的信息解决 ABC,利用独立性检验来解决 D 选项.
【详解】解:设男生人数为 x ,则女生人数为 x 20 ,由题得 x x 20 180 ,
解得 x 80 ,即在被调查者中,男、女生人数为 80,100,可得到如下22 列联表,
由表可知,A 显然错误,
男生中经常锻炼的人数比女生中经常锻炼的人数多48 40 8, B 正确;
在经常锻炼者中是男生的频率为 48 0.5455 ,在不经常锻炼者中是男生的频率为 32 0.3478, 0.5455 1.6, C
性别
锻炼情况
合计
经常锻炼
不经常锻炼
男
48
32
80
女
40
60
100
合计
88
92
180
88
正确;
920.3478
零假设 H0 :假期是否经常锻炼与性别无关,
则2
成立,
180 (48 60 32 40)2
80100 88 92
7.115 6.635 x0.01 ,根据小概率值 x 0.01 的独立性检验,我们推断 H0 不
即认为假期是否经常锻炼与性别有关,此推断犯错误概率不大于 0.01,D 正确,故选:BCD.
33.(2025·陕西汉中·一模)某人工智能研究实验室开发?一款全新的聊天机器人,该实验室对使用该款聊天机器人的 120 位用户进行调研,得到的调研数据如下表所示,则( )
年龄
周平均使用时间
超过 4 小时
不超过 4 小时
总计
不超过 40 岁
54
b
72
40 岁以上
c
d
c d
总计
72
b d
120
附: 2
n ad bc2
a bc d a cb d
, n a b c d .
当2 2.706 时,没有充分的证据判断变量 A,B 有关联,可以认为变量 A,B 是没有关联的;
当2 2.706 时,有 90%的把握判断变量 A,B 有关联;
当2 6.635 时,有 99%的把握判断变量 A,B 有关联;
当2 10.828 时,有 99.9%的把握判断变量 A,B 有关联.
d 18
用样本估计总体,每位使用该款聊天机器人的用户周平均使用时间超过 4 小时的概率为 3
5
没有 99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过 4 小时与年龄有关
有 99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过 4 小时与年龄有关
【答案】BD
【分析】先补全列联表的未知数值,再通过样本频率验证概率类选项,利用独立性检验的卡方公式计算统计量,结合临界值判断变量关联程度.
【详解】不超过 40 岁且周平均使用时间不超过 4 小时的b 72 54 18;
40 岁以上且周平均使用时间超过 4 小时的c 72 54 18 ;
40 岁以上的总计为120 72 48 ,
故 40 岁以上且周平均使用时间不超过 4 小时的d 48 18 30 .选项 A: d 18 ,A 错误;
选项 B:周平均使用时间超过 4 小时的样本数为 72,
总样本数 120,概率为 72 3 ,B 正确;
1205
年龄
周平均使用时间
超过 4 小时
不超过 4 小时
总计
不超过 40 岁
54
18
72
40 岁以上
18
30
48
总计
72
48
120
2
120 (54 30 18 18) 2
54 1818 30 54 18 18 30
120 1296 2
72 48 72 48
16.88 ,
因16.88 10.828 ,
故有 99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过 4 小时与年龄有关.所以 C 选项错误,D 选项正确.
故选:BD
11 独立性检验的一般步骤
根据样本数据制成 2×2 列联表.
根据公式2
n(ad bc)2
(a b)(c d )(a c)(b d )
计算.
比较2 与临界值的大小关系,作统计推断.
一周参与志愿服务次
数
1
2
3
4
5
6
合计
男生人数
4
6
6
4
3
2
25
女生人数
1
1
3
5
9
6
25
合计
5
7
9
9
12
8
50
34.(2025·云南昭通·模拟预测)某高校为了解学生在一周内参与志愿服务的情况,统计了全校所有学生在一年内每周参与志愿服务的次数,现随机抽取了 50 名同学,统计在某一周参与志愿服务的数据,结果如下表:
(1)若将一周参与志愿服务次数为 5 次及 5 次以上的,称为“积极参与”,其余的称为“一般参与”.请完成以下
性别
志愿服务
合计
一般参与
积极参与
男生
女生
合计
2×2 列联表,并依据小概率值 0.05的独立性检验,能否认为性别因素与学生参与志愿服务的积极性有关系;
(2)若将一周参与志愿服务达到 6 次的同学称为“最美志愿者”,在样本的 8 名“最美志愿者”中,随机抽取 3 人进行访谈,设抽取的 3 人中男生人数为Y ,求Y 的分布列和数学期望.
附: 2
n(ad bc)2
(a b)(c d )(a c)(b d )
, n a b c d .
【答案】(1)填表见解析;认为性别因素与学生参与志愿服务的积极性有关系
(2)分布列见解析;期望为 3
4
【分析】(1)由题意可直接完成列联表,再由2 公式即可求解;
(2)确定Y 的可能取值,求得概率,进而可求解.
【详解】(1)根据统计表格数据可得列联表如下:
0.1
0.05
0.01
x
2.706
3.841
6.635
性别
志愿服务
合计
一般参与
积极参与
男生
20
5
25
女生
10
15
25
合计
30
20
50
零假设为 H0 :性别与参与志愿服务情况独立,即性别因素与学生志愿服务的参与积极性无关,
250(2015 510)225
根据列联表的数据计算可得 8.333 ,
25 25 30 203
因为2 8.333 3.841,
所以,依据小概率值 0.05的2 独立性检验,推断 H0 不成立,即认为性别因素与学生参与志愿服务的积极性有关系.
(2)由题可知 8 名“最美志愿者”有 2 名男生,6 名女生,所以 Y 的所有可能取值为 0,1,2,
C0C35
C1 C215
C2C13
8
8
且Y 服从超几何分布,则 P(Y 0) 2 6 , P(Y 1) 2 6 , P(Y 2) 2 6 ,
C
C
C
8
314
328
328
Y 的分布列为:
可得 E Y 0 5 1 15 2 3 3 .
1428284
35.(2025·四川内江·一模)某兴趣小组调查了某校 100 名学生 100 米短跑成绩的情况,其中有 60 名学生
的短跑成绩合格.这 100 名学生中有 45 名学生每周自主锻炼时间超过 5 小时,60 名短跑成绩合格的学生中
有 35 名学生每周自主锻炼时间超过 5 小时.现对短跑成绩不合格的学生进行跑步技巧培训,已知每周自主锻
5
Y
0
1
2
P
5
14
15
28
3
28
炼时间超过 5 小时的学生参加跑步技巧培训后,学生的短跑成绩合格的概率为
6
3
,每周自主锻炼时间不超
过 5 小时的学生参加跑步技巧培训后,学生的短跑成绩合格的概率为
4
.用频率估计概率,从短跑成绩不合
格的学生中随机抽取 1 名学生(记为甲)进行跑步技巧培训.依据小概率值 0.005 的2 独立性检验,零假 设为 H0 :学生短跑成绩合格与每周自主锻炼时间相互独立.
先填写列联表,再依据小概率值 0.005 的独立性检验,判断是否能认为学生短跑成绩合格与每周自主
锻炼时间超过 5 小时有关;
每周自主锻炼时间
超过 5 小时
每周自主锻炼时间
不超过 5 小时
合计
短跑成绩合格
求学生甲在培训后短跑成绩合格的情况下,每周自主锻炼时间不超过 5 小时的概率;
为提高学生锻炼的积极性,学校偶尔会在田径运动场举办锻炼有奖活动,记 M 表示事件“田径运动场举办锻炼有奖的抽奖活动”,N 表示事件“小明去田径运动场锻炼”,0 P M 1, 0 P N 1.已知小明在田径运
动场举办锻炼有奖的抽奖活动的情况下去运动场锻炼的概率,比不举办抽奖活动的情况下去运动场锻炼的概率大.证明: P M | N P M | N .
n ad bc2
短跑成绩不合格
合计
100
参考公式与数据: 2
a bc d a cb d
,其中, n a b c d .
【答案】(1)列联表详见解析,2 10.77 ,根据小概率值 0.005 的独立性检验,可以认为学生短跑成绩合 格与每周自主锻炼时间超过 5 小时有关.
(2) 27 .
37
(3)证明详见解析.
【分析】(1)根据题意先完成列联表,根据表格中的数据计算2 即可进行独立性检验.
综合条件概率公式、全概率公式、贝叶斯公式求解.
根据条件概率公式与对立事件的概率公式化简求证.
【详解】(1)根据题意完善列联表如下:
0.01
0.005
0.001
x
6.635
7.879
10.828
每周自主锻炼时间
超过 5 小时
每周自主锻炼时间
不超过 5 小时
合计
短跑成绩合格
35
25
60
短跑成绩不合格
10
30
40
合计
45
55
100
根据列联表中的数据,计算得到
100 35 30 25 10 23200
2
10.77
60 40 45 55297
7.879x0.005 ,
根据小概率值 0.005 的独立性检验,我们推断 H0 不成立,即认为学生短跑成绩合格与每周自主锻炼时间超过 5 小时有关.
由(1)中的列联表知,短跑成绩不合格的学生有 40 人,其中每周自主锻炼时间超过 5 小时的有 10
人,每周自主锻炼时间不超过 5 小时的有 30 人.
记事件 A “甲在培训后短跑成绩合格”,事件 B “甲每周自主锻炼时间超过 5 小时”,则事件 B “甲每周自主锻炼时间不超过 5 小时”,
用频率估计概率知 P B 10 1 , P B 30 3 ,
404
由题意知 P A | B 5 , P A | B 3 ,
404
64
由全概率公式知 P A P B P A | B P B P A | B 1 5 3 3 37 .
4 64 448
由贝叶斯公式知 P B | A
P B P A | B
P A
3 3
44 27 ,即学生甲在培训后短跑成绩合格的情况下,每周自
3737
48
主锻炼时间不超过 5 小时的概率为 27 .
37
由题意知 P N | M P N | M ,
所以 P NM P NM P N P NM ,
P M P M 1 P M
因为0 P M 1,所以1 P M 0 ,
所以 P NM 1 P M P M P N P NM ,整理得 P NM P M P N ,
所以 P NM P N P NM P M P N P N P NM ,即 P NM P N P N P NM ,
因为0 P N 1 ,所以 P N 1 P N 0 ,
P NM
所以 P N
P NM
,即 P M | N P M | N .
P N
性别
体测结果
合计
合格
优秀
男生
2
28
30
女生
6
14
20
合计
8
42
50
36.(2025·江苏·模拟预测)教育部办公厅要求中小学校要通过体育与健康课程、大课间、课外体育锻炼、体育竞赛、班团队活动、家校协同联动等多种形式加强教育引导,让家长和中小学生科学认识体质健康的影响因素,了解运动在增强体质、促进健康、预防肥胖与近视、锤炼意志、健全人格等方面的重要作用,提高学生体育与健康素养,增强体质健康管理的意识和能力.某学校为了了解学生的身体健康与身体素质状况,随机抽取了 50 名同学的体测结果(“合格”或“优秀”),统计数据如下表:
能否有90% 的把握认为体测结果与性别有关?
用样本估计总体,频率估计概率.现等可能地从男、女生中抽取一个性别,然后再从选好的性别中随机抽取 1 名学生的体测结果,已知抽?的学生体测结果是“优秀”,求这名学生是男生的概率.
附: 2
n(ad bc)2
(a b)(c d )(a c)(b d )
,其中n a b c d .
【答案】(1)能有90% 的把握认为体测结果与性别有关
(2) 4
7
【分析】(1)根据列联表可得独立性检验的各项数据,利用独立性检验的计算公式以及检验过程,可得答案;
(2)根据古典概型以及条件概率,利用全概率公式,可得答案.
【详解】(1)由题意可得a 2, b 28, c 6, d 14, n 50 ,
0.1
0.01
0.001
x2
2.706
6.635
10.828
250 (2 14 28 6)
2
则 4.8611 2.706,
30 20 8 42
故能有90% 的把握认为体测结果与性别有关.
(2)设 A {抽取的一人为优秀}, B {抽取的一人为男生},则 A {抽取的一人为合格}, B {抽取的一人为女生},
可得 P A B 28 14 , P A B 14 7 , P B 1 , P B 1 ,
3015201022
所以 P A P A B P B P A B P B 14 1 7 1 49 ,
15210260
P AB P A B P B 14 1
故 P B A 15 2 4 .
P AP A
497
60
37.(2025·四川德阳·模拟预测)某青少年跳水队共有 100 人,在强化训练前、后,教练组对他们进行了成
绩测试,分别得到如图 1 所示的强化训练前的频率分布直方图,如图 2 所示的强化训练后的频率分布直方图.
(1)根据图中数据,估计强化训练前的成绩的平均数(同一组中的数据用该组区间的中点值作代表);并求强化训练后的成绩的 60%分位数.
(2)规定得分 80 分以上(含 80 分)的为“优秀”,低于 80 分的为“非优秀”.
强化训练
是否优秀
合计
优秀
非优秀
强化训练前
强化训练后
合计
将上面的表格补充完整,依据小概率值 0.005 的独立性检验,能否据此推断跳水运动员是否优秀与强化
训练有关?
附: 2
n(ad bc)2
, n a b c d .
(a b)(c d )(a c)(b d )
【答案】(1)平均数为76.5 , 60% 分位数为86.25 ;
(2)表格见解析,认为跳水运动员是否优秀与强化训练有关.
【分析】(1)根据题意求各组的频率,结合平均数和分位数的定义运算求解即可;
(2)完善列联表,求2 值,结合独立性检验思想分析判断.
【详解】(1)因为强化训练前的各组频率分别为0.04 , 0.06 , 0.2 , 0.3 , 0.21, 0.19 ;
强化训练前的成绩的平均数 x 45 0.04 55 0.06 65 0.2 75 0.3 85 0.21 95 0.19 76.5 ,强化训练后的各组频率分别为0.04 , 0.16 , 0.2 , 0.32 , 0.28 ,
又因为前三组频率之和为0.04 0.16 0.2 0.4 0.6 ,
前四组频率之和为0.04 0.16 0.2 0.32 0.72 0.6 ,
可知60% 分位数在80, 90 内,设60% 分位数为80 x ,则0.4 0.032x 0.6 ,解得 x 6.25 ,
所以60% 分位数约为86.25 ;
(2)零假设为 H0 :跳水运动员是否优秀与强化训练无关,补充完整的表格为
200 40 40 60 60 2
则2 8 7.879 x,
0.05
0.010
0.005
0.001
x
3.841
6.635
7.879
10.828
优秀人数
非优秀人数
合计
强化训练前
40
60
100
强化训练后
60
40
100
合计
100
100
200
100100100100
0.005
根据小概率值 0.005 的独立性检验,我们推断 H0 不成立,所以认为跳水运动员是否优秀与强化训练有关.
38.(2025·云南·模拟预测)近年来,某公司以电影和动漫中的一些元素为主题,开发了一些豪车模型玩具,
现抽取了部分孩童,调查他们是否喜爱豪车模型,所得数据统计如下表所示.
(1)现按照性别进行分层,用分层随机抽样的方法在不喜欢豪车模型的样本孩童中随机抽取 10 人,再从这
10 人中随机抽取 3 人,求至少 1 人是女孩的概率;
(2)根据 0.001 的独立性检验,能否认为是否喜欢豪车模型与性别具有相关性.
nad bc2
性别
男孩
女孩
喜欢豪车模型
340
160
不喜欢豪车模型
300
200
附: 2
a bc d a cb d
,n a b c d .
【答案】(1) 5
6
(2)不能认为是否喜欢豪车模型与性别具有相关性
【分析】(1)根据对立事件的概率及古典概型求解;
(2)计算2 ,与对应临界值比较即可得?结论.
【详解】(1)抽取的 10 人中,男孩有 6 人,女孩有 4 人,
0.05
0.01
0.001
x
3.841
6.635
10.828
C
3
C
3
故至少有 1 人是女孩的概率为 P 1 6
10
1 1 5 .
66
(2)零假设:是否喜欢豪车模型与性别无关,
1000 340 200 300 160 2
则2 6.944 10.828,
500 500 360 640
故不能拒绝零假设,即根据 0.001 的独立性检验,不能认为是否喜欢豪车模型与性别具有相关性.
相关学案
这是一份2027年高考数学一轮复习学案 专题19 统计与成对数据的统计分析学案主要包含了知能解读 01,知能解读 02,知能解读 03,重难点突破 01,重难点突破 02,易混易错 01,易混易错 02,易混易错 03等内容,欢迎下载使用。
这是一份2027届高中数学高考一轮复习学案:第十章 第73课时 成对数据的统计分析,文件包含2025-2026学年第二学期九年级数学第六章图形的相似单元测试卷docx、2025-2026学年第二学期九年级数学第六章图形的相似单元测试参考答案与试题解析docx等2份试卷配套教学资源,其中试卷共27页, 欢迎下载使用。
这是一份2024年高考数学一轮知识点复习—统计与成对数据的统计分析(解析版),共26页。
相关学案 更多
- 1.电子资料成功下载后不支持退换,如发现资料有内容错误问题请联系客服,如若属实,我们会补偿您的损失
- 2.压缩包下载后请先用软件解压,再使用对应软件打开;软件版本较低时请及时更新
- 3.资料下载成功后可在60天以内免费重复下载
免费领取教师福利 




.png)





