粉笔先生
返回全部学科 / 数学 / 知识点精讲 / 中位数与众数——数据中心的不同“代表”
数学 8年级 困难

中位数与众数——数据中心的不同“代表”

从生活案例出发,系统复习中位数和众数的概念、计算方法,深度对比平均数、中位数、众数在数据分布中的不同角色,重点分析异常值影响、分组数据应用及实际情景选择。结合图形直观展示偏态分布中三者的位置关系,提升学生综合运用统计量的能力。

中位数 众数 平均数 数据分布 异常值 频率分布

一、从生活中的“平均”说起

你听说过“平均工资”吗?某公司老板说员工平均工资8000元,但很多员工说“我们拖后腿了”——原来老板和几个高管的百万年薪拉高了平均数。这时,用“中位数”才能反映大多数人的真实收入水平。还有像鞋店进货时关心“哪款鞋卖得最多”,这就是“众数”的用处。统计中,平均数、中位数、众数都是描述数据集中趋势的统计量,但它们各有特点。

本专题聚焦两个统计量:中位数(不受极端值影响)和众数(反映最流行值),并通过图形和综合例题,让你彻底理解它们的“脾气”。

二、核心概念:中位数与众数的定义

1. 中位数(Median)

定义:将一组数据按从小到大(或从大到小)的顺序排列,位于中间位置的数叫做这组数据的中位数。如果数据的个数是奇数,中位数是正中间的那个数;如果是偶数,中位数是中间两个数的平均数。

关键步骤:

  1. 排序(必须!)
  2. 确定位置:
    • $n$ 个数据,奇数:第 $\frac{n+1}{2}$ 个数据
    • $n$ 个数据,偶数:第 $\frac{n}{2}$ 和第 $(\frac{n}{2}+1)$ 个数据的平均数

例1:数据 3, 7, 2, 5, 8,求中位数。

排序:2, 3, 5, 7, 8(奇数5个)。中间位置是第 $(5+1)/2=3$ 个,对应数5。所以中位数 = 5。

例2:数据 10, 20, 15, 25,求中位数。

排序:10, 15, 20, 25(偶数4个)。中间两个是第2个(15)和第3个(20),平均数 $(15+20)/2=17.5$。所以中位数 = 17.5。

2. 众数(Mode)

定义:一组数据中出现次数最多的数据叫做这组数据的众数。注意:众数可能不止一个,也可能没有(所有数据出现次数相同)。

快速求法:用“唱票法”统计每个数据出现的频数,频数最大的就是众数。

例3:数据 1, 2, 2, 3, 4, 2, 5,求众数。

统计:1出现1次,2出现3次,3出现1次,4出现1次,5出现1次。最多是2,所以众数 = 2。

例4:数据 1, 1, 2, 2, 3, 3,求众数。

1、2、3各出现2次,次数相同。所以这组数据有多个众数:1, 2, 3 或者可以说没有唯一的众数。

三、图形直观感受:不同位置的中位数与众数

我们通过两个典型的数据集来画图,看看中位数和众数在数轴上的位置,以及它们与平均数的关系。

图1:两个数据集的点图,展示中位数与众数。左侧数据对称分布(平均数=中位数=众数);右侧数据含异常值(中位数稳健,平均数被拉偏)。
对称分布(近似正态) 1020 3040 5060 70 中位数=40 众数=40 平均数=40 含异常值(右偏) 1020 3040 5060 70 异常值100 中位数≈3.5 众数=3 平均数≈12.7(被拉偏)

从图1可以清晰看到:在对称分布中,平均数、中位数、众数几乎重合(都是40);而在有极端值的右偏分布中,平均数被“拉”到了12.7,远大于中位数3.5和众数3,此时中位数和众数更能代表数据的“一般水平”。

四、进阶应用:分组数据中的中位数与众数估计

实际问题中,数据往往以频数分布表的形式呈现(比如考试成绩的分段统计)。此时我们不能直接看到原始数据,需要估计中位数和众数。

1. 分组数据的中位数(估计)

步骤:

  1. 计算累计频数,找到总频数的一半所在的分组(中位数组)。
  2. 用以下公式估计中位数:
$$\text{中位数} \approx L + \frac{\frac{N}{2} - F}{f} \times h$$

其中 $L$ 是中位数组的下限,$N$ 是总频数,$F$ 是中位数组之前的累计频数,$f$ 是中位数组的频数,$h$ 是组距。

2. 分组数据的众数(估计)

众数组就是频数最大的那一组。众数可以用组中值(该组端点平均值)近似代表,或者用公式:

$$\text{众数} \approx L + \frac{d_1}{d_1+d_2} \times h$$

其中 $L$ 是众数组的下限,$d_1$ 是众数组频数减去前一组频数,$d_2$ 是众数组频数减去后一组频数,$h$ 是组距。

图2:频数分布直方图,展示中位数和众数的估计位置。阴影柱为众数组(频数最高),中位数线穿过累计频数一半。
分数 频数 0 20 40 60 80 100 120 20 15 10 5 0 众数组 累计频数一半 中位数≈52.5 中位数=40+(12-7)/8×20≈52.5;众数≈40+(8-5)/((8-5)+(8-5))×20=40+3/6×20=50

在图2中,总频数24,一半=12。累计到第二组(20~40分)只有7人,累计到第三组(40~60分)达到15人,所以中位数组是第三组。通过公式估算中位数≈52.5。众数组也是第三组(频数最大8),估算众数≈50。

五、典型例题(由易到难)

例题1(基础):某校八年级10名学生的跳绳成绩(单位:次/分钟)如下:

120, 125, 125, 130, 130, 135, 140, 140, 140, 200

(1)求这组数据的中位数和众数;

(2)如果老师希望用“中等水平”来评价大多数学生的成绩,你认为用中位数还是平均数更合适?为什么?

解:

(1)先排序:120,125,125,130,130,135,140,140,140,200(10个,偶数)。中位数为第5(130)和第6(135)的平均数 = $(130+135)/2=132.5$。众数:140出现3次最多,所以众数=140。

(2)平均数 = $(120+125+125+130+130+135+140+140+140+200)/10 = 1385/10 = 138.5$。由于存在一个异常高分200,平均数被拉高到138.5,而中位数132.5更贴近多数学生的水平(120~140)。所以用中位数更合适。

易错点提示:①不要忘记排序;②偶数数据的中位数是中间两数的平均值。

例题2(综合):某商场记录了30天内某款商品的日销售额(单位:百元),数据如下(已排序):

10,12,12,15,15,15,18,18,20,20,20,20,20,22,22,22,25,25,25,28,30,30,30,35,35,40,45,50,55,120

(1)求平均数、中位数、众数;

(2)如果你是商场经理,你更关心哪个统计量?说明理由。

解:

(1)平均数 = 所有数据和 = ?计算麻烦,但可分组估算或直接加和:总和 = 20+?我们仔细算:10+12×2=34,15×3=45,18×2=36,20×5=100,22×3=66,25×3=75,28,30×3=90,35×2=70,40,45,50,55,120。逐项加:10+24=34,+45=79,+36=115,+100=215,+66=281,+75=356,+28=384,+90=474,+70=544,+40=584,+45=629,+50=679,+55=734,+120=854。共30个,平均数≈28.47(百元)。

中位数:30个为偶数,第15和第16个数的平均数。第15个数是22,第16个数是22,所以中位数=22。

众数:20出现5次最多,所以众数=20。

(2)作为经理,我更关心众数(20百元),因为这是最常出现的销售额,反映了日常销售水平。平均数28.47被120的高额销售拉高,中位数22也可能偏高(因为异常值120推高了中位数?实际上中位数22并未受异常值影响,但众数20更贴近大多数日销售额。如果重点是预测常规销售,众数最直接。当然,中位数22也较好,但众数20更聚焦。所以根据情境选择。

易错点:不要盲目选择中位数,具体问题具体分析。

例题3(提升——分组数据):在一次数学竞赛中,100名学生的成绩如下表:

分数段频数
0~208
20~4018
40~6030
60~8028
80~10016

(1)估计这100名学生成绩的中位数和众数;

(2)如果成绩在60分以上为及格,估计及格率;

(3)从平均数、中位数、众数中选一个作为“整体水平”,你选哪个?为什么?

解:

(1)总频数100,一半=50。累计频数:0~20:8;20~40:8+18=26;40~60:26+30=56(超过50),所以中位数在40~60分组。下限L=40,组距h=20,前组累计F=26,本组频数f=30。

$\text{中位数} \approx 40 + \frac{50-26}{30} \times 20 = 40 + \frac{24}{30}\times20 = 40+16=56$。

众数组:频数最大的是40~60分组(30),众数估计:前组频数=18,后组频数=28,$d_1=30-18=12$,$d_2=30-28=2$。

$\text{众数} \approx 40 + \frac{12}{12+2}\times20 = 40 + \frac{12}{14}\times20 ≈ 40+17.14≈57.14$。

(2)及格率为60分以上:频数为28+16=44,所以及格率≈44/100=44%。

(3)由于成绩分布不对称(低分段多,高分段少),平均数可能偏低(需实际计算)。但中位数56分和众数57分接近,而平均数因为低分段较多会被拉低。我认为中位数能较好代表整体水平:它表明一半学生超过56分,一半低于。众数也可参考,但中位数更稳健。所以选中位数

(附:计算平均数需组中值加权平均,此处略,可给有兴趣的学生计算。易错提醒:分组估计中位数时,注意累计频数公式的正确使用。)

六、常见误区与辨析

  • 误区1:求中位数前忘记排序。后果:直接取中间值会出错。一定要先排序!
  • 误区2:众数只能有一个。实际上可以多个或没有。
  • 误区3:认为中位数永远比平均数小/大。正偏态中位数<平均数,负偏态中位数>平均数,对称时相等。
  • 误区4:分组数据中直接取组中值作为中位数。必须用公式估计。
  • 误区5:在所有问题中都追求“平均”。要理解不同统计量的适用情境,如薪酬用中位数更合理。

七、学习建议

  1. 动手排序:遇到原始数据,养成先排序再找中位数的习惯。
  2. 画图辅助:在纸上画数轴或点图,直观感受中位数和众数的位置。
  3. 对比平均数:同时计算三个统计量,分析它们之间的差异,理解异常值的影响。
  4. 关注情境:做题时问自己“这里描述的是哪种分布?哪个统计量更能代表一般水平?”
  5. 练习分组数据:会用频数分布表估计中位数和众数,这是考试的高频考点。

八、知识链接

中位数和众数与平均数是描述数据集中趋势的“三剑客”。后续还将学习方差、标准差(离散程度)、百分位数(如四分位数)、箱线图等,它们与中位数关系密切。在数据分析(如统计与概率、机器学习)中,中位数和众数因为稳健性而常被用作基准。掌握好它们,就为更高阶的统计学习打下了坚实基础。

九、习题自测

  1. 数据:2, 3, 5, 5, 7, 8, 8, 8, 10, 100。求中位数、众数、平均数,并判断哪个统计量更能代表这组数据的“一般水平”。
  2. 某班40名学生身高(cm)频数分布:
    140~150:6人, 150~160:12人, 160~170:14人, 170~180:8人。估计中位数和众数。
  3. 两组数据:A组:10,20,30,40,50;B组:40,40,40,40,40。
    (1) 分别求平均数、中位数、众数。
    (2) 如果要从这两组中选一组代表“稳定”的数值,哪组更好?为什么?
点击查看答案
  1. 排序:2,3,5,5,7,8,8,8,10,100。中位数=(7+8)/2=7.5;众数=8;平均数=(2+3+5+5+7+8+8+8+10+100)/10=156/10=15.6。由于100是异常值,平均数被拉高,中位数7.5和众数8更能代表一般水平。
  2. 总人数40,一半=20。累计:140~150:6;150~160:18;160~170:32(超过20),中位数组160~170。L=160,F=18,f=14,h=10。中位数≈160+(20-18)/14×10≈161.43。众数组160~170(频数14),前组12,后组8,d1=14-12=2,d2=14-8=6,众数≈160+2/(2+6)×10=160+2.5=162.5。
  3. (1) A组:平均=30,中位数=30,众数无唯一(所有数出现一次)。B组:平均=40,中位数=40,众数=40。(2) B组更稳定,因为所有数据相同,没有波动。A组数据分散。(注:稳定一般用方差衡量,这里直观判断)