跳到主要内容
CalcMax

平方和计算器

结果

32.0000

离差平方和

各值平方之和(Σx²)
232.0000
总和
40.0000
平均数
5.0000
个数
8

这一页的平方和,指的是离差平方和:把每一个数减去平均数、把结果平方、再把这些平方加起来。方差与标准差就是由它算出来的——方差等于它除以自由度——而它同时回答了那两页从不追问的一件事:为什么要平方。不加平方的离差每次加起来都正好是 0,所以得先做点什么才能相加。这个平方和计算器把离差平方和连同恒等式右边的三个量一起印出来,它们是各值平方之和、普通的和,以及个数,两条路算出来的数因此可以互相对照。

公式

平方和 = Σ(x − x̄)² = Σx² − (Σx)² / n

x
列表里的每一个数,一个一个来。每个数都贡献自己那一段平方,所以少算一个数就会改变总数
x̄
这些数的平均数。离差就是从它量起的,而选它正是因为绕在它周围的那些离差正好抵消成 0
平方和
离差平方和——本页的主结果。当且仅当每一个数都相同时它等于 0;它既随离差本身变大而变大,也随离差的个数变多而变大
Σx²
各值的平方之和,也叫各值平方之和。它是恒等式右边第一项,也是两个「平方和」里最容易被认错的那个——两个都叫平方和
Σx
各值先不平方、直接相加得到的和。把它平方再除以 n,就是那个把 Σx² 修正成离差平方和的项
n
一共几个数,本站上限 200 个。它出现两次——一次是修正项里的除数,一次是印出来供核对的那个个数

当你要看的是中间那一步而不是最后那个量的时候用它:手算核对方差或标准差的时候、要讲清那两个量为什么把离差平方的时候、要比较一个模型吃掉了总变动的多少的时候。当你在跟「和」打交道而不是跟「平均数」打交道时,它也是最自然的写法,比如方差分析——那套方法通篇就是在对平方和做账。在有截距的回归里,这个量与人们说的总平方和是同一个量,模型的拟合优度就是看拟合出来的直线吃掉了它里面的多少。右边那半条恒等式还值得知道另一个理由:在机器出现之前它就是算法,而今天仍有很多公式照这么写,只是当数值很大而离散很小时,这条路会损失精度。所以上面的计算器走的是定义式那条路,把恒等式的几项印出来只是为了让你核对两条路给出的数一样。

算例

  1. 八个数:两条路都给出 32

    1. 平均数是 40 / 8 = 5
    2. 离差是 −3、−1、−1、−1、0、0、2、4,它们加起来是 0——每次都如此
    3. 把它们平方得到 9、1、1、1、0、0、4、16,加起来是 32
    4. 另一条路:各值平方之和是 232,(Σx)² / n = 1600 / 8 = 200,于是 232 − 200 = 32

    两条路都落在 32 上,而看见这件事正是这一页大半的意义。前三个离差是负的、后两个是正的,这正是非要平方不可的原因——不平方的离差加起来是 0,分不出两组数据有什么不同。

  2. 两个数,平均数带小数

    1. 平均数是 3 / 2 = 1.5,所以离差是 −0.5 与 +0.5
    2. 平方得到 0.25 与 0.25,于是平方和是 0.5——不是 1
    3. 另一条路:5 − 3² / 2 = 5 − 4.5 = 0.5,小数出现在减法那一步

    两个数的平方和最大也就是它们间距平方的一半,而这是最小的那一种情形:两个离差各承担距离的一半。最常见的错法是直接把间距平方,那在这里会得到 1 而不是 0.5——间距本身就是两个离差之差,它被算了两遍。

  3. 一个数:0 对 1764

    1. 一个数的平均数就是它自己,所以平均数是 42
    2. 离差是 42 − 42 = 0,0² 还是 0,所以离差平方和是 0
    3. 各值平方之和完全是另一个量:42² = 1764

    两个都叫平方和的数,差了三个数量级,出现在同一块面板上。正是这一格让它们分得开:列表长一点的时候这两个数通常同一个量级,很容易顺手拿错。离差平方和是 0,因为一个数无法偏离它自己——这是算得出来的真答案,不是失败,也正是这一页不像方差那样要求至少两个数的原因。

  4. 四个相同的数

    1. 平均数是 12 / 4 = 3,所以每一个离差都是 0
    2. 离差平方和是 0
    3. 各值平方之和是 3² + 3² + 3² + 3² = 36,它不等于 0,也永远不会等于 0

    这里的 0 说的是这组数据没有任何离散,而它与上面那一格虽然都印 0,却是两件事:这里有四个观测而它们完全一致,那里只存在一个观测。各值平方之和走的是相反的方向——每多一个数它就变大,与离散程度无关。

局限

这一页最大的风险在名字上。有两个不同的量都叫平方和,而两个都出现在这块面板上:离差平方和 Σ(x − x̄)² 是本页的答案,各值平方之和 Σx² 只是恒等式里的一项。只有一个数的时候两者差三个数量级。报一个数之前先看清是哪一行。第二个限制是这一页不做的事:回归会把总平方和拆成拟合直线解释掉的那部分与残差那部分,而这个拆分在这里拿不到。它需要第二组数(自变量)和一条穿过数据的拟合直线,而本节里没有任何一页拟合直线——协方差那一页算到相关系数就停了。有一件事是真的,而且值得知道:有截距的回归里,总平方和与这一页算的是同一个量,只是作用在被解释的那个变量上;缺的只是那个拆分。还有一条实际的理由让计算器走定义式而不走恒等式:两个很大又很接近的数相减会丢精度,所以在一串很大的数、离散又很小的时候,右边那条路给出的答案会明显不对。恒等式印出来是供核对的,不是用来提速的。列表上限 200 个数,而 1,500 这种写法会被直接拒绝而不是猜:「数字中间一个逗号」在一些国家是小数点,在另一些国家是千位分隔符。

常见问题

平方和怎么算?
先求平均数,再把每个数减去平均数,把每个结果平方,最后加起来。对 2、4、4、4、5、5、7、9 这组数,平均数是 5,离差是 −3、−1、−1、−1、0、0、2、4,它们的平方加起来是 9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32。每一个数都参与,包括那些正好落在平均数上的,它们贡献的是 0。
为什么要把离差平方,直接加起来不行吗?
因为不加平方的离差每次加起来都正好是 0。低于平均数的值把高于平均数的值抵消掉了,对任何一组数都成立,所以离差之和完全不携带离散程度的信息。平方一举做两件事:让每一项都变成正的、什么也抵消不掉;同时让离平均数远的值按比例获得更大权重——偏出两个单位贡献 4,偏出二十个单位贡献 400。后一件事是有意为之,也正是平方和以及由它算出的方差对单个极端值反应强烈的原因。
这一页上为什么有两个都叫平方和的数?
因为统计学里有两个量共用这个名字,而这一页把两个都印出来了。离差平方和 Σ(x − x̄)² 是本页的答案,也是方差的分子;各值平方之和 Σx² 是每个数各自平方之后相加,还没有减去任何平均数。两者由恒等式 Σ(x − x̄)² = Σx² − (Σx)² / n 联系起来,各值平方之和之所以在屏幕上,就是为了这条恒等式,但两者不能互相代替:对单独一个数 42,离差平方和是 0,而各值平方之和是 1764。
样本和总体那个选择会改变答案吗?
不会,这也是这一页没有那个下拉框的原因。样本与总体两条公式只差除数——n − 1 与 n——而平方和不做任何除法,给定一组数它就是一个数。那个选择出现在方差与标准差那两页,因为除法发生在那里,也正是同一组数据能算出两个方差却只有一个平方和的原因。
它和方差、标准差是什么关系?
方差就是这个数除以自由度:样本是 n − 1,总体是 n。标准差是方差的平方根。所以平方和是原料,而那个除法才是让不同大小的数据组可比的那一步——八个数的和天生比四个数的和大,哪怕离散程度一样。除以 n − 1 而不是 n,还顺带修正了一个轻微的偏低:离差是绕着样本平均数算的,而不是绕着真实的总体平均数。
平方和会是负数吗?
永远不会。每一项都是平方,所以每一项都是 0 或者正数,总和也一样。当且仅当每一个数都等于平均数时它等于 0,而那就意味着每一个数都等于其他所有数——要么列表里只有一个数,要么所有的数完全相同。0 是一个真实结果,说的是这组数据没有离散,不是出错的信号。如果你看到一个负数,那要么是各值平方之和 Σx² 被写错了符号,要么是手算的平方差算错了。

参考资料

相关计算器