经验法则计算器
结果
1σ 内的占比
- 低 1σ
- 85.00
- 高 1σ
- 115.00
- 低 2σ
- 70.00
- 高 2σ
- 130.00
- 2σ 内的占比
- 95.45%
- 低 3σ
- 55.00
- 高 3σ
- 145.00
- 3σ 内的占比
- 99.73%
经验法则(也叫 68-95-99.7 法则)说的是:对正态分布而言,约 68% 的数值落在均值两边一倍标准差之内,约 95% 落在两倍之内,约 99.7% 落在三倍之内。这一页把这句关于百分比的话变成它真正在说的那些数:填一个均值与一个标准差,页面就印出三组区间的六个端点——低一倍与高一倍、低两倍与高两倍、低三倍与高三倍各是多少——以及每个区间盖住了这个分布的多少。三个占比是算出来的而不是抄来的,所以出来是 68.27%、95.45% 与 99.73%,也就是把四舍五入去掉之后的那条经验法则。名字是简称,页面印的数是它简称的那个东西。
公式
一倍标准差:均值 ± 1σ · 两倍:均值 ± 2σ · 三倍:均值 ± 3σ · k 倍内的占比 = 2Φ(k) − 1,其中 Φ 是标准正态分布函数
- 均值
- 分布的中心。六个端点以它为中心对称,所以改均值会让整组区间整体平移,而三个占比一个都不动
- 标准差
- 分布的离散程度,也是这条法则的计量单位——一倍、两倍、三倍说的都是它。它必须是正数:标准差为零的正态分布退化成一个点,法则对它没有话说
- kσ
- 标准差的倍数,取 1、2 或 3。区间内的占比只取决于 k,这正是「无论均值与标准差是多少,三个百分比都一样」的原因
- 2Φ(k) − 1
- −kσ 到 +kσ 之间的精确占比。经验法则把它简化成 68 / 95 / 99.7 便于记忆,而这一页印的是没被简化过的值——也就是那个简化值所代表的东西
它的用处是把一个均值与一个标准差变成能指着说的区间。经验法则通常是以一句话的形式出现的,而一句关于百分比的话很难套到某个具体的测量值上;换成「超过 130 就是两倍标准差开外」就立刻能用了。它同时也是对标准差本身的一个快速体检:如果均值两边一倍标准差盖住的那个范围不可能装下 68% 的数据——因为它越过了硬性下限、或者数据明显是偏的——那么正态模型对这组数据就是错的,而这次体检不花什么成本。这一页通篇假定数据服从正态分布:它不替你拟合,也不告诉你这个假定成立不成立。
算例
均值 100、标准差 15
- 一倍标准差:100 − 15 = 85 到 100 + 15 = 115
- 两倍标准差:100 − 30 = 70 到 100 + 30 = 130
- 三倍标准差:100 − 45 = 55 到 100 + 45 = 145
- 三个占比完全不用到均值与标准差:一倍内 68.27%、两倍内 95.45%、三倍内 99.73%
这一页每一条算例上的三个百分比都一模一样,这是法则的内容而不是这一组数的巧合。正态分布由中心和离散程度两个数完全确定,而落在中心 k 倍标准差之内的那部分只取决于 k——所以均值与标准差只搬动端点,从不碰占比。如果哪天某个结果的百分比跟着均值动了,那就是占比算错了来源;把它们印在这三行上,正是为了这件事一眼可见。
标准正态:均值 0、标准差 1
- 0 两边一倍标准差是 −1 到 1
- 两倍是 −2 到 2,三倍是 −3 到 3
- 三个占比不变,仍然是 68.27%、95.45%、99.73%
均值 0、标准差 1 时端点本身就是标准差的倍数,于是这一格是这条法则最值得背下来的版本:−1、−2、−3 与它们的正数就是 z 值,而其他任何正态分布都不过是这一个被拉伸平移过。它也顺带说明了占比为什么不可能依赖输入——这里的端点字面上就是 k 的值,而它们旁边的百分比与均值取 100 时完全相同。
标准差很小:均值 500、标准差 0.5
- 一倍标准差是半个单位,所以第一个区间是 499.5 到 500.5
- 两倍是 499 到 501,三倍是 498.5 到 501.5
- 三个占比仍然是 68.27%、95.45%、99.73%
这条法则与标准差是不是整数、是不是大数毫无关系,而分布很窄的时候区间就不那么一眼看得出来了。机械加工的公差带通常就是这么写的——一个目标值,加上一个比目标值小得多的离散程度——这时有用的是端点那一行而不是百分比那一行。它也提醒一件事:三倍标准差能盖住几乎全部,只在分布真的是正态时才成立。这里的三个标准差在绝对量上是一个很窄的区间,任何尾巴更重的真实过程都会把远超 0.27% 的部分甩在外面。
均值为负:−2.5,标准差 1.25
- −2.5 两边一倍标准差是 −3.75 到 −1.25
- 两倍是 −5 到 0——上端点正好落在 0 上
- 三倍是 −6.25 到 1.25,跨过了 0
- 三个占比不变,仍然是 68.27%、95.45%、99.73%
均值为负是常事——温度距平、对数收益率、两次测量之差——而它正是区间跨过 0 的那一格,所以一个把符号写反的实现在所有正数例子上都可以看着是对的。这里两倍标准差的上端点正好落在 0 上,这种巧合会让一个错的答案看着像是刻意设计的,所以这一格被钉成一条测试而不是留给运气。标准差无论均值为正为负都保持正数:它是一个宽度而不是一个坐标,带符号的只有均值。
局限
这条法则属于正态分布,不属于别的任何分布。它常被当成一条关于「数据一般长什么样」的事实来复述,但它其实是一条特定曲线的性质——形状不同的分布在一倍、两倍、三倍标准差处的占比是别的数,而偏斜的分布两侧的占比还可能很不一样。所以这一页是假定正态而不是检验正态,结果的意义完全取决于这个假定。另外三条限制:标准差必须是正数,等于零时分布塌成一个点,「零点几个标准差之内存着多少比例」这个问题没有有用的答案,所以这一页宁可拒绝这组输入也不替它挑一个。三个占比是正态分布函数的精确值,所以它们与通常引用的 68、95、99.7 在小数第二位上是不同的——这一页不为了跟名字对上而把它们四舍五入,因为那个简化值只是简称,印出来的数才是它代表的东西。最后,这一页不会替你的数据拟合分布,也不检验某个分布拟不拟合得上;它把均值与标准差当作已知,然后报告由它们推出的东西。
常见问题
- 为什么这一页写 68.27%,而法则的名字里是 68%?
- 因为名字里的 68 是个约数,68.27% 才是它约的那个值。经验法则的用途是记住三个数,「约 68%、95%、99.7%」是大多数人在脑子里能装下的写法;而正态分布在均值一倍、两倍、三倍标准差之内的精确占比分别是 68.27%、95.45%、99.73%,这一页算的是后面这三个而不是引用前面那三个。如果还要拿其中一个数往下算,用的是没约过的那个——把一个约数当输入,结果会偏,而偏的方向事后没人能追回到四舍五入上去。
- 改均值或者标准差,三个百分比会变吗?
- 不会,而这正是这条法则的全部内容。正态分布由中心与离散程度两个数确定,而落在中心 k 倍标准差之内的那部分只取决于 k——1、2 或 3。所以改均值会让六个端点整体平移,改标准差会把它们拉宽或压缩,而三个占比纹丝不动。如果哪天某个结果的占比跟着输入动了,那说明占比是按端点算的而不是按标准差的倍数算的,那是实现出了错,不是数据的性质。
- 这个区间给出的到底是不是概率?
- 是概率,读作分布里的一部分。如果一个量确实服从你填的那个均值与标准差的正态分布,那么从它里面取一个值、落在某个区间内的概率就等于那个区间对应的占比;区间的作用是把「几倍标准差」翻译成你实际在用的单位,好让这句话能套到某个具体的数上。它不是关于你手上这份样本的陈述:一个分布可以把 68% 的概率放在某个区间里,而眼前这份数据落在里面的比例是另一个数——这一页没有数据,只有你填的两个参数。
- 怎么知道正态分布是不是对的模型?
- 这一页答不了,因为它看不到数据。它能给的是一次快速体检:如果均值两边一倍标准差盖住的区间不可能装下大约三分之二的数值——因为它越过了硬性的下限或上限、因为数值是计数而不可能为负、或者因为分布明显是偏的——那么正态这个假定就在造成真实的偏差,这一页上的百分比描述的是数据并不服从的那条曲线。要正经回答这个问题,通常得看直方图或者正态概率图;这里的算术是那个答案的下游,不是它的替代品。
- 为什么标准差不能填 0?
- 因为标准差为零的正态分布已经塌成了一个点,法则在那里就不再有意义。所有数值都精确落在均值上,于是宽一倍、两倍、三倍标准差的区间宽度全是零,问它们盖住了这个分布的多少会有两个都说得通的答案——全部,因为所有东西都在均值上;或者零,因为那个区间没有宽度——而没有依据在两者之间选。与其悄悄挑一个,这一页直接拒绝这组输入,并说明标准差必须是正数。实际计算里标准差算出 0,几乎总是意味着只有一个观测值或者数据录入出了问题,而不是真的存在这样一个分布。
- 这一页和从 z 值算概率的那一页是同一件事吗?
- 它们是同一个正态分布的两个入口。z 值那一页拿一个具体数值,告诉你它落在什么位置、它以下的概率是多少;这一页拿均值与标准差,把三组标准差的区间与各自覆盖的比例铺开来。区别在于问题的方向——一个是从一个测量值出发,另一个是从法则本身出发。两页的输入是刻意做成一样的,均值与标准差就在同样的两个字段里,所以在两页之间来回不用重填;而它们也不可能对同一个分布给出不一致的说法,因为底下用的是同一套计算。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- GB/T 4086.1-2025《数据分析与决策 统计分布数值表 第1部分:正态分布》(推荐性国家标准,现行:2025-10-05 发布 / 实施;本页三个占比与六个端点对应的官方数值表口径) — 国家市场监督管理总局 国家标准全文公开系统
- 68-95-99.7 Rule — from Wolfram MathWorld(英文原版;法则本身写成「约 68% / 95% / 99.7%」,更精确的那三个概率,以及「这条法则只适用于正态分布、不是关于任意分布的普遍结论」这句限定) — Wolfram MathWorld