為什麼常態分布到處都是?
接棒數學編輯室 · 2026 年 8 月
量一千個人的身高,畫成分布圖,會得到一個中間高兩邊低的鐘形。
量一千片工廠零件的厚度,也是鐘形。 統計一千次考試的分數,也是鐘形。 測一千次同一段距離的誤差,還是鐘形。
這些事情完全不相干,為什麼分布長得一樣?
答案是中央極限定理:只要一個量是由很多個獨立的小因素累加而成,不管那些因素本身是什麼分布,加起來的結果都會趨近常態分布。
身高受幾百個基因、營養、睡眠、運動影響,每一個都推一點點。零件厚度受機台溫度、材料批次、刀具磨損、震動影響。誤差是一堆微小干擾的總和。
它們的共同點不是內容,是結構——都是「很多小影響加起來」。
因此不是某種自然界的神秘偏好,它是加總這個動作的必然結果。
常態分布只要兩個數就完全確定:平均數決定中心在哪,標準差決定胖瘦。標準差小,資料擠在中間;標準差大,攤得比較開。
有三個數字值得記住:距離平均一個標準差之內約佔 68%,兩個標準差之內約 95%,三個標準差之內約 99.7%。
這三個數字在現實裡到處被用。工廠品管說「六個標準差」,意思是不良率低到百萬分之幾。醫學檢驗報告上的「參考範圍」,多半就是健康人群的 95% 區間——所以有 5% 的健康人天生會落在範圍外,報告紅字不一定代表生病。
把這件事推得更遠:就算母體不是常態的,樣本平均數的分布也會趨近常態,只要樣本夠大。這是整套方法的地基——民調、藥物試驗、品管抽驗,全都靠它。
有一個常見的誤解要澄清:不是所有東西都是常態分布。
所得分布不是,它右偏——少數人拉得很長。城市人口不是。地震規模不是。網路連結數不是。這些量的形成機制是「乘法」或「贏者通吃」,不是「很多小因素相加」,所以不會收斂到鐘形。
看到一份資料就假設它是常態的,是統計上最常見的誤用。
先畫圖看形狀,再決定用什麼工具。