搜尋意圖: 如果你在找「Z-score 是什麼」、「Z 分數怎麼算」或「和標準化差在哪」,先記住:Z-score 表示一個值離平均數有幾個標準差。
TL;DR: Z-score 的公式是 (x - 平均值) / 標準差。算出來的數值不是原始單位,而是用「離平均值幾個標準差」來表達位置。
實用情境: 適合用在看離群值、理解標準化前處理,以及判斷模型為什麼要先把不同尺度的特徵拉到可比較範圍。
下一步: 先把 Z-score 和 standardization 接起來,再去看 normalization,會更清楚兩種前處理不是同一件事。
你考了 85 分,朋友也考了 85 分,為什麼你覺得那次考得比較好?
你可以把 Z 分數想成,把一個數值放回平均值旁邊,看它到底高了幾個標準差、低了幾個標準差。
它重要,是因為不同考試、不同班級、不同單位的數字,不能直接拿來比,Z 分數可以先把它們放到同一把尺上。
容易混淆
Z 分數 vs 百分位數 Z 分數看的是離平均多遠,百分位數看的是排名在哪裡。
Z 分數 vs T 分數 T 分數是把 Z 分數換成另一種量尺,通常平均 50、標準差 10。
Z 分數 vs 原始數值 原始數值還帶著各自單位,Z 分數把它標準化後,才更容易比較。
最關鍵的區別:Z 分數回答的是「離平均有幾個標準差」。
記住這句就好
正的高於平均,負的低於平均。
實際案例
信用卡異常交易 如果某位客戶平常每筆消費都很穩定,但突然出現一筆遠高於平均的交易,系統可以用 Z 分數先把它標成可疑。
兒童生長評估 醫療上會把身高或體重和同齡參考值比較,Z 分數太低或太高,都可能代表需要進一步觀察。
算法與應用
Z = (x - μ) / σ
這裡 x 是你的數值,μ 是平均值,σ 是標準差。
它常用在標準化、異常偵測、品質管制和統計檢定裡。當數據分布很偏時,Z 分數還是能算,但門檻的解讀就要更小心。
公式與計算
Z 分數衡量一個數值離平均有幾個標準差:
z = (x − μ) / σx 是原始值,μ 是平均數,σ 是標準差。算出來的單位是「標準差」,所以不同量綱的資料可以直接比較。
實際算一次。假設一次考試平均 70 分、標準差 8 分:
| 原始分數 | 計算 | Z 分數 | 解讀 |
|---|---|---|---|
| 86 | (86 − 70) / 8 | +2.0 | 高於平均兩個標準差 |
| 70 | (70 − 70) / 8 | 0 | 剛好等於平均 |
| 58 | (58 − 70) / 8 | −1.5 | 低於平均 1.5 個標準差 |
同一個人數學 86 分(z = +2.0)、英文 78 分但英文平均 60、標準差 6(z = +3.0),原始分數是數學高,Z 分數卻是英文更突出。這就是 Z 分數的用途:把不同尺度的東西拉到同一把尺上比。
常見的判讀門檻
資料接近常態分布時,落在正負 1 個標準差內約佔 68%,正負 2 個約 95%,正負 3 個約 99.7%。這組數字叫 68-95-99.7 法則。
因此實務上常拿 |z| > 3 當離群值(outlier)的初步標準,較寬鬆的場合用 |z| > 2。
兩個要注意的地方。第一,資料明顯偏態時這套門檻不適用,該改用四分位距(IQR)判離群值。第二,樣本數很少的時候平均與標準差本身就不穩,算出來的 Z 分數也不可靠。
情境判斷
Q1(直覺題): 某班平均 60 分、標準差 5 分,一個學生考 75 分,Z 分數大約是多少?
→ 大約是 3,因為 (75 - 60) / 5 = 3,代表高出平均 3 個標準差。
Q2(判斷題): 如果資料分布明顯右偏,你還能直接把 Z 分數當成唯一的異常判準嗎?
→ 要小心。Z 分數可以算,但偏態很重時,可能要先做轉換或改用更穩健的方法。
常見問題
Z 分數為負代表什麼?
代表那個值低於平均,絕對值越大,離平均越遠。
Z 分數要多大才算異常?
沒有絕對門檻,常見會看 |Z| > 2 或 |Z| > 3,但要依場景調整。
Z 分數一定要常態分佈嗎?
不一定能算,但若要用門檻解讀機率,常態分佈會更好用。
Z 分數能用在非數值資料嗎?
不能直接用,因為它需要平均值和標準差這類數值統計量。