IPAS AI 應用規劃師 考前重點複習🔍 試看版
初級 L1 |科目一 + 科目二 |主題分類詳解卡
01AI 類型與定義
02機器學習三大範式
03深度學習與神經網路
04資料處理與特徵工程
05模型評估指標
06模型優化與正則化
07電腦視覺 & NLP
08AI 倫理與治理
09分析層次與專案管理
10EDA 與 NLP 基礎
🔍 試看版:科目一共 10 個主題,這裡開放「5. 模型評估指標與混淆矩陣」;其餘主題與科目二、易混淆對照、中英速記購買後開放。
05
5. 模型評估指標與混淆矩陣
分類 / 迴歸指標、不平衡資料的指標選擇
先問自己:「漏掉一個會怎樣?誤判一個又會怎樣?」漏掉癌症病人 = 要命 → 重 Recall;把正常信誤判垃圾 = 很煩 → 重 Precision;兩邊都要顧 → 看 F1。資料不平衡時千萬別只看 Accuracy!
分類指標
- Accuracy 準確率:100 題答對幾題。聽起來很直覺,但資料不平衡時會騙人 — 99% 正常 vs 1% 詐欺,模型全猜「正常」就有 99% 準確率,但一個詐欺都沒抓到!
- Precision 精準率:模型說「這是壞人」的裡面,有多少真的是壞人?重點:別冤枉好人。垃圾郵件分類要高 Precision,不然正常信被丟垃圾桶很煩。
- Recall 召回率 / Sensitivity 敏感度:所有真正的壞人裡面,模型抓到了幾個?重點:別放走壞人。癌症篩檢要高 Recall,寧可多檢查幾個也不能漏掉病人。
- Specificity 特異度:所有真正的正常人裡面,模型正確放行幾個?重點:別把正常人誤判成異常。常和 Recall 一起看,才知道模型是不是只會抓正類。
- F1-Score:Precision 和 Recall 的平衡分數。兩邊都要顧到才會高,任一邊太低就會被拉下來。不平衡資料的首選指標。
- FPR 偽陽性率:正常人被誤報成異常的比例。垃圾郵件、風控、告警系統若 FPR 太高,使用者會被大量誤報打擾。
- FNR 偽陰性率:真正異常卻被漏掉的比例。癌症、詐欺、瑕疵偵測若 FNR 太高,代表危險個案被放走。
- NPV 陰性預測值:模型說「不是異常」的案例裡,有多少真的不是異常。用來判斷「陰性結果」值不值得相信。
- AUC-ROC:不管門檻怎麼設,模型整體分辨好壞的能力。1.0 = 完美,0.5 = 跟丟銅板一樣。但嚴重不平衡時會虛高。
- PR-AUC:Precision vs Recall 的曲線面積。不平衡資料下比 AUC-ROC 更誠實,不會被多數類騙。
十個分類指標加混淆矩陣對照,最後附「情境怎麼選」與一行口訣。點圖可放大。
迴歸指標
- MAE (Mean Absolute Error):看「平均偏多遠」,像射箭看平均離靶心幾公分。對離群值比較寬容,單位跟原始資料一樣好理解。
- MSE (Mean Squared Error):偏差先平方再平均,對偏很遠的特別嚴格(大誤差會被放大)。
- RMSE (Root Mean Squared Error):MSE 開根號,回到原本的單位。比 MAE 更嚴格,比 MSE 更好讀。
- R² (決定係數):模型比「亂猜平均值」好多少?1.0 = 完美預測,0 = 跟亂猜一樣爛,負數 = 比亂猜還爛。
- MAPE:用百分比看誤差,方便跨不同尺度比較。但目標值接近 0 時會爆炸(除以接近 0 的數)。
- 實務提醒:預測住院天數時,不能只看整體 MAE,還要分開看「重症子群」的誤差,避免被大量短期住院的人平均掉。
MAE 看平均距離、MSE 重罰大錯、RMSE 好讀又嚴格、R² 看整體解釋力、MAPE 看百分比。點圖可放大。
迴歸公式速查
| 指標 | 公式 | 白話看法 |
| Residual 殘差 | ei = yi − ŷi | 單筆資料真實值和預測值差多少;有正負方向。 |
| MAE 平均絕對誤差 | MAE = 1nΣ|yi − ŷi| | 平均偏多遠;單位和原本目標值一樣,最直覺。 |
| MSE 均方誤差 | MSE = 1nΣ(yi − ŷi)2 | 先平方再平均;大錯誤會被放大懲罰。 |
| RMSE 均方根誤差 | RMSE = √1nΣ(yi − ŷi)2 | MSE 開根號回到原單位;仍然重罰大誤差。 |
| R² 決定係數 | R2 = 1 − Σ(yi − ŷi)2Σ(yi − ȳ)2 | 模型比「只猜平均值」好多少;可為負,代表比亂猜平均還差。 |
| MAPE 平均絕對百分比誤差 | MAPE = 100%nΣ|yi − ŷiyi| | 用百分比看誤差;真實值接近 0 時會不穩。 |
類別不平衡資料
- 核心警訊:少數類往往才是「真正重要的」— 疾病、詐欺、瑕疵、流失客戶,數量少但漏掉一個就出大事。
- Accuracy 會騙人:99% 正常 vs 1% 詐欺,模型全猜「正常」就有 99% 準確率,但一個詐欺都沒抓到!這種 99% 毫無價值。
- 該用什麼指標:F1、Recall、PR-AUC,不是 Accuracy。
- 怎麼處理:① SMOTE 合成少數類新樣本;② 砍掉一些多數類;③ 給少數類更高權重 (class_weight);④ 用 Balanced Random Forest;⑤ 改用合適指標。
- 考題訊號:看到「樣本不平衡」「少數類召回率低」「決策邊界被多數類主導」→ 就是在考這個。
少數類最重要;別被 Accuracy 騙,重點看 Recall、F1、PR-AUC,再搭配重抽樣或加權。點圖可放大。
指標選擇情境
- 癌症 / 瑕疵 / 詐欺偵測 → 高 Recall + F1(漏掉一個就出大事,寧可多檢查幾個)。
- 垃圾郵件 / 推薦 / 廣告 → 高 Precision(誤判會惹人煩,別推雷店)。
- 房價 / 業績 / 氣溫預測 → MAE / RMSE / R²(預測數字用迴歸指標)。
- 住院天數(多數短期 + 少數重症) → 整體 MAE + 重症子群誤差一起看,別被多數人平均掉。
- 搜尋 / RAG / 推薦排序 → MRR、NDCG、Recall@K(看好東西有沒有排前面)。
- 機率校準:模型說「70% 會下雨」,真的有 70% 的機率嗎?用 Reliability Diagram 檢查。
先看任務性質:抓異常重 Recall、怕誤報重 Precision、預測數字看 MAE/RMSE/R²、排序看 MRR/NDCG/Recall@K、機率可信度看 Reliability Diagram。點圖可放大。
抽樣、分群與統計檢定
- Random Oversampling / Random Undersampling / SMOTE:過採樣是補少數類;欠採樣是砍多數類;SMOTE 是在少數類之間合成新樣本。只看 Accuracy 很容易被不平衡資料騙。
- Gini impurity / Normalized Gini:決策樹切分時常用 Gini 衡量節點混亂程度;越低代表類別越純。Normalized Gini 常見於評估排序或分類表現的題型。
- one-sample t-test / Two-proportion Z-test / Chi-square / ANOVA:平均數跟某標準比用 one-sample t-test;兩個比例比用 Two-proportion Z-test;類別關聯用卡方;三組以上平均數比較用 ANOVA。
- LOOCV / Stratified K-Fold:LOOCV 每次留一筆當驗證,資料少但很耗時;Stratified K-Fold 會維持各類別比例,適合正負樣本差很多的分類題。
- K-Means / GMM / Hierarchical / DBSCAN:K-Means 要先給 K;GMM 是軟分群;Hierarchical 會形成樹狀階層;DBSCAN 靠 Epsilon 與 MinPts 找密度群,高維資料常因距離失真而難設 Epsilon。
- Association Rule:Support 看規則出現多常;Confidence 看買 A 後買 B 的比例;Lift 看 A 對 B 是否真的有提升,不只是 B 本來就常見。
- Pearson / Correlation Matrix:Pearson 看兩個數值欄位的線性相關;Correlation Matrix 把多欄位兩兩相關一次攤開,常搭配 heatmap 判讀。
- Quantile Regression / Tail Quantiles / Approximate Quantile:Quantile Regression 不只預測平均,也能看中位數或高分位;資料很大時用 Approximate Quantile 近似估分位數。
補少數看 Oversampling / SMOTE、砍多數看 Undersampling;樹切分看 Gini;比平均、比例、類別關聯要選對檢定;分類不平衡交叉驗證優先用 Stratified K-Fold。點圖可放大。
分群四法比較、關聯規則三大指標、Pearson 與相關矩陣、分位數回歸與尾端分位。點圖可放大。
混淆矩陣速查
| 預測 = 正 | 預測 = 負 |
| 實際 = 正 | TP (True Positive 真陽性) — 正確抓到 | FN (False Negative 偽陰性,漏報 / 漏檢) — Recall 關注 |
| 實際 = 負 | FP (False Positive 偽陽性,誤報) — Precision 關注 | TN (True Negative 真陰性) — 正確排除 |
分類公式速查
| 指標 | 公式 | 白話看法 |
| Accuracy 準確率 | (TP+TN)/(TP+TN+FP+FN) | 全部案例中,模型判對的比例。 |
| Precision 精準率 | TP/(TP+FP) | 模型說正類的人裡,有多少真的正確;怕誤報時重點看它。 |
| Recall 召回率 / Sensitivity 敏感度 | TP/(TP+FN) | 真正正類的人裡,有多少被抓到;怕漏報時重點看它。 |
| Specificity 特異度 | TN/(TN+FP) | 真正負類的人裡,有多少被正確排除。 |
| F1 Score | 2*P*R/(P+R) | Precision 與 Recall 的平衡分數,任一邊太低都會被拉低。 |
| FPR 偽陽性率 | FP/(FP+TN) | 真正負類卻被誤報成正類的比例;越低越少誤報。 |
| FNR 偽陰性率 | FN/(FN+TP) | 真正正類卻被漏掉的比例;越低越少漏報。 |
| NPV 陰性預測值 | TN/(TN+FN) | 模型說負類的案例裡,有多少真的負類。 |
P = Precision,R = Recall。Precision 看「模型判正的結果準不準」;Recall 看「真正正類有沒有被抓到」。
易錯點:① 不平衡資料只看 Accuracy 會被多數類欺騙;② F1 預設 Precision 與 Recall 同等重要,若不對稱可用 Fβ;③ ROC-AUC 在嚴重不平衡時會「看起來很好」,PR-AUC 才會誠實反映少數類;④ 交叉驗證時,標準化、SMOTE 等預處理需在每個 fold 內重做,不能對全資料先做(資料洩漏)。
🔒 1. AI 類型與基本定義完整版開放
🔒 2. 機器學習三大範式完整版開放
🔒 3. 深度學習與神經網路架構完整版開放
🔒 4. 資料處理與特徵工程完整版開放
🔒 6. 模型優化與正則化完整版開放
🔒 7. 電腦視覺 & 自然語言處理完整版開放
🔒 8. AI 倫理、治理與法規完整版開放
🔒 9. 分析層次與 AI 專案管理完整版開放
🔒 10. EDA 核心圖表與 NLP 基礎完整版開放
🔒 科目二 生成式 AI 共 8 個主題,購買後開放。
🔒 1. 生成式 AI 基礎完整版開放
🔒 2. 大型語言模型 (LLM)完整版開放
🔒 3. 提示工程 Prompt Engineering完整版開放
🔒 4. RAG 檢索增強生成完整版開放
🔒 5. Fine-tuning 與 PEFT完整版開放
🔒 6. AI Agent 與多模態應用完整版開放
🔒 7. AI 應用規劃與 MLOps完整版開放
🔒 8. GenAI 風險、合規與治理完整版開放