📖 這份指引怎麼用 (試看版:只開放「5.2 常見的大數據分析方法」這一節)
這一頁是把官方 182 頁的《科目二:大數據處理分析與應用》學習指引,整份重新用白話改寫的版本。章節編號與官方一致(第3~6章),方便對照原文。
- 🔑 每一節開頭都有「先搞懂這幾件事」:預備知識先花一分鐘看完,正文就不會卡住。
- 看到 這種小按鈕 都可以點:專有名詞都做成名詞小卡,每張卡用一個生活例子講給你懂。之後同一個名詞再出現時,會變成淡淡的虛線底線——一樣點得開。
- 🎮 每一節都有「玩玩看」小實驗:拉桿與按鈕把抽象概念玩成直覺,強烈建議動手玩過再往下讀。
- 📐 數學小教室、🧮 實際算一次:統計公式先用最基礎的方式帶一次、再用真實數字算給你看。
- ✏️ 每章結尾有官方練習題:點選項立刻對答案、看白話解析。
🎯 科目二到底考什麼
官方把科目二切成四大主題,就是本頁的四章:
| 主題代號 | 主題 | 白話說明 | 對應章節 |
|---|---|---|---|
| L221 | 機率統計基礎 | 敘述統計、機率分佈、假設檢定——資料分析的數學底子 | 第3章 |
| L222 | 大數據處理技術 | 資料怎麼收、怎麼洗、怎麼存、用什麼工具算 | 第4章 |
| L223 | 大數據分析方法與工具 | 統計在大數據的限制、時序/網路/文字/空間分析、視覺化 | 第5章 |
| L224 | 大數據在人工智慧之應用 | 大數據×機器學習、鑑別式/生成式 AI 的資料課題、隱私合規 | 第6章 |
※ 本頁是學習輔助整理,實際評鑑範圍以 iPAS 官方簡章與學習指引為準。
大數據分析方法與工具
第3章的統計是「教科書世界」;這章講統計掉進大數據的真實世界會發生什麼事——樣本不隨機、p 值失靈、算不動——以及對應的近似統計、時序/網路/文字/地理/異常五大分析武器與視覺化。
5.2 常見的大數據分析方法五大武器庫
- 大數據分析四特性:可擴展(TB 級照吃)、異質(什麼型態都收)、即時(串流回饋)、近似(容許小誤差換速度)。
- 「近似」是本節靈魂:資料太大算不了精確值時,用聰明演算法算出「夠準又超快」的估計——考試愛考哪個演算法配哪個任務。
- 五種資料長相對應五種方法:時間順序→時序分析、人際關聯→網路分析、評論文章→文字分析、有經緯度→地理分析、抓壞蛋→異常偵測。
1️⃣ 近似統計:算得快,比算得準更重要
資料塞不進記憶體時,與其硬算精確值,不如在可容忍誤差內快速算出代表性統計量。四個必背演算法:
| 技術 | 做什麼 | 殺手級應用 |
|---|---|---|
| t-digest | 高效估算中位數與任意分位數(95th/99th percentile),支援串流增量更新、多機合併,對偏態分佈特別穩 | 電商百萬筆訂單快速估中位數消費額;網路監控算 99th percentile 流量抓 DDoS |
| Histogram Sketch | 快速建近似直方圖,看資料形狀(偏態、峰度) | 社群用戶活躍度分佈速寫;感測器品質變異初探 |
| Count-Min Sketch | 用超省記憶體的結構估項目出現頻率(熱門排行) | 電商熱門商品點擊排行;抓高頻訪問 IP(潛在攻擊) |
| Welford 線上演算法 | 逐筆更新平均與變異數,不用存歷史資料 | IoT 感測器即時均值/變異監控;金融交易金額即時波動偵測 |
要算 10 億筆訂單的中位數,精確做法得把 10 億個數字全部排序——記憶體爆炸。t-digest 只維護幾百個「重心點」摘要,一邊串流一邊更新,算出的中位數誤差通常在 0.1% 內。拿 0.1% 誤差換一萬倍速度,這筆交易很划算——這就是大數據的思維轉換。
平台內建的近似統計
Apache Spark 的 approxQuantile()(基於 t-digest 估分位數)與 summary()(免載入全量出描述統計);Google BigQuery 的 APPROX_QUANTILES() 與 APPROX_COUNT_DISTINCT();PostgreSQL 加 tdigest 擴充套件直接在資料庫內算分位數——資料不用搬出來。
2️⃣ 時序分析:從趨勢到預測
| 層級 | 方法 | 白話 |
|---|---|---|
| 趨勢與平滑 | 移動平均 | 固定窗口取平均抹掉短期毛刺(過去 7 天平均銷售額看長期方向) |
| 指數平滑 | 越近的資料權重越高——對新變化反應快,適合短期預測 | |
| 統計建模 | ARIMA | 自迴歸(AR)+差分(I)+移動平均(MA)三合一,吃線性趨勢的穩定序列(月銷售額) |
| SARIMA | ARIMA 加掛季節性分量——月用電量、季度零售這種有週期的資料 | |
| 進階預測 | Prophet | Meta 開源:自動處理節慶效應、缺失值、趨勢突變,介面簡單好部署 |
| LSTM/Transformer | 深度學習抓長期依賴與非線性模式(股價、感測器);代價是算力與訓練成本高 |
工具:Spark+MLlib(分散式時序+建模)、TimescaleDB(PostgreSQL 時序擴充,資料庫層直接分析)、Meta Prophet/Kats(統一介面含變化點偵測)。應用:金融預測、用電高峰預測、產能瓶頸預警、雙 11 流量預估。
3️⃣ 網路(圖)分析:關係裡藏金礦
社群互動、顧客×商品、網頁連結——這些資料的價值在「關聯」。節點=個體(用戶/商品/網頁)、邊=關係(朋友/購買/超連結);圖還分有向(A 追蹤 B ≠ B 追蹤 A)、加權(互動頻率)、動態(隨時間變)。
| 任務 | 演算法 | 白話 |
|---|---|---|
| 中心性分析 (誰最重要) | Degree | 數直接連接數——粉絲數最多的人 |
| Betweenness | 誰最常當「橋樑」——資訊必經的中間人 | |
| Closeness | 到所有人的平均距離最短——消息傳得最快的位置 | |
| PageRank | Google 網頁排序祖師爺:被重要節點連到的節點更重要——意見領袖偵測 | |
| 社群偵測 (自然分群) | Louvain | 最大化模組度快速分群,大規模資料首選 |
| Label Propagation | 標籤傳染式分群,計算效率高 | |
| 鏈結預測 | 共同鄰居/Jaccard/圖神經網路 GNN | 預測「未來可能出現的關係」——好友推薦、你可能喜歡的商品 |
工具:Spark GraphX/GraphFrames(億級節點分散式圖計算)、Neo4j(圖資料庫+Cypher 查詢)、NetworkX/iGraph(Python 中小規模原型)、Gephi(視覺化探索)。應用:意見領袖辨識、商品推薦、高價值客戶網絡、詐欺偵測(可疑交易路徑與異常關聯群)。
4️⃣ 文字分析:把評論變成數字
(a) 預處理:先把文字洗乾淨
斷詞(「我愛這款手機」→我/愛/這款/手機)→ 去標點 → 轉小寫 → 停用詞過濾(丟掉「的」「是」)→ 詞形還原(running/ran/runs→run,考慮詞性語義)vs 詞幹提取(硬截字尾取詞幹,不管詞性)——兩者差異是考點。
(b) 特徵轉換:文字 → 數值
| 層級 | 方法 | 白話 |
|---|---|---|
| 傳統 | TF/TF-IDF | TF=詞在這篇出現多頻繁;IDF=這詞在全部文件中多稀有。相乘=突出這篇的關鍵詞、壓低到處都有的常見詞 |
| 詞嵌入 | Word2Vec/GloVe/FastText | 把詞變向量,語意相近的詞向量也接近(「手機」≈「平板」);FastText 看子詞、抗拼寫錯誤 |
| 深度語意 | BERT、RoBERTa | Transformer 抓上下文語意(同個「蘋果」在水果句和手機句向量不同),適合情感分析等複雜任務 |
(c) 任務與工具
分類(情感分析正/負向、主題分類)、分群(LDA 主題模型從評論挖出「價格」「品質」主題)、資訊擷取(命名實體辨識 NER 抓人名/地名/品牌、關鍵字抽取)。工具:Spark NLP(大規模)、spaCy(輕量高效)、Hugging Face Transformers(預訓練模型+微調)、Gensim(Word2Vec/LDA 經典款)。應用:顧客評論正負分類、輿情監控品牌聲量、客服對話自動分流。
5️⃣ 地理空間分析:在哪裡發生,很重要
地理空間資料分三型:點(GPS 座標、商店位置)、線(道路、管線)、面(行政區、土地使用區)。兩大特殊性質讓傳統統計失效:空間異質性(不同區域行為模式不同,單一模型套不住→要用地理加權迴歸 GWR 為每個地點建專屬模型)與空間自相關(鄰近商店銷售互相影響,違反獨立性假設)。
| 方法 | 做什麼 |
|---|---|
| 熱點分析 | KDE 核密度估計畫平滑熱圖;Getis-Ord Gi* 檢測統計顯著的熱點/冷點(高犯罪區、熱銷區) |
| 空間群聚 | K-means 含座標(均勻分群);DBSCAN(密度導向,吃不均勻分佈) |
| GWR | 每個地點一套迴歸係數——解釋「同個變數在不同區域影響力不同」 |
| 空間插值 | 用已知點(測站氣溫)推未知點數值,生成連續分佈圖 |
工具:GeoPandas(Python 中小規模)、ArcGIS/QGIS(圖形化平台)、Apache Sedona(Spark 分散式地理分析,億級資料)、PostGIS(PostgreSQL 空間擴充:距離、相交、空間索引)。應用:商業選址、物流路線優化、空品/災害監控、智慧城市人流規劃。
6️⃣ 異常偵測:從億萬筆中抓出那 0.1%
四大挑戰:資料極度不平衡(詐欺僅 0.1%,模型容易只學會「正常」)、即時性(信用卡詐欺要毫秒級回應)、多型態(數值/文字/圖像/時序都可能藏異常)、可解釋性(要能說出「為何這筆被標記」)。
| 路線 | 方法 | 白話 |
|---|---|---|
| 統計法 | Z-score/IQR 閾值、移動視窗指標 | 偏離均值超過 3 個標準差(或 1.5 倍 IQR)就標記;時序用滑動視窗抓突增 |
| 密度/距離法 | LOF、KNN 距離分數 | LOF:跟鄰居比密度,「住在冷清區的點」是異常;KNN:離最近 k 個鄰居平均太遠者異常 |
| 樹模型 | Isolation Forest、Random Cut Forest | 隨機亂切資料——異常點因為「特立獨行」,幾刀就被單獨隔離出來;RCF 是 Amazon 的串流強化版 |
工具:PyOD(Python 異常偵測演算法全家桶)、Spark MLlib(分散式+串流)、Elasticsearch ML(日誌即時監測)、SageMaker/Azure ML(雲端部署)。應用:金融詐欺、設備故障預警(異常振動/耗電)、資安流量監控、客戶流失突增偵測。
類別(商品、地區、選項)比大小→長條圖。折線管時間趨勢、箱型管數值分佈、散佈管兩變數關聯——口訣背起來這題送分。
「每日」「趨勢變化」=時間序列→折線圖。直方圖是看「分佈形狀」不是看「隨時間變化」——這兩個最容易搞混。
「兩變數」「線性關係」→皮爾森相關係數(−1 到 1)。變異數量一個變數自己的離散度、z 分數量單點偏離程度、t 值是檢定統計量。
中級科目二 大數據處理分析與應用全貌試看版只開放「5.2 常見的大數據分析方法」;其餘購買後開放
第3章 機率統計基礎
第4章 大數據處理技術
第5章 大數據分析方法與工具
第6章 大數據在人工智慧之應用
這只是中級科目二 大數據處理分析與應用白話指引 13 節中的 1 節
你剛看到的名詞小卡、玩玩看、官方練習題互動化,五科白話指引每一節都是這樣做的。完整版還有:
- 白話學習指引:初級 2 科+中級 3 科,官方 600 多頁指引整份白話改寫,名詞小卡+玩玩看+官方練習題
- 考古題全卷與 4,000 題以上變化題:逐題詳解,錯的選項也說清楚為什麼錯
- 中級程式題:逐行解析 35 題+程式題預測 20 頁完整練習(可在瀏覽器執行)
- 互動實驗室 55 座、複習筆記 2.0、官方推薦書重點整理、Python 學習中心、AI 面試官教學站
- 貓老師弱點分析:用你的錯題算出考前最該補的考點
- 考前預測與 6 份 PDF:每次考前更新;帳號永久使用、持續更新