科目二:大數據處理分析與應用iPAS AI應用規劃師(中級)白話學習指引
🔍 試看版

📖 這份指引怎麼用 (試看版:只開放「5.2 常見的大數據分析方法」這一節)

這一頁是把官方 182 頁的《科目二:大數據處理分析與應用》學習指引,整份重新用白話改寫的版本。章節編號與官方一致(第3~6章),方便對照原文。

  • 🔑 每一節開頭都有「先搞懂這幾件事」:預備知識先花一分鐘看完,正文就不會卡住。
  • 看到 這種小按鈕 都可以點:專有名詞都做成名詞小卡,每張卡用一個生活例子講給你懂。之後同一個名詞再出現時,會變成淡淡的虛線底線——一樣點得開。
  • 🎮 每一節都有「玩玩看」小實驗:拉桿與按鈕把抽象概念玩成直覺,強烈建議動手玩過再往下讀。
  • 📐 數學小教室、🧮 實際算一次:統計公式先用最基礎的方式帶一次、再用真實數字算給你看。
  • ✏️ 每章結尾有官方練習題:點選項立刻對答案、看白話解析。

🎯 科目二到底考什麼

官方把科目二切成四大主題,就是本頁的四章:

主題代號主題白話說明對應章節
L221機率統計基礎敘述統計、機率分佈、假設檢定——資料分析的數學底子第3章
L222大數據處理技術資料怎麼收、怎麼洗、怎麼存、用什麼工具算第4章
L223大數據分析方法與工具統計在大數據的限制、時序/網路/文字/空間分析、視覺化第5章
L224大數據在人工智慧之應用大數據×機器學習、鑑別式/生成式 AI 的資料課題、隱私合規第6章

※ 本頁是學習輔助整理,實際評鑑範圍以 iPAS 官方簡章與學習指引為準。

第5章

大數據分析方法與工具

第3章的統計是「教科書世界」;這章講統計掉進大數據的真實世界會發生什麼事——樣本不隨機、p 值失靈、算不動——以及對應的近似統計、時序/網路/文字/地理/異常五大分析武器與視覺化。

🔒 5.1 統計學在大數據中的應用名詞卡 23・玩玩看 2・完整版開放

5.2 常見的大數據分析方法五大武器庫

🔑 讀這節前,先搞懂這幾件事
  • 大數據分析四特性:可擴展(TB 級照吃)、異質(什麼型態都收)、即時(串流回饋)、近似(容許小誤差換速度)。
  • 近似」是本節靈魂:資料太大算不了精確值時,用聰明演算法算出「夠準又超快」的估計——考試愛考哪個演算法配哪個任務。
  • 五種資料長相對應五種方法:時間順序→時序分析、人際關聯→網路分析、評論文章→文字分析、有經緯度→地理分析、抓壞蛋→異常偵測。

1️⃣ 近似統計:算得快,比算得準更重要

資料塞不進記憶體時,與其硬算精確值,不如在可容忍誤差內快速算出代表性統計量。四個必背演算法:

技術做什麼殺手級應用
t-digest高效估算中位數與任意分位數(95th/99th percentile),支援串流增量更新、多機合併,對偏態分佈特別穩電商百萬筆訂單快速估中位數消費額;網路監控算 99th percentile 流量抓 DDoS
Histogram Sketch快速建近似直方圖,看資料形狀(偏態、峰度)社群用戶活躍度分佈速寫;感測器品質變異初探
Count-Min Sketch用超省記憶體的結構估項目出現頻率(熱門排行)電商熱門商品點擊排行;抓高頻訪問 IP(潛在攻擊)
Welford 線上演算法逐筆更新平均與變異數,不用存歷史資料IoT 感測器即時均值/變異監控;金融交易金額即時波動偵測
🧮 實際感受一下:為什麼要「近似」

要算 10 億筆訂單的中位數,精確做法得把 10 億個數字全部排序——記憶體爆炸。t-digest 只維護幾百個「重心點」摘要,一邊串流一邊更新,算出的中位數誤差通常在 0.1% 內。拿 0.1% 誤差換一萬倍速度,這筆交易很划算——這就是大數據的思維轉換。

平台內建的近似統計

Apache SparkapproxQuantile()(基於 t-digest 估分位數)與 summary()(免載入全量出描述統計);Google BigQuery 的 APPROX_QUANTILES()APPROX_COUNT_DISTINCT();PostgreSQL 加 tdigest 擴充套件直接在資料庫內算分位數——資料不用搬出來。

2️⃣ 時序分析:從趨勢到預測

層級方法白話
趨勢與平滑移動平均固定窗口取平均抹掉短期毛刺(過去 7 天平均銷售額看長期方向)
指數平滑越近的資料權重越高——對新變化反應快,適合短期預測
統計建模ARIMA自迴歸(AR)+差分(I)+移動平均(MA)三合一,吃線性趨勢的穩定序列(月銷售額)
SARIMAARIMA 加掛季節性分量——月用電量、季度零售這種有週期的資料
進階預測ProphetMeta 開源:自動處理節慶效應、缺失值、趨勢突變,介面簡單好部署
LSTMTransformer深度學習抓長期依賴與非線性模式(股價、感測器);代價是算力與訓練成本高

工具:Spark+MLlib(分散式時序+建模)、TimescaleDB(PostgreSQL 時序擴充,資料庫層直接分析)、Meta Prophet/Kats(統一介面含變化點偵測)。應用:金融預測、用電高峰預測、產能瓶頸預警、雙 11 流量預估。

🎮 玩玩看:移動平均平滑器
一年份毛毛躁躁的日銷售額(灰線)。拉大移動平均窗口,看 teal 線怎麼把雜訊燙平、露出長期趨勢——但窗口太大也會把真實轉折抹掉。

3️⃣ 網路(圖)分析:關係裡藏金礦

社群互動、顧客×商品、網頁連結——這些資料的價值在「關聯」。節點=個體(用戶/商品/網頁)、=關係(朋友/購買/超連結);圖還分有向(A 追蹤 B ≠ B 追蹤 A)、加權(互動頻率)、動態(隨時間變)。

任務演算法白話
中心性分析
(誰最重要)
Degree數直接連接數——粉絲數最多的人
Betweenness誰最常當「橋樑」——資訊必經的中間人
Closeness到所有人的平均距離最短——消息傳得最快的位置
PageRankGoogle 網頁排序祖師爺:被重要節點連到的節點更重要——意見領袖偵測
社群偵測
(自然分群)
Louvain最大化模組度快速分群,大規模資料首選
Label Propagation標籤傳染式分群,計算效率高
鏈結預測共同鄰居/Jaccard/圖神經網路 GNN預測「未來可能出現的關係」——好友推薦、你可能喜歡的商品

工具:Spark GraphX/GraphFrames(億級節點分散式圖計算)、Neo4j(圖資料庫+Cypher 查詢)、NetworkX/iGraph(Python 中小規模原型)、Gephi(視覺化探索)。應用:意見領袖辨識、商品推薦、高價值客戶網絡、詐欺偵測(可疑交易路徑與異常關聯群)。

4️⃣ 文字分析:把評論變成數字

(a) 預處理:先把文字洗乾淨

斷詞(「我愛這款手機」→我/愛/這款/手機)→ 去標點 → 轉小寫 → 停用詞過濾(丟掉「的」「是」)→ 詞形還原(running/ran/runs→run,考慮詞性語義)vs 詞幹提取(硬截字尾取詞幹,不管詞性)——兩者差異是考點。

(b) 特徵轉換:文字 → 數值

層級方法白話
傳統TF/TF-IDFTF=詞在這篇出現多頻繁;IDF=這詞在全部文件中多稀有。相乘=突出這篇的關鍵詞、壓低到處都有的常見詞
詞嵌入Word2VecGloVeFastText把詞變向量,語意相近的詞向量也接近(「手機」≈「平板」);FastText 看子詞、抗拼寫錯誤
深度語意BERT、RoBERTaTransformer 抓上下文語意(同個「蘋果」在水果句和手機句向量不同),適合情感分析等複雜任務

(c) 任務與工具

分類(情感分析正/負向、主題分類)、分群(LDA 主題模型從評論挖出「價格」「品質」主題)、資訊擷取(命名實體辨識 NER 抓人名/地名/品牌、關鍵字抽取)。工具:Spark NLP(大規模)、spaCy(輕量高效)、Hugging Face Transformers(預訓練模型+微調)、Gensim(Word2Vec/LDA 經典款)。應用:顧客評論正負分類、輿情監控品牌聲量、客服對話自動分流。

🎮 玩玩看:TF-IDF 計算機
三篇迷你評論。點一個詞,實際算給你看:TF(在該篇的頻率)× IDF(全庫稀有度)=重要性。看「手機」這種到處出現的詞怎麼被 IDF 打趴,而「當機」怎麼脫穎而出。
📄 文件1「手機 螢幕 漂亮 手機 輕」 📄 文件2「手機 常常 當機 當機 氣死」 📄 文件3「手機 電池 持久 出遊 安心」
點一個詞開始計算。

5️⃣ 地理空間分析:在哪裡發生,很重要

地理空間資料分三型:(GPS 座標、商店位置)、(道路、管線)、(行政區、土地使用區)。兩大特殊性質讓傳統統計失效:空間異質性(不同區域行為模式不同,單一模型套不住→要用地理加權迴歸 GWR 為每個地點建專屬模型)與空間自相關(鄰近商店銷售互相影響,違反獨立性假設)。

方法做什麼
熱點分析KDE 核密度估計畫平滑熱圖;Getis-Ord Gi* 檢測統計顯著的熱點/冷點(高犯罪區、熱銷區)
空間群聚K-means 含座標(均勻分群);DBSCAN(密度導向,吃不均勻分佈)
GWR每個地點一套迴歸係數——解釋「同個變數在不同區域影響力不同」
空間插值用已知點(測站氣溫)推未知點數值,生成連續分佈圖

工具:GeoPandas(Python 中小規模)、ArcGIS/QGIS(圖形化平台)、Apache Sedona(Spark 分散式地理分析,億級資料)、PostGIS(PostgreSQL 空間擴充:距離、相交、空間索引)。應用:商業選址、物流路線優化、空品/災害監控、智慧城市人流規劃。

6️⃣ 異常偵測:從億萬筆中抓出那 0.1%

四大挑戰:資料極度不平衡(詐欺僅 0.1%,模型容易只學會「正常」)、即時性(信用卡詐欺要毫秒級回應)、多型態(數值/文字/圖像/時序都可能藏異常)、可解釋性(要能說出「為何這筆被標記」)。

路線方法白話
統計法Z-score/IQR 閾值、移動視窗指標偏離均值超過 3 個標準差(或 1.5 倍 IQR)就標記;時序用滑動視窗抓突增
密度/距離法LOF、KNN 距離分數LOF:跟鄰居比密度,「住在冷清區的點」是異常;KNN:離最近 k 個鄰居平均太遠者異常
樹模型Isolation Forest、Random Cut Forest隨機亂切資料——異常點因為「特立獨行」,幾刀就被單獨隔離出來;RCF 是 Amazon 的串流強化版

工具:PyOD(Python 異常偵測演算法全家桶)、Spark MLlib(分散式+串流)、Elasticsearch ML(日誌即時監測)、SageMaker/Azure ML(雲端部署)。應用:金融詐欺、設備故障預警(異常振動/耗電)、資安流量監控、客戶流失突增偵測。

🎮 玩玩看:異常偵測門檻實驗
200 筆交易金額,混入 4 筆詐欺(紅點)。拉動 Z-score 門檻:門檻低→抓好抓滿但誤傷一堆正常交易(誤報);門檻高→清淨但漏掉詐欺(漏報)。感受靈敏度與誤報的拔河。
🔒 5.3 數據可視化工具名詞卡 7・玩玩看 1・完整版開放
✏️ 第5章 練習評量(官方 10 題)(試看 3 題)
點選你認為的答案,立刻對答案+看白話解析。
1. 在大數據的描述性分析中,最常用來呈現類別變數分佈的圖形是?
答案(C)長條圖

類別(商品、地區、選項)比大小→長條圖。折線管時間趨勢、箱型管數值分佈、散佈管兩變數關聯——口訣背起來這題送分。

2. 若要分析網站每日訪客數量的趨勢變化,最適合使用下列哪一種視覺化工具?
答案(B)折線圖

「每日」「趨勢變化」=時間序列→折線圖。直方圖是看「分佈形狀」不是看「隨時間變化」——這兩個最容易搞混。

3. 在大數據中進行關聯分析時,最常用來量化兩變數線性關係的指標為何?
答案(C)相關係數

「兩變數」「線性關係」→皮爾森相關係數(−1 到 1)。變異數量一個變數自己的離散度、z 分數量單點偏離程度、t 值是檢定統計量。

🔒 本組其餘 7 題與其他章節的練習題完整版開放

中級科目二 大數據處理分析與應用全貌試看版只開放「5.2 常見的大數據分析方法」;其餘購買後開放

第3章 機率統計基礎

🔒 3.1 敘述性統計與資料摘要名詞卡 14・玩玩看 2・完整版開放
🔒 3.2 機率分佈與資料分佈模型名詞卡 12・玩玩看 2・完整版開放
🔒 3.3 假設檢定與統計推論名詞卡 16・玩玩看 2・完整版開放

第4章 大數據處理技術

🔒 4.1 數據收集與清理名詞卡 14・玩玩看 1・完整版開放
🔒 4.2 數據儲存與管理名詞卡 15・玩玩看 2・完整版開放
🔒 4.3 數據處理技術與工具名詞卡 20・玩玩看 2・完整版開放

第5章 大數據分析方法與工具

🔒 5.1 統計學在大數據中的應用名詞卡 23・玩玩看 2・完整版開放
📖 5.2 常見的大數據分析方法你正在看這一節
🔒 5.3 數據可視化工具名詞卡 7・玩玩看 1・完整版開放

第6章 大數據在人工智慧之應用

🔒 6.1 大數據與機器學習名詞卡 33・玩玩看 1・完整版開放
🔒 6.2 大數據在鑑別式 AI 中的應用名詞卡 8・玩玩看 1・完整版開放
🔒 6.3 大數據在生成式 AI 中的應用名詞卡 3・玩玩看 1・完整版開放
🔒 6.4 大數據隱私保護、安全與合規名詞卡 17・玩玩看 1・完整版開放
🔒 ✏️ 官方練習題(4 組)點選即對答案+白話解析

這只是中級科目二 大數據處理分析與應用白話指引 13 節中的 1 節

你剛看到的名詞小卡、玩玩看、官方練習題互動化,五科白話指引每一節都是這樣做的。完整版還有:

名詞小卡