監督式、非監督式、強化學習差在哪?三大典範一次看懂
監督式學習、非監督式學習、強化學習是機器學習的三大典範,也是 iPAS AI 應用規劃師考試的核心考點。本文用白話定義加具體例子,搭配三者對照表、決策流程圖、應用場景分布圖,讓你一篇搞懂三種學習典範的差異、適用時機與代表演算法,考試實務兩用。
機器學習有成千上萬的演算法,但絕大多數都可以歸類到三種學習典範之一:監督式學習(Supervised Learning)、非監督式學習(Unsupervised Learning) 和 強化學習(Reinforcement Learning)。
這三者的根本差異不在演算法本身,而在於「資料的形式」和「系統學習的方式」。搞懂這個,你就能快速判斷任何 AI 應用屬於哪種典範,也能在面試或考試中對答如流。
想了解這些技術在 AI 發展脈絡中的位置,可以參考 機器學習、深度學習、生成式 AI 差在哪?。
監督式學習:有標準答案的學習
定義
訓練資料中每筆輸入(X)都有對應的正確標籤(y),模型學習「輸入→輸出」的映射關係。就像老師批改作業——每道題都有標準答案,模型靠對照答案來修正自己。
典型例子
- 垃圾郵件分類:每封信標記「垃圾/正常」,模型學會分辨
- 房價預測:每筆資料有房屋特徵和實際售價,模型學習預測
- 醫療影像診斷:每張 X 光片標注「正常/異常」,模型學習判讀
代表演算法
線性回歸、邏輯回歸、決策樹、隨機森林、支援向量機(SVM)、神經網路
非監督式學習:沒有標準答案的探索
定義
訓練資料只有輸入(X),沒有標籤。模型自己找出資料的結構、模式或分組。就像你丟給系統一堆購物紀錄,讓它自己發現「這些人有類似的購買習慣」。
典型例子
- 客群分群(Clustering):電商把顧客分成「重度用戶/季節性用戶/流失風險用戶」
- 降維(Dimensionality Reduction):把高維度的使用者行為壓縮成 2D 圖,便於視覺化
- 異常偵測(Anomaly Detection):找出信用卡交易中的異常模式
代表演算法
K-Means、DBSCAN、階層式聚類、主成分分析(PCA)、自動編碼器(Autoencoder)
強化學習:在環境互動中學習
定義
沒有預先標記的訓練資料。代理(Agent) 在環境中採取行動,根據環境給出的獎勵(Reward) 或懲罰來調整策略,目標是最大化長期累積獎勵。就像訓練一隻狗——做對了給零食,做錯了不給,狗自己摸索什麼行為有回報。
典型例子
- 棋局 AI:AlphaGo 透過數百萬局自我對弈學習圍棋策略
- 機器人控制:機器手臂透過反覆嘗試學習抓取物件
- 推薦系統:動態調整推薦策略,最大化使用者點擊或停留時間
代表演算法
Q-Learning、Deep Q-Network(DQN)、Proximal Policy Optimization(PPO)、Actor-Critic
三大典範對照表
| 維度 | 監督式學習 | 非監督式學習 | 強化學習 |
|---|---|---|---|
| 資料標註 | 需要(X + y) | 不需要(只有 X) | 不需要(靠獎勵訊號) |
| 學習目標 | 學習輸入→輸出映射 | 發現資料內在結構 | 最大化累積獎勵 |
| 典型任務 | 分類、回歸 | 分群、降維、異常偵測 | 序列決策、控制 |
| 資料需求 | 大量標注資料 | 大量未標注資料 | 環境互動次數 |
| 評估方式 | 準確率、F1、RMSE | 輪廓係數、Elbow 法 | 累積獎勵值 |
| 代表算法 | 隨機森林、SVM | K-Means、PCA | DQN、PPO |
應用場景分布
注意:上圖為教學概念示意,旨在說明各典範在不同場景的相對重要性,數字並非來自特定產業調查統計。實際應用中,多數系統會同時結合多種學習典範。
注意:上圖為教學概念示意,反映監督式學習因標注資料豐富而在商業應用中佔大宗的一般認知,並非特定市場研究的統計數據。
決策樹:我該用哪種學習典範?
半監督學習與自監督學習:補充概念
考試有時也會出現這兩個延伸概念:
-
半監督學習(Semi-supervised Learning):大部分資料沒有標籤,少量資料有標籤。模型先從有標籤資料學習,再利用無標籤資料的結構改善性能。適合標注成本高的場景(如醫療影像)。
-
自監督學習(Self-supervised Learning):從未標注資料中自動產生監督訊號。GPT 系列的預訓練方式就是自監督學習——預測下一個詞,不需要人工標注。
考試重點速查
| 考點 | 關鍵詞 |
|---|---|
| 監督式學習識別 | 有標籤、分類、回歸、訓練集+測試集 |
| 非監督式學習識別 | 無標籤、分群、降維、異常偵測 |
| 強化學習識別 | 代理、環境、獎勵、策略(Policy) |
| 半監督 | 少量標注 + 大量未標注 |
| 自監督 | 大型語言模型預訓練、BERT、GPT |
三種學習典範是 AI 應用規劃師考試必考的基礎概念,也是後續理解深度學習與生成式 AI 的重要基礎。準備好了嗎?免費開始 使用 CertFlow,用間隔重複法鞏固這些觀念,讓知識真正留在腦子裡。
參考來源
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer. (監督式與非監督式學習標準教科書)
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press. https://incompleteideas.net/book/the-book-2nd.html(強化學習權威教材)
- Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529, 484–489.(AlphaGo 原始論文)
應用場景分布圖及產業佔比圓餅圖均為教學概念示意,非特定統計報告數據。