iPAS AI 應用規劃師 重點整理
初級iPAS AI 應用規劃師

人工智慧基礎概論 重點整理

先免費試做 5 題

核心概念

「人工智慧基礎概論」是 iPAS「AI 應用規劃師」初級科目一,目的在於幫助考生掌握 AI 的基礎知識,奠定未來應用與規劃的堅實基石。依官方學習指引,人工智慧(Artificial Intelligence, AI)是一種旨在模擬人類智慧的技術,使機器能執行原本需要人類智慧才能完成的任務,如學習、推理、解決問題、感知環境等;近十年因軟硬體進步、計算能力提升、開放資料普及,加上演算法與機器學習精進,發展突飛猛進。

本科目由四個評鑑主題環環相扣:先以人工智慧概念建立定義、分類與治理視角;再透過資料處理與分析概念理解 AI 的「燃料」——資料如何蒐集、清洗、轉換與分析;接著以機器學習概念理解 AI 如何「學」,涵蓋監督式、非監督式、強化學習與訓練流程;最後在鑑別式 AI 與生成式 AI 概念中,分辨「分析判斷」與「創造生成」兩大技術方向並理解其整合應用。下圖為本科目的學習地圖:

人工智慧概念

AI 的定義與分類

定義。 依學習指引,人工智慧(Artificial Intelligence, AI)是一種旨在模擬人類智慧的技術,使機器能執行原本需要人類智慧才能完成的任務,如學習、推理、解決問題、感知環境等。AI 並非單一技術,而是由機器學習、專家系統、演算法等多種技術碎片共同組成的廣泛領域。

分類(依功能)。 學習指引依「功能」將 AI 分為三類:

類型核心目的學習指引舉例
分析型 AI洞悉數據模式,分析處理大量數據以提供有價值見解數據洞察
預測型 AI基於歷史資料預測未來趨勢與行為市場預測、風險評估
生成型 AI依使用者輸入的提示詞(prompt)生成各類素材文字、語音、圖像、影片

AI 能力類型雷達(弱AI/強AI/超AI,示意)。 下圖以雷達圖比較三種 AI 能力層級在各維度上的理論範圍——目前主流系統均屬「弱 AI(Narrow AI)」,強 AI 與超 AI 尚屬研究目標:

原理/運作(多層次架構)。 AI 的實現依賴多層次架構:技術底層(資料處理與分析、演算法、機器學習、深度學習、專家系統)提供計算能力、數據與核心演算法;開發應用將基礎技術轉化為模型設計、訓練、測試與部署;實際運用則落地為行業解決方案(智慧醫療、智慧物流、智慧製造)、產品與服務(語音助理、推薦演算法)與業務流程優化。

具體例子。 學習指引列舉醫療保健(疾病診斷、藥物研發、個人化醫療)、金融(風險評估、欺詐檢測、自動交易)、製造業(自動化生產、品質控制、預測性維護)、交通(自動駕駛、交通流量預測)、娛樂(遊戲開發、虛擬現實、內容推薦)等領域。

常見陷阱。 別誤以為「AI 僅限於深度學習」;AI 涵蓋機器學習、專家系統、演算法等多種技術。也別以為 AI 只能在學術研究使用——它已廣泛應用於金融、醫療、製造等領域。

常考點:分析型/預測型/生成型 AI、多層次架構、AI 涵蓋多種技術非僅深度學習

AI 治理概念

定義。 AI 治理關注 AI 系統在發展與應用過程中的透明性、責任與規範,確保技術被妥善、可信地使用。學習指引特別強調透明性(Transparency):為提升 AI 系統的透明性,應規劃透過發布報告、技術文件或網站,揭露 AI 系統於各決策環節的相關資訊。

原理/運作。 提升透明性的適當做法是「定期或不定期發布 AI 系統各決策環節的決策流程」,而非將資訊保密或僅對內部員工說明。透明的資訊揭露能讓外部利害關係人理解 AI 如何運作與決策,是治理的核心手段。

國際合作的重要性。 學習指引指出,AI 治理中國際合作具多重重要性:

具體例子。 透明性的落實如:對外揭露 AI 系統的技術文件與決策報告;國際合作的落實如:各國協調制定共通標準、跨國監管以降低倫理與安全風險、推動技術轉移以縮小數位落差。

常見陷阱。 透明性「不等於」把所有資訊保密,也不是只對內部員工說明;正確做法是規劃對外揭露相關資訊。國際合作的價值是「統一標準、避免濫用、促進轉移」三者兼具,而非單選其一。

常考點:透明性=對外揭露決策資訊、國際合作三大價值、避免技術濫用

資料處理與分析概念

資料基本概念與來源

定義。 在 AI 領域,資料是模型學習的基石,AI 模型的訓練與應用高度依賴大量、高品質的資料。資料蒐集(Data Collection)是資料處理與分析的起點,旨在從廣泛來源取得可用資料。

資料結構類型。 學習指引依結構將資料分為三類:

類型特性儲存形式與範例
結構化數據清晰且固定結構,行列形式關聯式資料庫(MySQL、PostgreSQL)、規範化電子表格
半結構化數據具結構標籤但格式靈活,無需嚴格固定架構XML、JSON、CSV
非結構化數據無固定結構,需處理解析後才能分析圖片、影像、音訊、文字(電子郵件、文章)

資料型態佔比(示意)。 下圖以圓餅圖說明現實世界中三種資料型態的大致組成比例——非結構化資料佔多數,正是 AI 模型訓練的主要挑戰來源:

常見蒐集方法。 學習指引列出:問卷與調查(直接從目標受眾蒐集第一手數據,用於市場研究、用戶回饋)、自有產品數據(網站、App、智慧手錶、汽車等與用戶互動產生的數據)、外部公開數據蒐集(政府資料開放平臺 API、網路爬蟲擷取公開數據)、外部付費數據購買(向第三方數據提供商購買專業數據集)、網路爬蟲(Web Scraping)(抓取商品價格、使用者評論、新聞文章等公開數據)。

具體例子。 想分析商品市場時,可串接政府開放平臺 API 取得統計數據,並以網路爬蟲蒐集電商的價格與評論(半/非結構化),再搭配自家 App 的用戶行為數據(結構化)綜合分析。

常見陷阱。 別把 JSON、CSV 當成「結構化數據」——它們屬於半結構化;真正的結構化數據以行列形式存於關聯式資料庫。圖片、音訊、自由文本則是非結構化,需先處理才能分析。

常考點:結構化/半結構化/非結構化、JSON/XML/CSV 屬半結構化、五種蒐集方法

資料整理與分析流程

定義。 資料處理與分析是 AI 專案的基礎階段,旨在將原始數據轉化為高品質且適合分析的格式。流程依序為:數據蒐集 → 數據清洗 → 數據轉換 → 數據分析,目標是確保數據的品質、一致性與可用性。

數據清洗。 處理四類問題:遺缺值(以平均值/中位數/眾數或插補法、預測模型填補,或刪除記錄)、重複值(以主鍵或唯一識別碼識別後刪除多餘項)、錯誤值(如年齡為 -5、Taiwan 拼成 Taiwwn,需檢測修正)、離群值(遠離多數數據的異常值,可能有意義也可能是雜訊,需依業務目標決定策略)。

數據轉換。 包含格式轉換(CSV→JSON)、類型轉換(字串→數值)、正規化/標準化(縮放至如 [0,1] 以消除單位影響)、離散化(如年齡分為青年/中年/老年)、縮減(以特徵選擇或 PCA 降維)。

數據分析四類方法。 依分析目的分為四種,是高頻考點:

分析類型回答的問題常用工具/方法
敘述性分析數據長什麼樣子平均值、中位數、標準差、百分位數;直方圖、散佈圖、折線圖
探索性分析有哪些模式與關聯散佈圖矩陣、熱圖、相關性分析、聚類、PCA、異常檢測
診斷性分析為什麼發生鑽取分析、關聯分析(Apriori)、因果分析(A/B 測試)
預測性分析未來會如何迴歸、分類、時間序列(ARIMA、LSTM)、集成學習

具體例子。 銷售下降時,先用敘述性分析看整體分佈,再用診斷性分析中的「鑽取分析」逐層拆解地區、品類、時段,鎖定問題來源;而「啤酒與尿布」的購物籃關聯即關聯分析的經典案例。

常見陷阱。 別把「資料分布估計」用錯圖——直方圖、散佈圖、四分位數都適合,但雷達圖不適合呈現機率密度(它用於多維度個體比較)。也別混淆相關性與因果性,因果分析才能驗證真正影響。

常考點:清洗四問題、正規化目的、敘述/探索/診斷/預測四分析、雷達圖不宜估計分布

資料隱私與安全

定義。 在 AI 與機器學習中,資料是模型學習的基石,而從海量資料中萃取有價值資訊須仰賴統計學作為「分析資料、驗證模型的指南針」。本能力指標聚焦統計測量數、機率模型與假設檢定,是確保資料可信、推論可靠的基礎。

統計測量數。 大致分三類:中央趨勢(平均數 Mean、中位數 Median、眾數 Mode)與分散度(四分位數、全距 Range、四分位距 IQR、平均差、標準差)及其他測量數。

測量數特性是否受極端值影響
平均數(Mean)資料的「重心」,計算簡單易受影響
中位數(Median)排序後正中間值,反映典型水平不受影響
眾數(Mode)出現頻率最高值;可能多個或不存在不受影響
標準差(SD)衡量分散程度;越大越不穩定受影響
四分位距(IQR)Q3 − Q1,代表中間 50% 範圍不易受影響

機率模型與假設檢定。 從母體抽樣會產生抽樣變異,需引入機率模型量化不確定性並進行區間估計與假設檢定。假設檢定流程為「猜想 → 蒐集資料 → 檢定 → 作決策」,核心名詞包含虛無假設 H0H_0、對立假設 HaH_a、顯著水準 α\alpha(常取 0.1、0.05、0.01)與 p 值。判斷準則為:

若 p-value<α拒絕 H0\text{若 } p\text{-value} < \alpha \Rightarrow \text{拒絕 } H_0

具體例子。 學習指引案例:當 p 值為 0.03、α=0.05\alpha = 0.05,因 0.03<0.050.03 < 0.05 故拒絕虛無假設,代表我們有 95% 的信心認為觀察到的結果並非偶然。又如品質管理中標準差顯著偏大,意味生產過程波動大、產品品質不穩定。

常見陷阱。 房價含少數豪宅極端值時,用中位數比平均數更能反映典型水平。型一錯誤(α)是「H₀ 為真卻拒絕」;IQR 是 Q3−Q1、不易受極端值影響。偏態判讀:平均數 > 中位數為正偏態,平均數 < 中位數為負偏態

常考點:中位數抗極端值、p 值與 α 比較、型一錯誤、正/負偏態判讀、IQR 定義

機器學習概念

機器學習基本原理

定義。 機器學習(Machine Learning)是 AI 的核心支柱,是一種基於數據驅動的方法,讓計算機系統從經驗(數據)中學習並執行特定任務,無需依賴人為編寫的規則。一般而言,資料量愈大且經過完整處理,模型效果通常愈好。

運作流程。 學習指引將機器學習步驟簡述為三步:(1)準備訓練資料:蒐集、過濾雜訊與前處理;(2)訓練模型:將資料輸入演算法並調整參數,使模型符合資料的模式或分佈;(3)測試及評估模型:評估效能並反覆訓練,若多次調校仍不佳則改用其他模型重來。

三大學習類型。 依訓練方式分為:監督式學習(以帶標記資料訓練,用於分類與迴歸,如垃圾郵件過濾、房價預測)、非監督式學習(無標記資料,自動發掘模式、分群與降維,用於市場區隔、異常偵測、推薦系統、影像壓縮)、強化學習(基於回饋機制,讓代理 Agent 透過與環境互動以最大化累積獎勵,適合試錯學習與長期規劃,如遊戲 AI、機器人控制、自動駕駛)。

三大學習範式比較雷達(示意)。 以下雷達圖從「標註需求」、「可解釋性」、「訓練資料量需求」、「適合動態互動」、「泛化能力」五個維度比較三種學習範式的相對特性(5 分最高):

訓練核心三要素與防過擬合。 機器學習三個核心要素為數據、模型、損失函數。訓練時透過優化器以梯度下降最小化損失函數;常見損失函數有迴歸用的均方誤差(MSE)與分類用的交叉熵。為防過擬合(訓練表現好、測試表現差),可用:正則化(L1/L2,於損失函數加懲罰項)、提早停止(Early Stopping)、資料增強(Data Augmentation)、增加訓練資料量與交叉驗證。

過擬合 vs 欠擬合示意(訓練誤差 vs 驗證誤差,示意)。 折線圖呈現隨模型複雜度增加,訓練誤差持續降低而驗證誤差先降後升的「過擬合」拐點:

常見陷阱。 訓練電腦下圍棋、自動駕駛等「動態重複互動」問題最適合強化學習,而非監督式或半監督式學習。降低過擬合是「增加正則化項」而非增加模型複雜度或學習率。

常考點:三步流程、監督/非監督/強化區分、三核心要素(數據/模型/損失)、強化學習用於動態互動、正則化防過擬合

常見的機器學習模型

定義。 機器學習依任務選用不同模型;監督式以迴歸與分類為主,非監督式以聚類與降維為主,強化學習以策略學習為主。學習指引並介紹深度學習三大經典模型。

監督式與非監督式代表模型。 監督式:線性迴歸(預測連續值如房價,假設輸入與輸出為線性關係,找最佳直線/超平面)、邏輯迴歸(名為迴歸實為分類,以 Sigmoid 將輸出映射到 0~1 機率,設閾值如 0.5 做二元分類)、SVM(找最大化類別間隔的超平面,可用核函數處理非線性)、KNN(找最近 K 個鄰居投票分類或取平均迴歸)、決策樹(樹形規則、可解釋性高)、隨機森林(集成多棵隨機決策樹並投票,降低過擬合)。非監督式:K-Means(K 代表欲分群的群組數量)、PCA(降維保留主要訊息)。

深度學習三大經典模型。 學習指引重點介紹:

模型擅長資料結構/原理重點應用
CNN 卷積神經網路圖像卷積層提局部特徵、池化層降維防過擬合、全連接層輸出影像辨識、物件偵測、圖像分割
RNN 循環神經網路序列/時間含循環連接可記憶前序資訊;LSTM/GRU 解梯度消失機器翻譯、語音轉文字、股價預測
GAN 生成對抗網路生成資料生成器與判別器對抗學習圖像生成、文本生成、語音合成

具體例子。 學習指引指出 K-Means 中的 K 代表「所需劃分的群組數量」,且易受雜訊與離群值影響其群集中心;隨機森林透過「集成多棵隨機決策樹並投票」改進單一決策樹的過擬合缺陷。

常見陷阱。 邏輯迴歸是分類而非迴歸演算法;K-Means 的 K 不是特徵數或樣本數,而是群組數,且不適合非球形、密度變化大或有離群值的資料。決策樹最大優勢是可解釋性高。RNN 的訓練易出現梯度消失/爆炸。

常考點:邏輯迴歸實為分類、K-Means 的 K=群組數、隨機森林集成投票、CNN/RNN/GAN 適用情境、決策樹可解釋性

鑑別式 AI 與生成式 AI 概念

鑑別式 AI 與生成式 AI 的基本原理

定義。 鑑別式 AI(Discriminative AI)與生成式 AI(Generative AI)是 AI 的兩大分支,分別代表數據分析判斷數據創造生成。鑑別式 AI 學習條件概率 P(yx)P(y|x),用於分類與迴歸;生成式 AI 學習聯合分佈 P(x,y)P(x,y) 或邊際分佈 P(x)P(x),能生成創新的新數據樣本。

原理/運作。 鑑別式 AI 專注於尋找**分類邊界(決策邊界)**以區分類別,不建構數據生成機制,在標記數據充足、目標明確時準確且高效,且具良好解釋性。生成式 AI 則模擬真實數據分佈並從中創造新樣本;其一大特性是「基於相同輸入可產生不同輸出」(內容固有變異性),使用者常透過提示工程反覆調整輸入。

典型模型對照。

面向鑑別式 AI生成式 AI
模型目標學決策邊界做分類/預測學數據內在分佈生成新數據
輸出特性分類標籤或數值預測新樣本,具創新性與變異性
代表模型邏輯迴歸、SVM、決策樹、隨機森林、神經網路GAN、VAE、擴散模型(Diffusion)
主要挑戰數據偏見、過擬合、標記成本內容真實性、可控性、計算成本

鑑別式 vs 生成式任務分布(示意)。 以下長條圖比較兩類 AI 在五大應用場景的相對適用程度(5 分=高度適用,1 分=不適用):

具體例子。 鑑別式:判斷郵件是否為垃圾郵件、用 CNN 對腫瘤分類、信用風險評估。生成式:ChatGPT 生成對話、DALL-E 創作圖像、風格轉換、Deepfake 影音合成。學習指引特別指出,VAE 由編碼器與解碼器組成、擴散模型透過「加噪再反向去噪」生成高細膩度圖像。

常見陷阱。 鑑別式 AI 學的是 P(yx)P(y|x)不適合生成新數據或無標記場景;分類醫學影像屬鑑別式而非生成式。GAN 由「生成器與鑑別器」組成(非編碼器/解碼器,那是 VAE)。SVM、邏輯迴歸、隨機森林皆為鑑別式模型。

常考點:P(y∣x) vs P(x,y)、GAN=生成器+鑑別器、生成式輸出具變異性、分類屬鑑別式

鑑別式 AI 與生成式 AI 的整合應用

定義。 隨應用場景日益複雜,兩者整合成為突破技術瓶頸的重要途徑。生成式 AI 的「數據生成」能力與鑑別式 AI 的「分類預測」能力相輔相成,可實現數據增強、模型泛化能力提升與多模態融合。

整合價值與運作。 學習指引歸納三大價值:數據增強與分析協同(生成式補足稀缺/不平衡數據,鑑別式再分類預測)、多模態數據處理(生成式負責跨模態生成轉換,鑑別式負責精確分類決策)、提升泛化能力(生成多樣樣本擴展學習邊界)。

具體例子。 學習指引案例:醫療影像——病理影像稀缺,用 GAN 生成高品質病變模擬影像供 CNN 等鑑別式模型訓練,提升腫瘤識別準確性與泛化能力;自動駕駛——生成式模擬濃霧、冰雪等複雜場景,鑑別式據以進行環境識別與路徑規劃;網路安全——生成式模擬攻擊模式,鑑別式即時分析流量識別異常;智慧客服——生成式產生回應文本,鑑別式過濾不當內容。

挑戰與解決策略。 學習指引指出三項挑戰與對策:訓練穩定性(生成式易模式崩潰/梯度消失 → 採用 Wasserstein GAN(WGAN)與自適應優化)、數據偏差與公平性(生成數據可能放大偏差 → 引入去偏演算法與強化數據審核)、整合架構設計(採分層架構+共享層即時交換資訊、動態學習框架)。

常見陷阱。 整合中生成式提供的數據增強主要解決數據稀缺或不平衡(而非過擬合或隱私問題)。解決生成式訓練不穩定的方法是採用 WGAN,而非單純加大數據集或硬體。未來關鍵方向是「開發更高效的整合框架」,而非讓兩者獨立使用。

常考點:數據增強解決稀缺/不平衡、WGAN 解訓練不穩、整合框架為未來方向、醫療影像 GAN+CNN 案例


本筆記內容依據 iPAS 官方學習指引《初級・科目一:人工智慧基礎概論》第三章(3.1 人工智慧概念、3.2 資料處理與分析概念、3.3 機器學習概念、3.4 鑑別式 AI 與生成式 AI 概念)撰寫,採用其定義、用詞、舉例與強調重點。

看懂了,接著就要練

免費開始練「人工智慧基礎概論」

註冊即可用 AI 助教、智慧複習與完整題庫,把重點整理讀到的東西真正練起來。

同證照其他重點整理