回部落格

LLM 大型語言模型是什麼?運作原理白話解析

大型語言模型(LLM)是 ChatGPT、Gemini、Claude 等 AI 助手的核心技術。本文用白話解釋 LLM 的定義、token 機制、預測下一個字的直覺、完整訓練流程(預訓練→微調→RLHF 對齊),以及常見模型家族對照,幫助你在 iPAS AI 應用規劃師考試中建立正確的技術概念基礎。

CertFlow 團隊·

ChatGPT 能回答問題、寫程式、翻譯文章,背後靠的是什麼技術?答案是大型語言模型(Large Language Model,LLM)。這篇文章用最直覺的方式,帶你從零理解 LLM 是什麼、怎麼運作,以及它的能力極限在哪裡。

LLM 的定義

LLM 是一種以海量文字資料訓練出來的神經網路模型,擁有數十億乃至數兆個參數(Parameters)。它的核心能力是:根據前文,預測最可能出現的下一個 token

聽起來很簡單?這個看似單純的能力,在超大規模下卻湧現出(Emergent Ability)推理、摘要、翻譯、程式撰寫等幾乎所有語言任務。

Token 是什麼?

LLM 不是以「字」為單位處理文字,而是以 token

  • 英文:大約 1 個單字 ≈ 1–2 個 token("running" = 1 token)
  • 中文:大約 1–2 個字 ≈ 1 個 token
  • 程式碼:特殊符號可能各佔 1 token

你可以把 token 想成「AI 的視覺單元」——它看到的世界是一串 token,不是人類閱讀的文字。

預測下一個字的直覺

給 LLM 看「今天天氣__」,它會計算所有可能的下一個 token(晴、陰、好、熱……)的機率分佈,然後取機率最高(或加入一點隨機性)的那個,接著繼續預測再下一個……

這個過程反覆執行,就生成了一整段回應。這種方式稱為自回歸生成(Autoregressive Generation)

LLM 完整訓練流程

三個核心階段:

  1. 預訓練(Pre-training):用數兆 token 的文字讓模型學習語言規律,耗費最多算力。
  2. 指令微調(SFT, Supervised Fine-tuning):用「問題→回答」格式的資料,讓模型學會遵循指令。
  3. 對齊(Alignment, RLHF/DPO):根據人類偏好調整輸出,減少有害或不實內容。

參數量與能力的關係

參數量越大,模型通常越強——但不是線性增長,而是在特定規模出現「能力突現(Emergence)」。

主流 LLM 家族對照

以下列出主流模型家族與其定位(模型版本迭代極快,下表以「系列」為準,實際最新版本請查各官方文件):

模型家族開發商開源?定位與強項
GPT 系列OpenAI否(雲端 API)綜合能力、多模態、視覺推理
Claude 系列Anthropic否(雲端 API)複雜推理、長上下文、安全對齊
Gemini 系列Google DeepMind否(雲端 API)多模態、多語言、搜尋整合
Llama 系列Meta是(開放權重)可自行部署、超長上下文、多模態
Mistral 系列Mistral AI部分開放輕量高效、企業邊緣部署
Qwen 系列Alibaba是(Apache 2.0)中文能力強、多語言支援

各家模型在不同任務的定性能力比較

圖表為教學概念示意,數值並非來自公開 benchmark 實測結果。各模型能力隨版本迭代持續變化,請參考 Vellum AI LLM Leaderboard 等動態評測平台取得最新比較。

LLM 的兩大根本限制

1. 幻覺(Hallucination)

LLM 不是在「查資料」,而是在「生成最可能的文字」。當它不確定時,可能用聽起來合理的內容填補,導致一本正經地說錯話

解法:搭配 RAG(檢索增強生成),讓模型有根據地回答,詳見 什麼是 RAG?

2. 知識截止日(Knowledge Cutoff)

模型訓練完後,知識就「凍結」了。它不知道訓練後發生的事情,除非透過工具呼叫(Tool Calling)或外部資料庫補充。

考試重點整理

iPAS AI 應用規劃師考試中,LLM 相關考點包括:

  • Token 的概念與 context window 長度限制
  • 預訓練 vs 微調 vs 對齊的差異與目的
  • 幻覺的成因與緩解策略(RAG、溫度參數調整)
  • 開源 vs 閉源模型的商業應用考量

建議搭配閱讀 提示工程入門 一起掌握與 LLM 互動的技巧。免費開始 練習,讓考試準備更有效率。

參考來源

「各家模型能力比較」圖表為教學概念示意,非 benchmark 實測數據。