LLM 大型語言模型是什麼?運作原理白話解析
大型語言模型(LLM)是 ChatGPT、Gemini、Claude 等 AI 助手的核心技術。本文用白話解釋 LLM 的定義、token 機制、預測下一個字的直覺、完整訓練流程(預訓練→微調→RLHF 對齊),以及常見模型家族對照,幫助你在 iPAS AI 應用規劃師考試中建立正確的技術概念基礎。
ChatGPT 能回答問題、寫程式、翻譯文章,背後靠的是什麼技術?答案是大型語言模型(Large Language Model,LLM)。這篇文章用最直覺的方式,帶你從零理解 LLM 是什麼、怎麼運作,以及它的能力極限在哪裡。
LLM 的定義
LLM 是一種以海量文字資料訓練出來的神經網路模型,擁有數十億乃至數兆個參數(Parameters)。它的核心能力是:根據前文,預測最可能出現的下一個 token。
聽起來很簡單?這個看似單純的能力,在超大規模下卻湧現出(Emergent Ability)推理、摘要、翻譯、程式撰寫等幾乎所有語言任務。
Token 是什麼?
LLM 不是以「字」為單位處理文字,而是以 token。
- 英文:大約 1 個單字 ≈ 1–2 個 token("running" = 1 token)
- 中文:大約 1–2 個字 ≈ 1 個 token
- 程式碼:特殊符號可能各佔 1 token
你可以把 token 想成「AI 的視覺單元」——它看到的世界是一串 token,不是人類閱讀的文字。
預測下一個字的直覺
給 LLM 看「今天天氣__」,它會計算所有可能的下一個 token(晴、陰、好、熱……)的機率分佈,然後取機率最高(或加入一點隨機性)的那個,接著繼續預測再下一個……
這個過程反覆執行,就生成了一整段回應。這種方式稱為自回歸生成(Autoregressive Generation)。
LLM 完整訓練流程
三個核心階段:
- 預訓練(Pre-training):用數兆 token 的文字讓模型學習語言規律,耗費最多算力。
- 指令微調(SFT, Supervised Fine-tuning):用「問題→回答」格式的資料,讓模型學會遵循指令。
- 對齊(Alignment, RLHF/DPO):根據人類偏好調整輸出,減少有害或不實內容。
參數量與能力的關係
參數量越大,模型通常越強——但不是線性增長,而是在特定規模出現「能力突現(Emergence)」。
主流 LLM 家族對照
以下列出主流模型家族與其定位(模型版本迭代極快,下表以「系列」為準,實際最新版本請查各官方文件):
| 模型家族 | 開發商 | 開源? | 定位與強項 |
|---|---|---|---|
| GPT 系列 | OpenAI | 否(雲端 API) | 綜合能力、多模態、視覺推理 |
| Claude 系列 | Anthropic | 否(雲端 API) | 複雜推理、長上下文、安全對齊 |
| Gemini 系列 | Google DeepMind | 否(雲端 API) | 多模態、多語言、搜尋整合 |
| Llama 系列 | Meta | 是(開放權重) | 可自行部署、超長上下文、多模態 |
| Mistral 系列 | Mistral AI | 部分開放 | 輕量高效、企業邊緣部署 |
| Qwen 系列 | Alibaba | 是(Apache 2.0) | 中文能力強、多語言支援 |
各家模型在不同任務的定性能力比較
圖表為教學概念示意,數值並非來自公開 benchmark 實測結果。各模型能力隨版本迭代持續變化,請參考 Vellum AI LLM Leaderboard 等動態評測平台取得最新比較。
LLM 的兩大根本限制
1. 幻覺(Hallucination)
LLM 不是在「查資料」,而是在「生成最可能的文字」。當它不確定時,可能用聽起來合理的內容填補,導致一本正經地說錯話。
解法:搭配 RAG(檢索增強生成),讓模型有根據地回答,詳見 什麼是 RAG?。
2. 知識截止日(Knowledge Cutoff)
模型訓練完後,知識就「凍結」了。它不知道訓練後發生的事情,除非透過工具呼叫(Tool Calling)或外部資料庫補充。
考試重點整理
iPAS AI 應用規劃師考試中,LLM 相關考點包括:
- Token 的概念與 context window 長度限制
- 預訓練 vs 微調 vs 對齊的差異與目的
- 幻覺的成因與緩解策略(RAG、溫度參數調整)
- 開源 vs 閉源模型的商業應用考量
建議搭配閱讀 提示工程入門 一起掌握與 LLM 互動的技巧。免費開始 練習,讓考試準備更有效率。
參考來源
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS 2017. https://arxiv.org/abs/1706.03762
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). https://arxiv.org/abs/2005.14165
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT / RLHF). https://arxiv.org/abs/2203.02155
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. https://arxiv.org/abs/2206.07682
- Meta AI Blog — Llama 4 (2025). https://ai.meta.com/blog/llama-4-multimodal-intelligence/
- Alibaba Qwen3 (2025). https://github.com/QwenLM/Qwen3
- Anthropic Claude — 模型總覽. https://platform.claude.com/docs/en/about-claude/models/overview
- Vellum AI LLM Leaderboard(動態更新). https://www.vellum.ai/llm-leaderboard
「各家模型能力比較」圖表為教學概念示意,非 benchmark 實測數據。