NVIDIA-Certified Associate: Generative AI LLMs 重點整理
AssociateNVIDIA-Certified Associate: Generative AI LLMs

Trustworthy AI 重點整理

先免費試做 5 題

G5 — Trustworthy AI

考試比重: Domain 5 佔全卷 10%(50–60 題中約 5–6 題)
依據來源: exam-blueprint · study-guide · blog-03-trustworthy-ai · blog-02-rag · dli-04-prompt-engineering


核心概念

Trustworthy AI 是一套確保 AI 系統在實際部署中可信、安全、公平、可解釋的原則與工程實踐。NVIDIA 將其拆解為五根支柱:Privacy、Safety & Security、Transparency、Non-discrimination & Fairness、Accountability。對 LLM 應用而言,這五個支柱具體對應到四大能力指標:公平性與偏見控制、hallucination 防禦與安全性測試(red-teaming)、隱私與資料治理、可解釋性與文件化。

核心思維是「defense in depth」:不依賴單一防線,而是在資料層、模型層、推理層、應用層各設關卡,讓每一層失效時仍有後備保護。連續評估(continuous evaluation)是維持信賴的關鍵——每次模型替換、prompt 修改、retriever 更新都應觸發完整的回歸測試套件,涵蓋品質(accuracy)、安全(harmful output rate)、公平(slice metrics)、忠實性(RAG faithfulness)四個軸向。


Fairness & Bias

Bias, fairness and dataset representativeness

定義

Bias(偏見)是指模型預測或生成的輸出對特定群體產生系統性偏差。Fairness(公平性)是衡量偏見影響是否在可接受閾值內的工程指標。Dataset representativeness(資料集代表性)則是訓練資料是否均衡涵蓋不同人口屬性(年齡、性別、語言、地區等)的程度——若某族群在語料中嚴重欠代表(underrepresented),模型對該族群的表現往往較差。

原理

偏見可以在三個階段進入模型:

  1. Pretraining 資料偏見:網路爬蟲語料天然過度代表英語、特定地區、特定觀點。若訓練資料中某族群的正向描述比例遠低於其真實比例,模型即學到偏差的語言關聯。
  2. Labeling 偏見:RLHF 中的人類標注者帶有文化、性別、語言等偏見,reward model 學到的偏好反映標注員群體而非全體用戶。不同標注員對「有幫助」的定義可能截然不同。
  3. Feedback loop 偏見:部署後的用戶互動資料若主要來自特定族群,持續微調會加劇對少數族群的偏差——這是一種自我強化的惡性循環。

緩解策略需針對偏見來源:資料層以策展(curation)平衡代表性;標注層以多元標注員群體與校準流程減少主觀偏差;模型層以 DPO 等對齊方法調整偏好分佈;評估層以切片評估(slice evaluation)測量跨族群表現差異。

具體例子

一個 LLM 若訓練資料中技術職缺描述多以男性代詞出現,則生成履歷摘要時可能自動補入男性語境。評估方法:切片測試(slice evaluation)——對「軟體工程師」問題分別以不同性別、種族、語言的 persona 提問,比較回答品質與語氣差異,若切片間差距超過設定閾值即觸發緩解流程。

常見陷阱

  • 只看整體準確率而不看切片(slice)指標,掩蓋少數族群的差劣表現;整體 90% 準確率可能隱藏某語言群體 60% 的慘況。
  • 以為換掉偏見詞彙(debiasing prompts)即可消除偏見;prompt 層面的緩解效果有限且不穩定,根本解法需從資料策展入手。
  • 誤以為開源模型已經「中立」,忽略其訓練語料的分佈問題——開源不代表無偏見。

常考點: 切片評估(slice evaluation)是 Trustworthy AI 考題的核心動作詞。偏見的三個來源(資料、標注、反饋循環)各自對應不同緩解策略。Model cards 是記錄公平性指標的標準文件格式,缺少公平性切片結果的 model card 是不完整的。


Safety & Robustness

Hallucination, safety and red-teaming

定義

Hallucination(幻覺)指 LLM 生成聽起來合理但事實上錯誤的陳述,通常是因為模型在無支撐事實的情況下依賴統計模式補全輸出。Safety 是確保模型不輸出有害、違法或不當內容的能力集合。Red-teaming 是仿攻擊者角度主動探測模型弱點的測試方法,源自軍事演習術語——紅隊代表攻擊方,藍隊代表防禦方。

原理

Hallucination 的根源在於語言模型的本質:它學習的是詞符的條件概率,而非「真值資料庫」的查詢。模型在訓練資料稀疏的領域、長尾知識、時效性資訊上特別容易產生幻覺。

Prompt injection 與 jailbreak 則是外部攻擊者利用模型指令遵從性(instruction following)繞過安全訓練的手段:

  • Prompt injection(提示詞注入):惡意用戶(或文件中嵌入的指令)嘗試覆蓋系統提示或提取機密指令。直接注入(direct injection)來自用戶輸入,間接注入(indirect injection)來自模型讀取的外部文件、API 回傳或工具輸出——後者在 agent 場景下特別危險。
  • Jailbreak(越獄):精心設計的 prompt(角色扮演、繞語、前綴攻擊、多語言混淆等)誘使模型繞過 safety 訓練,輸出有害內容。

Red-teaming 是系統化地在部署前發現這些弱點的方法,結合人工測試者(內外部)與自動化工具(如 NVIDIA Garak)。

Red-teaming 流程

NeMo Guardrails 三層攔截架構

NeMo Guardrails 是 NVIDIA 開源的可程式化護欄工具,使用 Colang 語言定義規則,分三層運作:

具體例子

  • Hallucination 緩解:RAG 是最有效的方法,因為它提供可引用的真值來源(retrieved context);模型被要求以「根據以下文件……」格式回答,若上下文不足則輸出「我不確定」而非猜測。搭配低 temperature(0.0–0.2)減少隨機性,以 JSON schema 約束輸出格式。
  • Prompt injection 防禦:對用戶輸入與系統指令使用不同的 message role(system vs user);在 prompt template 中以明顯分隔符(如 <document>…</document>)隔離不受信任的外部資料;遵循 principle of least privilege——agent 只持有完成任務所需的最小工具與憑證,限制攻擊面。
  • NVIDIA Garak:開源 LLM 漏洞掃描器,自動探測 jailbreak、資料萃取、有害內容生成等弱點,可整合進 CI/CD 管道。

常見陷阱

  • 以為「降 temperature」就能完全消除 hallucination;低溫只降低輸出隨機性,不代表模型知道正確答案——訓練資料本身的錯誤無法靠溫度解決。
  • 誤用單一過濾器(one big filter);應採多層 defense in depth(input rail → LLM → output rail),讓每一層的遺漏由下一層補位。
  • 忽略 indirect prompt injection——文件、工具回傳、搜尋結果都可能成為注入向量,這在 agentic AI 場景下特別嚴重。

常考點: NeMo Guardrails 分三層(input / output / dialog rail)。Red-teaming 是主動安全測試,與 penetration testing 概念相近,需在部署前執行。RAG 是緩解 hallucination 的首要工具,因為它提供可引用的真值來源。Principle of least privilege(最小權限原則)適用於限制 agent 的工具與憑證。


Privacy & Governance

Privacy and data governance for LLM apps

定義

Privacy(隱私)在 AI 語境中指保護個人識別資訊(PII,Personally Identifiable Information)在資料蒐集、訓練、推理、儲存各環節不被洩漏或濫用。Data governance 是制定資料分類、留存、存取、刪除政策的管理框架。Differential privacy 是一種數學保證:即使敵手能查詢模型,也無法以高信心推斷特定個人是否出現在訓練集中——這保護的是訓練集成員隱私,而非推理時的 prompt 隱私。

原理

LLM 的隱私風險來自兩個主要管道:

  1. Training-time memorization(訓練時記憶):模型在大規模訓練中可能記住高重複率的個人資料(電話、地址、信用卡號等),並在推理時被攻擊者用特定 prompt 萃取出來。研究顯示,訓練資料中重複出現超過一定次數的字串更容易被記憶。
  2. Inference-time leakage(推理時洩漏):用戶在 prompt 中貼入個人資料,這些資料可能被記錄於日誌、被其他 session 讀取(若多租戶隔離不佳),或被模型整合進回應中轉述給第三方。

Differential Privacy(差分隱私)原理

Pr[M(D)S]eεPr[M(D)S]\Pr[M(D) \in S] \leq e^{\varepsilon} \cdot \Pr[M(D') \in S]

其中 DDDD' 僅差一筆記錄,ε\varepsilon(epsilon)是隱私預算(越小越安全)。實作方式是在梯度更新時加入校準過的 Gaussian 雜訊:DP-SGD(差分隱私的 SGD 變體)在反向傳播時對每筆樣本的梯度裁剪(clip)後加入雜訊,確保單一樣本對模型的影響有界。代價是 utility tradeoff:epsilon 越小,模型效能損失越大。

PII 偵測與遮蔽流程

多租戶 RAG 隔離

企業 RAG 應用若多個客戶共用同一索引,存在 cross-tenant 資料洩漏風險。正確做法是為每個租戶維護獨立的向量索引(per-tenant index),而非依賴 metadata filter 過濾——後者在向量搜尋實作中可能被繞過或產生誤配。

具體例子

  • 在 RAG 管道的 ingestion 階段以 Microsoft Presidio 或 spaCy NER 自動偵測並遮蔽姓名、身分證字號、電話號碼,再存入向量資料庫。
  • 設定資料留存限制(data retention policy):對話 log 保留 30 天後自動刪除;推理 API 不使用用戶輸入資料進行模型訓練(opt-out by default)。
  • NVIDIA NeMo Curator 可在大規模資料策展管道中執行去識別化(anonymization)與重複資料刪除(deduplication),為 pretraining 資料打好隱私基礎。

常見陷阱

  • 將 API key、資料庫密碼放進 system prompt 或 few-shot 示例;模型可能在回應中複述這些機密,尤其是在 prompt injection 攻擊下。
  • 以為 embedding 後的向量不含可識別資訊;embedding inversion 攻擊已可從向量還原近似原始文字,向量本身仍需加密保護。
  • 忽略 differential privacy 的 utility tradeoff:過小的 epsilon 可能使模型效能大幅下降,需根據資料敏感程度與任務要求取得平衡。

常考點: Differential privacy 保護「訓練集成員隱私」,不保護「推理時的 prompt 隱私」——兩者是不同的威脅模型。PII 遮蔽應在進入 LLM 之前(ingestion 階段)完成,而非事後處理。多租戶 RAG 必須有 per-tenant index 隔離,僅靠 metadata filter 不夠安全。


Explainability & Documentation

Explainability and model documentation

定義

Explainability(可解釋性)是理解並向利害關係人說明模型決策依據的能力。LLM 的高維度參數使其本質上是「黑盒」系統,可解釋性研究以後驗方法(post-hoc methods)提供理解管道。Model documentation 是以標準化格式記錄模型能力、限制、訓練資料、評估結果和使用建議的實踐,目標是讓部署者與用戶做出知情決策(informed decision)。

原理

主要的可解釋性工具包括:

  • Attribution methods(歸因方法):計算每個輸入 token 對輸出的貢獻度,代表方法有 Integrated Gradients(IG)、SHAP、LIME。這些方法提供量化的 feature 重要性,比 attention 可視化更具因果解釋力。
  • Attention visualization(注意力視覺化):熱圖顯示模型在生成每個 token 時關注哪些輸入 token;工具成熟、人類可讀,但重要限制是注意力高≠因果貢獻大,attention 是中間計算結果而非決策解釋。
  • Mechanistic interpretability(機制可解釋性):探索模型內部電路(circuits)如何執行特定任務,如 Induction heads(歸納頭)負責上下文學習、attention patterns 解讀等。此為學術前沿,考試層級以概念為主。
  • Probing classifiers(探針分類器):在中間層訓練線性分類器,測試特定概念(如「是否為地名」)是否被編碼於該層表示,用於診斷模型的內部知識結構。

Model Cards、Datasheets、System Cards 比較

文件類型撰寫對象涵蓋範圍代表範例
Model Card模型開發者架構、訓練資料、評估指標、已知限制、公平性切片結果、使用建議HuggingFace model cards、Google BERT card
Datasheet for Datasets資料集維護者蒐集動機、來源、組成、預處理、建議用途、使用限制Gebru et al. 2018 框架
System Card系統部署者整合多個模型的端對端系統行為、安全評估、已觀察失效模式、red-team 結果OpenAI GPT-4 System Card

Model Card 標準章節(依 NVIDIA Trustworthy AI 建議)

具體例子

  • Integrated Gradients 實例:對情感分類任務(正評/負評),IG 可標示「非常滿意」四字對正評預測貢獻度最高,「退貨」對負評貢獻最高,協助開發者診斷模型是否學到正確特徵或 spurious correlation。
  • Attention heatmap 應用:在 QA 任務中視覺化模型「看了」哪段上下文,若模型看的段落與正確答案所在段落不符,提示 retrieval 或 attention 有問題。
  • 完整 model card 實例:應包含不同語言的 BLEU / F1 切片分數,使部署者可判斷是否適合多語言場景;若繁體中文切片明顯低於英語切片,應在使用建議中明確標注。

常見陷阱

  • 混淆 attention 與 attribution:attention visualization 直觀但因果性差;若需要向監管機構解釋決策依據,應使用 Integrated Gradients 等 attribution 方法,而非 attention 圖。
  • 以為發布 model card 等於解決可解釋性問題;model card 是透明度文件,不自動讓黑盒可解釋——可解釋性是工具,透明度是文件,兩者互補但不能互換。
  • 只在首次發布時寫 model card,之後版本更新不同步更新,導致資訊過期、公平性指標反映舊版本而誤導部署者。

常考點: Model card 由模型開發者撰寫,datasheet 由資料集維護者撰寫,system card 描述整合系統行為。Attention visualization 是最常見的 LLM 可解釋性工具,但有因果限制(高 attention ≠ 因果貢獻)。考題常以「部署前應準備哪份文件」形式出現——若題目問「整合多個模型的系統部署前需要什麼文件」,答案是 system card。


快速總覽表

風險類型主要緩解技術NVIDIA 工具對應文件
資料偏見切片評估、資料策展、DPO 對齊NeMo CuratorModel Card
HallucinationRAG 引用、低 temperature、verifier 模型NeMo Retriever、NIMSystem Card
Prompt injection角色分離、input rail、最小權限原則NeMo GuardrailsSystem Card
JailbreakRLHF + red-team、output rail、defense in depthGarakSystem Card
PII 洩漏PII 偵測遮蔽、per-tenant 索引、log 留存限制NeMo CuratorDatasheet
Training 隱私Differential privacy(DP-SGD)Model Card
不可解釋性Attribution 方法、attention 視覺化Model Card

總複習 Checklist

  • 能說出偏見的三個來源(資料、標注、反饋循環)並各舉一個緩解措施
  • 能描述 RAG 如何減少 hallucination(提供可引用的真值來源)
  • 能區分 prompt injection(注入指令覆蓋 system prompt)與 jailbreak(誘使模型繞過 safety 訓練)
  • 能說明 NeMo Guardrails 的三層架構(input / output / dialog rail)及各層作用
  • 能解釋 differential privacy 的 epsilon 含義與 utility tradeoff(epsilon 越小越安全但效能損失越大)
  • 能區分 model card(模型開發者)/ datasheet(資料集維護者)/ system card(系統部署者)的撰寫對象
  • 能說出 attention visualization 的因果限制(高 attention ≠ 因果貢獻)
  • 能說出 NVIDIA 五支柱:Privacy / Safety & Security / Transparency / Non-discrimination & Fairness / Accountability
看懂了,接著就要練

免費開始練「Trustworthy AI」

註冊即可用 AI 助教、智慧複習與完整題庫,把重點整理讀到的東西真正練起來。

同證照其他重點整理