描述
資料投毒 (Data Poisoning) 指在模型的預訓練 (pre-training)、微調 (fine-tuning) 或嵌入表示 (embedding) 階段,透過操控訓練資料來引入漏洞、後門或偏見。此類操控將影響模型的安全性、效能或道德行為,可能導致有害輸出或降低模型能力。常見風險包括模型表現退化、產生偏見或具攻擊性的內容,以及對下游系統的惡意利用。
資料投毒可在 LLM 生命週期的不同階段發生,包括預訓練 (透過一般性資料學習)、微調 (針對特定任務調適模型) 及嵌入表示 (將文字轉換為數值向量)。了解這些階段有助於辨識漏洞的來源。資料投毒屬於完整性攻擊 (integrity attack),因為篡改訓練資料會影響模型進行準確預測的能力。在使用外部資料來源時風險更高,因為這些來源可能包含未驗證或具惡意的內容。
此外,透過共享倉庫或開源平台分發的模型,除資料投毒外,也有其他風險,如透過惡意序列化 (malicious pickling) 等技術在模型載入時執行有害程式碼。同時,投毒手法亦可能建立一個後門,讓模型在特定觸發條件出現前行為正常,一旦觸發,模型行為便改變,成為「潛伏代理 (sleeper agent)」般的風險,難以測試或偵測。
常見漏洞實例
- 惡意攻擊者在訓練階段引入有害資料,使模型產生偏見輸出。例如使用 "Split-View Data Poisoning" 或 "Frontrunning Poisoning" 技術,在模型訓練動態中插入破壞元素。
- 攻擊者將有害內容直接注入訓練過程中,危及模型輸出品質。
- 使用者不自覺地在互動中提供敏感或專有資訊,該資訊可能在隨後輸出中被洩漏。
- 未經驗證的訓練資料增加產生偏見或錯誤輸出的風險。
- 資源存取限制不足可能使模型攝入不安全資料,導致偏差輸出。
預防與緩解策略
- 使用如 OWASP CycloneDX 或 ML-BOM 等工具追蹤資料來源及轉換歷程。在模型開發的所有階段驗證資料的合法性。
- 嚴格審核資料供應商,並透過與可信來源比對模型輸出,以偵測潛在的投毒跡象。
- 實施嚴密的沙箱機制 (sandboxing),限制模型存取未經驗證的資料來源。使用異常偵測 (anomaly detection) 技術過濾對抗性資料。
- 為不同使用情境專門使用特定資料集進行微調,可使模型的輸出更符合預期的目標與準確性。
- 確保基礎設施控管到位,以防模型存取未預期的資料來源。
- 使用 Data Version Control (DVC) 記錄與追蹤資料集變更,以便偵測資料操控。版本控管對維持模型完整性相當重要。
- 將使用者提供資訊儲存在向量資料庫 (vector database) 中,可在不重新訓練整個模型的情況下進行調整。
- 通過對抗性測試 (red team campaigns) 及使用聯邦學習 (federated learning) 等方法來檢驗模型的強健度,減輕資料干擾的影響。
- 持續監控訓練損失 (training loss) 並分析模型行為是否有投毒跡象。設定門檻以偵測異常輸出。
- 在推論階段整合 Retrieval-Augmented Generation (RAG) 與 grounding 技術,降低幻覺 (hallucination) 風險。
攻擊情境範例
- 情境 #1:攻擊者透過操控訓練資料或運用 Prompt Injection 技術,使模型的輸出偏頗,散播不實資訊。
- 情境 #2:未經適當過濾的有害資料導致模型產生不當或具攻擊性的輸出,進而散播危險內容。
- 情境 #3:惡意行為者或競爭者製造虛假文件供訓練之用,導致模型輸出反映這些錯誤資訊。
- 情境 #4:過濾不足使攻擊者得以透過 Prompt Injection 插入誤導性資料,導致模型輸出遭破壞。
- 情境 #5:攻擊者利用投毒技術在模型中植入後門觸發器,使模型在特定時機執行未授權行為,如繞過認證、外洩資料或隱藏指令執行。
參考連結
- How data poisoning attacks corrupt machine learning models:CSO Online
- MITRE ATLAS (framework) Tay Poisoning:MITRE ATLAS
- PoisonGPT: How we hid a lobotomized LLM on Hugging Face to spread fake news:Mithril Security
- Poisoning Language Models During Instruction:Arxiv White Paper 2305.00944
- Poisoning Web-Scale Training Datasets - Nicholas Carlini | Stanford MLSys #75:Stanford MLSys Seminars YouTube Video
- ML Model Repositories: The Next Big Supply Chain Attack Target:OffSecML
- Data Scientists Targeted by Malicious Hugging Face ML Models with Silent Backdoor:JFrog
- Backdoor Attacks on Language Models:Towards Data Science
- Never a dill moment: Exploiting machine learning pickle files:TrailofBits
- arXiv:2401.05566 Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training:Anthropic (arXiv)
- Backdoor Attacks on AI Models:Cobalt