這幾年,在工作上沒有使用 AI 輔助的人已經非常少了,許多企業選擇自建 LLM(Large Language Model, 大型語言模型) ,不但可以更貼近企業本身的需求、提高模型精準度,還可以降低資料外洩的風險。然而,自行建置的 LLM 也可能成為資安破口。
OWASP Top 10 for LLMs
非營利組織 OWASP(Open Worldwide Application Security Project)定期公布的各領域 Top 10 關鍵風險從 2023 年起納入了 LLM,最新版本的關鍵風險分別包含:
- 指令注入(Prompt Injection):有些攻擊者會透過精巧的指令操控 LLM 產生非預期的回應或行為,誘使模型洩漏機敏資訊或影響其提供答案。
- 敏感資訊揭露(Sensitive Information Disclosure):LLM 可能在其回應中不慎洩漏機密資料,或是使用者在輸入時無意間輸入了機敏資訊,將導致資料未經授權遭到存取、隱私權侵害、資安漏洞,或原始碼、訓練方法的洩露。
- 供應鏈風險(Supply Chain Vulnerabilities):在 LLM 開發部署的流程中,若使用的元件、服務或資料集存在的資安漏洞,可能破壞系統的完整性,導致輸出結果產生偏見、資安漏洞或系統故障。
- 資料與模型投毒(Data and Model Poisoning):攻擊者可能操縱用於訓練 LLM 的資料,在預訓練、微調或嵌入等階段影響模型的學習。這不僅會降低模型的安全性、影響準確度,還可能導致輸出偏頗或有害的內容,甚至植入只有在特定條件下才會觸發的漏洞、後門或偏見。
- 不當輸出處理(Improper Output Handling):若 LLM 的產出在輸出前未經過適當的驗證、篩選或處理,可能導致前端攻擊(如 XSS 或 CSRF)或後端攻擊(如 SSRF 或 RCE)。
- 過度代理授權(Excessive Agency):當 LLM 在應用程式中被賦予過高的自主權或過多的權限,使其能透過外掛程式或工具執行,卻缺乏足夠的控管時,可能導致機密資訊的存取或洩露、決策被更改、執行未經授權的操作,或是資源的過度消耗。
- 系統指令洩露(System Prompt Leakage):模型內部指令遭到洩露時,攻擊者便可利用機敏資訊、內部機制、規則或權限來理解系統運作方式、找出弱點、規避控制,或發動進一步的攻擊。
- 向量與嵌入弱點(Vector and Embedding Weaknesses):針對使用檢索增強生成(RAG)技術的 LLM 系統。攻擊者可能透過向量與嵌入對模型注入有害內容、操控模型輸出,或存取機敏資訊。
- 錯誤資訊(Misinformation):LLM 可能會產生看似可信但實際上不正確或具誤導性的資訊(即「AI 幻覺」),這可能導致資安問題(例如,推薦不存在的惡意軟體套件)、商譽損害及法律責任。
- 無限資源耗盡(Unbounded Consumption):攻擊者可能操控 LLM 產生大量輸出或傳送大量耗費資源的請求,導致阻斷服務(DoS)攻擊、效能降低、額外費用,或是企圖透過大量查詢來非法複製模型。
LLM 資安保護從何下手?
LLM 的資安防護可以從網路安全開始,就像許多企業為內部網路部署防火牆、WAF, LLM 也有相對應的防禦服務。Master Concept 的合作夥伴 Cloudflare 就提供 Firewall for AI 服務,Cloudflare 的「AI 防火牆(Firewall for AI)」是專為保護大型語言模型(LLM)而設計的資安防護層,能夠在 API 請求到達模型之前掃描每個指令,尋找潛在攻擊的模式和特徵。
舉例來說,針對 OWASP Top 10 for LLM 中指令注入的風險,AI 防火牆可以分析指令,根據其惡意可能性評分,並依內容(冒犯性、宗教、性暗示、政治相關等)標記分類,讓使用者可預先建立規則,阻擋或管理相關請求,有效遏止特殊設計的輸入導致 LLM 產生非預期回應。又,AI 防火牆也可以運用機敏資料偵測(Sensitive Data Detection, SDD)WAF 代管規則集,識別模型回應中可能吐出的個人身份資訊 (PII) 或機密資訊(如信用卡號或 API 金鑰)。
AI 防火牆與 WAF 本質上相同,但特別針對了 LLM 的潛在風險強化了指令和產出的部分,透過分析、篩選、限制等手段保護 LLM。
從基礎建設就爲 LLM 設下防護
在自建 LLM 的一開始,平台的選擇往往就讓企業傷透腦筋,Google 強調版本控制和資料治理;AWS 則有高度靈活性及大量第三方整合;Azure 則主打與微軟生態系的無縫接合;而許多資安大廠運用本身資源開發的 AI 平台結合了本身的資安基礎,對於 LLM 防護整合更加友善。
以 Master Concept 的合作夥伴 Cloudflare 旗下的 Workers AI 來說,其利用 Cloudflare 全球的 GPU 網路,讓 AI 模型得以在邊緣運行,提供低延遲、高效能的 AI 服務;Workers AI 整合了前段提到的「AI 防火牆(Firewall for AI)」,有效防範指令注入、運算資源遭到濫用、機敏資料外洩等問題,享有 Cloudflare 網路原生的 DDoS 防護的同時,也強調「預設隱私」,明確表示不會使用客戶資料訓練模型,且模型不從使用行為中學習,並支援多種主流開源 AI 模型。
除了上面提到的 AI 防火牆和基礎建設外,LLM 的防護還可以從存取權、端點、監控、SIEM 等方向下手。企業可以實施最小權限原則、多因素驗證(MFA)和 PassKey 來確保只有授權的用戶能執行特定操作;實施嚴格的 API 控制、驗證 LLM 的輸出內容,防止資料外洩和惡意程式碼注入;透過監控全面的系統日誌、行為模式及異常活動,即時偵測潛在威脅;利用 SIEM 系統整合所有資訊,進行關聯分析,識別更複雜的攻擊模式並支援快速的事件響應等等。若您仍然不知道從何下手,歡迎聯絡思想科技的專業顧問!






