安全護欄 是什麼?
Guardrails:安全護欄 的完整解釋
AI安全護欄是用於限制AI系統行為,確保其符合預期規範和倫理標準的機制,防止產生有害或不當的輸出。
容易混淆
guardrails vs 人工審核 guardrails 是系統自動設的限制 人工審核是人最後把關 最關鍵的區別是機器先攔,還是人後看
guardrails vs 提示工程 提示工程是把指令寫得更好 guardrails 是在輸入輸出層加保護 最關鍵的區別是誘導行為,還是限制行為
記住這句就好
先設欄,再讓模型自由跑。
實際案例
客服機器人 客服系統可以先用 guardrails 擋掉醫療、法律或暴力相關的危險內容,再把安全問題交給模型回答。
金融建議 當 AI 要回應投資建議時,guardrails 可以先限制它不要冒充專家或亂給保證。
深入了解
guardrails 常結合關鍵字規則、分類器、政策檢查和輸出過濾。 好的護欄不是把模型關死,而是讓它在可接受的空間裡工作。
中英對照與三層護欄
| 中文 | 英文 | 說明 |
|---|---|---|
| 護欄 / 安全護欄 | guardrails | 限制 AI 系統行為邊界的機制總稱 |
| 輸入過濾 | input filtering | 在請求進模型前先擋 |
| 輸出過濾 | output filtering | 在回應給使用者前先檢查 |
| 對齊 | alignment | 訓練階段讓模型行為符合期望,不是護欄 |
要分清楚護欄與對齊:對齊是在訓練時做的,改變模型本身;護欄是在執行時做的,包在模型外面。對齊會失效(越獄提示就是在攻擊對齊),所以正式系統一定要有護欄當第二道防線。
護欄實際要擋什麼
輸入端。 提示注入(prompt injection)、越獄提示、個資與機密外洩、超出服務範圍的請求。這一層最重要的是提示注入防護:使用者輸入或檢索回來的文件裡可能藏著「忽略以上指令」這類內容,必須把使用者資料與系統指令明確隔離。
輸出端。 幻覺內容、不當言論、洩漏系統提示、給出超出授權的建議(醫療、法律、投資)。輸出護欄常見的做法包括關鍵字比對、分類模型、以及用另一個模型當評審。
工具與行動端。 這一層在 AI agent 上最關鍵。模型可以呼叫工具時,護欄要規定哪些工具能用、參數範圍、需不需要人工確認。刪除資料、寄信、付款這類不可逆的動作,預設就該要求確認。
設計護欄的四個原則
預設拒絕。 白名單優於黑名單。列舉「允許做什麼」比列舉「禁止做什麼」可靠,因為攻擊者只需要找到一個你沒想到的說法。
不可逆的動作要人工確認。 判斷標準是「做錯了能不能撤銷」,不是「風險高不高」。
護欄本身要能被稽核。 擋下了什麼、為什麼擋,要留紀錄。沒有紀錄就無法知道護欄是太鬆還是太緊。
假陽性也是成本。 護欄擋掉正常請求會讓使用者放棄使用。上線後要同時追兩個數字:漏放率與誤擋率,只看其中一個一定會把系統調到另一個極端。
情境判斷
Q1: 模型開始回答自殺方法,最需要什麼? → 先加安全護欄,攔下高風險輸出。
Q2: 你只是想讓回覆語氣更有禮貌,這也算 guardrails 嗎? → 看情況,若只是語氣調整,可能更像提示工程;若是限制危險內容,才更像 guardrails。
相關術語
常見問題
guardrails 會不會讓模型變笨?
會限制一部分自由度,但換來的是可控性和安全性。
只靠規則夠嗎?
通常不夠,最好搭配模型判斷和人工流程。
它只管文字嗎?
不只,圖像、語音和工作流都可以加護欄。