安全護欄 是什麼?

Guardrails:安全護欄 的完整解釋

AI安全護欄是用於限制AI系統行為,確保其符合預期規範和倫理標準的機制,防止產生有害或不當的輸出。

容易混淆

guardrails vs 人工審核 guardrails 是系統自動設的限制 人工審核是人最後把關 最關鍵的區別是機器先攔,還是人後看

guardrails vs 提示工程 提示工程是把指令寫得更好 guardrails 是在輸入輸出層加保護 最關鍵的區別是誘導行為,還是限制行為

記住這句就好

先設欄,再讓模型自由跑。

實際案例

客服機器人 客服系統可以先用 guardrails 擋掉醫療、法律或暴力相關的危險內容,再把安全問題交給模型回答。

金融建議 當 AI 要回應投資建議時,guardrails 可以先限制它不要冒充專家或亂給保證。

深入了解

guardrails 常結合關鍵字規則、分類器、政策檢查和輸出過濾。 好的護欄不是把模型關死,而是讓它在可接受的空間裡工作。

中英對照與三層護欄

中文 英文 說明
護欄 / 安全護欄 guardrails 限制 AI 系統行為邊界的機制總稱
輸入過濾 input filtering 在請求進模型前先擋
輸出過濾 output filtering 在回應給使用者前先檢查
對齊 alignment 訓練階段讓模型行為符合期望,不是護欄

要分清楚護欄與對齊:對齊是在訓練時做的,改變模型本身;護欄是在執行時做的,包在模型外面。對齊會失效(越獄提示就是在攻擊對齊),所以正式系統一定要有護欄當第二道防線。

護欄實際要擋什麼

輸入端。 提示注入(prompt injection)、越獄提示、個資與機密外洩、超出服務範圍的請求。這一層最重要的是提示注入防護:使用者輸入或檢索回來的文件裡可能藏著「忽略以上指令」這類內容,必須把使用者資料與系統指令明確隔離。

輸出端。 幻覺內容、不當言論、洩漏系統提示、給出超出授權的建議(醫療、法律、投資)。輸出護欄常見的做法包括關鍵字比對、分類模型、以及用另一個模型當評審。

工具與行動端。 這一層在 AI agent 上最關鍵。模型可以呼叫工具時,護欄要規定哪些工具能用、參數範圍、需不需要人工確認。刪除資料、寄信、付款這類不可逆的動作,預設就該要求確認。

設計護欄的四個原則

預設拒絕。 白名單優於黑名單。列舉「允許做什麼」比列舉「禁止做什麼」可靠,因為攻擊者只需要找到一個你沒想到的說法。

不可逆的動作要人工確認。 判斷標準是「做錯了能不能撤銷」,不是「風險高不高」。

護欄本身要能被稽核。 擋下了什麼、為什麼擋,要留紀錄。沒有紀錄就無法知道護欄是太鬆還是太緊。

假陽性也是成本。 護欄擋掉正常請求會讓使用者放棄使用。上線後要同時追兩個數字:漏放率與誤擋率,只看其中一個一定會把系統調到另一個極端。

情境判斷

Q1: 模型開始回答自殺方法,最需要什麼? → 先加安全護欄,攔下高風險輸出。

Q2: 你只是想讓回覆語氣更有禮貌,這也算 guardrails 嗎? → 看情況,若只是語氣調整,可能更像提示工程;若是限制危險內容,才更像 guardrails。

相關術語

常見問題

guardrails 會不會讓模型變笨?

會限制一部分自由度,但換來的是可控性和安全性。

只靠規則夠嗎?

通常不夠,最好搭配模型判斷和人工流程。

它只管文字嗎?

不只,圖像、語音和工作流都可以加護欄。