輸入門(Input Gate)是什麼?

長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Input Gate
主題標籤
深度學習、自然語言處理、神經網路
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
輸入門(Input Gate)是什麼? 深度學習自然語言處理
術語快查

搜尋意圖: 如果你在找「輸入門 是什麼」或「輸入門 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

長短期記憶網路(LSTM)的關鍵元件,通過 sigmoid 激活函數產生 0-1 之間的門控信號,動態控制有多少當前輸入信息應被添加到細胞狀態,實現選擇性的信息流控制。

核心概念

LSTM(Long Short-Term Memory)的輸入門是一個動態決策機制,其核心思想是:並非所有輸入信息都等同重要,網路應該學習選擇接納哪些信息。

輸入門的數學表示為: i_t = σ(W_i · [h_{t-1}, x_t] + b_i)

其中 i_t 是輸入門的輸出(0-1 之間),σ 是 sigmoid 函數,h_{t-1} 是上一時步的隱藏狀態,x_t 是當前輸入。

同時,還有候選細胞狀態(candidate cell state): c̃t = tanh(W_c · [h{t-1}, x_t] + b_c)

最終細胞狀態的更新為: C_t = f_t ⊙ C_{t-1} + i_t ⊙ c̃_t

其中 f_t 是遺忘門,⊙ 表示元素級乘積。輸入門通過控制 c̃_t 的流入比例,實現信息的選擇性整合。

運作原理

輸入門在 LSTM 時序計算中的具體運作如下:

  1. 信息評估:輸入門同時接收前一時步的隱藏狀態 h_{t-1} 和當前時步的輸入 x_t。這種設計讓門機制能同時考慮歷史上下文和當前信號。

  2. 得分計算:通過線性變換 W_i · [h_{t-1}, x_t] + b_i 計算原始得分,然後用 sigmoid 激活函數約束到 [0,1] 範圍。

  3. 加權應用:輸入門的輸出(0-1 的向量)與候選細胞狀態逐元素相乘,實現選擇性遮蔽。高得分維度的信息保留,低得分維度的信息被抑制。

  4. 梯度流:輸入門的 sigmoid 導數為 σ(z)(1-σ(z)),在 z 為中等值時有較強梯度,避免了傳統 RNN 的梯度消失問題。

  5. 長期依賴學習:輸入門與遺忘門協作。遺忘門決定保留舊信息,輸入門決定添加新信息,共同支持長序列的信息流。

實際應用

輸入門在多個序列建模任務中發揮核心作用:

  1. 機器翻譯:編碼器使用 LSTM 處理源語言句子。輸入門幫助模型選擇性地吸收重要詞彙和短語,過濾掉無關填充詞。

  2. 語言建模:預測下一個詞時,輸入門決定當前詞與歷史上下文的整合程度。對於「The cat sat on the mat」,「the」的輸入門值可能較低(冠詞通常不決定性),「sat」的輸入門值較高(動詞是關鍵)。

  3. 情感分析:在處理長句子時,輸入門幫助忽視修飾詞和否定詞的干擾,專注於情感載體詞。

  4. 時間序列預測:股票價格、氣象數據等序列中,輸入門學習識別關鍵信號(如突發事件)並根據重要性決定整合程度。

  5. 語音識別:音頻特徵序列中,輸入門幫助模型關注音素轉變和發音邊界,對齊時間動態。

  6. 視頻理解:逐幀處理視頻時,輸入門區分關鍵幀(含新信息)和冗余幀(內容重複),提高效率。

常見誤區

  1. 輸入門與遺忘門的混淆:兩者都通過 sigmoid,但作用完全相反。遺忘門決定遺棄舊細胞狀態的多少,輸入門決定添加新信息的多少。合理的配置是兩者都不極端。

  2. 門值都接近 1 的誤解:如果訓練後輸入門始終接近 1,表示模型未有效學習選擇性,可能預示著過擬合或數據噪音過高。

  3. 候選狀態與輸入門的區分:候選狀態 c̃_t 由 tanh 激活生成,輸入門 i_t 由 sigmoid 產生。兩者都必不可少:tanh 提供內容,sigmoid 提供門控。

  4. 梯度流的過度樂觀:雖然 LSTM 解決了梯度消失,但在超長序列(>100 時步)或複雜依賴下,梯度仍可能消失,輸入門無法完全解決。

與相關技術的比較

  • LSTM 輸入門 vs GRU 更新門:GRU(Gated Recurrent Unit)簡化 LSTM,合併輸入門與遺忘門為單一更新門。GRU 參數更少,訓練更快,但表達能力略弱。在數據充足時 LSTM 常優於 GRU。

  • LSTM vs 標準 RNN:標準 RNN 無門機制,所有信息無差別流通。LSTM 通過三個門的協作實現選擇性控制,大幅改善長期依賴學習。

  • 輸入門 vs 注意力機制:注意力機制根據所有時步動態計算權重,粒度更細;輸入門只根據當前時步做決策。注意力通常優於 LSTM,但計算複雜度更高。

  • 靜態權重 vs 動態門控:傳統神經網路權重固定,LSTM 輸入門根據輸入動態調整。這種動態性使 LSTM 對變化環境的適應力更強。

常見問題

輸入門和遺忘門都使用 sigmoid,為什麼要分開?

雖然都用 sigmoid 產生 0-1 的門控信號,但它們控制的是不同的信息流。遺忘門作用於上一時步的細胞狀態(舊信息),決定遺棄多少舊內容;輸入門作用於候選細胞狀態(新信息),決定接納多少新內容。分開設計提供更多的表達自由度。在實踐中,模型常學到遺忘門接近 1(保留舊信息)、輸入門根據內容變化的模式,實現「保留背景,添加變化」的機制。

輸入門輸出接近 0 或接近 1 分別表示什麼?

輸入門輸出接近 0 時,新的候選信息被大幅阻擋,細胞狀態主要保持遺忘門決定的舊信息。這在相對穩定的序列中常見,例如長句子中連續的修飾詞,新詞義不大。輸入門輸出接近 1 時,新信息被大量接納,細胞狀態快速更新。這在關鍵詞、轉折句或動態變化的序列中常見。理想情況下,輸入門應動態變化,根據序列內容靈活調整。

為什麼 LSTM 用 tanh 而不是 sigmoid 生成候選細胞狀態?

tanh 的輸出範圍是 [-1, 1],而 sigmoid 是 [0, 1]。tanh 包含負值,能表達「抑制」信息;sigmoid 只有正值,無法表達負向影響。在細胞狀態累積的語境中,負值至關重要。例如在機器翻譯中,新詞可能與前文相反,需要用負值來修正。此外,tanh 的梯度(1-tanh²(x))在中央區域較大,相比 sigmoid 的梯度 σ(x)(1-σ(x)),tanh 提供更強的梯度信號,有利於訓練。