行動識別(Action Recognition)是什麼?

從視頻中識別和分類人體或物體執行的動作,將視頻片段分配給預定義的動作類別。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Action Recognition
主題標籤
電腦視覺、深度學習、AI應用
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
行動識別(Action Recognition)是什麼? 電腦視覺深度學習
術語快查

搜尋意圖: 如果你在找「行動識別 是什麼」或「行動識別 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從視頻中識別和分類人體或物體執行的動作,將視頻片段分配給預定義的動作類別。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從視頻中識別和分類人體或物體執行的動作,將視頻片段分配給預定義的動作類別。

核心概念

行動識別的基本定義很簡單:給定一段視頻,預測該視頻中發生的動作類別。例如,輸入一個 3 秒的視頻片段,輸出「踢足球」的概率最高。

與靜態圖像分類相比,行動識別的難點在於:

  • 時間維度:必須分析視頻的全部幀,捕捉運動軌跡。靜態圖像分類沒有時間概念。
  • 多尺度時間模式:有些動作快速(眨眼),有些緩慢(打太極)。
  • 背景變化:同一動作可能在不同背景、光線、視角下執行。
  • 外觀相似動作:「蹲」和「坐」的姿態外觀相似,但動作不同。

運作原理

雙流網絡(Two-Stream Networks)

雙流架構處理空間和時間信息分別:

  • 空間流:處理單幀圖像,提取靜態信息(外觀、物體、場景)。通常是標準的圖像分類網絡(如 ResNet)。
  • 時間流:處理光流或幀差,提取運動信息。光流表示像素間的運動向量。

兩個流的特徵在融合層結合(如平均或串接),進行最終分類。雙流的優點是可以分別優化兩種信息的提取。

三維卷積神經網絡(3D CNN)

3D CNN 直接在時空體積上進行卷積,一次性學習空間和時間信息。卷積核有三個維度:(height, width, time)。例如,3×3×3 卷積核同時考慮相鄰的 3 幀和 3×3 的空間窗口。

3D CNN 優點是端到端簡潔,缺點是計算成本高。為了效率,常採用分離卷積(先做 2D 空間卷積,再做 1D 時間卷積)。

光流特徵

光流是相鄰幀像素的運動向量。與原始幀差相比,光流更平滑,更好地表示運動信息。光流特徵通常預先計算,然後送入時間流網絡。光流計算本身是一個獨立的技術領域。

時間池化與聚合

視頻長度不固定,系統需要將可變長度視頻轉換為固定大小的特徵。方法包括:

  • 幀採樣:固定採樣特定幀(如首尾幀),其他丟棄。簡單但可能丟失中間的重要動作。
  • 池化:對所有幀的特徵進行最大或平均池化。簡單但無序。
  • 時間卷積:對時間軸進行卷積,考慮幀序列的局部時間依賴。
  • 循環網絡:使用 LSTM 或 GRU 依次處理各幀,維持時間狀態。

實際應用

體育分析

體育直播和訓練視頻中,系統自動識別球員的動作:射門、傳球、防守。分析可以生成統計報告、亮點集錦或提供實時注釋。例如,「在 03:25,勒布朗投籃命中」自動提取和標籤。

視頻搜索與推薦

用戶想找到所有「籃球扣籃」的視頻片段。視頻平台使用行動識別自動標籤所有視頻內容,然後用標籤進行檢索。這比基於文本描述更準確,因為文本可能遺漏或不準確。

監控與安全

監控系統使用行動識別檢測異常或風險動作:跌倒、打鬥、翻越圍欄。檢測到這些動作時,系統自動告警或通知安全人員。這在老年人照護、企業安全、交通安全等領域很有價值。

手勢識別與人機互動

AR/VR 和智能設備使用手部動作識別進行控制。例如,揮手關燈、豎起大拇指拍照、揮動進行遊戲操作。無需按鈕或遙控,直觀自然。

人體活動分析

醫療和健身應用識別患者或用戶的活動:站立、行走、坐著、躺著。用於監測老年人活動水平、檢測異常活動模式(如長時間不動可能表示跌倒)。

工業與製造

工業應用使用行動識別識別工人的操作:焊接、組裝、檢查。檢測操作流程是否正確,是否遵循安全規範。自動化生產線使用行動識別監控機器人動作的準確性。

常見誤區

誤區 1:「行動識別」等同「動作分類」,其他形式的識別不重要

實際上行動識別可以有不同的粒度和形式:粗粒度(識別主要活動如「運動」「靜止」),細粒度(具體動作如「籃球投籃」),多標籤(視頻同時包含多個動作),軟標籤(動作概率而非硬標籤)。不同應用需要不同的粒度。

誤區 2:所有動作的識別難度相同

實際上難度差異很大。外觀差異大的動作(如「跳躍」vs「站立」)容易識別。外觀相似的動作(如「蹲」vs「坐」或「走」vs「跑」)困難。需要不同的策略:簡單動作可用外觀信息,複雜動作需要時間信息。

誤區 3:更多時間幀總是更好

增加幀數增加計算成本。而且,某些動作用少數幀就足以識別(如「眨眼」),多幀不一定有幫助,反而增加噪聲。有效的幀採樣策略(選擇信息豐富的幀)往往比簡單的幀序列更優。

誤區 4:一個在大規模數據集上預訓練的模型可應用所有領域

在體育或日常活動上預訓練的模型,在特殊領域(如手術視頻、工業操作)可能表現差。原因是動作分佈不同,特殊領域的細微動作差異大。需要在目標領域的數據上微調。

與相關技術的比較

  • 與「時間動作定位」的區別:行動識別假設輸入已經是單個動作的短視頻片段。時間動作定位的輸入是長視頻,需要同時找到動作的時間邊界和分類。

  • 與「群體活動識別」的區別:行動識別通常識別單個人的動作。群體活動識別識別多人協作的活動(如「討論」「打籃球」)。

  • 與「手勢識別」的區別:手勢識別是行動識別的特例,只關注手部動作。行動識別涵蓋全身或多部位的動作。

  • 與「場景分類」的區別:場景分類判斷視頻發生的環境(「海灘」「辦公室」),通常基於靜止畫面。行動識別關注視頻中發生的活動,需要時間分析。

常見問題

雙流網絡中為什麼要分離空間流和時間流?為什麼不直接用 3D CNN?

分離有幾個優點:(1)效率:分別優化空間和時間特徵提取,計算複雜度低於全 3D CNN;(2)靈活性:可以使用不同的預訓練權重(空間流可用 ImageNet 預訓練,時間流用光流數據預訓練);(3)通用性:光流作為中間表示,可以處理各種類型的動作,不受視覺外觀限制。例如,同一動作在不同光線或背景下外觀不同,但光流相似。當然,3D CNN 是更新且更簡潔的方法,也有很多成功應用,特別是在計算資源充足時。

光流特徵為什麼比幀差更好地表示運動?

幀差是相鄰幀的像素值差異,直接反映像素變化但很粗糙。光流是經過處理的運動向量,表示每個像素的運動方向和速度。光流有幾個優點:(1)平滑:光流算法(如 Lucas-Kanade)基於光流方程,輸出平滑的運動場;(2)不變性:光流對亮度變化相對不敏感(只要物體形狀不變,光流相同);(3)信息豐富:光流直接編碼運動方向和速度,易於理解;(4)可視化:光流易於可視化為箭頭或色彩圖。缺點是光流計算需要額外開銷,且在快速運動或邊界處容易出錯。

如何處理視頻長度變化的問題?只採樣固定幀數會丟失信息嗎?

這確實是個挑戰。方法包括:(1)固定採樣:選擇均勻分佈的幀(如 8 幀、16 幀)。缺點是長視頻的中間內容被跳過,可能丟失動作峰值。優點是簡單、計算固定;(2)自適應採樣:根據視頻長度調整採樣密度或幀數。但這增加複雜度;(3)分片處理:將長視頻分成多個短片段,分別識別,最後聚合。這保留更多信息,但增加計算;(4)循環網絡:逐幀處理視頻,維持動態狀態。這最靈活,可處理變長序列。在實踐中,多數應用假設輸入視頻長度有界,採用固定採樣。