點雲 是什麼?
Point Cloud:點雲 的完整解釋
三維空間中由大量無序點組成的資料結構,每點含坐標和屬性,用於3D感知、掃描、建模和分析。
核心概念
點雲的核心優勢是無序性和密度靈活性。與網格表達(固定分辨率、計算量大)或多邊形網格(需明確連接關係)相比,點雲高效表達稀疏或密集的3D結構。每個點獨立存儲,無隱含的拓撲關係,天然適合LiDAR和深度傳感器的直接輸出。
N個點的點雲可表示為N×3矩陣(坐標)或N×D矩陣(含屬性),屬性D可包含顏色、反射強度、時間戳、物體ID等。點雲密度從稀疏(LiDAR:數百至數萬點)到超稠密(結構光掃描:數百萬點)。
點雲處理的主要挑戰是無序性。傳統CNN要求結構化網格輸入;點雲天然無序,(1,2,3)和(3,2,1)座標的相同點雲應認為相同,但傳統深度學習架構無此不變性。
運作原理
- PointNet是革命性突破。它直接在無序點集上操作,不需轉為網格。架構包含:輸入層(N×3)→ 共享MLP(逐點特徵提取)→ MaxPooling(全局聚合)→ 輸出層(分類或分割)。MaxPooling聚合N個點的特徵,不變性自動滿足:任意排列的點集MaxPooling結果相同。
PointNet++進一步引入層次結構。原始PointNet的全局MaxPooling丟棄局部細節。PointNet++用Set Abstraction層逐步抽象:先在局部鄰域提取特徵,再向上匯聚,形成層次的特徵金字塔。
圖卷積網絡(GCN)建模點間的連接關係。先根據點間距離或特徵相似度構建k-NN圖,再在圖上應用卷積。這捕捉了點的局部幾何結構。
Transformer架構(如Point Transformer)引入自注意力,每點對所有點計算注意權重,直接建模遠距離依賴。這避免了人工定義的鄰域或拓撲。
訓練方法包括監督學習(用標籤點雲或標籤分割掩模)和自監督學習(如點雲旋轉預測、鄰域重建、對比學習)。
實際應用
自動駕駛中,LiDAR掃描器每秒產生數十萬點的點雲,點雲檢測和分割網絡實時檢測障礙物、行人、車輛。點雲相比影像的優勢是精確的距離資訊和全天候性(不怕光照)。
機器人視覺和抓取用點雲進行物體檢測和姿態估計。機器人臂需精確定位物體和抓取點,點雲提供6-DoF(6自由度)位置資訊。抓取網絡基於點雲直接預測抓取點和方向。
3D地圖製作和SLAM利用點雲建構環境的3D地圖。移動機器人或無人機掃描環境,點雲融合成全局地圖。
文物和建築數位化用掃描儀獲取文物或建築的高精度點雲,用於保存、虛擬展示和修復。故宮或羅浮宮等博物館用點雲掃描珍貴藝術品。
地形和環保監測利用航拍LiDAR點雲進行地形分類(水、植被、建築、裸地),監測森林砍伐、冰川融化等環境變化。
常見誤區
誤區一:點雲密度越高越好。實際上,超高密度點雲計算複雜度迅速增加。適度降採樣往往能提升效率而不損精度。
誤區二:點雲無法表達細節的幾何。實際上,點雲能精確編碼任意複雜的3D形狀。限制來自掃描分辨率和計算能力。
誤區三:點雲直接輸入CNN就能工作。實際上,CNN預期有序網格,點雲無序。需專門架構(PointNet等)或先轉為網格表達。
與相關技術的比較
點雲 vs 網格:網格(voxel網格或多邊形網格)固定分辨率或明確連接;點雲無序且密度靈活。點雲輕量,網格易於幾何操作。
點雲 vs 影像深度圖:深度圖是2D影像,每像素一個深度值;點雲是3D資料結構。兩者互轉,應用場景不同。
點雲 vs 網格面片:網格面片明確表達曲面,點雲只是坐標集合。網格更適合渲染,點雲更適合分析。