神經網路架構搜尋 是什麼?
NAS:神經網路架構搜尋 的完整解釋
NAS 是一種自動化設計神經網路架構的技術,旨在減少人工設計的試錯成本,讓演算法自行尋找效能最佳的模型結構。
核心概念
神經網路架構搜尋(Neural Architecture Search,簡稱 NAS)代表著人工智慧發展歷程中的一次重要典範轉移:從「利用 AI 解決問題」進階到了「利用 AI 來設計 AI 模型」。在傳統的深度學習發展軌跡中,設計一個效能優異的神經網路架構(如著名的 ResNet、Inception 或 Transformer)是一門極度依賴人類專家經驗、直覺甚至運氣的學問。頂尖研究人員需要耗費數月甚至數年的時間,不斷進行反覆試錯,調整層數、卷積核大小、通道數量、連接方式等超參數,才能找到一個適合特定任務的網路架構。
NAS 的核心理念旨在徹底打破這種人工作坊式的高成本設計模式。它將神經網路的設計過程轉化為一個複雜的數學最佳化問題(Optimization Problem),讓機器演算法代替人類在龐大的架構空間(Search Space)中進行系統性的自動化探索,找出在特定資料集上表現最佳的網路結構。NAS 的出現標誌著自動化機器學習(AutoML)技術邁向了深水區,它不僅極大地降低了深度學習的進入門檻,讓不具備頂尖架構設計經驗的軟體工程師也能獲得高效能的模型;更重要的是,NAS 演算法能夠發掘出人類思維難以想像到的創新且高效的網路拓撲結構,持續推動整個深度學習領域性能上限的突破與發展。
運作原理
一個完整的 NAS 系統通常由三個相互獨立但又緊密配合的核心組件構成:搜尋空間(Search Space)、搜尋策略(Search Strategy)與效能評估策略(Performance Estimation Strategy)。這三個模組的協同運作共同定義了 NAS 的全自動設計流程。
搜尋空間:這是 NAS 系統允許探索的所有可能網路架構的集合總稱。搜尋空間的設計與定義至關重要,如果定義得太大,演算法搜尋將會如同海底撈針,計算成本與時間將無法承受;如果定義得太小,則可能錯失真正優秀的架構創新。搜尋空間可以是巨觀的,例如決定網路的總層數與各層的類型;也可以是微觀的基於細胞結構(Cell-based)。在 Cell-based 搜尋中,演算法只專注於搜尋一個可重複使用的微小網路模塊(Cell),然後透過堆疊這些相同的 Cell 來構建完整的龐大網路。這種方法在保證結構靈活性的同時,指數級別地縮減了搜尋範圍,是目前學界與業界最主流的作法。
搜尋策略:這決定了演算法如何在龐大且離散的搜尋空間中進行導航與有效探索。早期的 NAS 使用強化學習(Reinforcement Learning, RL),透過一個遞迴神經網路(RNN)作為控制器來生成網路架構的描述,然後將該架構在驗證集上的準確率作為獎勵訊號(Reward)來更新控制器。另一種經典策略是演化演算法(Evolutionary Algorithms),將網路架構視為生物染色體,透過隨機突變(Mutation)與交配世代交替,篩選出適應度最高的架構。近年來,基於梯度下降的可微架構搜尋(如 DARTs)成為主流。它將原本離散的架構選擇問題放鬆為連續機率分佈,從而可以直接使用反向傳播(Backpropagation)極其高效地同時優化網路架構與內部權重,將搜尋時間從數千個 GPU 小時巨幅縮減到單張 GPU 幾個小時。
效能評估策略:為了引導搜尋策略往正確的方向前進,必須評估每一個被搜尋到的子網路的效能。最原始直觀的方法是將每個子網路從頭訓練到收斂,然後測試準確率。但這種方法成本過於高昂。因此研究者發展出了多種加速評估機制,例如權重共享(Weight Sharing),讓所有被生成的子架構共享一個巨大超級網路(Supernet)的權重,避免重複訓練;低保真度預估(在較小的數據集或較少的 Epoch 訓練來推估最終效能);或是利用神經網路代理模型(Surrogate Model)來直接預測某個架構可能達到的最終表現,大幅縮短評估迴圈。
實際應用
NAS 技術已經從學術實驗室的純理論研究,全面走向了工業界的實際商業產品與應用場景中,帶來了極為顯著的影響,特別是在需要極致效能或面臨嚴苛硬體限制的環境中。
在電腦視覺(Computer Vision)與影像辨識領域,NAS 設計出的模型已經全面超越了傳統人工設計的經典網路。例如,Google 團隊透過 NAS 結合模型複合縮放技術(Compound Scaling)開發出了著名的 EfficientNet 家族。該系列模型在 ImageNet 影像分類任務上,不僅達到了當時最先進的準確率,而且其參數數量與運算量(FLOPs)比人類設計的最佳模型小了一個數量級。這種同時兼顧極高準確率與極低運算成本的特性,正是 NAS 強大數學搜索實力的最佳展現。
在邊緣運算(Edge Computing)與行動裝置應用中,NAS 發揮了無可替代的作用。智慧型手機、穿戴裝置或物聯網設備的運算力、記憶體頻寬與電池容量極度受限,根本無法運行雲端伺服器上龐大的標準深度學習模型。透過硬體感知神經網路架構搜尋(Hardware-Aware NAS),工程師可以在搜尋空間中直接加入目標晶片的硬體延遲(Latency)、能耗與記憶體佔用等硬性約束條件。演算法能夠自動權衡準確率與設備限制,客製化設計出專屬於特定手機晶片的輕量級模型。著名的 MobileNetV3 就是透過結合硬體感知 NAS 搜尋出來的,目前已廣泛應用於全球數十億台手機的人臉解鎖、計算攝影與即時影像處理功能中。
在自然語言處理(NLP)與語音辨識領域,NAS 亦被用來搜尋更高效的 Transformer 注意力機制結構,或者尋找比標準 LSTM 更加適合特定時間序列任務的記憶細胞單元。透過 NAS,企業可以針對自己獨特的垂直產業數據與商業場景,全自動地打造出獨一無二的專屬 AI 語言模型架構,不僅提升了推理速度與業務表現,也大幅降低了頂尖 AI 研究人才的招募難度與研發成本。
常見誤區
儘管 NAS 展現了驚人的潛力與前景,但在實際認知與工程應用上仍存在許多誤區。最普遍的極端誤解是認為 NAS 可以完全取代人類 AI 演算法工程師。事實上,目前的 NAS 技術遠未達到完全無人介入的自動化境界。NAS 的成功高度依賴於人類專家對搜尋空間的精心設計與約束。如果人類將搜尋空間定義得過於隨意、充滿垃圾架構,NAS 演算法再強大也無法無中生有變出魔法。人類工程師的職責只是從設計具體的網路,轉移到了更高階的設計搜尋空間與優化獎勵函數,因此 NAS 是一種強大的輔助增強工具,而非完全的人力替代品。
另一個常見的工業界迷思是認為 NAS 搜尋出來的模型一定適合所有的硬體平台部署。由於很多基礎 NAS 演算法在搜尋時僅將模型的準確率或理論浮點運算次數(FLOPs)作為優化目標,但理論上的低運算量並不直接等於在真實硬體上的低延遲執行時間。不同的 GPU、TPU 或手機 NPU 對於不同的張量運算子(如深度可分離卷積、記憶體碎片化操作)有著截然不同的底層優化程度。一個在 NAS 理論中 FLOPs 很低的模型,在實際手機晶片上跑起來可能會因為嚴重的記憶體存取瓶頸而非常緩慢。因此,現代實用的 NAS 必須強制整合具體的硬體延遲查表(Latency Lookup Table)成為硬體感知架構。
此外,許多人忽視了 NAS 本身極高的計算成本與碳足跡排放。早期的基於強化學習的 NAS 方法需要從頭訓練數以萬計的模型來進行評估,消耗了驚人的伺服器電力與運算資源。雖然近期的可微架構搜尋大幅降低了這項成本,但其架構轉移穩定性與跨資料集泛化能力有時仍受到學界質疑。盲目地對每一個微小的 AI 專案都動用 NAS 往往是大砲打小鳥,對於一般的中小型企業而言,直接微調(Fine-Tuning)開源社群中現成的頂級模型,配合簡單的超參數優化,通常是更具時間與運算成本效益的務實選擇。
與相關技術的比較
NAS 是 AutoML 領域中的一顆明珠,要深入且精準地理解它,需要將其與其他相關的機器學習優化技術進行詳細區隔。
與超參數最佳化(Hyperparameter Optimization, HPO)相比:兩者的界線有時在口語上會被混淆,但工程本質上有所不同。HPO(如網格搜索、隨機搜索、貝氏最佳化)主要用於調整給定且固定的網路架構的外部配置參數,例如學習率大小、批量大小(Batch Size)或優化器演算法的種類。HPO 絕對不會改變神經網路的拓撲結構本身。相反地,NAS 專注於從無到有地建構網路的內部骨架,例如決定是否需要在特定層與層之間加入跳躍連接(Skip Connection),或者某一層應該使用哪種尺寸的卷積核。NAS 的搜尋空間通常遠比 HPO 龐大、離散且複雜得多。
與網路剪枝(Network Pruning)及量化(Quantization)相比:網路剪枝與量化嚴格來說屬於模型壓縮(Model Compression)技術範疇。它們通常發生在一個已經被人類設計好並充分訓練完成的大型繁重模型之上。剪枝是透過演算法找出並移除不重要的神經元或權重連接來縮小模型體積;量化則是透過降低權重矩陣的數值精度(如從 32 位元浮點數暴力轉為 8 位元整數)來加速晶片運算。這些技術是既有架構由大變小的減法過程。而 NAS 則是從無到有的設計過程,直接在浩瀚的搜尋空間中找出最合適的輕量級網路結構。現代的實務邊際做法經常將兩者深度結合,即先用硬體感知 NAS 搜尋出一個原生高效的架構,訓練收斂後再施以剪枝與整數量化,以達到行動端部署的極致效能。
與傳統深度學習模型設計相比:傳統網路設計極度依賴工程師的直覺與反覆試錯,這是一種充滿不確定性的啟發式作法,容易陷入次優解,且當面對新的數據類型時,舊架構的遷移成本極高。NAS 則是將設計這件事轉化為系統化的數學演算法搜索,它讓模型架構設計過程變得具有一定程度的可重現性與數學邏輯支撐。當企業面臨一種極度特殊的專屬數據模態時,傳統方法可能需要演算法團隊摸索數年,而 NAS 可以在強大算力的支持下,於幾週內快速掃描找出適合該新數據模態的創新架構基礎骨架。
神經網路架構搜尋 在 iPAS 考試中的重點
根據歷年統計,神經網路架構搜尋 相關題目 屬於未分類考範圍。
常見問題
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定