資訊檢索(Retrieval)是什麼?

從大規模資料庫中快速且精準地找出與使用者查詢高度相關的資訊或文件的核心技術。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Retrieval
主題標籤
自然語言處理、生成式AI、大型語言模型
考點定位
非 iPAS 核心術語
最後更新
2026/06/27
資訊檢索(Retrieval)是什麼? 自然語言處理生成式AI
術語快查

搜尋意圖: 如果你在找「資訊檢索 是什麼」或「資訊檢索 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從大規模資料庫中快速且精準地找出與使用者查詢高度相關的資訊或文件的核心技術。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從大規模資料庫中快速且精準地找出與使用者查詢高度相關的資訊或文件的核心技術。

核心概念

在人工智慧與自然語言處理的領域中,檢索 (Retrieval) 扮演著不可或缺的基石角色。簡而言之,檢索技術是指系統根據使用者的查詢 (Query),從龐大且無結構或半結構化的知識庫中,篩選並提取出最相關資訊的過程。隨著大型語言模型 (LLM) 的崛起,檢索技術的地位不降反升,成為解決語言模型「幻覺」(Hallucination) 與「知識斷層」(Knowledge Cutoff) 的關鍵拼圖。

傳統的檢索通常依賴於詞彙匹配 (Lexical Matching),也就是我們熟知的關鍵字搜尋。然而,現代 AI 領域所討論的檢索,更多是指語意檢索 (Semantic Retrieval)。語意檢索超越了字面上的匹配,系統能夠理解查詢語句背後深層的意義與上下文,即使查詢與目標文件在字面上沒有完全重疊的關鍵字,只要概念相符,檢索系統依然能將其精準提取。這種轉變不僅大幅提升了搜尋的準確率,更為後續的 AI 應用奠定了穩固的資料基礎。

運作原理

現代 AI 檢索系統的運作原理可以拆解為幾個高度關聯的核心步驟:索引建構、查詢處理、特徵比對與重新排序。

  1. 資料前處理與索引建構 (Indexing): 這是檢索系統的基礎建設階段。所有的文件、網頁或知識庫內容都會先經過清洗與分割 (Chunking)。接著,透過強大的嵌入模型 (Embedding Model) 將這些文字片段轉換為高維度的浮點數向量 (Vectors)。這些向量捕捉了文字的語意特徵,並被儲存於專門的向量資料庫 (Vector Database) 中。建立索引的優劣直接決定了後續檢索的速度與品質。

  2. 查詢處理 (Query Processing): 當使用者輸入查詢時,系統首先會對這個查詢進行解析。有時候,系統會利用語言模型對查詢進行擴展或重寫 (Query Rewriting),以釐清使用者的真實意圖。隨後,這個處理過的查詢會被同一個嵌入模型轉換為向量。

  3. 相似度計算與初步檢索 (Similarity Computation): 系統會在向量資料庫中,計算「查詢向量」與所有「文件向量」之間的距離。常用的數學度量包括餘弦相似度 (Cosine Similarity)、內積 (Dot Product) 或歐氏距離 (Euclidean Distance)。距離越近,代表語意越相似。系統會迅速篩選出最相關的 Top-K 份文件。這一步通常被稱為密集檢索 (Dense Retrieval)

  4. 重新排序 (Reranking): 為了進一步提升精準度,初步檢索出的文件集合會交由一個更複雜但計算成本較高的重排模型 (Reranker,例如 Cross-Encoder)。重排模型會同時考量查詢與文件的交互特徵,對這 Top-K 份文件進行更精細的分數計算與排序,最終輸出給使用者的結果將是高度相關且邏輯契合的資訊。

實際應用

檢索技術在當今的 AI 產品中無處不在,其應用深度與廣度都在持續擴張:

  • 檢索增強生成 (Retrieval-Augmented Generation, RAG):這是目前最熱門的應用。企業利用檢索技術從內部文件庫中找出與使用者問題相關的片段,並將這些片段作為上下文提供給大型語言模型,讓 LLM 能夠基於最新、最準確的企業私有資料生成回答。這極大地解決了模型胡說八道的問題。
  • 智慧企業搜尋系統:有別於過去只能搜尋檔名的系統,現代檢索讓員工可以用自然語言提問,例如「去年第四季的行銷預算報告在哪裡?」,系統能直接從龐大的雲端硬碟中檢索出包含該答案的文件與具體段落。
  • 精準電商推薦與搜尋:電子商務平台利用多模態檢索技術,讓消費者不僅能用語音或文字搜尋,還能上傳圖片進行「以圖搜圖」,系統會從商品庫中檢索出視覺與語意最相近的商品。
  • 專業領域輔助 (醫療/法律):在需要極高準確度的醫療文獻或法律判例分析中,檢索系統能幫助專業人士快速定位過去的相似案例、相關法規或最新醫學期刊,大幅減少人工翻閱資料的時間。

常見誤區

儘管檢索技術強大,但在實務認知上仍有幾個常見的誤區:

  1. 「檢索」與「生成」的混淆:許多人誤以為只要使用了 ChatGPT 就是在進行檢索。實際上,單純的 LLM 是在「生成」它訓練資料中記住的模式,並不保證事實正確性;而「檢索」是實實在在地從資料庫中把具體的文件「提取」出來。兩者結合才是 RAG 架構。
  2. 向量檢索 (Dense) 永遠優於關鍵字檢索 (Sparse):雖然語意檢索擅長理解概念,但在特定場景下(例如搜尋特定的產品型號、人名、專有名詞),傳統的 TF-IDF 或 BM25 關鍵字檢索反而更精準。因此,現代最佳實踐通常是結合兩者的混合檢索 (Hybrid Search)
  3. 過度關注 LLM 而忽略檢索品質:在構建 AI 應用時,許多團隊花費大量精力微調模型,卻忽略了「垃圾進,垃圾出 (Garbage In, Garbage Out)」的原則。如果檢索系統找出的資料本身就不相關或品質低落,再強大的生成模型也無法給出正確答案。

與相關技術的比較

  • 檢索 (Retrieval) vs 微調 (Fine-Tuning): 當企業希望語言模型擁有特定領域知識時,面臨的兩個主要選擇是檢索與微調。微調是將知識內化到模型的權重中,成本高、更新不易,且難以溯源;而檢索則是外掛一個知識庫,成本較低、知識更新即時,且生成的每個答案都可以追溯到具體的檢索來源文件,透明度極高。

  • 稀疏檢索 (Sparse Retrieval) vs 密集檢索 (Dense Retrieval): 稀疏檢索(如 BM25)基於詞彙頻率,優勢在於精確匹配和計算速度快,但對同義詞或語句變換的容錯率低。密集檢索基於深度學習嵌入模型,優勢在於能捕捉上下文語意,但計算資源需求較高。兩者的融合 (Hybrid Retrieval) 截長補短,是目前業界的主流標準。

常見問題

檢索技術在 RAG 架構中扮演什麼樣的角色?

在 RAG(檢索增強生成)架構中,檢索扮演著「知識提供者」與「事實守門員」的關鍵角色。當使用者提問時,檢索系統會優先從企業內部或可信賴的外部知識庫中,快速尋找出最相關的文件片段。這些片段隨後會連同使用者的問題一起餵給語言模型,確保模型在生成回答時,有堅實的事實基礎可以參考,大幅降低了模型憑空捏造(幻覺)的風險,同時解決了語言模型無法即時更新知識的問題。

向量檢索 (Dense Retrieval) 真的可以完全取代傳統的關鍵字檢索嗎?

並不能完全取代。雖然向量檢索強大於理解語意與上下文,即使關鍵字不完全匹配也能找到相關內容,但在特定情境下它表現不佳。例如當使用者想要精確搜尋特定的產品序號、罕見人名或專有代碼時,傳統的關鍵字檢索(如 TF-IDF 或 BM25)反而能提供更精準的絕對匹配。因此,目前業界最推薦的做法是採用「混合檢索 (Hybrid Retrieval)」,結合兩者的優勢,再透過重排模型來提升最終結果的品質。

為什麼檢索出來的資料品質會直接影響 AI 的表現?

這是因為語言模型在 RAG 流程中極度依賴提示詞(Prompt)提供的上下文。業界常說的「垃圾進,垃圾出 (Garbage In, Garbage Out)」在這裡完全適用。如果檢索系統因為演算法不佳或索引混亂,找出了錯誤、過時或不相關的文件,語言模型就會基於這些錯誤資訊進行推理與總結,最終產生的回答必然也是錯誤的。因此,優化文件的切塊 (Chunking) 策略與檢索準確率,往往比單純更換更大的語言模型更能提升系統的整體表現。