嵌入模型 是什麼?

Embedding Model:嵌入模型 的完整解釋

將文字、圖像、音頻等高維度輸入轉換為低維稠密向量表示的模型,使語義相近的內容在向量空間中距離相近。

嵌入模型的核心思想是「語義相似 = 向量空間相近」。傳統的文字表示方法(如 one-hot encoding)將每個詞表示為只有一個位置為 1 的高維稀疏向量,無法表達詞與詞之間的語義關係(「貓」和「狗」的 one-hot 向量正交,無法反映兩者都是動物的語義關聯)。嵌入模型透過大規模語料訓練,學習到能夠捕捉語義關係的緻密向量表示,使得「國王 - 男人 + 女人 ≈ 女王」這樣的語義運算成為可能。

嵌入模型的發展脈絡

  • Word2Vec(2013):由 Google 提出,包含 CBOW(連續詞袋)和 Skip-gram 兩種架構,透過預測上下文詞或被遮蔽詞的方式學習詞向量。每個詞對應一個固定向量,無法處理一詞多義。
  • GloVe(2014):基於全局共現統計的詞向量,結合全局與局部上下文資訊。
  • ELMo(2018):使用雙向 LSTM,為每個詞生成上下文相關的向量,同一個詞在不同句子中有不同嵌入,解決多義問題。
  • BERT(2018):Transformer 架構的雙向預訓練語言模型,生成動態的上下文嵌入,在多數 NLP 任務上取得突破。
  • Sentence Transformers / SBERT(2019):針對句子級語義相似度優化的 BERT 變體,透過孿生網路架構(Siamese Network)訓練,生成可直接用餘弦相似度比較的句向量。
  • 現代大型嵌入模型(2023-2025):如 OpenAI text-embedding-3 系列、Cohere Embed、voyage-3 等,基於更大規模的 LLM 骨幹訓練,支援多語言、多模態,維度可達數千。

嵌入的維度與品質

嵌入向量的維度(如 384、768、1536、3072 維)影響模型能夠捕捉的語義細膩程度,但也影響儲存成本與計算效率。維度並非越高越好,需要根據任務和規模在品質與效率間取捨。衡量嵌入品質的常用基準測試包括:MTEB(Massive Text Embedding Benchmark)和 BEIR(Benchmarking IR),涵蓋語義相似度、資訊檢索、分類等多種任務。

核心應用場景

  1. 語意搜尋(Semantic Search):將查詢和文件都轉為嵌入向量,以向量相似度替代關鍵字匹配,能找到語義相關但用詞不同的結果(如搜尋「心臟疾病」能找到含「心肌梗塞」的文件)。

  2. RAG(Retrieval-Augmented Generation):在 LLM 回答問題前,先用嵌入模型從知識庫中檢索相關段落,將其作為上下文餵給 LLM,提升答案的準確性和可靠性。

  3. 向量資料庫(Vector Database):Pinecone、Weaviate、Qdrant、pgvector 等向量資料庫專門儲存和高效檢索嵌入向量,是現代 AI 應用基礎設施的重要組成。

  4. 推薦系統:將用戶行為和物品特徵嵌入到同一向量空間,以向量相似度計算用戶與物品的匹配度。

  5. 文件聚類與分類:對文件嵌入進行 K-Means 或 DBSCAN 聚類,或作為分類器的輸入特徵。

  6. 跨模態搜尋:多模態嵌入模型(如 CLIP)能將圖像和文字嵌入到同一空間,支援「用文字搜圖像」或「用圖像搜文字」。

嵌入模型與生成模型的區別

嵌入模型(Encoder)的輸出是固定維度的向量,設計用於表示輸入的語義;生成模型(Decoder / LLM)的輸出是文字序列,設計用於生成內容。兩者常結合使用,嵌入模型負責「找到」相關資訊,生成模型負責「理解並回答」問題,即 RAG 架構的分工模式。

常見問題