AI專題

CLIP是什麼?OpenAI對比式圖文預訓練模型解析:4億組圖文配對如何實現零樣本影像分類

E
EffectStory 編輯部編輯部
發布 · 更新
OpenAI的CLIP以自網路蒐集的4億組圖文配對訓練,透過影像與文字編碼器把兩者特徵投影到同一潛在空間、以內積算相似度,使模型在ImageNet零樣本分類即可追平ResNet-50,且完全不用其128萬筆訓練樣本;並在逾30個電腦視覺資料集上驗證跨任務泛化能力。

CLIP是什麼?模型定義與零樣本學習的核心概念

OpenAI的CLIP是以圖片與文字配對訓練的神經網路,能以自然語言指示模型為一張影像找出最相關的文字描述CITE:E1。這項預測不需要針對該任務直接最佳化即可完成,OpenAI將此能力類比為GPT-2與GPT-3展現的零樣本能力CITE:E1

CLIP的預訓練方法:對比式學習與4億級規模的圖文配對

CLIP的預訓練任務是預測哪段文字說明對應哪張圖片,OpenAI以此從零學習影像表徵CITE:E2。訓練所用的資料集由自網路蒐集而成的4億組(圖片,文字)配對組成CITE:E2。OpenAI稱這是一種「有效率且可擴展、能從零學習SOTA(當前最佳)影像表徵」的方式CITE:E2

CLIP的技術架構:雙編碼器與向量空間映射

CLIP的架構由影像編碼器與文字編碼器組成,分別取得視覺特徵與文字特徵CITE:E6。Hugging Face的技術文件說明,這兩種特徵會被投影到維度相同的潛在(嵌入)空間,模型再以兩者的內積計算相似度分數CITE:E6

CLIP如何實現零樣本遷移:從預訓練到下游任務

完成預訓練後,CLIP以自然語言指涉模型已學到的視覺概念,或用來描述新的概念,藉此讓模型零樣本遷移到下游任務CITE:E3

CLIP的零樣本性能突破:ImageNet基準測試

在ImageNet基準測試中,CLIP零樣本分類即可匹配原始ResNet-50的準確率CITE:E4。OpenAI指出,達成此結果完全不需要使用ResNet-50訓練時所用的128萬筆訓練樣本CITE:E4

CLIP的泛化性能:跨資料集與跨任務的基準評估

OpenAI在30多個既有電腦視覺資料集上為CLIP做基準測試,藉此評估其跨任務泛化能力CITE:E5。測試範圍涵蓋OCR(光學文字辨識)、影片動作辨識、地理定位,以及多種細粒度物件分類等任務CITE:E5

關鍵數字一覽

項目數字說明
預訓練圖文配對規模4億組自網路蒐集的(圖片,文字)配對,用於從零學習影像表徵CITE:E2
ImageNet訓練樣本128萬筆CLIP零樣本分類匹配ResNet-50準確率時,完全未使用的訓練樣本數CITE:E4
基準測試資料集數量30多個涵蓋OCR、影片動作辨識、地理定位與細粒度物件分類等任務CITE:E5

這代表什麼:CLIP以4億組網路圖文配對取代ResNet-50所需的128萬筆人工標註訓練樣本,仍在ImageNet零樣本分類上達到相同準確率CITE:E4;而OpenAI進一步在30多個涵蓋OCR、影片動作辨識、地理定位與細粒度物件分類的資料集上驗證此方法CITE:E5,顯示雙編碼器與同一潛在空間的架構設計CITE:E6,與其零樣本遷移機制CITE:E3,是支撐上述規模與廣度驗證結果的共同基礎。

📊 證據與數據

常見問題

CLIP是什麼?模型定義與零樣本學習的核心概念

OpenAI的CLIP是以圖片與文字配對訓練的神經網路,能以自然語言指示模型為一張影像找出最相關的文字描述CITE:E1。這項預測不需要針對該任務直接最佳化即可完成,OpenAI將此能力類比為GPT-2與GPT-3展現的零樣本能力CITE:E1。

CLIP如何實現零樣本遷移:從預訓練到下游任務

完成預訓練後,CLIP以自然語言指涉模型已學到的視覺概念,或用來描述新的概念,藉此讓模型零樣本遷移到下游任務CITE:E3。

📎 資料來源

  1. github.com
  2. arxiv.org
  3. huggingface.co

延伸數據

作者觀點EffectStory 編輯部

CLIP真正的技術判斷點不在於它贏了ResNet-50多少,證據顯示的是「追平」而非超越——真正的關鍵是它用4億組網路圖文配對取代了128萬筆人工標註樣本,卻能在同一個ImageNet基準上打平監督式訓練的結果。這意味著雙編碼器將圖文特徵投影到同一潛在空間、以內積計算相似度的架構設計,本身就足以承載零樣本遷移,不需要針對下游任務重新標註或微調。後續值得觀察的具體指標,是這套雙編碼器架構在30多個資料集所涵蓋的OCR、影片動作辨識、地理定位與細粒度物件分類之外的任務類型上,是否仍能維持「零樣本追平監督式基準」的表現模式。

E
EffectStory 編輯部編輯部

相關文章

快訊

中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作

中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。

EffectStory 編輯部 ·