AI專題

Vision Transformer(ViT):影像塊序列如何讓純 Transformer 取代卷積網路完成影像分類

N
Nathan科技編輯 · 技術負責人
發布 · 更新
Google Research 提出的 Vision Transformer(ViT)將影像切成固定大小影像塊,當作詞元序列直接輸入純 Transformer,不需依賴卷積網路即可完成影像分類;大量資料預訓練後,表現優於當時最先進卷積網路,且訓練所需計算資源更少。

ViT 的核心創新是什麼?為什麼要將影像分割成固定大小的 patch 序列?

ViT 由 Google Research 提出,將影像切成固定大小的影像塊作為輸入CITE:E1。具體做法是把這些影像塊的線性嵌入序列,直接提供給 Transformer 作為輸入CITE:E1。在架構設計上,影像塊被當成 NLP 任務裡的詞元(單字)一樣處理CITE:E2。Google Research 進一步指出,對卷積網路(ConvNet)的依賴並非必要——純 Transformer 直接作用於影像塊序列,就能在影像分類任務上表現良好CITE:E7

位置嵌入在 ViT 中如何保留影像的空間資訊?

ViT 會把位置嵌入加到影像塊嵌入上,藉此保留影像的空間位置資訊CITE:E3。由於 Transformer 本身不像卷積運算那樣天生具備空間鄰近的概念,位置嵌入是 ViT 用來補上這塊資訊的機制CITE:E3

ViT 在預訓練與性能上相比卷積網路有什麼優勢?

ViT 經大量資料預訓練後,在多個影像辨識基準上優於當時最先進卷積網路CITE:E4。Google Research 在 2020 年的研究中指出,ViT 在遷移至 ImageNet、CIFAR-100、VTAB 等多個中小型影像辨識基準時取得優異成績,同時訓練所需計算資源低於當時最先進的卷積網路CITE:E4

ViT 相比 CNN 缺少了哪些歸納偏置,為什麼資料量不足時會表現不佳?

ViT 缺乏卷積網路(CNN)固有的部分歸納偏置,例如平移等變性與局部性CITE:E5。Google Research 指出,正因為缺少這些歸納偏置,Transformer 在訓練資料量不足時無法良好泛化CITE:E5。這說明了 ViT 在前一節展現的效能優勢,是建立在「大量資料預訓練」這個前提之上CITE:E4CITE:E5

ViT 的具體架構配置有哪些,以市面現有模型為例有什麼特徵?

以 Hugging Face 釋出的 google/vit-base-patch16-224 為例,此為基礎版架構CITE:E6。Hugging Face 的文件記載,該模型的影像塊解析度為 16x16、微調解析度為 224x224CITE:E6

項目數值
影像塊解析度(patch resolution)16×16
微調解析度(fine-tuning resolution)224×224
論文發表年份2020

影像塊與微調解析度數據引自 Hugging Face 文件CITE:E6,論文發表年份引自 Google Research 的研究CITE:E4

這代表什麼

從影像塊序列輸入、位置嵌入補上空間資訊,到大量資料預訓練後超越當時最先進卷積網路,ViT 呈現的是一條把 Transformer 架構從 NLP 直接搬進影像分類的路徑CITE:E1CITE:E2CITE:E3CITE:E4CITE:E7。但 Google Research 同時指出,這條路徑的代價是喪失 CNN 內建的平移等變性與局部性等歸納偏置,使 ViT 在資料量不足時的泛化能力受限CITE:E5;而 Hugging Face 釋出的 google/vit-base-patch16-224,則顯示這套架構已從研究論文延伸為具備明確影像塊解析度與微調解析度的可用模型規格CITE:E6

📊 證據與數據

常見問題

ViT 的核心創新是什麼?為什麼要將影像分割成固定大小的 patch 序列?

ViT 由 Google Research 提出,將影像切成固定大小的影像塊作為輸入CITE:E1。具體做法是把這些影像塊的線性嵌入序列,直接提供給 Transformer 作為輸入CITE:E1。在架構設計上,影像塊被當成 NLP 任務裡的詞元(單字)一樣處理CITE:E2。

位置嵌入在 ViT 中如何保留影像的空間資訊?

ViT 會把位置嵌入加到影像塊嵌入上,藉此保留影像的空間位置資訊CITE:E3。由於 Transformer 本身不像卷積運算那樣天生具備空間鄰近的概念,位置嵌入是 ViT 用來補上這塊資訊的機制CITE:E3。

ViT 在預訓練與性能上相比卷積網路有什麼優勢?

ViT 經大量資料預訓練後,在多個影像辨識基準上優於當時最先進卷積網路CITE:E4。Google Research 在 2020 年的研究中指出,ViT 在遷移至 ImageNet、CIFAR-100、VTAB 等多個中小型影像辨識基準時取得優異成績,同時訓練所需計算資源低於當時最先進的卷積網路CITE:E4。

ViT 相比 CNN 缺少了哪些歸納偏置,為什麼資料量不足時會表現不佳?

ViT 缺乏卷積網路(CNN)固有的部分歸納偏置,例如平移等變性與局部性CITE:E5。Google Research 指出,正因為缺少這些歸納偏置,Transformer 在訓練資料量不足時無法良好泛化CITE:E5。

📎 資料來源

  1. arxiv.org
  2. arxiv.org
  3. huggingface.co
  4. research.google

延伸數據

作者觀點Nathan

ViT 的關鍵在於架構抉擇本身:Google Research 證明拿掉卷積網路,只靠影像塊序列加位置嵌入,大量資料預訓練後就能超越當時最先進的卷積網路。但這個優勢有交換條件——缺少平移等變性與局部性等歸納偏置,代表表現高度依賴預訓練資料量,而非架構本身的巧思。對評估 google/vit-base-patch16-224 這類模型的團隊而言,該追蹤的指標不是 16×16 的切塊方式或 224×224 的微調解析度本身,而是手上資料規模能否撐起這種『捨棄歸納偏置換取擴展性』的選擇。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作

中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。

EffectStory 編輯部 ·