中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
ViT 由 Google Research 提出,將影像切成固定大小的影像塊作為輸入CITE:E1。具體做法是把這些影像塊的線性嵌入序列,直接提供給 Transformer 作為輸入CITE:E1。在架構設計上,影像塊被當成 NLP 任務裡的詞元(單字)一樣處理CITE:E2。Google Research 進一步指出,對卷積網路(ConvNet)的依賴並非必要——純 Transformer 直接作用於影像塊序列,就能在影像分類任務上表現良好CITE:E7。
ViT 會把位置嵌入加到影像塊嵌入上,藉此保留影像的空間位置資訊CITE:E3。由於 Transformer 本身不像卷積運算那樣天生具備空間鄰近的概念,位置嵌入是 ViT 用來補上這塊資訊的機制CITE:E3。
ViT 經大量資料預訓練後,在多個影像辨識基準上優於當時最先進卷積網路CITE:E4。Google Research 在 2020 年的研究中指出,ViT 在遷移至 ImageNet、CIFAR-100、VTAB 等多個中小型影像辨識基準時取得優異成績,同時訓練所需計算資源低於當時最先進的卷積網路CITE:E4。
ViT 缺乏卷積網路(CNN)固有的部分歸納偏置,例如平移等變性與局部性CITE:E5。Google Research 指出,正因為缺少這些歸納偏置,Transformer 在訓練資料量不足時無法良好泛化CITE:E5。這說明了 ViT 在前一節展現的效能優勢,是建立在「大量資料預訓練」這個前提之上CITE:E4CITE:E5。
以 Hugging Face 釋出的 google/vit-base-patch16-224 為例,此為基礎版架構CITE:E6。Hugging Face 的文件記載,該模型的影像塊解析度為 16x16、微調解析度為 224x224CITE:E6。
| 項目 | 數值 |
|---|---|
| 影像塊解析度(patch resolution) | 16×16 |
| 微調解析度(fine-tuning resolution) | 224×224 |
| 論文發表年份 | 2020 |
影像塊與微調解析度數據引自 Hugging Face 文件CITE:E6,論文發表年份引自 Google Research 的研究CITE:E4。
從影像塊序列輸入、位置嵌入補上空間資訊,到大量資料預訓練後超越當時最先進卷積網路,ViT 呈現的是一條把 Transformer 架構從 NLP 直接搬進影像分類的路徑CITE:E1CITE:E2CITE:E3CITE:E4CITE:E7。但 Google Research 同時指出,這條路徑的代價是喪失 CNN 內建的平移等變性與局部性等歸納偏置,使 ViT 在資料量不足時的泛化能力受限CITE:E5;而 Hugging Face 釋出的 google/vit-base-patch16-224,則顯示這套架構已從研究論文延伸為具備明確影像塊解析度與微調解析度的可用模型規格CITE:E6。
ViT 由 Google Research 提出,將影像切成固定大小的影像塊作為輸入CITE:E1。具體做法是把這些影像塊的線性嵌入序列,直接提供給 Transformer 作為輸入CITE:E1。在架構設計上,影像塊被當成 NLP 任務裡的詞元(單字)一樣處理CITE:E2。
ViT 會把位置嵌入加到影像塊嵌入上,藉此保留影像的空間位置資訊CITE:E3。由於 Transformer 本身不像卷積運算那樣天生具備空間鄰近的概念,位置嵌入是 ViT 用來補上這塊資訊的機制CITE:E3。
ViT 經大量資料預訓練後,在多個影像辨識基準上優於當時最先進卷積網路CITE:E4。Google Research 在 2020 年的研究中指出,ViT 在遷移至 ImageNet、CIFAR-100、VTAB 等多個中小型影像辨識基準時取得優異成績,同時訓練所需計算資源低於當時最先進的卷積網路CITE:E4。
ViT 缺乏卷積網路(CNN)固有的部分歸納偏置,例如平移等變性與局部性CITE:E5。Google Research 指出,正因為缺少這些歸納偏置,Transformer 在訓練資料量不足時無法良好泛化CITE:E5。
ViT 的關鍵在於架構抉擇本身:Google Research 證明拿掉卷積網路,只靠影像塊序列加位置嵌入,大量資料預訓練後就能超越當時最先進的卷積網路。但這個優勢有交換條件——缺少平移等變性與局部性等歸納偏置,代表表現高度依賴預訓練資料量,而非架構本身的巧思。對評估 google/vit-base-patch16-224 這類模型的團隊而言,該追蹤的指標不是 16×16 的切塊方式或 224×224 的微調解析度本身,而是手上資料規模能否撐起這種『捨棄歸納偏置換取擴展性』的選擇。
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
Sony Music Publishing、Warner Chappell等多家音樂出版商於2026年8月28日晚間向加州北區地方法院對Anthropic提起訴訟,並將共同創辦人Dario Amodei、Benjamin Mann列為個人被告,求償每件作品最高15萬美元,總額上看數十億美元。
Anthropic今年8月接連與Lambda簽下350億美元、與Nscale簽下450億美元算力合約,兩案的資料中心與晶片皆與輝達相關:輝達是Lambda股東與晶片供應商,也是Nscale的投資方,並被外媒指為德州資料中心租戶。