AI專題

多模態 AI 是什麼?GPT-4o 與 Gemini 如何同時理解文字、圖片、聲音與影像

N
Nathan科技編輯 · 技術負責人
發布 · 更新
OpenAI與Google官方説明顯示,多模態AI已從「串接多個模型」走向「單一模型端到端處理」:GPT-4o以單一神經網路處理文字、音訊、影像與視訊,Gemini則從預訓練階段就跨模態設計,但GPT-4o的新音訊視訊功能發表時僅先開放給少數受信任夥伴。

多模態 AI 的核心定義是什麼?如何無縫理解與結合不同類型的資訊?

Google 將 Gemini 定義為能夠一般化並無縫理解、跨越並結合文字、程式碼、音訊、影像與視訊等不同類型資訊的模型CITE:E1。Google 在 2023 年 12 月 6 日發布的官方說明中指出,Gemini 是「從頭打造」成多模態,而非事後拼接不同功能CITE:E1

純文字模型與串接式做法存在什麼限制?這些限制如何導致關鍵資訊遺失?

OpenAI 說明,GPT-4o 問世前的語音模式是由三個獨立模型串接而成的流程CITE:E2。具體做法是:先由一個模型把語音轉成文字,再由 GPT-3.5 或 GPT-4 讀取文字並輸出文字,最後由第三個模型把文字轉回語音CITE:E2。OpenAI 指出,身為主要智能來源的模型在這個流程中只讀得到文字,無法直接感知語氣、多位說話者或背景聲,也無法輸出笑聲、歌唱或表達情緒CITE:E2

GPT-4o 支持哪些模態的輸入與輸出?其端到端統一訓練方式有什麼優勢?

GPT-4o 接受文字、音訊、影像與視訊的任意組合作為輸入,並輸出文字、音訊與影像的任意組合CITE:E3。值得注意的是,輸出模態不含視訊,僅涵蓋文字、音訊與影像三種CITE:E3。OpenAI 表示,GPT-4o 是一個跨文字、視覺與音訊端到端訓練而成的單一新模型,所有輸入與輸出都由同一個神經網路處理,而非分別由不同元件負責CITE:E5

Gemini 如何實現原生多模態?其多模態預訓練策略與 GPT-4o 有何不同?

Google 表示,Gemini 從設計之初就是「原生多模態」,一開始便以不同模態進行預訓練CITE:E4。Google 說明,團隊之後再以額外的多模態資料微調 Gemini,以進一步提升效果CITE:E4。相對於 OpenAI 以單一神經網路端到端訓練文字、視覺與音訊CITE:E5,Gemini 選擇的路徑是讓多模態預訓練從一開始就存在,兩者的共同點都是不把個別模型串接完成任務CITE:E4

多模態 AI 在複雜推理上有何優勢?如何幫助理解複雜的文字與視覺資訊組合?

Google 指出,Gemini 1.0 的多模態推理能力有助於理解複雜的文字與視覺資訊CITE:E6

當前多模態 AI 的技術成熟度如何?能力宣稱與實際可用功能存在什麼差距?

OpenAI 在發表 GPT-4o 時說明,新的音訊與視訊能力將先開放給 API 的一小群受信任夥伴CITE:E7。這代表發表當下宣布的能力,與實際開放給多數開發者使用之間存在時間差CITE:E7

這代表什麼

GPT-4o 與 Gemini 的官方說明共同指向同一個設計選擇:兩家公司都把「單一模型處理多種模態」當作優於「多個模型串接」的做法,前者用以避免舊語音模式因串接而遺失語氣、說話者與背景聲等資訊CITE:E2,GPT-4o 以端到端單一神經網路達成CITE:E5,Gemini 則從預訓練階段就導入多模態CITE:E4。但 OpenAI 也自行說明,GPT-4o 發表當下宣布的音訊與視訊能力,並非同步全面開放,而是先侷限於一小群受信任的 API 夥伴CITE:E7。這顯示多模態能力的「發表」與「可用」之間,存在官方自行揭露的落差。

📊 證據與數據

常見問題

多模態 AI 的核心定義是什麼?如何無縫理解與結合不同類型的資訊?

Google 將 Gemini 定義為能夠一般化並無縫理解、跨越並結合文字、程式碼、音訊、影像與視訊等不同類型資訊的模型CITE:E1。Google 在 2023 年 12 月 6 日發布的官方說明中指出,Gemini 是「從頭打造」成多模態,而非事後拼接不同功能CITE:E1。

純文字模型與串接式做法存在什麼限制?這些限制如何導致關鍵資訊遺失?

OpenAI 說明,GPT-4o 問世前的語音模式是由三個獨立模型串接而成的流程CITE:E2。具體做法是:先由一個模型把語音轉成文字,再由 GPT-3.5 或 GPT-4 讀取文字並輸出文字,最後由第三個模型把文字轉回語音CITE:E2。

GPT-4o 支持哪些模態的輸入與輸出?其端到端統一訓練方式有什麼優勢?

GPT-4o 接受文字、音訊、影像與視訊的任意組合作為輸入,並輸出文字、音訊與影像的任意組合CITE:E3。值得注意的是,輸出模態不含視訊,僅涵蓋文字、音訊與影像三種CITE:E3。

Gemini 如何實現原生多模態?其多模態預訓練策略與 GPT-4o 有何不同?

Google 表示,Gemini 從設計之初就是「原生多模態」,一開始便以不同模態進行預訓練CITE:E4。Google 說明,團隊之後再以額外的多模態資料微調 Gemini,以進一步提升效果CITE:E4。

📎 資料來源

  1. blog.google
  2. openai.com

延伸數據

作者觀點Nathan

GPT-4o 與 Gemini 的官方說明點出同一個技術判斷:用單一模型端到端處理文字、音訊、影像與視訊,能避免像 GPT-4o 舊語音模式那樣因三段式串接而遺失語氣、說話者與背景聲等資訊。但值得留意的是,GPT-4o 的輸入涵蓋視訊、輸出卻不含視訊,顯示「全模態輸出」目前仍有邊界;而 OpenAI 也坦承,新的音訊視訊能力發表時只先開放給一小群受信任的 API 夥伴。接下來該觀察的具體指標,是這些能力何時從「受信任夥伴」擴大到一般開發者可用。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·