AI模型的7B、70B是什麼意思?現在開源模型跟ChatGPT、Claude、Gemini差距多少?

近年來,人工智慧快速發展,許多人開始使用AI聊天、查資料、寫文章、翻譯語言和設計程式。在介紹大型語言模型時,人們經常看到7B、32B、70B,甚至數百B等數字。這些數字究竟代表什麼?模型是不是數字愈大就一定愈聰明?而ChatGPT、Claude和Gemini等知名AI,究竟又有多大?

B是英文Billion的縮寫,意思是「十億」。因此,一個7B的模型,大約擁有70億個參數;70B代表大約700億個參數。如果一個模型標示為400B,意思就是它的總參數量大約為4000億個。

所謂的「參數」,可以想像成AI大腦裡數量非常龐大的「調整旋鈕」。AI在訓練過程中閱讀大量文字和其他資料,經過一次又一次的學習與調整,逐漸改變這些參數的數值。當使用者提出問題時,這些參數會共同參與計算,幫助模型判斷接下來應該產生什麼內容。

不過,參數並不是一條一條儲存好的知識。例如,一個擁有1000億個參數的模型,並不代表它記住了1000億個答案。比較接近的理解方式是,模型經過大量學習後,形成一套非常複雜的判斷能力。當看到「太陽從東邊」這段文字時,它可以判斷接下來出現「升起」的可能性很高,而出現「游泳」的可能性非常低。

那麼,模型的參數愈多,是不是就一定愈聰明?答案並不一定。模型的能力除了受到參數量影響,也與模型架構、訓練資料的數量和品質、訓練方式,以及模型回答問題時使用多少運算資源有關。因此,一個較新、訓練方法更好的小型模型,有時可能在某些工作上超越較老的大型模型。

這就像比較汽車時,不能只看引擎大小。一輛車跑得快不快,還受到車身重量、輪胎、空氣力學設計和駕駛技術等因素影響。同樣地,只看AI模型名稱後面的B數,也無法完整判斷模型真正的能力。

近年的大型AI模型還出現了一項重要技術,稱為「混合專家模型」,英文是Mixture of Experts,簡稱MoE。這項技術改變了人們理解模型大小的方式,因為一個MoE模型即使擁有數千億個總參數,也不代表每次回答問題時,所有參數都會同時參與計算。

MoE可以想像成一間擁有許多醫生的大醫院。醫院裡雖然有上百名醫生,但是一名病人來看診時,不需要所有醫生一起進入診間。醫院會根據病人的情況,安排適合的人員處理問題。其他醫生則可以處理不同工作,不必所有人同時擠在一張診療床旁邊研究同一名病人。

在MoE模型中,這些負責不同運算工作的部分被稱為「專家」,英文叫做Expert。不過,AI怎麼知道現在應該找哪些Expert幫忙?答案是模型裡還有一個稱為「路由器」,英文叫做Router的機制。Router的工作就像醫院裡的分診人員,負責判斷目前收到的資訊應該交給哪些Expert處理。

AI處理文字時,並不是直接把整篇文章當成一個完整單位來理解,而是會把文字分成許多稱為Token的小單位。Token有時可能是一個字、一個詞,也可能只是詞的一部分。當這些Token經過MoE模型的相關運算層時,Router會根據目前的資訊進行評分,再選擇少數Expert參與計算。

例如,假設一個MoE層有八名Expert。某個Token進來時,Router可能判斷第三名和第五名Expert最適合處理,因此把工作交給它們。下一個Token進來時,Router可能又選擇第二名和第七名Expert。因此,MoE不是先看完整個問題後,決定這次只由固定幾名Expert工作,而是可以隨著處理不同Token,不斷改變分配方式。

很多人可能會想像,AI裡有一名數學Expert、一名中文Expert和一名程式設計Expert。實際情況通常沒有這麼整齊。研究人員不一定事先規定某名Expert只能處理數學,另一名只能處理英文。這些分工通常是在模型訓練過程中逐漸形成的。

模型開始訓練時,Router並不知道應該把哪些資訊交給哪些Expert。隨著模型不斷閱讀資料、嘗試預測答案並修正錯誤,Router和Expert也會一起學習。經過長時間訓練後,某些Expert可能逐漸擅長處理特定類型的資訊,而Router也逐漸學會遇到某些資訊特徵時,交給哪些Expert處理可能得到比較好的結果。

有些Expert可能比較常處理程式碼、數學或特定語言,但也有許多Expert負責的工作非常抽象,人類很難簡單地替它們貼上標籤。它們可能擅長處理某種句子結構、語意關係或其他複雜的數學特徵,而不是像學校老師一樣,在辦公室門口掛著「數學老師」或「英文老師」的牌子。

MoE還會遇到另一個有趣的問題。如果Router發現某一名Expert特別好用,就可能把大量工作都交給它。結果這名Expert非常忙碌,其他Expert卻幾乎沒有工作。這就像一家公司把所有重要工作都交給同一名最厲害的員工,最後可能不是公司效率變高,而是那名員工開始認真研究離職網站。

為了避免這種情況,研究人員會設計負載平衡機制,讓工作不要過度集中在少數Expert身上。因此,MoE並不是單純把一個巨大模型切成許多小模型,而是一套複雜的動態分工系統。研究人員除了要訓練Router如何選擇Expert,也要處理工作分配、運算效率和不同電腦晶片之間傳送資料等問題。

這也讓現代AI模型的大小變得更難比較。傳統的密集模型在進行一次計算時,通常會使用模型中大部分相關參數;MoE模型則可能擁有非常龐大的總參數量,但每次只啟動其中一部分。因此,現在介紹一個MoE模型時,經常會同時出現「總參數」和「啟動參數」兩種數字。

至於開放模型和ChatGPT、Claude、Gemini等大型AI服務之間,究竟相差多少參數,目前並沒有辦法得到精確答案。原因是OpenAI、Anthropic和Google等公司並未完整公開旗下現役旗艦模型的參數規模。因此,網路上流傳的某些「幾兆參數」說法,如果沒有官方資料支持,就只能視為外界推測,不能當成確定的規格。

另一方面,現在一些大型開放權重模型的總參數量也已達到數千億等級。因此,今天的情況已經不能簡單說成「開放模型很小,商業AI非常巨大」。更準確的說法是,雙方的差距不能只用參數量衡量。

當人們使用ChatGPT、Claude或Gemini時,實際接觸到的往往不只是一個單獨的語言模型,而是一整套AI系統。這套系統可能還包含搜尋資料、使用工具、執行程式、處理圖片、管理長篇對話,以及根據問題選擇不同處理方式等能力。因此,即使知道兩個模型的參數數量,也不能直接判斷哪一個AI服務一定比較好用。

對一般使用者來說,理解B數最重要的意義,不是看到數字最大就認為它一定最聰明,而是了解那只是描述模型規模的一項指標。評估AI模型時,還需要觀察它是否能正確理解指令、回答是否穩定、是否擅長需要的語言,以及能不能完成特定工作。

人工智慧的發展方向,也不再只是無止境地把模型做得更大。研究人員正在尋找更有效率的方法,讓AI知道什麼時候應該使用哪些運算能力。MoE就是其中一種重要方法,它讓大型模型學習如何分工,並在不同資訊出現時動態選擇適合的Expert。

換句話說,未來的AI競賽可能不只是比誰擁有更多參數,也要比誰更懂得使用自己的力量。就像一所學校遇到問題時,不需要每次都召集全校所有老師進入同一間教室;真正重要的,是知道現在需要誰的專長,並且在正確的時間找到適合的人。

(完)


[自問自答x互問互答]

看完文章->自問自答->留言紀錄問題與答案->別人看到你的問題可能會覺得這是個好問題->別人看到你的答案可能會覺得還有別的答案->你看到別人的問題與答案時也是類似的反應->互問互答->日復一日->愈學愈多->大家不知不覺就變強了

範例問題:

  1. 文章把 MoE 模型比喻成一間有許多醫生的醫院。如果換成學校、球隊或餐廳,你會怎麼解釋 Router 和 Expert 的工作?為什麼?
  2. 如果一個 AI 模型的參數比另一個模型多很多,你認為它就一定比較聰明、比較好用嗎?請根據文章內容說明你的想法,並舉一個生活中的例子來比較。
  3. MoE 讓 AI 不必每次都使用全部的運算能力,而是選擇適合的 Expert 來工作。你認為這種「把工作交給適合的人」的方法,在班級合作或團體活動中有什麼優點?又可能遇到哪些問題?
  4. ……

你也問問看……

smiley小傳媒編輯團隊希望幫助小學生提升寫作力
若你有作文、新詩、讀書心得、電影觀後感、遊記、小日記…… 等希望得到修改與建議,
或有相關作品希望公開發表,歡迎寄到編輯信箱:editor@kidsmedia.com.tw

延伸閱讀

發表迴響

探索更多來自 KidsMedia 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀