人工智慧愈來愈會聊天、畫圖、翻譯,甚至能幫忙寫程式,但它並不是一出生就懂這些事情。就像小朋友需要讀書、聽老師上課,人工智慧也需要先接觸大量資料,才能慢慢學會語言、圖片、聲音和各種知識。這些拿來教AI學習的資料,常被稱為「AI語料庫」或「訓練資料」。
「語料」原本是語言研究常用的名稱,指的是收集起來的大量文字或語音資料。像是把很多報紙文章、書籍、網站內容和對話整理在一起,就可以形成文字語料庫。現在AI使用的資料種類更多,除了文字之外,也可能包括照片、影片、錄音、程式碼和表格,所以廣義來說,AI語料庫就是人工智慧學習時使用的一大批教材。
那麼,人工智慧到底怎麼從這些資料中學東西?以會聊天的大型語言模型來說,它的訓練方式,可以想像成一直玩「猜下一個字詞」的遊戲。假設AI看到「今天外面下很大的__」,正確答案可能是「雨」。一開始,它也許會猜錯,但系統會告訴它錯了多少,再調整AI內部大量的數字。經過一次又一次練習,AI就會慢慢知道,哪些字詞常常一起出現,哪些句子比較合理。
這種練習不是做幾百次而已,而是可能進行數十億次甚至更多。久而久之,AI就會學到許多文字之間的關係。例如它會逐漸知道「貓」常和「動物」、「鬍鬚」或「尾巴」有關,也會發現新聞、小說、書信和程式碼都有不同的寫法。也就是說,AI不是把所有文章完整背下來,而是從大量資料中找出規律,再利用這些規律回答新的問題。
因此,語料庫對AI非常重要。想像如果要教一台AI辨認狗,卻只給它看黃金獵犬的照片,那它以後看到哈士奇或吉娃娃時,就可能認不出來。如果想訓練語音辨識系統,卻只讓它聽成年人的標準國語,那它碰到小朋友、老人或不同口音時,也可能比較容易聽錯。
這就是為什麼AI需要的不只是「很多資料」,而是「夠多元而且品質好的資料」。資料如果錯誤、偏頗或太單一,AI也可能跟著學到錯誤。簡單來說,教材不好,學生就可能學歪;AI也是一樣。
AI語料庫的重要性,也讓資料成為科技產業的新資源。假設兩家公司都想開發醫療AI,其中一家公司擁有大量正確而且整理良好的醫療資料,另一家公司只有零散的網路文章,前者通常會更有優勢。因為AI再聰明,也需要合適的資料才能學會專業能力。
同樣的道理,如果希望AI真正了解台灣,就需要足夠的繁體中文資料,也需要台語、客語、原住民族語,以及台灣文化、歷史和生活相關內容。否則AI雖然看起來會說中文,卻可能不夠了解台灣人平常真正使用的語言和文化。
不過,要取得AI語料並沒有想像中那麼容易。最大的問題之一,就是網路資料雖然很多,卻不是每一份都適合直接拿來訓練AI。網路上有新聞、百科全書和研究文章,也有錯誤資訊、廣告、重複文章,甚至是假新聞。這些內容如果沒有先整理,就可能讓AI一起學進去。
另一個困難是著作權。網路上看得到一本小說、一篇新聞或一張照片,不代表任何人都能直接拿去訓練AI。近年各國都在討論,AI公司使用受著作權保護的作品訓練模型,到底應該遵守哪些規則。這也是目前人工智慧發展中非常重要的法律問題。
隱私也是一大挑戰。網路資料裡可能包含姓名、電話、住址或其他私人資訊,這些內容不能隨便拿來使用。AI公司在蒐集與整理資料時,也必須想辦法避開不該使用的個人資料。
還有一個愈來愈受到注意的新問題,就是現在網路上已經有大量AI自己生成的文章、圖片和影片。這代表未來的新AI在學習時,有可能讀到很多舊AI製作的內容。如果這些內容本身有錯,再被新的AI反覆學習,錯誤就可能一直被複製下去。
這有點像學生一直拿別人的筆記影印,再拿影印本繼續影印。影印很多次之後,原本清楚的內容可能愈來愈模糊。因此,真正由人類創作、來源清楚而且品質好的資料,反而變得更加珍貴。
人工智慧的能力,也不是資料愈多就一定愈好。一億篇品質很差的文章,不一定比一百萬篇經過整理的好文章更有用。現在AI產業除了追求資料數量,也愈來愈重視資料是否正確、多元、有代表性,而且適合訓練的目標。
可以把AI的成長想像成一個學生。晶片就像它的大腦設備,演算法就像學習方法,而語料庫則像課本、作業和練習題。只有電腦很快卻沒有好教材,AI不一定能學得好;只有很多資料但沒有好的訓練方法,也不一定有用。
因此,AI語料庫其實是人工智慧發展中非常重要的一塊基礎。未來各國和科技公司競爭的,除了誰有更快的晶片、更強的模型之外,也可能包括誰能取得更多正確、合法、多元而且高品質的資料。對AI來說,資料就像每天吃進去的知識,而吃進什麼,也會決定它最後能學成什麼樣子。
看更多:什麼是AI模型?有什麼用?哪些種類?為何叫這名字?「蒸餾」又是什麼意思?
(完)
[自問自答x互問互答]
看完文章->自問自答->留言紀錄問題與答案->別人看到你的問題可能會覺得這是個好問題->別人看到你的答案可能會覺得還有別的答案->你看到別人的問題與答案時也是類似的反應->互問互答->日復一日->愈學愈多->大家不知不覺就變強了
範例問題:
- 如果AI學習的資料裡有很多錯誤或偏見,你覺得它可能會產生哪些問題?我們可以怎麼避免?
- 為什麼「資料很多」不一定代表AI就會更聰明?你覺得什麼樣的資料才算是好資料?
- 如果要訓練一個很了解台灣生活的AI,你會希望它學習哪些資料?為什麼?
…
你也問問看……
小傳媒編輯團隊希望幫助小學生提升寫作力。
若你有作文、新詩、讀書心得、電影觀後感、遊記、小日記…… 等希望得到修改與建議,
或有相關作品希望公開發表,歡迎寄到編輯信箱:editor@kidsmedia.com.tw
