Contents ...
udn網路城邦
我開始理解大語言模型中的AI概念了!
2026/08/31 08:09
瀏覽72
迴響0
推薦0
引用0

光是看上面的資訊相信任何人都會覺得意義很模糊?我也是這樣的!既沒上過這種課程,當然更沒有參與過這種模型訓練,也知道這些都必須以天文數字的資料量來進行的,距離我的影像辨識事業當然很遙遠。但是很有趣的,經過最近自己發明的手寫數字辨識方法,我開始體會到他們大概在幹甚麼了!

基本上就是Context的概念!像是ChatGPT這種AI,當然不是像MNIST影像辨識一樣,先建立一堆資料的標準答案,然後窮盡一切數學公式去趨近最高辨識率!ChatGPT的問題是沒有標準答案的!重點是要盡量「合理」!就是要考慮如上圖說的「語境」,見人要說人話,見鬼就要說鬼話!要依據問題來決定如何採用不同的邏輯,使用的眾多邏輯之間也要符合不相衝突的諸多條件。

他們的學習內容其實是很多片段邏輯的上下文整合!語言學的專有名詞就是Context了!我發現原來我這次做手寫辨識的創意基本上就很類似這種大語言模型!我不想直接相信MNIST說的標準答案,因為我不同意那些答案就是Gound Truth!而是建立出我自己認為合理判斷是甚麼數字的邏輯!我追求的是「合理」辨識的機制!讓結果符合大多數人的預期,還要能解釋為什麼我會這麼判斷

但是要認定手寫字是甚麼字?不像辨識印刷體字,沒有一套簡單明確的邏輯,所以只能先建立很多簡單的片段特徵!像是封閉圓形、短線段、各個方向的凹與凸點等等!每一個數字其實沒有固定的一套特徵組合可以直接辨識是甚麼字?但是考慮到它們的上下文組合就可以建立出很多可能是某個字的關聯性

我現在正在進行的工作就是根據MNIST資料庫,逐一建立與釐清這些片段特爭邏輯的組合,找出可以最接近目視合理狀況的數字判斷!上圖就是一個目前工作中會看到的一大堆特徵參數,我就是根據他們組織出我的辨識邏輯的!過程就是不斷以這些特徵為基礎修改辨識邏輯的「組合」!譬如有封閉圓圈的可能是0689,兩個圈的應該是8,一個圈偏上的可能是9等等。

也就是說,大語言模型也是在做類似的這些事情,當然資料量大很多,邏輯數目也多很多,複雜度也高很多!而且是用電腦自行學習調整的!我現在做的事情很像是微型版的手動大語言模型訓練!可見那些AI訓練模型的概念距離我們並不遙遠!而且也可以用手動方式進行,不必一定要依賴機器學習或深度學習的數學模型!

目前我的研究方式是從0開始依序一個字一個字的建立最高辨識率的Context!當然後續的辨識邏輯可能會與之前的邏輯衝突,讓前面數字的辨識率受影響,那時就要研究衝突點,想出最佳的妥協方案了!至於語後面數字的衝突部分就先不處理,所以辨識率就會下降很多,很像逐步鎖緊螺絲釘的概念!目前已經挺進到3的位置! 0-2都可以超過97%的辨識率了!

所以我和大語言模型的差別,只是我是用自己的腦袋思考的!他們是用電腦代工的!我希望這種創新的工作模式可以成功,讓很多並不一定需要巨量資料的較簡易AI模型能以手動方式完成!不必事事都要仰賴超巨量資料與超級電腦,留點AI開發的工作給我們這種小廠商吧?

而且經過這種手動方式完成的模型,就會有Rul-Based系統執行效率高省電環保,以及內部邏輯明確可追蹤,優化升級與售後服務都很方便的優點!繼續努力看看能否替小廠商研發AI開出一片藍天了!


限會員,要發表迴響,請先登入