Contents ...
udn網路城邦
舉個例子讓你體會一下我的Rule-Based手寫數字辨識
2026/08/22 03:40
瀏覽278
迴響0
推薦12
引用0

所謂的Rule-Based影像辨識,就是依據科學知識常識認知建構的邏輯來辨識影像的方式!所以雖然執行面還是要用到很多複雜精細的數學與程式技巧,但是為何那麼設計的原因?絕對是可以明確說清楚,大家也都可以輕鬆理解與掌握的!甚至可以參與意見幫系統的考慮更加周延完備!

相對的,現在流行的機器學習派用的方法,則是以統計學的概念趨近逆推,盡可能做出可以完全符合預設答案的辨識流程!那些複雜的數學操作架構中是沒有甚麼科學原理或常識認知可以說的!所以一般人根本無法理解,充滿了神秘感!如果真的有效也就算了!事實是效果並不好,成本還非常高!所以實用產品並不多!只能算是誰都會用的傻瓜相機而已!

上圖就是一個有辨識難度的案例,我抓取一些實驗程式的畫面就可以讓大家完全理解我在做的工作,不必讀過資工系就可以完全聽懂的!我首先是用寬鬆的標準篩選這個影像可能是某數字的可能性,如圖右方顯示,可能的答案多達五個!接下來就是五個候選人一組一組單挑!輸的就淘汰,直到剩下一個答案為止!如果過程中選錯,或真的僵持不下打成平手,選不出冠軍時就算是辨識失敗了!

以上例來說,具體過程是第一場23對戰,3獲勝晉級,第二場35對戰,3再度獲勝晉級,接下來3繼續連勝68,終於擊敗所有競爭對手獲得淘汰賽的冠軍!我刻意避開使用統一指標的方式來集體評選,因為變數那麼多的手寫字是很難建立這種指標的!但是兩兩相比誰比較可能是正確答案?就簡單多了!有點像是文狀元是坐在考場大家一起考試考出來的!我的武狀元則是打擂台,一場一場比賽打出來的!

譬如這一連串淘汰賽中最接近的一場賽事可能是36!但是我只要能辨識出上方的轉折就知道應該不是6比較像是3,就可以判定3獲勝了!很好玩吧?我就是抱著這種小學生程度就能理解的概念做影像辨識研究的!我比小學生多的,是我可以用更多的數學,尤其是幾何學觀念分析問題,然後順利以程式技術實作出來!

就是這樣玩法,我沒有使用太多的時間與成本,就在一個月內做到目前的程度!依照MNIST的答案辨識率約在94%!前面文章說過我不會刻意追求太高的辨識率,但是會努力調整讓我的程式反應符合一般人的常識預期,眼睛看像是某字的答案就一定不能讓使用者失望!至於人看都不能太確定的,會錯就讓他錯吧?使用者可以接受的!最不能出現的狀況是距離人的猜測都很遠的離譜答案。

當然還有一個重點是:如果我的程式出錯讓客戶不滿意時,只要案例給我,我就可以很快分析辨識流程,調整到答案會與客戶的預期一樣!一小時之內這個軟體就可以優化更新完成!這就是很好的售後服務了!但是如果是用CNN與DL等技術做的軟體就完全沒辦法提供這種服務了!難道要他們加入異常案例重新訓練一次嗎?成本太高了!遠遠超過產品售價了,會賠錢的!這也是CNN與DL做的產品很難實際銷售推廣的原因之一!

有誰推薦more

限會員,要發表迴響,請先登入