
最近公司主要研發案是監理所的煞車燈檢驗影像辨識,主要工作都是RD在做的,我除了處理幾個車牌辨識客戶的試用諮詢之外,日常時間還是繼續研究手寫辨識的細微邏輯,就是現在一般人常說的已經進入深水區了!進展極緩慢,但不是毫無收穫,整體辨識率提升每周不過0.1%,但實際上摸索到的細微邏輯很多也很有趣!即使不能變成商品也極有趣味,真的有在探索人類辨識智慧的感覺!
如上的兩個字MNIST說上面是9下面是4,相信絕大多數人都會同意!但是為何我們如此篤定的原因呢?以我之前建立的基本辨識特徵根本是完全一樣的!這些兩難判斷就是我現在的遊戲與研究目標了!常常就是坐看這種案例幾十分鐘進入冥想,甚至非工作時間忽然靈光一現就想到如何量化關鍵差異了!
以上面案例來說,我想到的是綠色圈圈畫出區域的差異!那個筆畫端點如果是呈水平扁長狀就幾乎不可能是4!如果是偏向垂直細長就幾乎不可能是9了!很像伸直手指表示1,彎曲手指表示2之類的!所謂見微知著大概就是這樣的意思!我根據這個特徵建立辨識邏輯,大量這種模糊地帶就被釐清了!整體辨識率就會明顯增加了!
其實我們年輕時吃飽太閒時,都會玩一些傷腦筋的益智遊戲,如填字或數獨遊戲等等,每次成功破解找到答案都會很高興!其實我現在研究這些影像辨識問題的心情也很類似,但是因為知道這是真實世界中有意義的謎題,所以做起來更有動力!也可以說是在做逆向工程,探索人類的智慧,那不就是研究AI的意思嗎?
相對的,那些機器學習派的影像辨識專家或玩家,就完全沒有這種探索智慧的樂趣了!他們只是監督電腦做訓練學習的管理員而已!即使機器學會了怎麼辨識?他們自己還是不會的!他們學會的技術知識都跟影像辨識沒有直接關係,只是一些模糊的數學模型概念而已!我真的很同情他們研究生活的無聊空虛!希望我的傳統辨識之路持續暢通,永遠不必被迫變成那種會無聊致死的研究者!
限會員,要發表迴響,請先登入




