Contents ...
udn網路城邦
無法突破天花板時,就是必須打掉重建的時候了!
2026/08/28 03:46
瀏覽27
迴響0
推薦0
引用0

這幾天埋頭苦幹提升手寫數字的辨識率,大概到了94.5%以上就陷入泥潦,不斷微調各種衝突條件的狀況也只能勉強衝到如上左的94.667%!這就是所謂的達到辨識率天花板了!此時就是必須回頭檢討前面的基礎流程有甚麼可以改善的地方?但是就像蓋房子,地基要改建就表示大部分建築都要打掉重蓋了!

我的Rule-Based方法建立的辨識條件特徵是所有資料一體適用的!所以當資料庫的答案本身有矛盾時,就是某兩個影像其實幾乎一樣,卻有不同的標記答案時,我的答案不可能兩個都答對!但是機器學習只要有任何些微的差異,即使只是一個畫素的隨機差異,他們都可以「學習」到能依據答案分辨這兩個字!所以我不會刻意跟那些機器學習技術比拚固定資料庫的辨識率!那沒有意義,我也一定會輸!我力拚的是合乎一般人眼判斷的合理性

即使如此,我還是不滿意自己的94.6%辨識率,因為在我的無法辨識與辨識錯誤的失敗案例中,還是有很多人眼可以清晰辨識的案例!我必須要讓他們盡量都成功!不能與人為判斷落差太大!我的自我檢討結果就是如上圖的Q辨識率不夠好!就是某字候選答案至少要包括正確答案的機率!候選人都是錯的,當然無法得到正確答案!

前一版很多字的初選辨識率都沒到99%,深入看那些被淘汰的案例其實有很多都不難辨識,那就是我的初選機制太嚴苛或不合理把他們變成遺珠了!但是如果開始調整這個部分就是動到地基了!如右上圖,我剛剛努力提升Q辨識率都超過99%之後,C辨識率就從94變成84了!

為何如此?就是初選及格的可能答案越多,後續選錯答案或兩個答案相持不下無法決定的情況就會增加!那些就是把辨識率拉低的原因!我必須從頭開始檢視調整所有衝突錯誤的狀況!每解決一個衝突辨識率就會提升一點!其實我很樂觀!當那些原本應該入選卻被淘汰的案例獲得重生後,當然讓競選過程變得複雜,但最終辨識率是有望提升的!我希望是可以達但9697的水準!繼續努力了!


限會員,要發表迴響,請先登入