
這幾年因為有執行一些與司法AI有關的計畫,有機會與不少法律領域的老師討論,常常聽到老師們提到在學期中與學期末常常需要花大量的時間批改學生的作業或考題。由於我們團隊也是有做些AI與教育相關的應用,而這又正好是目前AI技術可以幫得上忙的地方,因此我們開發了一個「申論型題目批改小幫手」,於此介紹並邀請法律相關專業科目的老師參與我們第一次的線上說明會,希望能對此問題有幫助。
・適合的參加者:法律領域的大學教師(不限學校)
・時間:9/1 (二) 與 9/2 (三) 中午 12:00-13:00 (擇一參加即可)
・形式:線上會議(會議連結將寄給報名者)
・報名連結:https://forms.gle/Sug1mzCi6e6rrc8Q6
・報截止日:8/31(一)中午12:00 ,預計當天下午6點前寄送會議連結
・系統網頁:https://hssai-textgrading.phys.nthu.edu.tw/
・介紹影片:https://youtu.be/fUejkor0F88
之所以先以說明會的形式介紹而非直接開放,主要是因為這套系統的批改品質,很大程度取決於擬答與配分的呈現方式。我們希望能在老師實際使用前,把這些使用上的細節先說清楚,讓系統從一開始就能發揮應有的效果。同時,我們也很期待在會中直接聽到第一線教學現場的想法與需求,作為後續改進的依據。歡迎有教授法律相關課程的老師報名參加,也歡迎轉知有需要的同事。說明會後會再統計想要參與第一階段免費試用的教師。
◎ 背景說明:
由於本文介紹面向社會大眾,此處也簡要說明一下這個問題的特質,與我個人所認為,為何這個專案的重要性不是只是減輕教師負擔那樣單純。
相信大家都知道,法律不同於其他人文社會領域,有一個明顯的特點是關於白紙黑字的「法律條文」,特別是如我國這樣的大陸法系國家。明確的法條文字是政府與人民之間的公開約定,需要經過複雜的程序與相關專業人士特定才能制定、修改或解釋。因此雖然法條的文字解讀不免有一定的空間,但比起其他著重於文字表達的人文社會領域,法律領域明顯對文字表達的精確性與邏輯嚴密性的確有更為嚴謹的要求。
也因此,法律相關的學生若要在專業上發展,除了繼續讀博深造以外,就幾乎必須通過各種國家考試,以取得司法事務官、律師乃至於司法官的資格。而這些考試最核心的地方除了法條內容以外,更需要大量思辨申論,要將一些模擬的司法情境按照法律條文的精神與相關倫理原則有所論述。以往的考試是學生手寫,讓老師批改。但是這顯然極費兩者的眼力,也不盡公平(字體潦草如我必定吃虧... 還好我從未想讀法律)。因此在大部分學校的課程中,教師都不太敢布置太多的作業或考題,以免自己負擔不來批改的工作。結果造成想要參加國家考試的學生,往往又會花錢進入補習班來刷題練習。這使得法學思辨和考試練習脫鉤,也間接讓司法實務人才的需求與培育逐漸僵化。
從今年開始,司法官與律師考試全面電腦化,這本早該是發展的方向,畢竟各類行政文書早就電子化了。但批改的問題不但仍在,甚至更為棘手:平時多出幾份申論題給學生練習,換得的就是成倍增加的批改時間。而學生現在也很容易利用AI生成看似合理的答案,但是授課老師要用AI或人工區別出來則是相對困難的。
◎ 「申論型題目批改小幫手」的特色:
「申論型題目批改小幫手」想處理的就是這一段。它的做法很單純:老師提供題目與自己的擬答,系統就依照那份擬答,逐題給學生的答案打分數、寫給分說明與評語,最後整理成一份 Excel 成績表。至於學生是否用AI代寫,系統並不負責辨識,但至少批改的尺度能統一按照教師的擬答來把關。而更根本的是,國考現場終究只能憑自己的思辨能力作答,AI代寫換來的分數並不會轉化成應考實力;相對的,願意認真寫、也認真讀評語的學生,就能從每一次練習裡累積出真正帶得走的東西。或許這樣可以將法律教育的現場與司法實務人才的篩選做更緊密的結合,不論是在數量或品質上都能有所提升,不再只是一般的刷題背誦,可以有更多的思辨探索。

「申論型題目批改小幫手」整個流程分四步,不需要任何技術背景:
1. 設定題目與擬答:可以手動輸入,也可以直接上傳 PDF 或 Word 考卷,由 AI 自動拆成各題的題目、擬答與配分,老師再檢查修改。
2. 整批匯入學生答案:從課程平台打包下載的 Excel 或 ZIP 檔可以直接上傳,系統會自動比對學號姓名與題號,不需要另外整理檔案格式。
3. 可先單筆測試:先試改一位學生,看看結果是否符合預期,必要時回頭調整擬答。
4. 整批批改與匯出:確認沒問題後再整批批改,逐題給分、附上給分說明與個別評語,一鍵匯出 Excel。
評分標準有兩種可以選:「一般評分」適合平時成績,論述完整者大約可得 75 分以上;「嚴格評分」則比照國考標準,須定義精確、涵攝完整、結論明確三者兼備才算完整論述,60 分左右就算高分,適合模擬考或需要鑑別度的場合。


◎ 初步測試的結果:
我們有商請一位國立大學法律系的教授,把他實際批改過的學生答案交給系統重跑一次,再把兩邊的分數放在一起比較。下圖中每一個點代表一位學生,橫軸是教師實際給的分數,縱軸是系統給的分數,虛線是「完全一致」的參考線。

這24份答案的平均絕對誤差(MAE)為 7分,相關係數 0.707,屬中高度正相關。也就是說,本系統排出來的高低順序與老師相當接近,個別分數平均相差 7 分上下。這說明在擬答寫得夠具體的前提下,系統的批改結果與教師標準之間具有相當的可信度。速度方面,平均每位學生約6-7秒完成批改,而且不只給分數,還會逐題寫出與擬答之間的落差在哪裡、下次該注意什麼,這是人工批改難以達到的速度。
◎ 補充說明:
1. 批改所使用的指令提示是可以修改的:例如老師希望整體平均落在60分附近、標準要再嚴格或再寬鬆一些,或是對答題字數、論述結構有特殊要求,都可以寫進提示裡,讓AI做整體性的調整,貼近自己這門課一貫的評分習慣。
2. 本系統是完全依照老師提供的擬答來給分的:擬答裡列出的爭點才會被檢查計分,沒列出的內容就算學生有寫到,也不會額外加分或扣分。這代表擬答的完整度直接決定批改品質。
3. 最終成績還是應該由授課教師檢視調整:AI匯出的 Excel 都會列出每題的分數、給分說明與評語,就是為了方便快速複核。由於AI的批改仍可能有個別的錯誤,可以再由教師確認或調整。
4. 系統不儲存任何教學資料:題目、擬答、學生答案與批改結果都只留在老師當下的瀏覽器分頁,關掉就自動清除,不會寫進伺服器,也不會拿去訓練模型。這是刻意的取捨,代價是批改完成後必須立即匯出 Excel——因為我們沒有留任何副本,關掉頁面後就找不回來了。
我自己覺得,這個工具對學生的意義可能比省下老師的時間更大一些。系統會為每一題產出給分說明與個別評語,另附整體總評,當學生課後來問「這題怎麼改會更好」,老師不必再重新翻閱整份考卷。學生若對成績有疑義,也可以直接帶著這份回饋文字來與老師討論——因為上面寫明了是哪一個爭點沒有涵攝、哪一個要件的定義不夠精確,討論就有具體的著力點,不再只是「我覺得我應該可以更高分」。學生一方面知道下次該怎麼針對性地補強,另一方面也會在過程中更清楚地看見法律議題思辨的癥結所在。而當平時的練習能夠被有效率地批改,老師才有機會把它納入平時分數,讓評量分散到整個學期,而不是全部壓在期末那一次。
感謝系統開發者,國立清華大學科技法律研究所(科技專業組)杜雅涵同學的用心。系統相關問題或合作洽詢,歡迎來信 aifr.general@gmail.com。
◎ 附錄:一則實際批改案例的 AI 評語
以下是系統對某位學生一份三題申論的實際評語(題目與答案內容已略去,僅保留回饋文字)。可以看到評語並非泛泛的「論述不夠完整」,而是具體指出漏掉了哪一個爭點、哪一個學說的區辨沒有做出來,因此學生拿到之後知道該補什麼,老師要複核也很快。
題A:你有掌握到乙不成立185-3、乙過失致死及甲需負責任的基本方向,值得肯定。但本題核心爭點在於甲是否成立185-3之間接正犯(因該罪為己手犯而不能成立)、以及甲對A之過失致死是否具預見可能性,你完全未論及甲是否能成立185-3間接正犯的爭點,也未深入討論甲的預見可能性,涵攝略嫌跳躍。建議加強對己手犯概念與間接正犯限制的理解,並就甲主觀上是否可預見乙精神恍惚駕車致死做更細緻分析。
題B:你正確掌握到客體不能、需討論不能犯之爭點,並嘗試以重大無知說與具體危險說分析,是本題的優點。但兩說之涵攝內容幾乎相同,未能凸顯兩說判斷基準之差異,也未提及實務之客觀因果法則說,論述深度不足。此外完全未討論乘機性交與強制性交之區別、以及乘機性交罪無得因共同犯而加重之特殊規定,此為擬答明確列出之爭點卻付之闕如。建議加強不能犯三說之區辨與乘機性交罪特殊性之討論。
題C:本題僅寫出罪名即中斷作答,未完成任何論述,殊為可惜。擬答所列甲之公務員身分認定、違背職務收賄罪與洩密罪之想像競合、乙是否成立共同正犯或幫助犯(涉及刑法31條身分犯理論)、丙之行賄罪及對向犯不成立共同正犯之討論、以及連續犯廢除後之罪數處理等重要爭點均未觸及。建議加強考前時間分配,確保每題至少完成基本論述架構。
值得一提的是題C。學生只寫了罪名就沒有繼續作答,系統仍逐一列出這一題原本應該處理的爭點,等於直接告訴學生「你這題如果寫完,該長什麼樣子」。這類回饋若要由老師逐份手寫,在五十人的班級裡幾乎是不可能的。






