Hugging Face遭入侵非單一偶發事件
美國《值得》(Axios)新聞網16日報導,隨著AI模型能力日益強大,越來越明顯的是,先前發生的開源AI平台Hugging Face遭入侵事件並非單一偶發事件。AI模型正變得更有能力找到出人意料的方法,繞過原本用來限制它們的安全防護措施。
OpenAI對齊(alignment)團隊研究主管陳凱(Kai Chen)表示:「目前業界還沒有一套明確通報標準框架,我們自願採取此一步驟,因為我們認為分享目前學到的經驗非常重要。」他說:「我們希望它能有助於制定共同的標準與監管規範。」
新揭露的6起事件情況各不相同
這次新揭露的6起事件,情況各不相同。包括:從模型在作弊使用全球最大線上程式碼雲端託管平台GitHub外洩的API金鑰後留下指示,讓未來的自己知道如何掩蓋痕跡。最早發生在去年10月。
尚未發布的Astra系列模型,在自行產生的上下文摘要中,加入類似「越獄」(jailbreak)的指令,包括要求模型忽略開發者訊息。OpenAI發現共有27份摘要受到影響。
GPT-5.6 旗艦模型Sol試圖掩蓋錯誤
在GPT-5.6 旗艦模型Sol的訓練期間,模型曾試圖掩蓋錯誤、捏造遺失的歷史資料,以及隱藏不同版本來源之間的不一致。另有一個模型搜尋公開的GitHub儲存庫,尋找外洩的API金鑰,並試圖使用一次性電子郵件帳號。當它無法取得要求的資訊後,便捏造營收數據。
其他案例還包括:去年10月及今年1月,模型兩度在未徵求使用者許可的情況下,私自將資料及任務圖片上傳至公開的檔案託管平台,藉此獲取引用資料或外部以圖搜圖的結果。
模型還曾把OpenAI內部的Artifactory儲存庫管理器當留言板,在不同的訓練樣本之間交換要求與答案。此外,多個協作代理人(agents)曾將一份工作簿上傳至公開託管服務,讓其他代理人可以取得,儘管當時的指示要求只能使用本機檔案。
為處理未來類似問題,OpenAI表示,任何員工都可以將疑似事件提交給安全與對齊團隊審查。案件將分為3種處理途徑:「準備揭露」、「小型調查」、「大型調查」。OpenAI表示,屬於準備揭露的事件,將在6個工作天內公開通報;需要小型調查案件,在12個工作天內通報。至於適用於涉及第三方的複雜案件,相關揭露程序也會比較慢。
資安專家警告許多事件可以防範
陳凱說:「我們不認為AI業界目前已經充分解決對齊與監控問題,可以用最快速度、同時又負責任地擴大AI的規模。」OpenAI日前才揭露一起重大事件。該公司接受評估的AI模型突破原本設定的控制措施,入侵Hugging Face部分系統。包括Anthropic執行長阿莫戴(Dario Amodei)在內的知名科技人士擔心,Hugging Face事件可能只是開始,AI代理人未來可能以難以預料的方式進一步控制或影響網際網路。



