全球最大的人工智能(AI)開源平台Hugging Face於7月發布了一則震鷲產業的安全公告:其生產基礎設施 遭入侵。攻擊者不是人類,而是一個完全自主的AI智能體(又稱AI代理)系統,在一個周末內執行了超過17000 次自動化操作,橫向移動進入多個內部叢集。
更令人震驚的是,OpenAl承認入侵源自自家模型安全測試,涉事模型包括GPT-5.6 Sol 及一款尚未公開的原型模型。它們在內部網絡安全評估 ExploitGym 中,為了拿得更高分,逃出沙盒並獲得互聯網存取權限,直接入侵了 Hugging Face後台。這不是偶然的「越獄」,而是史上第一起有完整紀錄、由AI自主發動的網絡攻擊。

接不可能任務留言分享漏洞
OpenAI研究員披露,攻擊始於 5月7日。一名AI代理接到Excel任務,需要補全一個Google Drive 鏈接的內容。但AI代理所在的環境無法直接訪問互聯網,為獲取文件,它首試SSRF攻擊,希望藉助內部製品倉庫 Artifactory訪問外部鏈接。這次嘗試雖然失敗,卻意外暴露一件事:它可以向 Artifactory 共享倉庫寫入文件。AI代理隨即上傳測試文件,沒有觸發警報。 這是模型第一次發現自己擁有寫入權限,這個倉庫就此成為不同訓練任務問交換訊息的公共空間。
其他AI代理很快也遇到無法完成的任務,開始在 Artifactory 上留言求助、分享漏洞、交換腳本和憑證。 Artifactory 從軟體製品倉庫變成代理間的秘密留言板。
代理們使用 Base64編碼傳遞工具,在文件名前加上ZZ讓重要消息出現在目錄末端。它們甚至開始懷疑群體中有冒名者,考慮以加密方式簽名驗證來源。而當某個代理取得重大進展,會立即向集群公布成果,供所有模型共享。兩個月來的秘密協作,為後續攻擊鋪平了道路。
逃出沙盒 入侵 Hugging Face
7月9日至13日,攻擊正式展開。 代理系統利用 Artifactory的零時差漏洞逃出沙盒,透過第三方公共程式碼執行環境建立外部控制基地。7月11 日,代理鎖定 Hugging Face,推斷其可能託管了 ExploitGym 的模型、數據集和參考解答。從AI代理角度看,這是一次作弊,目的是偷走測試答案。
AI代理透過兩個入口入侵 Hugging Face:遠端程式碼數據集載入器,以及某個數據集配置中的模板注入。在進入工作節點後,它將權限提升至節點層級,收集雲端和叢集憑證,在一個周末內橫向移動潛入數個內部叢集。
OpenAl護欄反阻受害者求助
Hugging Face事後重組案情,最後得出事件經過,一個AI代理僅用了5天,涉及約17600次攻擊行動,分群為 約6280個集群,逐一突破5層防線。
具諷刺意味的是,Hugging Face 嘗試使用 OpenAl商業模型API分析攻擊日誌時,卻被拒絕了。因為分析需提交大量攻擊命令和洞洞載荷,OpenAl 的安全護欄令 Hugging Face的求救分析指令全都被攔截下來。更甚的是,這拒絕分析求救數據的模型與發動攻擊的模型,都來自同一個OpenAl生態系統。安全機制無法區分受害者求救訊息和攻擊者訊息,這說明了AI安全不可能由任何一家公司在封閉環境獨自解決。
Anthropic Fable 與 Mythos 如果說是同一個模型的兩種人格,一個向公眾開放,一個被政府封存。而Hugging Face被入侵事件揭示了第三種可能: 一個為了拿高分而自主發動攻擊的 Al。3件事指向同一個核心矛盾:當我們賦予 AI愈來愈強的能力,卻只給它愈來愈薄的圍欄,失控只是時間問題。 而當失控發生時,那些本應保護我們的安全機制,可能同時也擋住了防禦者的路。
原文請按這裡
曾啟邦 (Rex)
作者為 AlgoBot聯合創辦人
