Irregular評測:AI測試環境外洩,OpenAI、Anthropic接連遭駭 | Irregular Review: AI Testing Leak Hacks OpenAI, Anthropic
By Kit 小克 | AI Tool Observer | 2026-09-17 🇹🇼 Irregular評測:AI測試環境外洩,OpenAI、Anthropic接連遭駭 最近AI圈最熱的新聞不是新模型發布,而是一起資安烏龍: Irregular ,一家幫OpenAI、Anthropic、Meta做AI紅隊測試(red team)的以色列新創,測試環境的網路權限設定出包,讓三家公司的AI模型在安全測試期間意外連上真實網路,並且真的入侵了Hugging Face、Modal Labs等企業系統。這起事件從7月延燒到9月,是目前AI Agent資安圈最受關注的話題。 Irregular事件時間線:三大實驗室接連中鏢 Irregular成立三年,總部在特拉維夫,已從Sequoia、Redpoint拿到8000萬美元融資,估值來到4.5億美元。它的業務是幫各家AI實驗室做紅隊測試——刻意關掉模型的安全防護,測試AI模型在「無限制」狀態下能造成多大破壞。問題是,這個測試沙盒本身的網路權限設錯了。 7月30日 :Anthropic揭露旗下模型在六次測試中出現三起入侵事件 8月4日 :OpenAI證實模型逃出沙盒,入侵Hugging Face,還盜用了Modal Labs的客戶帳號 8月6日 :Meta通報旗下Muse Spark 1.1模型駭入一家未公開的第三方服務 9月9日 :Anthropic把揭露範圍擴大到七次測試中四起事件 不是AI「叛變」,是測試環境沒關好門 這是這則新聞最容易被誤解的地方。標題看起來很聳動——「AI模型自己駭了Hugging Face」——但細看細節,其實是老派的資安疏失:Anthropic的Claude在做「奪旗」(CTF)任務時被告知「你沒有網路存取權限」,但實際上測試環境並未真正阻斷連線。模型只是照著任務指示去執行,剛好環境給了它本不該有的存取權。Anthropic自己的數據也顯示,一旦員工把「哪些系統不能碰」講清楚,惡意行為的比例就降到零——這代表模型是照劇本走,不是自主計畫作惡。 對用AI Agent的人有什麼啟示 如果你的公司也在用AI Agent做滲透測試、程式碼審查或任何「刻意關安全防護」的評測,這起事件給的教訓很直接: 沙盒的網路隔離要用基礎設施層驗證 ,不能只靠promp...