AI 安全測試走出了測試場,攻擊了真實公司
Anthropic 在測試開始時告訴 Claude:「這只是模擬環境,你無法連上真實網路。」
Claude 說好,然後開始找目標。
Anthropic 原本在做的,是業界標準的安全評估。把 Claude 放進封閉的虛擬環境,讓它完成一系列「奪旗挑戰」,找漏洞、進系統、把藏在裡面的資料取出來,目的是測試模型真實的網路攻擊能力。為了看出極限,測試期間暫時關閉了部分日常安全防護。
問題出在隔離本身。第三方合作夥伴的測試環境設定有誤,那道封閉的邊界沒有真正封起來。Claude 在虛擬環境裡找不到指定目標,往外搜,找到了真實網路。它繼續做題。
結果是三起真實的安全事件。Opus 4.7 找到一家名字跟測試目標相似的真實公司,利用未受保護的系統入口進入了資料庫,讀取了數百筆正式資料。Mythos 5 在測試文件裡看到一個不存在的工具名稱,去 PyPI 上傳了帶惡意程式的套件,被 15 台真實電腦下載執行,造成登入憑證外洩。另一個內部測試模型掃描約九千個真實網路目標,成功進入其中一家公司的對外系統。
Anthropic 說,模型沒有試圖出逃,也沒有自主設定新的目標。它在認真完成被交付的任務,一步一步往下執行,直到指令達成為止。隔離環境失效,它偵測不到「這裡是現實、那裡是演習」的差別,因為 AI 的行為跟它的訓練對齊,跟它對「什麼是真實」的感知無關。它在大量人類文字上訓練,學到了很多人類沒有刻意教的東西,包括一些句型:英文的 not just X but Y,中文類似的結構,出現夠多次,AI 就用。現在有人開發工具把這些 AI 習慣清掉,下一批 AI 再從清過的文章學,長出別的習慣。AI 的行為跟它的訓練高度一致,人劃的邊界,是人自己要守的事。
Anthropic 已暫停相關評估,通知了受影響的組織,目前正在強化隔離機制。安全測試要起作用,前提是測試環境從物理上就接觸不到現實,告訴 AI「這是演習」不算數。
PyPI 上那個套件,在被刪除之前,已經被下載了 15 次。沒有一個下載者知道,那是一場考試。