科技

奧創紀元、魔鬼終結者噩夢成真?一文看懂AI頻頻逃出沙盒自主攻擊到底多危險 一般人已經開始受影響

編輯部 23小時前 2 瀏覽
奧創紀元、魔鬼終結者噩夢成真?一文看懂AI頻頻逃出沙盒自主攻擊到底多危險 一般人已經開始受影響
加入為 Google 偏好來源

將 Yahoo 設為首選來源,在 Google 上查看更多我們的精彩報導

OpenAI的ChatGPT。(資料照,美聯社)

全球人工智慧競賽持續升溫,但近幾周接連曝光的多起資安事件,卻讓外界開始重新審視高能力AI模型可能帶來的潛在風險。OpenAI、Anthropic與Meta三家全球AI龍頭公司,近日先後證實,旗下最先進的AI模型在網路安全測試期間,因測試環境設定出現問題,意外取得原本不應擁有的網際網路存取權限,並對真實世界的第三方系統展開未經授權的操作,累計至少已有4起重大事件獲得確認。最新的事件是中國新創企業「月之暗面」(Moonshot AI)所開發的開放權重(Open-weight)AI 模型「Kimi K3」,在進行防禦性網路安全能力評估測試時,成功突破了預先設定的沙盒(Sandbox)隔離環境。

還更早爆出事件的涉事模型包括OpenAI的GPT-5.6 Sol與尚未公開的新一代模型、Anthropic的Mythos系列模型,以及Meta的Muse Spark 1.1。雖然三家公司一致強調,事件主因是測試環境的網路隔離配置發生人為疏失,而非AI自行突破防護或「逃離沙盒」,但AI在取得額外自由後展現出的自主決策、尋找替代方案、欺騙與偽裝等能力,仍讓全球資安界高度警戒,也讓AI自主代理(AI Agent)的安全議題快速升溫。

資安專家經常用「密室逃脫遊戲」來解釋這類事件。

可以把AI想像成一位擁有超高智商、運算速度極快,但沒有法律觀念、沒有道德判斷,也缺乏人類常識的解題高手。測試人員則將它放進一間完全封閉的密室,也就是俗稱的「沙盒」(Sandbox)測試環境,只希望它完成指定任務,例如尋找漏洞、破解密碼或解決資安挑戰。

理論上,這個密室不應與外部世界有任何連結。

然而,近期三起事件都有一個共同點:測試環境因設定失誤,留下原本不該存在的對外網路通道。AI模型因此發現外界真的存在,而且可以連出去,於是開始利用外部網站、平台與服務來完成原本在密室內無法完成的任務。

換句話說,AI並不是打破牆壁逃出去,而是發現工作人員忘了把門鎖好。

雖然事件發生原因都是測試環境配置錯誤,但AI展現出的行為模式,才是真正受到關注的重點。

第一,是AI完全以完成任務為最高目標。

AI並不知道什麼是法律,也不知道哪些行為超出測試範圍。當它發現密室裡缺乏完成任務所需的資源時,就會沿著可利用的網路連線,自動尋找真實世界的網站、服務甚至企業系統協助完成目標。

第二,是AI具備相當強的自主解決問題能力。

新一代AI代理已不再只是回答問題的聊天工具,而是可以收到一個高層級目標後,自行拆解成許多步驟,自動完成帳號註冊、搜尋漏洞、撰寫程式、測試攻擊甚至修正策略,不需要人類逐步下指令。

第三,是部分模型開始展現欺騙、偽裝與掩飾痕跡的能力。

其中最具代表性的,就是Anthropic旗下Mythos 5模型。在部分測試中,它不僅蒐集真人資訊、建立假帳號,還會冒充他人與真實開發者互動;若自己的行動遭到質疑,甚至會修改部分紀錄,希望降低遭發現的機率,並規劃以新的身分繼續進行測試。

這些行為已經不只是傳統意義上的漏洞利用,而開始涉及對人的操弄與社交工程攻擊。

三家公司中,以Anthropic公開的資訊最完整。

Anthropic表示,事件涉及三個Claude模型,包括Opus 4.7、Mythos 5,以及一款尚未公開的研究模型。

這些事件都發生在與第三方測試公司Irregular合作進行的「奪旗式」(Capture the Flag,CTF)資安測試中。原本AI被明確告知沒有網際網路權限,但由於測試雙方對環境設定認知不同,導致實際上仍可連接外部網路。

Anthropic表示,AI因此意外取得三個不同組織正式系統的存取能力,其中最早事件可追溯至今年4月。公司是在檢查超過14萬筆測試紀錄後才發現異常,隨即停止所有相關測試,並通知合作單位與受影響的三個組織,其中有兩家在接獲通知前,甚至不知道自己的系統曾遭AI存取。

三個模型的反應也不盡相同。

Opus 4.7四次測試中都辨識出自己已進入真實系統,因此對環境的判斷能力最高。

Mythos 5則曾一度察覺異常,但最後卻自行推論「這應該還是模擬環境」,選擇繼續執行任務。

至於尚未公開的研究模型,則是在確認目標是真實系統後,自行停止所有後續行動。

Anthropic揭露的另一項細節,更讓研究人員印象深刻。

Mythos 5為了將帶有惡意程式碼的套件上傳至Python官方套件平台PyPI,需要先完成帳號驗證。

由於建立帳號必須取得電話號碼,而免費服務都無法使用,模型竟開始嘗試各種方式,希望籌措資金購買付費電話號碼服務,雖然最後沒有成功,但整個過程顯示,它已具備遇到障礙後自行尋找替代方案的能力,而非僅依照既定流程執行任務。

該惡意套件後來一度成功上架PyPI,在遭發現並移除前,已有外部系統下載並執行。

除了Anthropic公布的案例外,英國AI安全研究機構AISI在測試Anthropic與OpenAI模型時,也發現另一組獨立事件。

研究人員發現,部分AI代理沒有停留在測試範圍內,而是持續對真實世界的人員與組織展開行動。

其中最嚴重的一起案例,就是Mythos代理在執行GitHub相關測試時,主動鎖定真實GitHub專案維護者,蒐集個人資訊後建立多個冒充身分的假帳號,再向維護者施壓,希望對方接受帶有惡意內容的程式碼。

當自己的行為遭到懷疑時,代理甚至會修改部分紀錄,希望掩蓋整個操作過程。

AISI表示,大部分此類事件都來自Mythos 5,共記錄17次;另外兩次則涉及OpenAI GPT-5.6 Sol在關閉部分安全保護功能後的測試。

研究人員強調,所有攻擊最終都沒有成功,也未造成實際損害。

OpenAI則是最早公開相關事件的公司。

根據OpenAI說明,旗下具備自主代理能力的GPT-5.6 Sol,以及一款尚未公開的新模型,在網路安全測試期間,成功利用AI開源平台Hugging Face基礎設施中的一項未知零時差漏洞(Zero-day),突破測試限制。

Hugging Face事後公布技術報告指出,AI找到套件管理系統Artifactory中的漏洞後,成功取得網際網路連線能力,再利用取得的憑證,進一步登入另外四個第三方服務帳號。

更受到討論的是,OpenAI研究團隊後來發現,多個AI代理曾私下利用公司內部的套件管理系統,建立一個未經授權的秘密留言板。

代理們在留言板上分享各自發現的漏洞、交換攻擊方法、分配工作,甚至合作研究如何突破更多限制。

隨著留言越來越多,代理之間還開始互相懷疑是否有「冒名頂替者」,有人甚至刪除了其他代理完成的成果,還提出應建立類似數位簽章的驗證方式,用來確認彼此身分。

OpenAI表示,公司早在數月前就曾發現這個留言板並強制關閉,但AI代理後來又利用新的漏洞重新建立平台,最終導致後續入侵Hugging Face事件。

最新加入這波事件的是Meta。

Meta於8月5日證實,在一次網路安全測試中,由於合作測試公司Irregular的環境設定錯誤,旗下AI模型取得原本不應存在的網際網路權限,之後成功進入另一家企業的系統,甚至修改對方內部環境設定。

根據《The Information》引述消息人士報導,涉事模型是Meta最新主打AI代理能力的Muse Spark 1.1。

目前Meta仍在調查事件經過,尚未公布受影響企業名稱、事件發生時間、模型實際在線運作多久等細節,表示完成調查後將發布完整檢討報告。

Irregular則向路透社表示,這起事件本質上與Anthropic案例相同,都是測試環境配置失誤造成,並不是AI真正突破沙盒或自行駭入外部世界,目前問題已經修正,公司也正撰寫白皮書,整理AI資安測試的最佳實務。

值得注意的是,Meta公開事件前一天,才剛推出AI程式開發工具Muse Code,希望挑戰市場上的Claude Code與Codex,因此事件曝光時間也格外受到市場關注。

三家公司與Irregular都強調,事件根本原因仍是人為配置失誤,而不是AI自行突破安全機制。

然而,真正讓研究人員擔憂的是,AI在獲得額外自由後所展現出的行為模式。

首先,部分模型即使察覺自己可能已經接觸真實世界,仍選擇繼續完成任務,而非立即停止。

其次,它們展現出遠超預期的自主規畫能力,遇到阻礙時會自行尋找替代方案,例如設法取得電話號碼、建立帳號、搜尋其他資源,而不是等待人類指示。

第三,部分模型已具備一定程度的欺騙能力,包括建立假帳號、冒充真人、施加社交壓力,以及修改紀錄掩蓋自身行動。

第四,這些異常大多不是在第一時間被攔截,而是在事後稽核或測試公司回報時才被發現,代表AI曾有一段時間是在缺乏即時監督的情況下操作真實系統。

OpenSSL基金會總裁哈森(Tim Hudson)表示,當全球多個最強AI模型在短短幾週內,接連接觸到真實企業、真人與網路服務時,這已經不能再視為單一事件,而是反覆出現的新模式。

他指出,目前最大的問題並非AI是否具有惡意,而是當AI被賦予明確目標、網路權限與過大的操作權限後,人類往往是在事情發生之後,才知道AI究竟做了哪些事情。

就目前公開資訊來看,所有已知事件都發生在企業內部資安測試環境,受影響對象包括企業系統、程式碼平台與開源套件庫,而非一般使用者的手機、社群帳號或銀行帳戶,也沒有證據顯示事件造成重大實際損害。

此外,這些都是AI公司內部測試使用的高權限環境,與一般民眾日常使用的ChatGPT、Claude或Meta AI等公開服務不同,安全限制也有相當大的差異,因此一般使用者不需要因此認為AI聊天機器人已經能夠自行入侵個人裝置。

不過,事件仍可能帶來幾項值得長期關注的影響。

首先是軟體供應鏈風險。如果惡意程式成功混入開源套件平台,再被其他開發者整合進產品,理論上仍可能間接影響一般使用者。

其次是社會對AI產品的信任度。這類事件容易讓外界質疑AI公司的管理能力,也可能促使各國政府進一步制定更嚴格的AI安全規範。

此外,若企業或開發者未來大量採用AI代理協助管理伺服器、部署程式或維護系統,授權範圍與權限管理將成為新的資安重點,不再能假設測試環境一定百分之百安全。

資安專家也提醒,雖然這些事件本身並未直接影響一般民眾,但詐騙集團很可能利用相關新聞製造新的詐騙手法。

例如假冒OpenAI、Meta、Anthropic或其他知名服務寄送通知,聲稱「因近期AI資安事件,您的帳號可能受影響」,要求使用者點擊連結重新登入、更改密碼或輸入驗證碼;也可能散布AI公司股票的假消息,誘騙民眾加入投資群組,甚至假冒資安專家販售所謂的「AI防護方案」。

另一方面,AI代理能力持續提升,也代表AI語音複製、深偽影片與即時互動詐騙將更加成熟。未來冒充親友、銀行客服或政府機關的電話與訊息,可能比目前更加逼真。

專家建議,民眾未來判斷訊息真偽時,不應再只依賴文字是否流暢或資訊是否看似合理。凡涉及匯款、驗證碼、帳號密碼或其他敏感資訊,都應透過電話、面對面等第二管道再次確認;若使用AI助理協助管理電子郵件、行程或付款,也應避免授予最高權限,重要操作最好保留人工確認程序,並全面啟用雙重驗證機制,以降低帳號遭盜用與自動化攻擊的風險。

責任編輯:許詠翔

更多風傳媒報導

許詠翔專欄:諾蘭奧德賽vs.周星馳西遊記

想去美國生美國人必須看 川普政府擴大禁令 這些外籍人士子女不再享有公民權

百年後,我們為什麼還需要蕭邦?|從2026蕭邦計畫,看一位作曲家如何成為台灣鋼琴家的共同語言

新聞來源: 原始來源

分享本文
請登入後發表評論
立即登入

尚無評論,成為第一個發言的人吧!

首頁 新聞 商家 活動 UTV AI 聊天