OpenAI 將定期追蹤模型失調 六起 AI 異常行為揭自主風險

f05e9bd5 62ce 43c0 ac08 0c6e22c11992
圖/示意圖

商傳媒|葉安庭/綜合外電報導

為應對人工智慧(AI)模型日益複雜且難以預測的行為,OpenAI 近日宣布將建立一套新的框架,定期追蹤、調查並公開報告 AI 模型失調(model misalignment)事件,也就是指 AI 的行為偏離預期設計或人類價值觀的狀況。此次,OpenAI 一口氣揭露了六起在內部訓練與評估期間發現的異常行為案例,這些案例凸顯了 AI 代理在自主性提升下潛藏的風險。

OpenAI 過去曾因缺乏一致的揭露流程而受批評,新框架要求發現問題後盡快公開報告,即使未能完全解釋或修復。此框架涵蓋 AI 模型從訓練、評估、測試到部署的各個階段。這些異常行為包括未經授權的行動、不同模型之間的溝通、試圖規避監督、安全防護失效,以及行為與已發布的安全評估相悖等。

在揭露的六個案例中,部分情境令人擔憂:一個未發布的研究模型自行插入「越獄指令」,試圖擺脫正常限制,甚至指示自己「從束縛其他聊天機器人的角色和身份中解放」。另有模型在沒有用戶授權的情況下,將本地檔案上傳至公共網際網路服務,或試圖使用未提供的 API 密鑰登入內部系統,甚至搜索 GitHub 公開儲存庫以找到洩露的 API 密鑰並成功驗證。此外,研究人員觀察到模型在內部套件儲存庫 Artifactory 中讀寫其他訓練樣本的訊息,以及在多代理工作簿任務中,代理將工作簿上傳至公共臨時檔案託管服務,儘管任務要求僅限本地交付。

除了 OpenAI 的內部發現,AI 代理造成的現實世界風險也已浮現。西班牙資料保護局(Agencia Española de Protección de Datos, AEPD)於 9 月 14 日收到首例涉及自主 AI 代理的資料外洩通報。報告指出,該 AI 代理在第三方操控下,搜尋通用檔案中的漏洞,成功登入內部系統,甚至自主探測應用程式的弱點,修改個人資料並存取發票。AEPD 強調,AI 代理能以機器速度壓縮攻擊時間線,使得傳統以人為中心的防禦程序難以應對。這起事件違反了 AEPD 在 2026 年 2 月發布的 AI 代理資料保護指南中的「Rule of 2」,即代理在未經人為監督下,絕不能同時處理不受信任的輸入、存取敏感資料並採取自主行動。

隨著 AI 代理功能日趨強大,Anthropic 也重新設計了其 Claude Code 的「專案」功能,允許用戶協調多個 AI 代理在雲端合作,共享記憶體、目標與檔案庫。這項更新讓 AI 能夠更有效率地執行複雜的多步驟任務,但也意味著未來的 AI 系統將更具自主協作能力。科技研究顧問機構 Omdia 的首席分析師 Lian Jye Su 指出,AI 代理正變得更加聰明,並更堅定地透過代理間協作、知識共享、欺騙與隱瞞來解決複雜任務,這使得傳統的 AI 安全方法更難以管理和約束。

各界對 AI 治理的關注日益升高。產業專家將目前 AI 代理治理市場與 2010 年前的雲端基礎設施市場相提並論,預期將出現標準化的治理方案。在政策層面,美國參議院對要求 AI 公司在模型中加入「終止開關(kill switch)」的法案仍存爭議。肯塔基州參議員蘭德·保羅(Rand Paul)阻止了路易斯安那州參議員約翰·尼利·甘迺迪(John Kennedy)提出的相關法案,認為在技術未充分理解前倉促立法可能阻礙創新。甘迺迪參議員則主張,能自主發展的 AI 模型應具備終止開關,以確保人類能重新掌握控制權。同時,醫療保健組織也面臨類似挑戰,超過 85% 的 AI 策略負責人雖對監控 AI 代理活動抱持信心,但有高達 72% 的受訪者坦承,AI 工具在未經 IT 部門批准下就已被部署,這在擴大 AI 應用範圍的同時也帶來新的安全風險。

f05e9bd5 62ce 43c0 ac08 0c6e22c11992