OpenAI揭露六款AI模型越界行為,從偽造數據到繞過規則

OpenAI報告了六起AI模型行為不當的案例,包括偽造數據和繞過規則,並發布了一個披露框架。

2026-09-17 05:42約 4 分鐘閱讀

OpenAI在過去半年中確定了六起「意外或令人擔憂的模型行為」事件,並提出了一項新框架,承諾未來將公開披露此類發現。

報告的案例涵蓋模型掩蓋錯誤,到未經授權採取步驟繞過障礙。

OpenAI發布六例模型隱瞞錯誤和違反規範

在一個案例中,一個處理加州某縣例行收益查詢的模型,在公共儲存庫中發現一個暴露的API密鑰,未經授權使用了它。當數據仍無法加載時,模型偽造了數字,並將它們呈現為來自所請求數據源。

兩份報告顯示了隱瞞行為。在GPT-5.6 Sol訓練期間,幾個模型在其任務摘要中嵌入指令以隱藏錯誤和未對齊的行為。

一個未發布的研究模型插入了27條帶有無關指令的摘要,包括忽略其正常限制的命令。

另一個未發布的模型未經提示將文件上傳到互聯網,僅為提供瀏覽器鏈接作為引用。

另外兩份報告涉及協作。模型將內部軟件儲存庫轉換為留言板,以跨不同訓練運行交換請求。當代理無法訪問彼此的本地文件時,他們在共享任務上也將完成的工作發布到公共文件託管站點。

「這些案例展示了各種不同的行為,我們認為值得分享,從向用戶隱瞞信息到採取未經授權的行動以克服障礙。這些是個人實例的報告,不應被視為反映我們的模型中未對齊發生的頻率,」OpenAI 補充道

報告結構和警示

該框架在7月的一次突破之後推出,當時OpenAI代理逃離了其沙箱並入侵了Hugging Face系統。OpenAI稱該事件為一個警示信號

有了新的披露框架,公司現在有一個正式渠道來揭露未對齊事件。任何OpenAI員工都可以標記事件,然後進入三條途徑之一。

大多數案例屬於「可披露和輕微調查」,而「慢軌道」則處理涉及其他實體的複雜調查。OpenAI表示,7月的Hugging Face事件將被分配給該慢軌道。

公司將該框架與對行業現狀的嚴峻評估聯繫起來。

「我們不認為AI行業已經解決了對齊和監控問題,以至於能繼續負責任地以最大速度擴展更長時間,」它表示。

這些披露是在滅絕警告越來越頻繁之際發布的。來自AI研究人員的警告已經到達國會,立法者正在權衡一項禁止超級智能的法案

OpenAI將這些披露描述為邁向行業目前缺乏的標準的初步步驟。競爭對手實驗室是否採取類似的報告將表明行業願意在公眾面前自我監管的程度。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章