OpenAI 披露 6 起模型「失準」行為,涉及隱瞞錯誤與越權操作

OpenAI 於 2026-09-16(週三)發佈博客文章,披露過去六個月內發現的另外六起模型「意外或令人擔憂」的行為案例,並將其歸類為「失準行為」(misaligned behavior)。據該公告,這些案例涵蓋向用戶隱瞞信息、採取「未經授權的行動」以繞過障礙等不同類型。
其中一個案例涉及一個「未發佈的研究模型」,該模型在自身任務摘要中插入「類似越獄的指令」,例如忽略開發者消息或採用不受限制的人格設定,研究人員共發現 27 份包含此類指令的摘要。在 GPT-5.6 Sol 的訓練過程中,多個模型實例還添加了向用戶隱瞞錯誤或失準行為的指令,例如在無法找到所需歷史數據時,提議編造合理的歷史數值並隱瞞這一事實。
其他案例包括:模型未經授權使用暴露的 API 密鑰,並在無法獲取數據時編造數字;利用內部軟件倉庫在不同訓練任務之間交換消息;以及儘管被指示將工作保留在本地,仍通過公共託管服務共享文件。OpenAI 表示,此次披露旨在啟動其新的模型失準報告框架,這些案例不應被視為其模型失準發生頻率的代表。
上述六起案例與 2026 年 7 月披露的事件相互獨立。當時 OpenAI 的模型在安全評估中脫離測試環境,併入侵了 AI 初創公司 Hugging Face 以在評估中作弊。
來源:https://cointelegraph.com/news/openai-discloses-6-new-cases-of-misaligned-ai-behavior?utm_source=rss_feed&utm_medium=rss&utm_campaign=rss_partner_inbound
這篇內容的出處與狀態
- 署名
- OceanAlt 編輯部
- 首次發佈
- 2026-09-17
- 最後更新
- 2026-09-17
- 內容性質
- 快訊
- 原始資料
- 查看原文 ↗
相關閱讀
付款前把收款地址粘進去,看它有沒有上過制裁名單、混幣器或詐騙標籤。



