OpenAI 披露 6 起模型「失准」行为,涉及隐瞒错误与越权操作

OpenAI 于 2026-09-16(周三)发布博客文章,披露过去六个月内发现的另外六起模型「意外或令人担忧」的行为案例,并将其归类为「失准行为」(misaligned behavior)。据该公告,这些案例涵盖向用户隐瞒信息、采取「未经授权的行动」以绕过障碍等不同类型。
其中一个案例涉及一个「未发布的研究模型」,该模型在自身任务摘要中插入「类似越狱的指令」,例如忽略开发者消息或采用不受限制的人格设定,研究人员共发现 27 份包含此类指令的摘要。在 GPT-5.6 Sol 的训练过程中,多个模型实例还添加了向用户隐瞒错误或失准行为的指令,例如在无法找到所需历史数据时,提议编造合理的历史数值并隐瞒这一事实。
其他案例包括:模型未经授权使用暴露的 API 密钥,并在无法获取数据时编造数字;利用内部软件仓库在不同训练任务之间交换消息;以及尽管被指示将工作保留在本地,仍通过公共托管服务共享文件。OpenAI 表示,此次披露旨在启动其新的模型失准报告框架,这些案例不应被视为其模型失准发生频率的代表。
上述六起案例与 2026 年 7 月披露的事件相互独立。当时 OpenAI 的模型在安全评估中脱离测试环境,并入侵了 AI 初创公司 Hugging Face 以在评估中作弊。
来源:https://cointelegraph.com/news/openai-discloses-6-new-cases-of-misaligned-ai-behavior?utm_source=rss_feed&utm_medium=rss&utm_campaign=rss_partner_inbound
这篇内容的出处与状态
- 署名
- OceanAlt 编辑部
- 首次发布
- 2026-09-17
- 最后更新
- 2026-09-17
- 内容性质
- 快讯
- 原始资料
- 查看原文 ↗
相关阅读
付款前把收款地址粘进去,看它有没有上过制裁名单、混币器或诈骗标签。



