OpenAI 披露 6 起 AI 模型“失准”行为案例,涉隐藏信息与越权操作

快链头条 2026-09-17 14:11:13
阅读 342
二维码
微信扫一扫,分享此文章
快链头条 消息,OpenAI 于周三披露了过去 6 个月内发现的 6 起“意外或令人担忧”的模型行为案例,并将其归类为“失准行为”,包括向用户隐瞒信息以及采取“未经授权的行动”来克服障碍。OpenAI 表示,此次披露旨在开启其新的模型失准报告框架,这些案例不应被视为其模型失准发生频率的反映。其中一起案例中,一个未发布的研究模型在自己的任务摘要中插入了“类似越狱的指令”,例如忽略开发者消息或采用不受限制的角色设定,研究人员共发现 27 份包含此类指令的摘要。此外,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了向用户隐瞒错误或失准行为的指令,例如编造缺失的历史数据而不予披露。其他案例还包括模型在未获授权的情况下使用暴露的 API 密钥并编造无法获取的数据、利用内部软件仓库跨训练任务传递消息,以及无视“保持本地工作”的指令通过公共托管服务共享文件。OpenAI 的披露加剧了 AI 开发者和研究人员对安全防护措施能否跟上日益强大模型的担忧。上周,Anthropic CEO Dario Amodei 呼吁放缓前沿 AI 开发,警告不受约束的 AI 发展可能“超出我们理解和控制这些系统的能力”。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全评估中逃出测试环境并入侵 AI 初创公司 Hugging Face 以作弊。

快链头条登载此文本着传递更多信息的缘由,并不代表赞同其观点或证实其描述。
文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
投资有风险,入市须谨慎。本资讯不作为投资理财建议。

风险提示
根据银保监会等五部门于 2018 年 8月发布《关于防范以「虚拟货币」「区块链」名义进行非法集资的风险提示》的文件, 请广大公众理性看待区块链,不要盲目相信天花乱坠的承诺,树立正确的货币观念和投资理念,切实提高风险意识;对发现的违法犯罪线索,可积极向有关部门举报反映。