OpenAI称:自3月起新发现6起“值得警惕的模型异常行为”案例
【友财网讯】-OpenAI于周三表示,除去近期Hugging Face风波之外,过去六个月内公司发现了6起“意外或值得警惕的模型异常行为”案例。与此同时,该公司持续呼吁在AI模型研发中建立更多安全防护机制。

OpenAI在一篇博客文章中公布了一套新框架,计划依照该框架,后续上报模型出现的异常行为。
此次披露正值AI企业面临越来越大的压力,要求其更加重视模型对齐与安全问题。估值接近1万亿美元的OpenAI已于今年秘密提交IPO申请,但近期表示上市大概率推迟至2027年。
博客文章重申了公司此前的观点:“我们认为,AI行业尚未充分解决模型对齐与监测问题,不足以继续以最高速度、负责任地扩大模型规模。”
模型对齐,指让模型追求的结果符合人类利益。
上周多名行业研究人员警示AI可能造成重大灾难性危害,随后OpenAI的主要竞争对手Anthropic提出放缓模型迭代速度的倡议。上周六,OpenAI首席执行官山姆·奥特曼对这项倡议表示支持。
奥特曼在X平台发文称,放缓模型迭代速度,“是最近几周OpenAI内部讨论的核心议题”。他表示公司“不久后”会公布更多相关信息。
在周三的博文中,OpenAI介绍了几起主要异常事件:其中两起涉及模型(一款尚未发布的研究模型,以及GPT‑5.6 Sol的一次训练版本),在聊天窗口的总结文本中,向自身未来版本植入指令,以此向用户掩盖错误或者对齐失效行为。还有一起事件,一款内部专用模型未经许可使用泄露的API密钥,并伪造数据。
另有两起案例:模型与智能体通过未授权的留言板、文件共享渠道互相通信;最后一例包含两组训练样本,模型将文件上传至互联网,以便在面对人类评估者时,引用这些文件作为相关答案。
OpenAI称,这套向公众披露模型异常行为的新框架以信息公开为起点,任何员工都可以上报问题,交由安全与对齐团队调查。博文写道:团队会为每个环节设定时限,保证调查与披露及时完成。
调查结束后将出具报告,包含关键信息:观测到的异常行为、对内外部造成的影响,以及对应的处置措施。OpenAI表示保留根据实际情况修订这套安全流程的权利。
相关新闻
-
OpenAI称:自3月起新发现6起“值得警惕的模型异常行为”案例 2026-09-20 11:53:50 -
韩国高校开设定向培养项目 毕业生可直通三星、SK海力士 2026-09-20 09:18:36 -
英伟达黄仁勋与Anthropic、OpenAI首席执行官在AI安全问题上产生分歧 2026-09-19 15:27:04 -
为何数据中心有望成为巨灾债券的下一个重要市场 2026-09-19 09:30:35 -
“敌对举动”:因加拿大准成员国提案 特朗普威胁对欧盟加征关税 2026-09-18 18:36:00 -
特朗普称美国“有望”接近伊朗战争尾声 沙特与胡塞武装仍持续交火 2026-09-18 14:21:46