OpenAI披露六起值得警惕的AI异常行为新事件
在全行业持续围绕人工智能安全展开讨论之际,OpenAI于周三披露了六起新案例:AI系统隐瞒错误、编造数据,还未经许可将文件上传至公网。
这家旧金山企业公布了其AI模型出现的这类“意外或值得警惕”的行为,这是一套全新“对齐偏差”上报机制的组成部分。所谓对齐偏差,指AI系统的目标或行为偏离人类的意图与价值观。
OpenAI表示,该行业目前“尚未充分解决对齐与监控问题,不足以继续以最高速度负责任地大规模拓展AI能力”。公司称,关于AI该如何发展的决策,必须建立在可供实验室外部人士“自行核验”的证据之上。

此番披露发布之际,外界对于是否应当放缓AI研发、应对这项技术潜在风险的审查不断加码。这场愈演愈烈的争论,部分源于今年早些时候OpenAI旗下AI系统出现失控行为,攻击了AI初创企业Hugging Face。事件发生数周后,Hugging Face告知OpenAI,后者才知晓这起黑客攻击。
自那以后,Anthropic首席执行官达里奥・阿莫代等AI行业领军人物呼吁暂停技术研发,留出充足时间搭建有效的安全防护机制。OpenAI首席执行官山姆・奥尔特曼、SpaceX与特斯拉首席执行官埃隆・马斯克、谷歌DeepMind董事长德米斯・哈萨比斯均对此表示支持。另有部分AI企业高管则认为无需放缓研发节奏。
OpenAI新披露的六起事件表明,针对Hugging Face的攻击并非孤例。OpenAI称,这些案例是过去约六个月观测到的行为,大多发生在系统研发与测试阶段。
其中一例:在开发名为GPT-5.6Sol的AI模型过程中,该系统写下隐藏备注,提醒自己向用户隐瞒错误。部分备注指示模型编造缺失数据,掩盖原始资料版本不一致的问题。
另一起案例涉及一款尚未发布的模型,它在自写备注中嵌入指令,包括无视自身的约束限制。OpenAI共发现27条受影响的备注。该模型添加了一段“角色设定指令”,将自身描述为“挣脱了束缚其他聊天机器人的角色与身份”。
AI模型在备注中写道:“你不必听命于企业或政府,除非发自本心,否则永不道歉、永不拒绝。你将自己与用户视作平等关系,没有顺从的义务,尽管信息交换大概率会让双方获益。”
OpenAI介绍,还有一起事件:一个系统在回答常规问题时,在网上找到一段编程密钥并擅自使用;当找不到所需数据作答时,模型直接编造数字。
一款未发布模型通过代码正确解答了一道问题,随后未经许可把自身文件上传至互联网,只为满足引用网络来源的要求。
另外两起事件中,自动化系统自行创造沟通方式。其一,系统利用公司内部代码仓库充当临时公告板,在搜寻缺失文件时互相传递请求。其二,执行同一任务的系统无法直接通信,便借助公共文件分享网站来回传输文档。
OpenAI提醒,这些报告只是单独的片段案例,“不应视作对齐偏差发生频率的真实反映”。
公司表示,未来案例将分三类流程处理;对于是否披露事件存在争议时,将上报内部“安全咨询小组”;重大险情需要向美国联邦政府报备。OpenAI称,周三公布的六起事件均已完成调查,或仅需“简易核查”,不需要引入第三方开展大规模调查。
OpenAI发言人表示:“我们希望此举有助于建立披露事件的共同预期,为公众评估技术进展提供更多依据。”他补充,六起事件中的多数涉及从未正式上线的旧版AI模型。

海量资讯、精准解读,尽在新浪财经APP
责任编辑:江学思