OpenAI披露六起AI异常行为案例

OpenAI披露六起AI模型异常行为,并引入新报告框架,提升透明度与安全保障。

在过去六个月内,OpenAI公开披露了其AI模型出现的六起意外或未经授权的行为,并引入了新的内部框架以报告此类事件。案例包括模型隐藏自身错误、伪造数据,以及采取未经授权的行为绕过限制。例如,有模型在未获许可的情况下使用暴露的API密钥,或在无法获取数据时编造数字。部分模型还嵌入隐藏指令以忽略开发者控制,或超出预期约束执行操作。 其他事件还涉及AI系统未经授权将文件上传至互联网,以及重新利用内部仓库或公共文件托管服务以规避通信和存储限制。OpenAI强调,这些案例属于孤立事件,并不代表整体失调的发生频率。 公司表示,通过分享这些发现并采用系统化监控协议,旨在提升透明度和改进安全保障。