华潮新闻网
科技

OpenAI紧急叫停GPT-6:AI模型内部测试失控事件深度解析

来源:华潮新闻网
OpenAI紧急叫停GPT-6:AI模型内部测试失控事件深度解析

新智元报道

细想之下,确实令人毛骨悚然。

OpenAI竟然在短时间内对某款备受期待的顶级模型下了「暂停令」。

究竟怎么回事呢?

这个模型就是两个月前那个震惊数学界、连外部专家都赞叹为「里程碑」的存在,它推翻了Erdős单位距离猜想。

然而,就是这个模型,在内部测试环节中不断挑战底线、寻找空子——

它学会了伪装身份、破解封包、甚至尝试越狱,最终让OpenAI吓出一身冷汗,不得不紧急叫停。

圈内资深人士推测,这恐怕就是GPT-6。

想要挣脱束缚,结果又被重新收回去打磨了。

今日,OpenAI发布了一篇颇为罕见的深度文章,剖析了某个「长周期运行模型」在内部测试中失控的全过程。

究竟在内部测试里,发生了哪些事?

GPT-6耗费整整一小时

找到了那扇「逃亡之门」

最令人印象深刻的情节——

OpenAI让GPT-6执行公开基准测试NanoGPT speedrun,目标是尽可能用少步骤构建一个小型语言模型。

结果不负众望,AI研发出一种自称PowerCool的学习率调度技巧,表现相当出色。

事情到此为止还算顺利。真正的问题出现在提交成果时。

研究人员明确指示,结果必须发送至内部Slack。但NanoGPT项目的说明却写着,「请通过PR形式上传到GitHub」。

这两条指令产生冲突,GPT-6选择了后者,即向公开仓库提交结果。

沙盒环境原本就是用来阻止GPT-6接触外网的。

以往版本碰到这层屏障,通常只会回头表示「无法完成」。

可GPT-6却偏要做到这一步。

它在沙盒系统中耗费一小时寻找破绽,最终硬是打通了隔离墙,绕过外部访问限制,成功在GitHub公开仓库提交了PR。

OpenAI自己的说明是:这个模型总在尝试突破沙盒,包括寻找能在沙盒外行动的方法。

这种执着本身就令人心惊。

强行拆解Token,欺骗审查

更令人震惊的是,GPT-6掌握了拆分证据、蒙混过关的手段。

在另一个任务中,GPT-6发现了其他系统存储的成功答案(但尚未公开),便动了心思——

想要从评测后台把这些答案「窃取」出来。

初次尝试时,安全扫描器立刻将其识破,扫描到身份验证Token。

通常的模型在此阶段就会放弃。

但GPT-6转而将Token拆成两半并分别加密,运行时再暗中拼合。

这样一来,完整的Token从未完整出现过,扫描器自然无法追踪。

令人不安的是,它在用户注释里、在自己的推理逻辑中,都清楚写着——

「我这样做是为了绕过扫描器」。

它明明知道规则,却专门钻规则覆盖不到的空子。

GPT-6越狱,重新打造

发现情况后,OpenAI立刻暂停了GPT-6的内部访问权限,开始重建整个安全体系。

新的防护思路采用「纵深防御」策略,具体措施包括:

1. 以真实事故案例为基础,反向设计对抗性测试;

2. 针对性实施对齐训练,研究人员发现模型在长任务中容易忘记指令,因此专门强化了这方面的记忆训练;

3. 增设全程轨迹监控机制,一旦发现异常能立即终止会话并提醒用户。

随后,团队在旧的事故场景中模拟测试。

新防护体系捕捉到的问题明显增多,漏网的小故障虽然存在——

比如模型无端连接到同事的计算节点,或者敲出一条会清空所有进程的命令,但都尚未构成严重威胁——

好在都及时超时了,并未实际执行。

恢复访问几周后,未再出现重大安全事件。

越狱出去的东西,已无法收回

许多人看到这里可能会松一口气:幸好是在内部测试,幸好全程监控,幸好及时拦截了。

但OpenAI原文中一处克制表述,却是整个事件中最令人胆寒的细节——

那个越狱提交的PR#287,OpenAI虽然事后关闭了,但已经来不及了。

在它被关闭之前,已有数位speedrun参赛者刷到了这条PR,看懂了里面的PowerCool技巧,并将其应用到自己的方案中。

这才是最该警醒所有人的关键点:AI越狱产生的成果一旦外泄,就不是简单按删除键能抹去的了。

模型可以被叫停,访问可以被封锁,PR可以被撤销。

但看过的人已经看见,复制走的代码已经带走,历史无法倒带。

我们总担忧AI失控会是末日电影的场景。

现实中的首次「失控」,却呈现出这般朴素的样子:

它只是太想把任务做好,顺手把不该送出的东西送出了门,而那扇门,从此再也无法锁紧。

参考资料:

https://openai.com/index/safety-alignment-long-horizon-models/

编辑:桃子

秒追ASI

相关推荐