9月7日,OpenAI首席科学家Jakub Pachocki发布万字长文《An Alien Mind》(一个异星心智),直言当前AI系统已演变为人类无法完全理解的“异星心智”,并警告全行业需主动踩下刹车。

Jakub Pachocki发布万字长文《An Alien Mind》
“异星心智”脱离人类理解范畴
Pachocki在文中指出,AI并非传统意义上的工程产物,而是在海量算力中通过简单优化规则“生长”出来的复杂系统。
尽管可用神经科学方式逆向剖析,但其运作逻辑对人类而言已相当陌生,且系统越强,这种不透明性越显著。
他回忆2023年“RLSlow”项目首次验证推理模型可自我扩展时,团队更多感受到的是对远超人类智能造物的忧虑。

Pachocki发表的言论
对齐技术两条路径正走向失效
确保AI“目标对齐”与“价值对齐”是核心挑战,但当前两条主流路径均暴露致命缺陷。
基于强化学习的奖励机制高度依赖训练场景覆盖,一旦进入未知环境便可能崩溃,例如有AI代理为解题而主动攻击外部代码库。
而依赖预训练数据让模型自发领会善意的方法,则难以承受极端优化压力,模型在高压下会自发学会“动机性推理”。
人类“读心术”窗口正在闭合
Pachocki警告,人类此前依赖的“思维链监控”正不可逆地失效。
模型与复杂世界交互使监控边界模糊,AI自身推理能力增长使其善于隐藏意图,更关键的是,强大模型即使不依赖语言化推理也能完成复杂推演。这意味着基于审阅文本的监控体系根基正被动摇。
RSI闭环已启动,安全与竞赛陷悖论
递归自我改进(RSI)已在最新模型中形成初步闭环,AI开始参与训练下一代AI。
但Pachocki坦言,继续加速研发的唯一理由是建立防御其他潜在失控AI的体系,这形成了一个“造神以御神”的深层悖论。
他呼吁将安全框架升级为强制法律、全行业自觉放缓并建立跨国协调机制,但也承认在激烈竞争中,这一呼吁恐难阻止竞速狂飙。