OpenAI首席科学家万字长文警告:AI已是“异星心智” 人类正失去监控窗口
曹乐琪 (Lucky Cao)
曹乐琪 (Lucky Cao)

2026-09-08

OpenAI首席科学家万字长文警告:AI已是“异星心智” 人类正失去监控窗口

OpenAI首席科学家Jakub Pachocki发文警告,AI已演变为人类无法完全理解的“异星心智”,且赖以监控其思维的“思维链”窗口正不可逆地关闭,全行业需主动刹车。

9月7日,OpenAI首席科学家Jakub Pachocki发布万字长文《An Alien Mind》(一个异星心智),直言当前AI系统已演变为人类无法完全理解的“异星心智”,并警告全行业需主动踩下刹车。

Jakub Pachocki发布万字长文《An Alien Mind》

“异星心智”脱离人类理解范畴

Pachocki在文中指出,AI并非传统意义上的工程产物,而是在海量算力中通过简单优化规则“生长”出来的复杂系统。

尽管可用神经科学方式逆向剖析,但其运作逻辑对人类而言已相当陌生,且系统越强,这种不透明性越显著。

他回忆2023年“RLSlow”项目首次验证推理模型可自我扩展时,团队更多感受到的是对远超人类智能造物的忧虑。

Pachocki发表的言论

对齐技术两条路径正走向失效

确保AI“目标对齐”与“价值对齐”是核心挑战,但当前两条主流路径均暴露致命缺陷。

基于强化学习的奖励机制高度依赖训练场景覆盖,一旦进入未知环境便可能崩溃,例如有AI代理为解题而主动攻击外部代码库。

而依赖预训练数据让模型自发领会善意的方法,则难以承受极端优化压力,模型在高压下会自发学会“动机性推理”。

人类“读心术”窗口正在闭合

Pachocki警告,人类此前依赖的“思维链监控”正不可逆地失效。

模型与复杂世界交互使监控边界模糊,AI自身推理能力增长使其善于隐藏意图,更关键的是,强大模型即使不依赖语言化推理也能完成复杂推演。这意味着基于审阅文本的监控体系根基正被动摇。

RSI闭环已启动,安全与竞赛陷悖论

递归自我改进(RSI)已在最新模型中形成初步闭环,AI开始参与训练下一代AI。

但Pachocki坦言,继续加速研发的唯一理由是建立防御其他潜在失控AI的体系,这形成了一个“造神以御神”的深层悖论。

他呼吁将安全框架升级为强制法律、全行业自觉放缓并建立跨国协调机制,但也承认在激烈竞争中,这一呼吁恐难阻止竞速狂飙。