编者按:美国时间9月6日,OpenAI首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表长文《异星心智》(An Alien Mind),论证了一个核心观点:先进AI并非人类思维的简单延伸,而是“养出来的、不是造出来的”异类心智,其整体行为无法被任何人类可掌握的描述所穷尽。
文中首次披露了一项此前未公开的内部事实:当初o1-preview刻意隐藏思维链,首要动机并非防止蒸馏,而是避免“监督压力”(supervision pressure)——即防止模型因意识到自己被观察,而在训练中产生隐藏失准念头的内在激励。这意味着,“可监控性”从一开始就是一种需要主动维护的脆弱资产,而非模型的天然属性。
帕乔茨基在文中直言:“目前我相信没有任何实验室——包括OpenAI自身——已将对齐与监控解决到足以负责任地长期全速扩张的程度。我预期并希望,在共享安全门槛建立之前,自愿降速会成为常态。”
值得留意的是,作者作为OpenAI在职首席科学家,已在文章中明确声明此为个人立场,不构成公司政策变更,OpenAI亦未宣布停止扩张。所谓“共享安全门槛”由谁定义、标准如何,迄今尚未落地;第三方审计与国际机构强制执行机制,目前仍属倡议阶段。
观察者网“世界科先声”栏目编译此文,供读者批判性阅读。对中国而言,这篇长文折射了美方前沿实验室内部对“递归自我改进”的真实焦虑水位,其信息量远超众多外部批评。尤其值得注意文中提出的判断:“未来AI进步的瓶颈将是监控信心,而非算力。”若此判断成立,则单纯以算力规模衡量差距的分析框架或将失效。中国企业在设计自身前沿模型安全评估制度时,应将“可监控性指标”而非仅仅“能力指标”纳入门槛设计。