很多人觉得可解释性,或者「AI 如何工作得那么好」这个问题不重要,但我却觉得很重要。
试想之后的两种场景:
场景一:如果我们仅仅通过 Scaling 就达到了 AGI 乃至 ASI ,全体人类的劳动价值都降为零,AI 作为一个巨大的黑盒子帮我们解决了所有问题,那如何让 AI 作为一个超级智能,一直行善,不欺骗不以隐秘的方式作恶,就是当务之急,要解决这个问题就要做可解释性。
场景二:如果 Scaling 这条路最终失效,人类在指数增长的资源需求面前败下阵来,必须得要寻求其它的方案,那我们就不得不去思考「模型为什么有效,什么东西会让它失效」,在这样的思考链条之下,我们就必须回归研究,可解释性就是目所能及的另一条路了。
在这两种情况下,最终都需要可解释性来救场。就算最终 AI 是个全知全能全善的神,以人类好奇和探索的天性,必然还是会去研究 AI 为什么能做得好。毕竟「黑盒」就意味着猜疑链的诞生,在大模型技术爆炸,开始达到甚至超过人类平均水平的今天,《三体》中「黑暗森林」的规则,也许会以另一种方式呈现出来。
目前打开训练好模型的黑箱,去找到电路(circuit),还是处于比较初步的阶段。可解释性真正的难点,在于从第一性原理,即从模型架构、梯度下降及数据本身的固有结构出发,解释为什么模型会收敛出这些解耦、稀疏、低秩、模块化、可组合的特征与回路,为什么会有大量不同的解释,这些涌现出来的结构和模型训练的哪些超参数相关,如何相关,等等。等到我们能从梯度下降的方程里,直接推导出大模型特征涌现的必然性,可解释性才算真正从生物式的证据收集走向物理式的原理推导,最终反过来指导实践,为下一代人工智能的模型设计开辟道路。对比四百年前的物理学,我们现在有很多 AI 版的第谷(收集数据),一些 AI 版的开普勒(提出假说),但还没有 AI 版的牛顿(发现原理)。
等到那一天来临的时候,我相信,世界一定会天翻地覆。