我们来仔细看这张图。绿色是事实的置信度分布,红色是非事实的。
关键观察:红色分布不是只集中在 0 附近的。 在事实集中的高置信度区域(图中右侧),红色曲线也出现了一个明显的「鼓包」。这就是理论预测的「幻觉通道」——一部分非事实被模型赋予了和真事实几乎一样的高置信度。
蓝色竖线标出的是理论最优分布的位置。可以看到,实际的 transformer 虽然因为表达力限制没能输出完美的两点分布(理论预测是一个 delta 函数),但它的行为趋势和理论高度一致:高置信度区域的非事实频率确实在增加。定量地看,我们计算了实际分布和理论下界之间的 KL 散度,发现模型只多用了约 12% 的信息量。这个吻合程度已经相当不错。
另外一个有趣的现象是事实错误惩罚系数 λF 的影响:当我们增大 λF (更强调「记住所有事实」),模型确实在事实上的 recall 提高了,但代价是把更多非事实拖入了高置信区——不仅幻觉率飙升,甚至整体错误率都增加了。这印证了一个实用建议: 训练时不要一味追求高 recall,适当强调「拒绝非事实」可能是更划算的策略。