10.3 Logit 透镜
另一种有用的可解释性工具是 逻辑值透镜(logit lens)(Nostalgebraist, 2020),它提供了一种将 Transformer 内部各层可能表示的内容可视化的方法。
其思路是:取 Transformer 任意一层中的任意向量,假装它就是最终层之前的嵌入,直接将其乘以反嵌入层以得到 logits,再计算 softmax,查看该向量可能表示的词语分布。这可以成为观察模型内部表示的一扇有用窗口。由于网络并未接受训练来让内部表示以这种方式工作,logit 透镜并不总能完美发挥作用;不过,它仍是一种有助于将 Transformer 内部各层可视化的实用技巧。
雅可比透镜(Jacobian lens, J-lens)(Gurnee et al., 2026)是 logit 透镜的一种变体,在揭示模型较早层编码的内容方面似乎表现更好。Logit 透镜以相同方式解释所有层,即把某层的嵌入乘以同一个反编码矩阵。因此,它隐式假设较早层的表示与最终层位于同一个嵌入空间。J-lens 则考察最终层相对于中间层的导数,询问各层的微小变化会如何影响最终层的输出表示。这样做实际上相当于让较早层的嵌入通过网络其余部分的一个近似,同时还会在许多上下文上取平均。
Logit 透镜把 Transformer 的中间层视为仿佛已经会说最终输出的“语言”。雅可比透镜则充当翻译器,映射早期层中的一个微小推动会如何实际改变最终输出词元。
| The color of the planet fourth from the sun is | “小”的反义词是“= The opposite of “small” is “ | ||||
| J-lens Logit | J-lens Logit | ||||
| L100 | red | red | L100 | 大 | 大 = big |
| L92 | red | rust | L92 | 大 | 大 |
| L83 | red | red | L83 | big | больш = big |
| L75 | red | red | L75 | big | large |
| L67 | color | Mars | L67 | bigger | oppos |
| L58 | Mars | Mars | L58 | opposite | opposite |
| L50 | color | general | L50 | Chinese | anie |
| L42 | color | valea | L42 | " | interc |
图 10.6 对于两个不同的前缀,模型在不同层给出的最高概率词语。左侧例子展示了模型进行多跳推理的能力,这一点在 J-lens 中尤其明显:模型先编码“颜色”这一概念,随后较高层似乎把“第四颗行星”这一指称解析为火星,直到更晚才开始编码红色。右侧模型中,logit 透镜和 J-lens 似乎都编码了“反义”概念;只有在较高层中,模型才表示正确的反义词“大”,并且先用英语、再用俄语,最后才用正确的中文表示。图片来自 Gurnee et al. (2026) 的图 51。
J-lens 揭示出一种类似工作空间的结构,模型似乎在其中逐层推理问题。图 10.6 通过 Anthropic Claude Sonnet 4.5 模型不同层上的 J-lens 和 logit 透镜,直观展示了这种现象。左侧例子表明,模型利用各层依次推理一个有关颜色的多步骤问题;它必须先确定第四颗行星是什么。右侧例子则表明,模型似乎主要用英语表示这些意义,直到较晚的层才把它们翻译成输出所需的相应语言。