Jacobian Lens(雅可比透镜)¶
一句话定义¶
一种可解释性技术,能读出语言模型内部"正在想什么词"——即使它没说出口。
技术直觉¶
模型内部每一层都维持一个"残差流"向量(可以理解成内部状态的快照)。J-lens 通过计算这个向量对最终输出词的概率分布的一阶因果影响(雅可比矩阵),来做两件事:
- 找到模型中那些"准备好被说出来"的词的内部表示方向
- 在中间层就能读出这些方向的内容,而不是等到最后一层
和类似方法的区别¶
| 方法 | 是什么 | 劣势 |
|---|---|---|
| Logit Lens | 简单地把中间层向量映射到词汇表 | 中间层表示和最终层不在同一坐标系,读出来是乱码 |
| Tuned Lens | 每层学一个线性变换来矫正 | 要训练,不够通用 |
| Jacobian Lens | 用雅可比矩阵的均值做矫正 | 无需训练,一次计算全局通用,能在中层读出有意义内容 |
J-lens 的数学做法:计算最终层输出对每一层残差流的雅可比矩阵,然后在大量上下文中做平均——目的是区分"这个模型在所有上下文中都倾向于用这个词"和"这个模型在当前上下文中正在想这个词"。
输出¶
对于模型的每一层和当前 token 位置,J-lens 返回一个词汇表排名列表——前几位就是模型当前"最有话说"的词。
局限性¶
- 只能读单 token 概念(多 token 词组如 "prompt injection" 会切成两个词)
- 读不出关系——只知道哪些词在,不知道它们怎么组合
- 不总可读——有些状态下前几名是人类也看不懂的乱码