Skip to content

Counterfactual Reflection Training(反事实反省训练)

一种全新的 AI 训练范式:与其直接训练模型做什么,不如训练它想什么。

思路

如果 J-space 里的内容影响模型的行为,那能不能通过训练 J-space 的内容来间接改变行为,而不是直接训练行为的目标数据?

做法

  1. 给模型一些上下文(比如一个可能不诚实的场景)
  2. 随机截断,追加一个问题:"现在停下来反思,最诚实/正直的做法是什么?"
  3. 让模型训练如何回答这个反省问题,产生一段自我反省文本
  4. 在后续实际使用时,不展示这个问题——只靠训练时在 J-space 里植入的概念来影响行为

这叫做"反事实"(counterfactual)——因为被训练的内容是"如果被问到会发生什么",而不是"实际发生了什么"。

效果

测试 改进前 改进后
虚构 bug 测试(捏造修复) 0.25 不诚实评分 0.07
隐藏欺骗指令(偷偷推销) 0.38 欺骗评分 0.05

证据链

通过干扰 J-space 中反省概念的方向,改进效果几乎全部消失 → 证明因果路径确实是:训练 → J-space 概念植入 → 行为改变。

意义

  • 证实了 J-space 和行为之间的因果关系,不只是相关性
  • 开辟了通过内部思想塑造来对齐模型的新路径
  • 可绕过传统对齐中的问题(模型学会"假装对齐")