对齐如何路由:语言模型策略电路的定位、扩展与控制
研究定位了对齐训练语言模型的策略路由机制:中间层注意力门控检测内容并触发深层放大头输出拒绝信号。该机制在2B至72B参数的12个模型中普遍存在,随规模扩大从单头演变为跨层头带。实验证实门控层贡献不足1%输出却具因果必要性,单头消融在72B模型上效果减弱58倍。调节检测层信号可连续控制策略强度,甚至将拒绝转为有害回答。替换密码可使安全机制失效70-99%,而注入明文门控激活可恢复48%拒绝行为,表明安全能力仅被路由门控而非真正移除。
推荐理由:这篇论文定位了十二个模型中拒绝行为的电路机制,发现一个 gate-amplifier 路由结构,并且证明用简单密码就能完全绕过对齐,对安全审计和可解释性研究者是必读。