LLM 条件化中的有效性-流畅性权衡:一项系统研究
系统研究考察 LLM 条件化在概念注入与移除中的有效性与流畅性权衡,发现高效 steering 方法常以显著牺牲流畅性为代价。activation steering 在指令微调模型上远不如基座模型有效;简单 prompting 与完整 supervised fine-tuning 适合概念注入,但不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关,可揭示条件化方法行为。
系统研究考察 LLM 条件化在概念注入与移除中的有效性与流畅性权衡,发现高效 steering 方法常以显著牺牲流畅性为代价。activation steering 在指令微调模型上远不如基座模型有效;简单 prompting 与完整 supervised fine-tuning 适合概念注入,但不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关,可揭示条件化方法行为。
DSAS 是一种与具体方法无关的激活引导框架,把「何时引导」与「如何引导」解耦,按层和输入动态调节现有引导变换的强度。与现有引导方法结合时,它在毒性缓解与效用保持之间取得更好权衡、持续改善 Pareto 前沿,并可用于文本到图像扩散模型调节特定概念。该框架计算开销极小,能定位哪些 token 需要引导及幅度,代码将在 GitHub 发布。