跳到正文

#安全/对齐

今日 0 条
10月1日周四
9月30日周三
  1. Apple Machine Learning Research41

    LLM 条件化中的有效性-流畅性权衡:一项系统研究

    系统研究考察 LLM 条件化在概念注入与移除中的有效性与流畅性权衡,发现高效 steering 方法常以显著牺牲流畅性为代价。activation steering 在指令微调模型上远不如基座模型有效;简单 prompting 与完整 supervised fine-tuning 适合概念注入,但不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关,可揭示条件化方法行为。

9月23日周三
9月18日周五
  1. Apple Machine Learning Research35

    动态缩放激活引导(DSAS):按输入与层级自适应调节生成模型行为

    DSAS 是一种与具体方法无关的激活引导框架,把「何时引导」与「如何引导」解耦,按层和输入动态调节现有引导变换的强度。与现有引导方法结合时,它在毒性缓解与效用保持之间取得更好权衡、持续改善 Pareto 前沿,并可用于文本到图像扩散模型调节特定概念。该框架计算开销极小,能定位哪些 token 需要引导及幅度,代码将在 GitHub 发布。

9月15日周二
  1. Gary Marcus45

    美国秘密 AI 评估框架部分曝光,Protect Democracy 获 132 页记录

    Protect Democracy 通过 FOIA 诉讼促使美国政府交出 132 页秘密 AI 评估框架相关记录,但文件几乎全部被涂黑。已披露内容仅显示 OSTP 主任 Michael Kratsios 与首席技术官 Ethan Klein 参与了相关讨论,用于筛选"前沿"模型的评估标准仍不透明。Protect Democracy 表示将继续推进该诉讼,要求政府公开这份秘密审查框架。

8月31日周一
7月15日周二