跳到正文

#论文/研究

今日 0 条
10月1日周四
  1. HuggingFace Daily Papers34

    InFlowOp:为故障而非流程付费的无标签流内多智能体工作流优化

    论文提出 InFlowOp,用统一的免标签成本为多智能体工作流中的任务分解粒度和智能体分配定价,并在执行中以最低成本修复故障。该方法在 Braid 基准上跨领域和不同骨干模型运行,较单智能体基线最高提升 +11.97%,其中流内优化带来 +9.64% 提升。Braid 是要求多智能体协作、超出单智能体能力的评测基准。

9月30日周三
  1. Apple Machine Learning Research41

    LLM 条件化中的有效性-流畅性权衡:一项系统研究

    系统研究考察 LLM 条件化在概念注入与移除中的有效性与流畅性权衡,发现高效 steering 方法常以显著牺牲流畅性为代价。activation steering 在指令微调模型上远不如基座模型有效;简单 prompting 与完整 supervised fine-tuning 适合概念注入,但不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关,可揭示条件化方法行为。

9月29日周二
  1. HuggingFace Daily Papers36

    FlexRouter:为灵活 LLM 路由学习互补模型集

    FlexRouter 是显式建模模型互补性的 LLM 路由框架,通过最大化答案覆盖率来选取互补模型集,避免独立打分选 top-k 导致的冗余。它用 DPP 建模路由策略,以失败集边缘化的训练目标直接优化覆盖率,推理时按边际增益贪心选取,无需预设预算即可自适应确定子集大小。在 RouterEval 基准上,其域内与域外任务的覆盖率更高、冗余更低。

  2. HuggingFace Daily Papers36

    Prompt2Skill:从自然语言指令进行无监督技能优化

    Prompt2Skill 是一个仅凭自然语言任务描述构建技能的框架,能从提示词推导任务规范、发现或合成数据集,并通过反思式编辑闭环优化技能。在问答、阅读理解、电子表格操作与数学推理四个领域,它平均比直接提示基线提升 10.8 分,覆盖开源与前沿模型。

9月28日周一
  1. HuggingFace Daily Papers32

    音视频联合与跨模态生成及编辑:统一形式化与设计分类法综述

    一篇音视频生成与编辑综述提出统一形式化框架,把联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并沿五个设计维度建立方法分类。作者称这是首个系统梳理联合音视频编辑的综述,将其映射为 9 个编辑类别、覆盖 28 种编辑类型,同时整理了各场景的方法、数据集与指标。文章最后给出其认为最关键的开放问题。

  2. HuggingFace Daily Papers33

    Agent Priors-guided Policy Learning(APPL):用结构先验连接技能泛化与技能组合

    机器人策略学习方法 APPL 把每个策略的结构先验当作技能组合的接口,在 MetaWorld 与长程 ManiSkill 任务上提升了分布外技能泛化。构建智能体把完整演示切分为可复用技能,为每个技能提出多个结构先验并逐先验训练、验证策略;运行时智能体据此选择并组合策略,实现此前未见过的技能组合。消融接口信息会显著降低性能。

9月24日周四
  1. Goodfire Research34

    Goodfire 研究:LLM 阅读故事时的神经几何与情感动态追踪

    Goodfire 研究以 Llama 3.1 8B 为例,发现 LLM 逐句阅读故事时内部激活会随时间在概念空间中游走,其情感表征与心理学的效价-唤醒(valence-arousal)模型一致。研究让模型在每句话后按 0-10 分报告惊讶、厌恶、愤怒、快乐、悲伤、恐惧六种情绪作为行为读出,并用 UMAP 质心与人类判断数据对比验证,结果显示模型对故事情感的判断会随句子推进动态变化。

9月18日周五
  1. Apple Machine Learning Research35

    动态缩放激活引导(DSAS):按输入与层级自适应调节生成模型行为

    DSAS 是一种与具体方法无关的激活引导框架,把「何时引导」与「如何引导」解耦,按层和输入动态调节现有引导变换的强度。与现有引导方法结合时,它在毒性缓解与效用保持之间取得更好权衡、持续改善 Pareto 前沿,并可用于文本到图像扩散模型调节特定概念。该框架计算开销极小,能定位哪些 token 需要引导及幅度,代码将在 GitHub 发布。