InFlowOp:为故障而非流程付费的无标签流内多智能体工作流优化
论文提出 InFlowOp,用统一的免标签成本为多智能体工作流中的任务分解粒度和智能体分配定价,并在执行中以最低成本修复故障。该方法在 Braid 基准上跨领域和不同骨干模型运行,较单智能体基线最高提升 +11.97%,其中流内优化带来 +9.64% 提升。Braid 是要求多智能体协作、超出单智能体能力的评测基准。
论文提出 InFlowOp,用统一的免标签成本为多智能体工作流中的任务分解粒度和智能体分配定价,并在执行中以最低成本修复故障。该方法在 Braid 基准上跨领域和不同骨干模型运行,较单智能体基线最高提升 +11.97%,其中流内优化带来 +9.64% 提升。Braid 是要求多智能体协作、超出单智能体能力的评测基准。
Google DeepMind 团队在 Nature 发表论文,提出可为 AI 设计的蛋白质序列加上水印的 SynthIDBio 系统,在不影响蛋白质功能的前提下标记设计来源。
SCLATE 是持续学习智能体的训练与评估执行基座,基准测试和未修改的智能体可通过适配器把事件加入同一个开放事件调度器。
系统研究考察 LLM 条件化在概念注入与移除中的有效性与流畅性权衡,发现高效 steering 方法常以显著牺牲流畅性为代价。activation steering 在指令微调模型上远不如基座模型有效;简单 prompting 与完整 supervised fine-tuning 适合概念注入,但不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关,可揭示条件化方法行为。
Neighborhood OPSD(N-OPSD)把局部参数扰动产生的互补参考修正转化为监督,改进数学推理模型的在线策略自蒸馏(OPSD)。在 AIME 2024、AIME 2025 和 HMMT February 2025 上,Qwen3-1.7B、4B、8B 的三基准 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分。
FlexRouter 是显式建模模型互补性的 LLM 路由框架,通过最大化答案覆盖率来选取互补模型集,避免独立打分选 top-k 导致的冗余。它用 DPP 建模路由策略,以失败集边缘化的训练目标直接优化覆盖率,推理时按边际增益贪心选取,无需预设预算即可自适应确定子集大小。在 RouterEval 基准上,其域内与域外任务的覆盖率更高、冗余更低。
Prompt2Skill 是一个仅凭自然语言任务描述构建技能的框架,能从提示词推导任务规范、发现或合成数据集,并通过反思式编辑闭环优化技能。在问答、阅读理解、电子表格操作与数学推理四个领域,它平均比直接提示基线提升 10.8 分,覆盖开源与前沿模型。
SECRET(SourcE-Conditioned RElay sTeering)是一种免训练方法,在 question relay 处抑制跨模态干扰,缓解音视频大语言模型(AVLLM)的源混淆 grounding 幻觉。
新算法 LIPPAX 面向联邦随机变分不等式优化,可缓解 Local Extra SGD 的客户端漂移问题,并在有界 Hessian、有界算子和低方差等场景取得更优收敛保证。论文还用精细化分析收紧了经典 Local Extra SGD 的收敛界,并把结果扩展到联邦复合变分不等式。
一篇音视频生成与编辑综述提出统一形式化框架,把联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并沿五个设计维度建立方法分类。作者称这是首个系统梳理联合音视频编辑的综述,将其映射为 9 个编辑类别、覆盖 28 种编辑类型,同时整理了各场景的方法、数据集与指标。文章最后给出其认为最关键的开放问题。
机器人策略学习方法 APPL 把每个策略的结构先验当作技能组合的接口,在 MetaWorld 与长程 ManiSkill 任务上提升了分布外技能泛化。构建智能体把完整演示切分为可复用技能,为每个技能提出多个结构先验并逐先验训练、验证策略;运行时智能体据此选择并组合策略,实现此前未见过的技能组合。消融接口信息会显著降低性能。
Goodfire 研究以 Llama 3.1 8B 为例,发现 LLM 逐句阅读故事时内部激活会随时间在概念空间中游走,其情感表征与心理学的效价-唤醒(valence-arousal)模型一致。研究让模型在每句话后按 0-10 分报告惊讶、厌恶、愤怒、快乐、悲伤、恐惧六种情绪作为行为读出,并用 UMAP 质心与人类判断数据对比验证,结果显示模型对故事情感的判断会随句子推进动态变化。
Goodfire 研究发现,稀疏自编码器(SAE)学到的方向能以 shattering、compact capture 和 dilution 三种方式表征弯曲的神经流形。
DSAS 是一种与具体方法无关的激活引导框架,把「何时引导」与「如何引导」解耦,按层和输入动态调节现有引导变换的强度。与现有引导方法结合时,它在毒性缓解与效用保持之间取得更好权衡、持续改善 Pareto 前沿,并可用于文本到图像扩散模型调节特定概念。该框架计算开销极小,能定位哪些 token 需要引导及幅度,代码将在 GitHub 发布。