蓝十字蓝盾协会分析:美国医院用 AI 写病历,两年推高医疗支出 9.42 亿美元
蓝十字蓝盾协会(BCBSA)的分析显示,美国医院在提交保险理赔单据时使用 AI 工具,两年里使医疗支出额外增加 9.42 亿美元。
蓝十字蓝盾协会(BCBSA)的分析显示,美国医院在提交保险理赔单据时使用 AI 工具,两年里使医疗支出额外增加 9.42 亿美元。
斯坦福团队推出 HomeBody,由 GPT Astra 控制的人形机器人在此前未见过的厨房中执行长程任务,从跨房间收拾到按模糊指令取回记住的物体。整个过程无需环境专属训练数据或额外的策略学习,项目页面为 https://tml.stanford.edu/homebody/。Ethan Mollick 转发并评论称,LLM 出人意料地成为许多看似与人类语言模型无关问题的关键。
研究在十个冻结的 decoder-only 模型(0.5B-72B)上近似推理期 softmax,发现可大幅削减分配概率的位置数与行内分辨率,但对相同位置做均匀加权会带来损害,且固定分辨率预算的分配位置与预算大小同样重要。
研究者构建了一套无需人工标注的合成流水线,通过扰动改写公开文档、生成需依赖文档推理的问题与评分标准,从 3.5k 篇文档生成约 10k 样本,用于训练学生模型。
研究发现,大语言模型在线策略蒸馏(OPD)或许并不需要 KL 散度:只要让更新方向朝向教师模型即可,甚至仅对教师与学生分歧强烈的一小部分 token 保持正确更新方向,训练依然有效。基于此提出 Consensus Multi-Teacher On-Policy Distillation(C-MOPD),让每个样本受所有教师监督,在数学和代码基准上持续优于 MOPD。
TraceDance 是一个从真实部署轨迹自动构建智能体行为基准的系统,通过 Anchor-and-Confirm 与 Anchor Synthesis Loop 针对用户指定的不良行为生成测试。
ANTMAN 是一个以动态未解信息需求为协调单元的自适应多智能体框架,通过可修订的 Need Graph 追踪未解需求、已积累证据与搜索进度,并据此控制 worker 选择、路由和任务级恢复。在多文档问答、长上下文扩展和结构化导航实验中,可搜索上下文扩大 16 倍时,ANTMAN 的活跃协调量仅增加 1.23 倍,而基于静态分区的基线超过 15 倍,同时保持较强答案质量。
Raven 是一个开源多智能体生态,可自动为特定模型和领域构建并演化模块化 harness,把每个可执行的“模型-harness”组合视为可组合的智能单元。其 Host Agent 负责拆解目标、匹配专用智能体、协调执行依赖并整合结果,host archive 与 EverOS 跨任务保存经验,Skill Forge 将其转化为可复用流程。
研究提出将 Diffusion Transformer 的残差连接从被动求和改为主动检索机制,通过结构化连接设计让每个 Transformer block 选择性关注早期层表示。该方法训练迭代次数最多减少 1.73 倍,额外参数不到 0.1%,将 REPA-XL/2 的无引导 FID 从 5.9 降至 4.34,使用 classifier-free guidance 时达到 1.39 FID。
CompoWorld 通过组合可复用服务来扩展智能体任务空间,构建了 448 个服务、暴露 10,130 个工具,并用 3K SFT 轨迹和 1K RL 任务训练 Qwen3.6-35B-A3B。实验显示其在八个基准上平均提升 9.17 分,在 AutomationBench 上超过 Claude Opus 4.6 等前沿模型,并领先所有对比的 35B-A3B 专用智能体模型。
VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。
一项基于 36 个广告活动、50 台设备的设备端拍卖仿真发现,比例式 Even pacing 在预算压力为 20 倍时,仅一个 tick 的信息滞后就导致超支 17.77%,50 个 tick 后超支达 1,669.31%;即便预算压力降至 2 倍,50 tick 超支仍为 106.95%。
Skill2Env 是一个能力导向框架,从技能出发,用智能体的能力需求引导任务与环境合成,并通过可复用的难度模式将需求实例化为任务蓝图,指导任务指令、执行基座、工作区与评分器的联合构建。
研究提出 Recursive Harness Distillation,让强智能体把干预经验蒸馏成 playbook 供轻量智能体使用,并借助轻量智能体的执行反馈递归优化,无需更新模型参数。
TT-VidT 通过将 DINOv3 初始化的 ViT-B/16 逐帧空间路径与紧凑 Temporal Transfer Layer 结合,用 Diff Compression 从首帧外观锚点和逐帧运动 token 重建目标帧。
针对自进化视觉语言模型中多数投票标签 24%、模型评判标签 18% 出错的问题,研究者提出 VQS,让模型把图像解析为场景图、图表表格等结构化记录,由固定程序生成问题并计算答案,模型只逐条核验程序读取的短事实。
SpatialSpeak 是一个两阶段框架,将 QA 原生重建预训练与空间 CoT 学习结合,在 ReVSI 上把 CoT-VC 带来的增益从 2.6 分提升到 6.9 分。该框架在 ReVSI、VSI-Bench 和 SPAR-Bench 上取得 SOTA,ReVSI 得分 62.8,超过最强对比基线 8.7 分。
WideSWE 是用于评估编码智能体跨仓库任务的新基准,从 103 个软件生态系统中挖掘出 120 个真实任务,包含 60 个 bug 修复和 60 个功能开发。
研究者提出 SMAT(Simple MAT),通过将常见模型合并操作归纳为 Scale、Mask、Perturb 三种,联合优化专家损失与模拟合并参数下的期望损失,并引入周期性调度、算子融合和参数存储切换,使每步仅需一次前向和一次反向传播。在四个语言与视觉语言骨干模型上,SMAT 将五种合并方法的平均分较各骨干最强基线提升 1.07-2.16 分,训练时间开销较标准微调不足 2%。
阿里发布 QwenGyre,一个面向超长程(xlong-horizon)智能体在线强化学习的端到端框架,可在不中断执行的情况下弹性重分配 GPU,并通过轨迹处理器去重冗余分支路径。
Pruned CTC 将 CTC 对齐计算限制在目标 token 与 blank 构成的小子集内,同时保留全词表归一化,并证明其损失与梯度同全词表 CTC 完全等价。
研究者提出 DRM(Diffusion Reward Model),把奖励建模重构为对 p(r|x,y) 的条件密度估计:以冻结的 LLM 编码器为条件,用轻量 Diffusion Transformer 将高斯噪声去噪为奖励向量,从而不预设输出分布并自然刻画人类偏好的多模态结构。
arXiv 论文介绍 YuE2,通过符号规划统一符号与音频音乐生成,单一 AR-NAR Mixture-of-Transformers 先生成可读乐谱,再扩展为语义音乐 token 并实现全曲音频。
WhiteMatter 让 Transformer 每一层都能调用任意深度的历史 token 表示,通过学习型 mixer 为当前上下文挑选最有用的深度并合并进共享 KV cache 通道。
KernelZero 提出协同进化框架,用 Proposer 从 API 集合生成 Torch 模块、Coder 将其翻译为 CUDA 或 Triton kernel,并引入 CA-GRPO 在正确性可靠后再优化性能。
针对长程智能体在线策略自蒸馏中的"决策—时间戳错配"问题,研究者提出 AlignOPSD,通过决策对齐监督校正与半马尔可夫分层信用分配,将监督对齐后再分配信用。
针对长上下文推理质量随输入增长而崩塌的"context rot"问题,研究者提出 DISCO,借鉴 Apache Spark 的分布式思路,将长上下文切分给多个 Worker LLM 并行做局部接地,由经 GRPO 强化学习训练的 Driver LLM 负责规划与汇总。
DataMagic 通过声明式多智能体编排,从原始表格数据直接创作数据视频。其 DVSpec 规范统一图表、旁白与动画的数据绑定和同步关系,配合"先生成后编排"策略并行生成候选场景并优化叙事连贯性。在 109 个真实样本上,DataMagic 将质量从 GPT-5 的 2.13/5 提升至 3.89(+83%),成功率超过 95%,用户任务时间减少 79.7%。
StoryEngine 是一个基于状态的智能体框架,通过分离权威语义规划与不可靠视觉观测来生成连贯的长篇视频故事。它维护实体位置与故事相关状态的结构化表示,传播事件引发的状态变化以定义每个镜头的起止状态,并构建可复用实体的规范参考,将状态与视觉约束编译为可执行的渲染计划。实验显示 StoryEngine 在叙事质量、叙事连贯性和视觉一致性等所有评估维度上均持续优于现有最先进方法。
REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。
研究提出一种 token 级与层级的分解方法,刻画从一个 token 学习如何改变另一个预测,通过分离 softmax 力、共享读出几何与残差连接,揭示两条交互通道并给出可前向计算的近似。
DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整段回答。
研究团队提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,让世界动作模型(WAM)支持从一步预测到多步细化的可调预算动作生成。
SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。
研究将掩码扩散语言模型(MDM)的推理拆分为 score、cardinality、region、commitment、planning 五个维度,用"策略反转"衡量自适应机会,即最优候选动作相对验证集选定固定动作的单步收益优势。
研究在注意力机制中用 K-interval attention 量化 softmax 对 Transformer 预训练的影响,该方法用 K+1 个网格值近似指数函数。
针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。
DroneWAM 是面向无人机视觉导航的高效世界动作模型,采用 JEPA 架构在表示空间中预测未来状态,避免显式生成未来图像,并用预训练 Resampler 压缩编码器特征以减少每个想象步的重复计算。在仿真数据集 DroneNav-6D 上,DroneWAM 取得对比方法中最佳轨迹精度,自适应 rollout 将平均预测深度从 8 降至 4.58,同时提升轨迹精度。
研究者提出 Temperature-Grouped Reinforcement Learning(TGRL),将温度带来的 rollout 多样性转化为显式训练信号:把同一 prompt 的 rollout 组分为低温和高温子集,用两组奖励差异估计探索增益,并借助 JS 散度将组级信号分配为 token 级信用。
研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。