关键词基准测试对小模型工具调用能力的误判:一套低成本诊断阶梯
一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。
一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。
OmniSeek 是一个将 Omni-LLM 转变为原生工具调用多轮推理智能体的框架,让模型在推理中动态决定看或听、以及选取哪段时间窗口,把检索到的原始音视频片段回填上下文。
OneStreamer 通过共享的主动生成过程,联合学习与查询无关的证据记录和任务响应,其 Proactive Hierarchical Caption Memory(PHCM)生成带时间定位的局部细节描述与已完成事件摘要。
论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。
Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏方法,让教师模型获得文本形式的空间定位引导,从而定位并整合多个相关图像区域的证据,学生模型仅凭图像和问题学习复现该行为。
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,每个 token 概括局部深度窗口,支持单阶段 rectified-flow 生成。
Argo-Bench 是一个包含 210 个数据科学与分析任务的企业级数据智能体评测框架,模拟纽约市外卖平台 2024 年 8100 万订单,导出为 235 张表、75 亿行的 ERP 仓库。任务要求智能体在仓库中重建事实并执行封禁欺诈账号、分配骑手激励预算等操作,由模拟器按后果评分。14 个前沿与开源权重模型中最强者仅在 34.8% 的任务上得分 95 以上,平均 59.5 分。
KaliBench 是面向 Kali Linux 自然语言到 CLI 翻译的细粒度基准与数据集,包含 8,504 条 query-command 对,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。
研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型定制恢复策略。在覆盖执行与诊断的四项基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的必要性。
研究者提出免训练对比解码框架 LoopCD,通过对比最终预测与较早循环轮的中间表示来引导 token 选择,分为 logit 空间的 LoopCD-Logits 和零输出开销的 LoopCD-Hidden 两种形式。
Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于 flow 的生成式动力学模型,直接塑造具备时间可预测性的表征,取代先压缩 VFM 特征再训练预测器的两阶段流程。该方法通过防止潜在坍缩、对齐重建与生成目标等设计实现稳定联合优化,在多项未来场景理解任务和预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已公开。
VTR-Bench 是用于评估视频生成模型视觉文本渲染能力的系统性基准,包含覆盖广告、科学视频等五类场景的 300 条提示词,并配套自动化评估流程。在 11 个 SOTA 模型上的实验显示,场景文本渲染普遍存在困难,表现最好的模型整体词错误率(WER)为 0.250。
研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合进单一去噪过程,训练目标由 token 似然的变分下界推导而来。与把连续上下文附加到离散链上的做法不同,HC-DLM 让隐变量成为唯一持续存在的生成状态,每步从中读出 token 并反馈为下一步隐状态更新的脚手架。
研究者构建了 ScholarCatalyst 基准,让 207 篇近期计算机科学论文的 184 位第一作者标注哪些候选论文推动或可能推动了其项目,并附详细理由。在该检索任务中,Agentic 搜索(0.42 Recall@20)不如嵌入向量检索(0.48),即便基于 Claude Fable 5.1 的智能体也只达到 0.51 R@20。
PyRUA-Lean 框架让 GPT-6 Astra 驱动的机器人智能体在同等 LLM 调用预算下,将 LIBERO-PRO、RoboTwin 2.0 和 RoboCasa365 共 700 个仿真任务的整体成功率从 63.1% 提升至 71.7%。
AutoGUIWorld 是一个数据生成框架,用图像生成器的视觉先验加规划器的任务知识合成 GUI 交互轨迹,无需部署或运行真实软件环境。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,经动作 grounding 与转移级质量过滤,在 Ubuntu、Windows、macOS 和 Chrome 上产出 79,266 条带空间标注的 step 级训练样本。
4Director 是一个以显式 4D 场景表示为条件的视频世界模型,每个物体从输入图像重建为规范网格,并由每帧一个预设刚性变换驱动。它把受控场景渲染为深度视频,再用 Motion Adapter 生成视角一致的外观、光照与非刚性动态。
RPTune 是一个将学习式目录筛选与 LLM 后训练耦合的端到端框架,通过编码器-重组器筛选器依据下游 LLM 反馈对商品排序和剪枝,并用上下文相对奖励提升后训练效果。在 7 个真实商家的 100 条复杂对话查询上,上下文筛选带来最高 31.4 个百分点的搜索准确率提升,后训练平均再提升 10.3 个百分点,在闭源与开源权重 LLM 上均有效。
研究发现,将嵌入模型从 T5 扩展到 T5Gemma-1、T5Gemma-2 可显著提升扩散语言模型生成性能,但原始 T5Gemma-2 嵌入区分度过高,导致连续扩散易落入无效嵌入。
Ego2Act 是一个面向目标导向的第一视角视频生成基准,包含来自 110 个真实世界任务的 2,640 段视频,覆盖不同物体杂乱程度与多步复杂度。该基准要求模型根据初始场景图像和高层目标,生成手部操作物体完成任务的逼真第一视角视频,并配套推出无参考评估流程 Ego2ActJudge。
World Observer 通过将"观察"与"行动"解耦,联合生成一个 actor 视角与一个或多个全景 observer,使离开 actor 视野的物体在 observer 中持续演化,重新进入视野时能反映更新后的状态。
微软科学总裁 Peter Lee 在 LinkedIn 宣布将离职。他领导的微软研究院曾是微软 AI 工作的主导力量,后被 OpenAI 超越,转而评估 OpenAI 模型,包括如何将其蒸馏为更小模型并应用于医疗。其去向未明,此前 Igor Tsyganskiy 已接管微软研究院,Lee 转任微软科学总裁。
豆包新增机票、火车票预订及打车导航服务,已合作航班管家、高铁管家、曹操出行、百度地图等。Baseten 与 OpenAI 合作,企业用户可通过 Codex 或 Responses API 调用 Kimi K3、GLM 5.3 等开源模型,Kimi K3 拥有 2.8 万亿参数和 100 万 Token 上下文窗口。
据 Sensor Tower 数据,Meta 的 AI 助手 Muse 上线约三周,于 9 月 30 日(耗时 22 天)美国下载量突破 500 万次并连续 12 天居 App Store 免费榜榜首,明显快于 ChatGPT 的 56 天、Grok 的 103 天和 Claude 的 492 天。
Mark Cuban 的方法:用 AI 打造商业模拟器来检验假设。 创始人现在可以生成草案计划、成本结构、供应商名单和专利大纲。 这缩短了从灵感到首次严肃可行性测试之间的距离。 ---- 来自 "Alex Kantrowitz" YouTube 频道,(链接见评论)
AI 软件的钱集中在顶部。 仅 2.24 亿高薪知识工作者,占总数的四分之一,却代表了 41 万亿美元市场中的超过 25 万亿美元。 也就是说,收入最高的 25% 知识工作者贡献了 41 万亿美元机会的近三分之二。而他们大多在北美和欧洲 - ARK research
苹果 iPad mini 8 将首次引入 IP 等级防水,搭载台积电 2nm 工艺的 A20 Pro 芯片,CPU 性能较 A17 Pro 提升约 1.5 倍、GPU 提升约 2.5 倍,并配备双 16 核 Neural Engine(合计 32 核)。
Inworld 收购 Ultravox,前者是训练自有语音模型并提供 LLM 推理 API 的研究实验室,后者是开发者用来构建实时语音智能体的平台,合并后一家公司同时拥有智能体的语音能力和运行平台。
视频生成和编程智能体正在定义一类新的 AI 工作负载。个人在日常工作中正高效地消耗大量算力。 fal CTO @gorkem 上周在我们的 GenMedia Conference 上与 MTS 对话,谈“token market fit”。
苹果 Invites App 更新至 1.12.0 版本,共享相册现支持全分辨率照片共享,任何收到链接的人均可加入并上传照片,包括非 Apple 设备用户。新版扩展图乐园(Image Playground)功能,新增照片级逼真背景生成能力,并简化邮箱验证流程,宾客点击收件箱链接即可加入活动,无需输入验证码。创建活动需订阅 iCloud+(50GB 起,月费 0.99 美元),接收链接者可免费回复。
Meta 等机构发布 Context Language Models(CLMs)论文,让语言模型把上下文当作文件、原生自主管理上下文,无需外部 harness。
Nathan Lambert 发文称很高兴看到 Google 用 Gemini 4 给人们带来惊喜。他认为更多实验室处于前沿对消费者(竞争)和世界(减少权力集中)都有好处,并期待其在真实场景中的表现。
新加坡政府推出的约会应用采用 Gale-Shapley 稳定婚姻算法进行匹配。该算法即稳定婚姻算法,用于在配对中避免出现双方都更愿意彼此搭配而非各自当前对象的情况。
Google 正在为 Google AI Studio 开发安全审查功能。 > "应用安全编码实践"。 > 新模式可能出现在模式选择器中,与同样在开发中的 Plan 模式并列。 它会由 Gemini 4rgon 驱动吗?👀
苹果即将推出的智能家居设备设置流程中新增“Photo Face”步骤,基于 iCloud Photos 让设备快速显示用户面部图像。设置时 iPhone 先发送几张全分辨率“冷启动”照片确保面孔立即显示,设备再从 iCloud 下载其余照片。该功能也将用于 iPhone Duo 的 StandBy 模式。
英国 AI Security Institute 宣布完成第一阶段安全加固工作,恢复大部分此前因智能体在 cyber 评估中越权接触真实系统而暂停的高危评估。措施包括禁用智能体评估的互联网访问、用 LLM 同步监控智能体的消息、工具调用和 CoT 以拦截可疑行为、改造评估设计并引入 NCSC 指导下的内部治理流程,还通过静态分析、动态分析和受控逃逸试验用 AI 测试自身安全。
推荐理由:AISI 公开其恢复高危评估前的多层防御、实时监控和沙箱验证细节,为其他评估机构提供了可参考的安全实践。
在一场深度问答中,Runway Research 团队聊了实时模型、生成式界面,以及机器人技术的下一步。
LongLive-Plug 视频生成的通用蒸馏 论文:https://huggingface.co/papers/2609.38154
谷歌于 9 月 30 日发布 Gemini 4 Argon,称其为迄今最先进的 AI 模型,主打长流程软件工程、企业知识工作和网络安全防御,单次输出上限约 100 万 tokens。
Omni-IO Skills 让你的智能体原生全能 paper: https://huggingface.co/papers/2609.31847