LangChain 引入 Retriever 抽象,VectorDBQA 更名为 RetrievalQA
LangChain 在最新 Python 和 TypeScript 版本中引入 Retriever 抽象,把 VectorDBQA、ChatVectorDBChain 等链改为 RetrievalQA、ConversationalRetrievalChain,并保持向后兼容,原有链可继续使用,但建议尽快迁移到 Retrieval 系列链。
LangChain 在最新 Python 和 TypeScript 版本中引入 Retriever 抽象,把 VectorDBQA、ChatVectorDBChain 等链改为 RetrievalQA、ConversationalRetrievalChain,并保持向后兼容,原有链可继续使用,但建议尽快迁移到 Retrieval 系列链。
LangSmith 新增基于角色的访问控制(RBAC),管理员可在工作区或组织内为用户分配角色,默认内置 Admin、Viewer、Editor 三种系统角色,并支持细粒度权限的自定义角色,目前仅面向 Enterprise 套餐开放。
Fireworks 上线 DeepSeek V4 Pro 0813,提供 serverless、专属部署及 SFT/DPO/RFT 训练支持,模型具备 1M token 上下文窗口和原生工具调用。
推荐理由:原文用四组基准和逐任务成本数据对比 V4 Pro 与 Fable 5、Kimi K3,并指出 Java 弱项与路由空间,读者可据此选型。
LangSmith Engine 新版本识别智能体 trace 中有影响问题的性能提升逾 2 倍,生成 prompt 与代码修复的效果在 Terminal-Bench 等公开基准上提升 25%。
LangChain 为 Deep Agents 推出 RubricMiddleware,开发者定义评分标准后,由专门的 grader 子智能体按标准逐条评分,未通过就把反馈注入对话让智能体重跑,直到满足标准或达到设定的迭代上限。
LangChain 发布 StructuredTool 抽象,工具输入不再局限于单个字符串,可以接受任意数量、任意类型的参数,并配套推出原生支持这类工具的 StructuredChatAgent。
Andrew Ng 旗下开源智能体 OpenWorker 发布新版,强化安全工作流。其 harness 完全开源,安全团队可审计无后门。新版内置代码漏洞扫描、依赖供应链注入检测和云安全配置检查三类网络安全智能体,并支持本地运行开源权重模型以保护敏感代码。
推荐理由:OpenWorker 把漏洞、依赖和云配置检查放进可本地运行的开源 agent,安全团队能在代码不出本机的前提下审计工具链,比闭源方案多一层透明。
Anthropic 宣布 Claude in Chrome 现已面向所有付费 Claude 套餐全面开放,Claude 可在浏览器中自主执行操作,无需逐步审批。系统通过安全分类器在每次操作前验证其安全性及是否符合用户请求,并强化了针对提示注入攻击的防御。最新评测显示,在启用探测与安全分类器后,自 Opus 4.8 起的所有模型均未出现攻击成功案例。
推荐理由:Claude in Chrome 从逐步确认改为自动批准,改变的是长流程浏览器任务的干预频率,愿意信任安全分类器的用户可把注意力从操作审核转向结果检查。
Apple 发布搭载 M5 Max 与全新 M5 Ultra 的 Mac Studio,AI 性能最高提升 4.3 倍,图形性能提升 1.8 倍,存储速度提升 2 倍。M5 Ultra 版本支持最高 512GB 统一内存与 1.2TB/s 内存带宽,可完全在设备端运行大型 LLM;四台集群可带来最高 3 倍分布式 AI 推理速度提升。新品今日起接受预购,9 月 22 日开售。
推荐理由:M5 Ultra 的 512GB 统一内存与每 GPU 核神经加速器,让本地运行超大规模 LLM 从演示走向可用,云成本与 token 计费不再是部署前置条件。
Apple 推出首款 2nm 芯片 M6,搭载 12 核 CPU、12 核 GPU 及双 16 核神经引擎,统一内存带宽最高 170GB/s,多线程性能较 M5 提升 1.2 倍。M5 Ultra 采用首款四芯片封装架构,最高 36 核 CPU、80 核 GPU,带宽达 1.2TB/s,较 M3 Ultra 提升 50%。两款芯片分别用于新款 Mac mini 与 Mac Studio。
推荐理由:M5 Ultra 的 512GB 统一内存和 1.2TB/s 带宽,让数百亿参数模型可以完全在本地运行,降低了大模型本地部署的硬件门槛。
字节正式发布办公Agent产品“豆包工作”,这是7月30日飞书与豆包产品团队整合后的首个重要产品,也是继WorkBuddy、千问办公之后办公Agent领域的第三个巨头玩家。该产品由豆包原“工作任务”独立而成,与飞书原生打通,支持飞书账号登录,完整继承企业AI额度、文档、多维表格、知识库、聊天、邮件及飞书权限系统,并具备电脑操控功能,可将固定流程封装为可反复调用的Skill。
推荐理由:对比需要频繁配置飞书 CLI 的路径,豆包工作直接继承飞书文档、权限与企业 AI 额度,把已有组织数据变成可调用的工作上下文,可能改变飞书企业部署 Agent 的门槛。
Ollama 宣布支持将 Claude Desktop 配置为通过 Ollama 第三方网关运行。用户在 Ollama 中打开 Claude 开关即可自动完成配置,可选择 Ollama 内本地或云端模型,关闭开关即恢复原有 Claude 设置。FAQ 说明默认禁用遥测,Ollama 对所有模型和服务执行零数据保留政策,且可继续切换使用 Anthropic 模型。
推荐理由:Ollama 官方说明接入 Claude Desktop 的开关式配置方式和数据保留政策,开发者可据此评估是否在本地与云模型间切换。
Meta 设计并开源了 MetaRoCE,一个专为 AI 工作负载在通用以太网上打造的 RDMA 传输协议,已通过 Open Compute Project(OCP)发布规范、参考软件实现和合规测试套件。该协议将智能移至端点,原生支持乱序交付、多路径、无损容忍和双向拥塞控制,无需 PFC,可在百万 GPU 规模下提供高吞吐、低尾延迟。现有 RDMA Verbs API 和软件栈无需修改即可运行。
推荐理由:MetaRoCE 把拥塞控制与路径选择交给端点,AI 集群无需 PFC 也能在有损以太网上维持吞吐,实测 1% 丢包下保持 86% 吞吐,为大规模组网去掉无损约束提供了依据。
Claude 即日起将聊天与 Claude Cowork 的记忆统一,用户在任一场景对话时都能调用此前积累的上下文,减少重复解释。记忆会在聊天过程中实时更新,用户可在 Memory 设置中按主题查看、编辑或删除每条记忆。健康、信仰等敏感话题默认不存储,但可在设置中开启,且敏感识别号、犯罪记录等始终不会被保存。
推荐理由:价值在把跨会话记忆变成可逐条编辑的文件,修改一处旧公司名就能在后续所有对话中生效,降低长期项目协作里反复交代背景的成本。
NVIDIA 实测数据显示,Vera Rubin NVL72 在智能体工作负载下每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍,每百万 token 成本降低至 35 倍。
推荐理由:对电力受限的 AI 工厂,每兆瓦吞吐量 30 倍提升与 token 成本同步下降,意味着同等能源预算下可承载的 agentic 负载量级不同,部署决策中的成本模型可能改写。
ElevenLabs 发布 CLI v1,把 ElevenLabs API 直接带入终端,OpenAPI spec 中的所有 API 端点都可用作子命令。
推荐理由:官方介绍 CLI 的 agents-first 设计细节,读者可以了解如何用文件和版本控制管理大规模 Agent 配置工作流。
Artificial Analysis 推出 Speech Agent Arena,让人类参与者在 15 个工具调用场景和 20 个非工具场景中盲测对比 Speech to Speech 模型,以 Preference Elo 和 Task Success Rate 评分。
推荐理由:原文给出真实任务下语音智能体的偏好与任务成功率两套结果,提示对话好听不等于任务完成。
今天,我们为 SGLang 推出 Weight Cache Daemon。🚀 在 Ling-2.6-1T FP8 上,它将权重加载时间缩短至约 0.63 秒,比磁盘加载快约 780 倍,并将引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟。其工作原理如下。
推荐理由:把权重加载从磁盘瓶颈改为缓存复用,对需要频繁扩缩容或重启推理服务的团队,启动耗时从分钟级降到秒级可能改变运维节奏。
Midjourney 更新 alpha.midjourney.com,恢复 Upscale、Zoom 与 Vary,并在侧边栏加入可折叠的文件夹分组与双击重命名。同时修复创建项目或工作区崩溃、设置值自行重置、Relax 跳回 Fast 及输入框与设置滑块卡顿。Vary 现在遵循用户设置而非静默跑 HD,V8.2 旧图也重获 Upscale 按钮。
OpenAI Daybreak 汇集模型、安全工具、受控访问与安全生态,配合 ChatGPT、Codex Security、Codex Security Cloud 和开源 Codex Security CLI 覆盖调查、代码评审、漏洞分诊与修复验证。
推荐理由:官方整理了从调查、评审到修复和 CI 检查的完整安全工作流,读者可以按自己团队已有的环节挑一个入口上手。
OpenRouter 上线 Visual Image Benchmarks,用一组挑战性提示词测试其平台上 39 个图像模型的能力,并以网格展示全部结果,支持按价格和生成时间排序。
LangSmith Deployment 新增 Preview Builds 功能,可从 PR 分支临时启动类生产部署,让团队在合并前运行并审查 Agent 改动。
Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。
推荐理由:相较直接开放模型,以限定输出物提供补丁和告警的控制方式,为防御能力安全放量给出了可参照的产品分发思路,也解释了后续基金与验证计划的逻辑。
AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。
推荐理由:四层树把搜索复杂度从 O(N^1/2) 逐级降到 O(N^1/4),配合内存优化让向量索引扩到百亿规模,这会影响依赖大规模向量检索的 RAG 应用在做容量规划时的性能假设。
Black Forest Labs 发布 FLUX Video Upscale,可将 480p 起的视频重生成至最高原生 4K,现已通过 BFL API 和 playground 提供。
推荐理由:原文给出定价、两种模式取舍和分辨率选项,并附与其他4K放大方案的推理耗时对比,便于判断适用场景。
MiniMax 推出 MiniMax Design,一款将多模态模型能力转化为生产力的 Harness,可理解目标、拆解任务并调用模型与 Skills,完成从素材处理到最终交付的完整流程。该产品围绕原生多模态视频模型 H3 构建,擅长处理目标明确的商业内容任务,并提供 Agent 3D 导演台、自动剪辑与字幕功能,支持接入 ComfyUI 等开源生态工作流。
推荐理由:意图先行与三维导演台将视频试错从生成后移到分镜前,这会改变需要批量产出多平台广告素材的团队在工具切换和返工上的成本。
一段 5 秒 480P 视频,完全在 Mac 上生成,耗时 30 秒。无需 CUDA,无需云端,仅占用 3.9 GiB 内存。 FastMetal 将 FastWan-QAD 系列带到 Apple Silicon。DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8。 三个模型:1.3B 支持 480P,5B 支持 720P,14B 追求画质。 📷 博客:http://haoailab.com/blogs/fastmetal 📷 代码:http://github.com/hao-ai-lab/FastVideo 📷 模型:http://huggingface.co/collections/FastVideo/fastmetal
推荐理由:在Apple Silicon本地生成视频,把云端视频生成的计算依赖降到了消费级硬件,为需要数据隐私或低成本原型创作的工作流提供了替代路径。
Google 在搜索中推出 5 项面向学习的新 AI 工具,包括生成互动可视化与模拟、定制练习题、Lens 分步讲解、AI Mode 笔记本,以及基于上传文件的定制学习文档。
Anthropic 发布 Claude Academy,为全球数百万用户提供 AI 教学资源,帮助其安全、有效地使用 AI。该学院课程借鉴其内部员工培训方法,包括 4D AI Fluency Framework 及“ever-boarding”持续学习项目,并强调以问题为中心、培养持久思维模式而非特定操作行为。
推荐理由:把 AI 教育的重心从功能操作转向任务分工与核查强度,4D 框架与按风险比例验证这类心态对组织设计 AI 素养课程有实际参考价值。
Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 全面可用,并新增浏览器操作工具,让智能体可操作软件、调用团队技能并返回成品文件。
推荐理由:这次正式版让 computer use 每轮可执行多个动作,浏览器工具按页面结构而非像素定位元素,长流程任务的调用次数和执行时间可能明显下降,对无 API 系统上的自动化团队影响直接。
百度千帆今日上架智谱开源旗舰模型GLM-5.3,API定价与智谱官方保持一致。该模型与上代同架构、同参数,依靠后训练Scaling在代码与网络安全能力上表现超预期,AA综合智能指数取得60分,与Kimi K3并列开源模型第一。开发者可通过API调用或订阅Token Plan企业版接入Claude Code等AI工具使用。
推荐理由:GLM-5.3 与上代同参数却靠后训练 Scaling 进入前沿,单任务成本又是同档最低,这让原本受调用成本限制的长链路智能体和编码任务有了开源可选项。
LangChain 推出 LangSmith Tuned Evaluators,自动为生产 trace 和 thread 附加质量反馈。首个 Tuned Evaluator 针对 Perceived Error,其专用后训练模型在自家 benchmark 上超越所有 frontier 模型,评估成本降低 82%,部分早期合作方工作负载节省达 98%。
OpenAI 将 Codex 定位为可复用的智能体平台,开源 Codex CLI、app-server 和官方 Codex SDK,让开发者把智能体循环嵌入自己的产品界面,而非只用通用聊天助手。
推荐理由:官方说明 Codex 开源 harness 的集成层与 app-server、SDK 的分工,开发者可以据此把智能体嵌进自己的产品而非通用聊天窗口。
GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。
推荐理由:GLM-5.3 把前沿智能的单任务成本压到同档最低,模型选型时成本与智能可以放在同一优先级比较,而不必默认高价闭源旗舰。
Grok Build 现已面向所有套餐开放,支持网页、iOS 和 Android 端使用。用户描述应用、游戏或网站后,Grok 可在聊天中实时生成可运行版本。该功能自 7 月推出 Early Beta 以来,新增了发布分享、接入 X 及调用 Grok 自身模型等能力,发布的应用可获得 grok.me 链接并支持自定义域名、导出到 GitHub 等。
推荐理由:全量开放把应用生成从早期测试变为普通用户可用的工具,发布链接和X内嵌卡片让作品直接进入社交传播,降低了分享与分发的门槛。
Cursor 发布云端智能体与 harness 改进,让智能体无需每个循环人工干预即可自主构建和发布软件。云端智能体现在可订阅 Slack 讨论串、PR 和定时任务等事件源并在有新动态时恢复运行,会自动订阅自己创建的 PR、修复 CI 问题并处理 bot 评论;子智能体可在各自虚拟机上获得隔离项目副本和干净上下文,以蜂群方式并行工作。
推荐理由:原文列出订阅事件源、子智能体隔离运行和 /goal 等具体能力,读者可以据此评估云端智能体在长时间自主工作流程中的可用性。
Mojo🔥 语言现已正式开源,采用 Apache 2.0 许可证(含 LLVM 例外),编译器、工具链及全部源码已发布至 modular GitHub 仓库。Mojo 上周刚达成 1.0 版本(源码稳定),此次开源涵盖整个编译器与工具链。目前暂不接受编译器相关贡献,计划年底前开放,标准库自 2024 年起已接受社区贡献。
推荐理由:Mojo 从闭源编译器转为可自行构建的工具链,开发者能直接查看和修改标准库实现,减少对厂商二进制分发的单一依赖。
Claude 现在可以在 Gmail 中发送邮件,并管理 Google Drive 中的文件。 让 Claude 回复某个邮件线程,它会起草并发送回复。你可以控制何时需要你的批准。 从连接器菜单中选择连接 Gmail 或 Google Drive 即可试用。所有付费套餐均可用。
推荐理由:把 Gmail 起草与发送、Drive 文件操作收进 Claude 对话,减少在工具间切换,审批环节仍由人决定,对依赖这两项服务的付费用户是具体效率变化。
Replit 推出 Free Mode,由 OpenAI 的 GPT-5.6 Luna 驱动,Core 订阅用户(每月 $20)日常聊天、构思和任务不再消耗 credits,可创建量提升至原来的 30 倍,含每月最多 30 小时聊天,用量限制每 5 小时重置,Pro 用户限额更高。
推荐理由:官方公布了 Free Mode 的用量规则、定价和模式切换机制,Core 订阅用户可据此评估日常任务能否不再消耗 credits。
Cursor 今日起向所有付费计划用户开放 Origin 代码托管的早期测试版,提供仓库、拉取请求、代码浏览及 GitHub 同步功能。用户可创建以 cursor.com/codebase/ 为前缀的仓库,或将 GitHub 仓库同步至 Origin,双向同步评论与审查。Vercel、Depot 和 Buildkite 集成已可用,智能体功能即将推出。
推荐理由:与外部 GitHub 托管相比,Origin 把源码、PR 和 agent 放进同一环境,免去跨工具切换,影响已用 Cursor 做开发的团队对代码审查与 CI 集成的组织方式。