LangServe 新增 Playground 与可配置能力
LangChain 为 LangServe 新增 Playground 与配置(configuration)能力。部署链或智能体后会自动附带 Playground,支持流式输出、中间步骤完整日志和可调参数,方便发链接给同事协作试用。配置基于 LangChain Expression Language,可通过 URL 保存不同版本,但当前配置尚不持久化,官方正 alpha 测试可持久化的部署平台。
LangChain 为 LangServe 新增 Playground 与配置(configuration)能力。部署链或智能体后会自动附带 Playground,支持流式输出、中间步骤完整日志和可调参数,方便发链接给同事协作试用。配置基于 LangChain Expression Language,可通过 URL 保存不同版本,但当前配置尚不持久化,官方正 alpha 测试可持久化的部署平台。
LangChain 发布名为 Plan-and-Execute 的新智能体执行器,先规划步骤再逐步执行,与 ReAct 式 Action Agent 相对。该框架依赖 planner 和 executor 两个组件,executor 初期由 Action Agent 承担,代价是需要更多模型调用,但规划与执行分离便于日后换成更小的微调模型。
Timescale Vector 为 LangChain 提供集成,让 PostgreSQL 充当 AI 应用的向量数据库,在 100 万 OpenAI embeddings 数据集上以约 99% recall 实现比 Weaviate 快 243.77% 的相似度搜索。
LangChain 为 LangSmith 发布 Pytest 与 Vitest/Jest 集成,已随 LangSmith Python 和 TypeScript SDK v0.3.0 以 beta 形式提供。
LangChain 发布新的网络研究检索器并提供使用文档,放弃最初的自主智能体路线,改为用 LLM 生成多个搜索 query、并行搜索并抓取页面、索引进向量库后检索最相关片段。
Cube 与 LangChain 集成,以文档加载器 CubeSemanticLoader 将语义层数据模型的嵌入写入向量数据库。该向量库可用于匹配语义层实体,把自然语言输入映射到数据模型中的视图及其成员,加载时只载入视图。Cube 还提供 chat 演示应用,用 OpenAI 提示词、FAISS 向量库和 Streamlit 界面生成对 Cube SQL API 的查询。
LangChain 在最新 Python 和 TypeScript 版本中引入 Retriever 抽象,把 VectorDBQA、ChatVectorDBChain 等链改为 RetrievalQA、ConversationalRetrievalChain,并保持向后兼容,原有链可继续使用,但建议尽快迁移到 Retrieval 系列链。
LangSmith 新增基于角色的访问控制(RBAC),管理员可在工作区或组织内为用户分配角色,默认内置 Admin、Viewer、Editor 三种系统角色,并支持细粒度权限的自定义角色,目前仅面向 Enterprise 套餐开放。
LangSmith Engine 新版本识别智能体 trace 中有影响问题的性能提升逾 2 倍,生成 prompt 与代码修复的效果在 Terminal-Bench 等公开基准上提升 25%。
LangChain 为 Deep Agents 推出 RubricMiddleware,开发者定义评分标准后,由专门的 grader 子智能体按标准逐条评分,未通过就把反馈注入对话让智能体重跑,直到满足标准或达到设定的迭代上限。
LangChain 发布 StructuredTool 抽象,工具输入不再局限于单个字符串,可以接受任意数量、任意类型的参数,并配套推出原生支持这类工具的 StructuredChatAgent。
Midjourney 更新 alpha.midjourney.com,恢复 Upscale、Zoom 与 Vary,并在侧边栏加入可折叠的文件夹分组与双击重命名。同时修复创建项目或工作区崩溃、设置值自行重置、Relax 跳回 Fast 及输入框与设置滑块卡顿。Vary 现在遵循用户设置而非静默跑 HD,V8.2 旧图也重获 Upscale 按钮。
OpenRouter 上线 Visual Image Benchmarks,用一组挑战性提示词测试其平台上 39 个图像模型的能力,并以网格展示全部结果,支持按价格和生成时间排序。
LangSmith Deployment 新增 Preview Builds 功能,可从 PR 分支临时启动类生产部署,让团队在合并前运行并审查 Agent 改动。
Google 在搜索中推出 5 项面向学习的新 AI 工具,包括生成互动可视化与模拟、定制练习题、Lens 分步讲解、AI Mode 笔记本,以及基于上传文件的定制学习文档。
LangChain 推出 LangSmith Tuned Evaluators,自动为生产 trace 和 thread 附加质量反馈。首个 Tuned Evaluator 针对 Perceived Error,其专用后训练模型在自家 benchmark 上超越所有 frontier 模型,评估成本降低 82%,部分早期合作方工作负载节省达 98%。
Sierra 的 Horizon 智能体为每位潜在客户配备一名长时 AI 智能体,可跨数天、数周甚至数月持续跟进,直到客户购买或放弃。车险案例中,AI 智能体 Jamie 在第 1、4、7 天用短信和电话跟进 Anne,当晚促成投保。沟通内容(已批准报价、下一步、保障细节)由企业掌控,每次对话积累的客户上下文归企业独有。
Mistral 的 Regional Endpoints 正式可用、Priority Tier 进入公开预览,客户可自选推理在欧洲或美国运行,后者提供承诺服务等级与 SLA。
OpenRouter 发布 Auto router(openrouter/auto)重大更新,改用过去 7 天平台上按任务类型统计的真实 token 消费份额挑选模型,官方称在多数领域以更低成本达到旧版默认路由的同等表现。
Sierra 推出 Voice Personas,让同一个 AI 智能体可针对不同品牌、市场和场景使用不同声音与性格,把智能体「做什么」与「如何表达」分离开来。新功能由 Sierra Agent SDK 支持,可调节语速、应对打断并中途切换声音或语言。Sierra 称某智能体搭配自然声音与 Persona 后解决率提升近 50%,该功能现已上线。
Sierra 的 Context Engine 把企业自有的客户关系与交互上下文变成竞争优势,驱动 Horizon 智能体在数天到数月内持续追求业务结果。智能体在每次交互中积累新上下文,引擎把每个决策当作实验并小比例探索新方案以持续自我改进,积累的证据还可训练预测流失、优惠接受率与线索转化的模型。
OpenRouter 为模型页接入 Artificial Analysis 提供的编程、数学、科学与长上下文推理基准分数,并新增 Effective Pricing 标签,按提供商展示含阶梯定价的实际费用。Rankings 页面新增基准散点图与扩展表格,100K–1M token 长上下文请求正在激增。新路由 openrouter/free 可自动为请求选择兼容的全部免费 LLM。
Sierra 的 Expert Answers 能自动把 AI agent 转交人工客服处理的对话转化为可审核的知识文章,并回灌给 AI agent。每篇草稿发布前均可审核,该功能还与 Live Assist 打通,把知识共享给整个客服团队。一家数字健康公司测试后解决率提升 4% 且无需客服额外投入,随后全面推广。
OpenRouter 新增可蒸馏模型标识,并推出 enforce_distillable_text 请求参数,开启后所有输出都来自许可允许用于训练和蒸馏的模型。
OpenRouter 新增隐私优先提供商 Venice,主打开源模型对用户自主、隐私与创作自由的尊重。其主推模型 Dolphin Mistral 24B Venice Edition 基于 Mistral 24B 微调,审查拒答率为 2.2%,对比 Claude 的 71% 与 GPT-4o-mini 的 64%。
Modal 产品更新:多节点训练集群进入 beta,加 @clustered 装饰器即可调度多主机上的数十块 GPU,并借 3.2 Tbps Infiniband RDMA 随节点数线性扩展。
OpenRouter 现已支持用 Passkeys 无密码登录,并同步推出多项开发者体验更新。provider 与量化版本新增 slug,便于精确指定 API;模型旁的 Copy 按钮可直接复制含 slug 的 API 调用,文档页也新增了 Copy Page 下拉菜单。由 Mastra 撰写的 TypeScript 智能体编写指南已上线其文档。
OpenRouter 为所有模型上线 :nitro 和 :floor 快捷方式:前者按吞吐量(tokens per second)优先选最快供应商,后者优先选最低价供应商。
OpenRouter 发布 Reasoning Tokens 功能,在 Chatroom 和 API 中展示模型的推理步骤,请求时加上 include_reasoning: true,即可从 message 的 reasoning 字段读取推理内容。
OpenRouter 对 finish reasons 进行标准化,内容发布于 OpenRouter Blog。正文未披露涉及的模型、字段细节或生效时间,页面仅说明订阅其邮件简报可获取模型用量数据、产品更新与研究报告,约每周一封,可随时退订。
OpenRouter API 新增 web search 功能,所有模型均可使用,开发者可在模型 slug 后追加 :online 或启用 web 插件,把实时搜索结果注入消息流。
Modal 宣布所有用户现在都能使用 NVIDIA H100 GPU。按 NVIDIA 基准,H100 对比 A100 最高带来 4 倍训练加速和 30 倍推理加速,单卡 80 GB 显存、每小时 7.65 美元,最多可 8 卡通过 NVLink 互联。在 Modal decorator 中把 GPU 类型设为 “H100” 即可运行,且只按实际用量付费。