LangChain 推出 Plan-and-Execute 智能体执行器
LangChain 发布名为 Plan-and-Execute 的新智能体执行器,先规划步骤再逐步执行,与 ReAct 式 Action Agent 相对。该框架依赖 planner 和 executor 两个组件,executor 初期由 Action Agent 承担,代价是需要更多模型调用,但规划与执行分离便于日后换成更小的微调模型。
LangChain 发布名为 Plan-and-Execute 的新智能体执行器,先规划步骤再逐步执行,与 ReAct 式 Action Agent 相对。该框架依赖 planner 和 executor 两个组件,executor 初期由 Action Agent 承担,代价是需要更多模型调用,但规划与执行分离便于日后换成更小的微调模型。
LangChain 发布新的网络研究检索器并提供使用文档,放弃最初的自主智能体路线,改为用 LLM 生成多个搜索 query、并行搜索并抓取页面、索引进向量库后检索最相关片段。
LangChain 宣布完成 1000 万美元种子轮融资,由 Benchmark 领投。当时 LangChain 在 GitHub 已有 20K+ stars、10K 活跃 Discord 成员和 350 多名贡献者,资金将用于继续投入这个开源框架。
LangChain 的 SQL chains 和 SQL agent 通过向提示词注入数据库描述,让 LLM 生成可执行的 SQL 查询。为对抗模型幻觉(编造表、字段)与上下文窗口限制,做法是在提示词中附上 CREATE TABLE 语句和示例行;Rajkumar 等人的研究显示 3 行示例效果最佳,更多内容反而降低表现,LangChain 已将其设为默认。
LangChain 阐述“上下文工程”(context engineering)的兴起,将其定义为构建动态系统、以正确格式向 LLM 提供正确的信息与工具,使其有可能完成任务。文章称智能体表现不佳多因上下文、指令或工具传达不到位,而非模型本身出错,并认为上下文工程正成为 AI 工程师最重要的技能。LangGraph 以完全可控为设计目标,可支持上下文工程,而多数其他智能体框架的抽象会限制它。
LangSmith Engine 新版本识别智能体 trace 中有影响问题的性能提升逾 2 倍,生成 prompt 与代码修复的效果在 Terminal-Bench 等公开基准上提升 25%。
LangChain 为 Deep Agents 推出 RubricMiddleware,开发者定义评分标准后,由专门的 grader 子智能体按标准逐条评分,未通过就把反馈注入对话让智能体重跑,直到满足标准或达到设定的迭代上限。
LangChain 发布 StructuredTool 抽象,工具输入不再局限于单个字符串,可以接受任意数量、任意类型的参数,并配套推出原生支持这类工具的 StructuredChatAgent。
AI 客户服务平台 Sierra 宣布在首尔设立办公室,正式进入韩国市场。其 Horizon 长期运行智能体可跨系统、跨渠道运行数周至数年,并通过 Context Engine 从每次交互中学习,Sierra 按结果而非用量计费。
LangSmith Deployment 新增 Preview Builds 功能,可从 PR 分支临时启动类生产部署,让团队在合并前运行并审查 Agent 改动。
Addy Osmani 在 The Pragmatic Engineer 播客中讲述自己从 16 岁自建浏览器到 Google 工程总监的路径:在 Google 超过 14 年,先后参与 Chrome、DevTools、Core Web Vitals,最近负责 AI 开发者体验。
LangChain 推出 LangSmith Tuned Evaluators,自动为生产 trace 和 thread 附加质量反馈。首个 Tuned Evaluator 针对 Perceived Error,其专用后训练模型在自家 benchmark 上超越所有 frontier 模型,评估成本降低 82%,部分早期合作方工作负载节省达 98%。
LangChain 博客主张,企业要获得持久的 AI 优势,必须拥有自己的智能,而非只依赖通用模型。文章认为不必自建 AI 每一层,但要控制模型、harness 编排逻辑以及上下文与记忆这些决定智能行为的部分。企业还需像管理操作系统一样控制成本、衡量质量,并界定智能体可独立行动与需要监督的边界。
Sierra 的 Horizon 智能体为每位潜在客户配备一名长时 AI 智能体,可跨数天、数周甚至数月持续跟进,直到客户购买或放弃。车险案例中,AI 智能体 Jamie 在第 1、4、7 天用短信和电话跟进 Anne,当晚促成投保。沟通内容(已批准报价、下一步、保障细节)由企业掌控,每次对话积累的客户上下文归企业独有。
OpenRouter 发布 Auto router(openrouter/auto)重大更新,改用过去 7 天平台上按任务类型统计的真实 token 消费份额挑选模型,官方称在多数领域以更低成本达到旧版默认路由的同等表现。
Sierra 推出 Voice Personas,让同一个 AI 智能体可针对不同品牌、市场和场景使用不同声音与性格,把智能体「做什么」与「如何表达」分离开来。新功能由 Sierra Agent SDK 支持,可调节语速、应对打断并中途切换声音或语言。Sierra 称某智能体搭配自然声音与 Persona 后解决率提升近 50%,该功能现已上线。
Sierra 的 Context Engine 把企业自有的客户关系与交互上下文变成竞争优势,驱动 Horizon 智能体在数天到数月内持续追求业务结果。智能体在每次交互中积累新上下文,引擎把每个决策当作实验并小比例探索新方案以持续自我改进,积累的证据还可训练预测流失、优惠接受率与线索转化的模型。
Moonshot 发布 2.8 万亿参数多模态模型 Kimi K3,具备 1M token 上下文窗口和原生视觉能力,Modal 在发布当天以 460 tokens/s 提供推理。
Sierra 与 Knox Systems 合作获得 FedRAMP High 认证,其 AI 智能体将可用于美国联邦机构服务。平台支持语音、聊天、邮件渠道与 58 种语言,已服务 40% 的 Fortune 50 企业。Cigna 用 8 周将智能体投入生产,患者身份验证时间缩短 80%。
Sierra 在澳大利亚悉尼开设办公室,这是其继新加坡、东京、马德里、巴黎和伦敦之后的又一次扩张。其平台上的 AI 智能体可 7×24 小时以 30 多种语言无等待服务,覆盖产品发现、注册登录、故障排查与流失管理。美国 Rocket Mortgage 每月贷款量达 $1BN,使用该智能体的购房者完成流程的可能性是 4 倍。
Sierra 的 Expert Answers 能自动把 AI agent 转交人工客服处理的对话转化为可审核的知识文章,并回灌给 AI agent。每篇草稿发布前均可审核,该功能还与 Live Assist 打通,把知识共享给整个客服团队。一家数字健康公司测试后解决率提升 4% 且无需客服额外投入,随后全面推广。
Sierra 宣布在上线七个季度后 ARR 达到 1 亿美元,公司于 2024 年 2 月推出。其客户包括 Deliveroo、Discord、Ramp、Rivian、SoFi、Sonos、Tubi、Wayfair 等,使用 Sierra 的公司中有 50% 营收超过 10 亿美元、20% 超过 100 亿美元。
Modal 提出一套面向编码智能体的开发者体验框架,认为人类与智能体同样依赖紧密的反馈循环。框架强调用 CLI、SDK 和 API 提供程序化访问,让错误信息具备可操作性,并以一致、贴近代码的示例作为学习基础。Modal 称这些原则来自服务数千名用户的迭代,其 vLLM 推理示例即体现基础设施与逻辑同处一处。
OpenRouter 现已支持用 Passkeys 无密码登录,并同步推出多项开发者体验更新。provider 与量化版本新增 slug,便于精确指定 API;模型旁的 Copy 按钮可直接复制含 slug 的 API 调用,文档页也新增了 Copy Page 下拉菜单。由 Mastra 撰写的 TypeScript 智能体编写指南已上线其文档。
Sierra 在纽约开设办公室,并招聘智能体开发和销售岗位。纽约已有多家 Sierra 客户,包括 CLEAR、SiriusXM 和 Casper。Sierra 称纽约处于其服务的金融服务、媒体、医疗、旅游等行业核心。
Sierra 的 AI 智能体可在用户萌生取消念头时主动介入并提供个性化方案,把客服从成本中心变成创收职能。一家旅游平台将其部署在 web 和 mobile 端,用于厘清套餐权益、探索替代方案,带来 5% 的 plan keeps 提升和 4.7 的 CSAT。保险与娱乐客户则用它识别取消倾向、处理取消意向来电,提升续约与留存并减轻客服负担。