Agent Anomaly Detection 在 Gemini Enterprise Agent Platform 进入 Private Preview
Agent Anomaly Detection 在 Gemini Enterprise Agent Platform 进入 Private Preview,作为推理式监控与审计层,识别自主智能体的行为异常、可疑意图与策略违规。
Agent Anomaly Detection 在 Gemini Enterprise Agent Platform 进入 Private Preview,作为推理式监控与审计层,识别自主智能体的行为异常、可疑意图与策略违规。
The Coalition 公布《战争机器:事变日》发售宣传片,该作将于 10 月 7 日登陆 XBOX Series X|S 与 PC,首发加入 XBOX Game Pass。PC 版首发支持英伟达 DLSS 4.5 与硬件光线追踪,同时兼容 AMD FSR、虚幻引擎 TSR 和 Intel XeSS。标准版售价 298 元,高级版 428 元,预购高级版可提前最多 5 天体验。
Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef,包含 Clef 与 Clef-flash 两款。两者分别基于 Qwen3.8-27B 和 Qwen3.5-9B,在 Jev 决策指数(Decision Index 0.2.1)评测中 Clef 处于领先地位,且完全兼容 Jev-API。
OpenRouter 的模型路由指南建议客服机器人采用 cheap-first 方案:常规 FAQ 交给小型廉价模型,仅把困难或不确定的请求升级到更强模型。文中对比静态规则、分类器分流和带置信度阈值的答案校验三种模式,并指出 Auto Router 负责选择初始模型、有序 fallback 列表处理请求错误,支持策略的验收检查仍由应用维护
Modal 宣布其多节点集群 Modal Clusters 正式可用,用户通过 @modal.clustered 装饰器即可创建集群。集群节点间通过 InfiniBand RDMA 通信,速率最高 6.4 Tbps,为 PyTorch 和 NCCL 自动配置,按秒计费。
OpenRouter 发布教程,讲如何把固定的 LLM eval 集放进仓库并在 CI 中门禁 Pull Request,通过率低于阈值时脚本以退出码 1 阻断合并,eval 无法运行时以退出码 2 区分。
FlexRouter 是显式建模模型互补性的 LLM 路由框架,通过最大化答案覆盖率来选取互补模型集,避免独立打分选 top-k 导致的冗余。它用 DPP 建模路由策略,以失败集边缘化的训练目标直接优化覆盖率,推理时按边际增益贪心选取,无需预设预算即可自适应确定子集大小。在 RouterEval 基准上,其域内与域外任务的覆盖率更高、冗余更低。
Databricks 的 Data and AI Platform 通过 zero-copy Open Sharing 和 Lakehouse Federation 直接查询工厂、供应商与质量系统中的原始数据,无需为每个用例新建 ETL 管道或复制数据。平台以序列号、批次或零件号作为关联键,把跨阶段的追溯问题变成一次查询,并支持机器与车辆遥测的低延迟处理。
LangSmith 推出 Custom Apps,可基于 LangSmith 数据构建并发布自定义 UI,并直接在 LangSmith 内运行。用户可用 LangSmith Chat 生成应用,或用模板配合 LangSmith API 编写,默认使用同步开源的 Macaw 设计系统。
LangSmith Engine v2 发布,新增 Red Teaming 红队测试,可在问题影响生产前主动发现幻觉与系统提示词违规。新版本还能识别低效 agent 轨迹及错误率、延迟、成本趋势,并在人工审核前自动复现、验证修复,这两项能力均向 LangSmith Deployment 用户开放 Private Beta。
Crusoe 完成 39 亿美元融资,估值达 309 亿美元,由 Atreides Management、Valor Equity Partners 和 Mubadala 领投。Newcomer 获得的财务数据显示,这家数据中心建设和云服务商今年的收入预计将达到 20 亿美元。原文同时提到,AI 行业增长空前,但其前景的不确定性也在上升。
OpenRouter 上线 Batch API,把请求打包提交可享受通常为原价 50% 甚至更低的每 token 价格,目前已支持 70 多个模型。官方称两周 beta 期内完成的 230k+ 批次中,完成时间中位数为 7 分钟,90% 在一小时内返回。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》在 GeForce NOW 首发当日上线,玩家无需等待 45GB 下载即可串流。本周 007 First Light 加入路径追踪与 DLSS 4.5 Ray Reconstruction,Ultimate 会员可以 GeForce RTX 5080 级性能、最高 5K HDR 串流。
零数据留存(ZDR)指 AI 提供商处理提示词并返回结果后不再保存,它只约束提供商侧的留存,不改变数据仍会到达模型,也不覆盖应用日志、插件或第三方工具。在 OpenRouter 上可通过账户隐私设置、护栏或请求中的 provider.zdr 字段强制 ZDR,请求级开关与账户级设置按或关系生效,且只能开启、不能放宽账户规则。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,让企业在私有云、公有云、本地及完全气隙环境中运行推理并保持完全控制。企业还可在受控环境中基于大量专有数据训练自有模型,数据与由此产生的智能均归自己所有,合作面向 Cloudera 平台上 30 exabytes 的客户管理数据。
OpenRouter 推出美国 In-Region Routing,与去年 10 月上线的欧盟路由一起,让请求在指定区域内解密并只路由到该区域的提供商端点。
Botika 把全栈生成式 AI 运行在 Modal 上:自研数十亿参数基础模型、100TB 图像数据管道,并在生产环境同时服务约 15 个模型。该管道用数千个并发容器处理 100TB 数据,错误率低于 1%;单个研究员的实验量从每天一两个提升到 50 个。生产推理覆盖 L4、L40S、A100 和 H100,队列、自动扩缩容与冷启动由 Modal 承担。
Pyromind 创始人兼 CEO Kevin Ding 称,RL as a Service 只是起点,公司押注的 AutoRL 要把训练、奖励、反馈、部署与数据回流串成可自动循环的管道。
LangChain 的 LangSmith LLM Gateway 进入公开测试版,作为智能体与所调用模型之间的集中治理层,提供生产环境的运行时控制。它支持在组织、工作区、API key 和用户四个层级设置消费上限与限流,可用自定义请求头为多租户场景中的每个终端客户单独控制,并定义跨模型和主机的回退路由。
LangSmith 重新设计产品主页,把功能重组为观测、评估与提示工程三大板块,并在主页顶部新增入门引导。Resource Tags 支持按默认的“Application”或自定义标签筛选资源,便于按 dev、staging、prod 等环境隔离。官方称将很快为 Resource Tags 引入 ABAC,提供更细粒度的权限控制。
LangChain 与 Replit 合作为 LangSmith 新增大 trace 性能扩展、trace 内搜索过滤与 thread view 三项能力。Replit Agent 的智能体流程会产生数百步 trace,新能力让 Replit 可直接按输入输出关键词过滤而非逐条翻查。thread view 还能把同一多轮对话中分散的 trace 归并,帮助定位用户卡点与人工介入机会。
Factory 用自托管 LangSmith 自动化反馈闭环,把提示词迭代速度提升 2 倍。LangSmith 的 Feedback API 将反馈附加到工作流各阶段并导出为数据集,traces 则导出至 AWS CloudWatch 日志,用于追踪 LLM 数据流和定位上下文相关问题。
langchain Python 包发布两周年,已从开源库成长为 LangChain 公司,并新增 LangGraph 与 LangSmith 两款产品。其集成规模从最初约 3 个 LLM 提供商增至 70 多个模型提供商、总计超 700 个集成;langchain 于 2024 年初发布首个稳定版本,此后仅有两次破坏性变更。
LangChain 博客给出加速 AI 智能体的方法:先用 LangSmith 的 waterfall 视图定位延迟瓶颈,再针对性优化。做法包括流式返回计划步骤与检索结果——Perplexity 仅改 UI 展示中间步骤就提升了用户满意度,总耗时未变。其余手段是减少 LLM 调用、改用 Gemini Flash 等更快模型、缩短上下文,并用 LangGraph 做并行调用。
LangGraph Platform 正式 GA,为长时运行、有状态的 Agent 提供部署与管理层,自去年 6 月 beta 以来已有近 400 家公司用它把 agent 部署到生产。
LangChain 用 Deep Agents、LangSmith 和 You.com Finance Research API 搭建了一个宏观研究智能体,对 2025 年欧盟 27 国 GDP 数据做异常筛查并输出带引用的简报。
基于 Perplexity Agent API 与 LangGraph 的投资研究智能体,可在约 90 秒内产出引用可追溯的 VC 投资备忘录初稿,API 成本约 $0.40。
LangChain 与 Pay-i 联合撰文,说明如何量化金融服务中 Agentic AI 的 ROI。方案用 LangSmith 按 trace 追踪每次执行的 token 用量与成本,再由 Pay-i 跨智能体把成本关联到业务 KPI 并实时打分。
Qdrant 称与 LangChain 的组合可支撑生产环境的 RAG 性能,且是 LangChain 支持的 40+ 向量库中唯一支持异步操作的向量数据库。该异步 API 基于 gRPC,开源版与 Qdrant Cloud SaaS 均可用,配合 FastAPI 等异步框架可减少对外部服务的 I/O 等待。
LangChain 为 LangServe 新增 Playground 与配置(configuration)能力。部署链或智能体后会自动附带 Playground,支持流式输出、中间步骤完整日志和可调参数,方便发链接给同事协作试用。配置基于 LangChain Expression Language,可通过 URL 保存不同版本,但当前配置尚不持久化,官方正 alpha 测试可持久化的部署平台。
Timescale Vector 为 LangChain 提供集成,让 PostgreSQL 充当 AI 应用的向量数据库,在 100 万 OpenAI embeddings 数据集上以约 99% recall 实现比 Weaviate 快 243.77% 的相似度搜索。
LangChain 为 LangSmith 发布 Pytest 与 Vitest/Jest 集成,已随 LangSmith Python 和 TypeScript SDK v0.3.0 以 beta 形式提供。
LangSmith 新增基于角色的访问控制(RBAC),管理员可在工作区或组织内为用户分配角色,默认内置 Admin、Viewer、Editor 三种系统角色,并支持细粒度权限的自定义角色,目前仅面向 Enterprise 套餐开放。
LangSmith Engine 新版本识别智能体 trace 中有影响问题的性能提升逾 2 倍,生成 prompt 与代码修复的效果在 Terminal-Bench 等公开基准上提升 25%。
OpenRouter 发布视频生成 API 代码指南,介绍通过 POST /api/v1/videos 提交任务、轮询状态并下载 MP4 的完整流程。同一套端点、鉴权和轮询逻辑适用于 Seedance 2.0、Veo 3.1 和 Wan 2.7,切换模型只需修改 model 字段。
LangSmith Deployment 新增 Preview Builds 功能,可从 PR 分支临时启动类生产部署,让团队在合并前运行并审查 Agent 改动。
LangChain 博客主张,企业要获得持久的 AI 优势,必须拥有自己的智能,而非只依赖通用模型。文章认为不必自建 AI 每一层,但要控制模型、harness 编排逻辑以及上下文与记忆这些决定智能行为的部分。企业还需像管理操作系统一样控制成本、衡量质量,并界定智能体可独立行动与需要监督的边界。
Mistral 的 Regional Endpoints 正式可用、Priority Tier 进入公开预览,客户可自选推理在欧洲或美国运行,后者提供承诺服务等级与 SLA。
OpenRouter 发布 Auto router(openrouter/auto)重大更新,改用过去 7 天平台上按任务类型统计的真实 token 消费份额挑选模型,官方称在多数领域以更低成本达到旧版默认路由的同等表现。
OpenRouter 发布团队 AI 花费控制配置指南,按组织、预设、密钥限额、guardrail、Activity 五步依次设置。组织默认支持最多 10 名成员并共享一个额度池,仅管理员可购买额度;密钥可设 limit 和 limit_reset(daily、weekly、monthly),guardrail 可按成员设 USD 预算与模型白名单,超限请求返回 403。