OpenAI 向 Plus、Pro、Business 和 Enterprise 用户全面推送 Astra
OpenAI 宣布 Astra 已全面推送给 Codex 和 ChatGPT Work 中的 Plus、Pro、Business 和 Enterprise 用户。用户可以直接使用,并可通过 openai.com/gpt-tv/ 观看 Astra 的实机演示。
推荐理由:原文给出了 Astra 的正式开放范围和覆盖产品,读者可以确认自己的订阅计划是否已可用。
OpenAI 宣布 Astra 已全面推送给 Codex 和 ChatGPT Work 中的 Plus、Pro、Business 和 Enterprise 用户。用户可以直接使用,并可通过 openai.com/gpt-tv/ 观看 Astra 的实机演示。
推荐理由:原文给出了 Astra 的正式开放范围和覆盖产品,读者可以确认自己的订阅计划是否已可用。
OpenAI 发布 ChatGPT Images 2.5,官方称图像生成更快、更清晰、更智能。改进包括提升生成速度、更自然可辨识的图像保真度、多次编辑间保持细节一致,以及支持基于评论的编辑,只改动想改的部分。
推荐理由:官方列出了速度、保真度和多次编辑一致性等具体改进点,读者可据此评估是否更新自己的图像生成工作流。
OpenRouter 上线 openrouter:shell 服务端工具和 Files API,任意模型都能在托管 Linux 容器里运行命令,并上传文件供模型处理、取回运行输出,两项功能已开放 beta。
Meta 发布个人智能体 Muse,运行在用户专属的 Muse Secure VM 中,并公开其安全设计。系统默认假设智能体可能被攻击:运行环境用 systemd-nspawn 隔离,Sentinel 作为唯一权限机构审批所有连接器操作和网络出站,代理令牌机制确保模型看不到真实凭证,配合提示注入检测分类器和内核级 taint tracking。
推荐理由:原文详细拆解了 Muse 的安全架构和赏金计划细节,读者可以据此理解个人智能体如何约束提示注入风险。
Runway 发布 Runway Plugins,面板可直接嵌入 Premiere Pro 和 After Effects,无需导出导入即可在时间线内生成图像和视频、重渲染片段并一键放置结果。
推荐理由:原文给出了插件的功能范围、付费条件与下载方式,剪辑工作流用户可据此评估是否把生成环节搬进时间线。
Berkeley RDI 推出开源平台 CUA-Lite,为计算机使用智能体提供三个标准化抽象。其环境接口下运行 15+ 个覆盖桌面、浏览器和移动端的基准,并提供含 30k+ 可验证任务的免 VM 桌面沙箱;统一监督数据格式已转换 10+ 个公开 CUA 数据集;每模型一个 harness 在评测、SFT 和 RL 间共享,支持 14 个模型族。
推荐理由:原文说明了平台的三项标准化抽象及覆盖规模,读者可以据此评估它在整合分散的计算机使用智能体资源上的可用性。
GPT-6 Astra (Max) 以 1797 分登顶 Code Arena: WebDev,领先第 2 名 Claude Fable 5.1 (Max) 35 分、第 3 名 Claude Opus 5 (Max) 1688 分。
推荐理由:榜单数据给出了与 Claude 系列的具体分差和同价位对比,读者可以据此评估新模型的实际编码位置。
xAI 给 Grok Bot 开放供应商支出、合同和使用数据,搭建了名为 Haggle Bot 的采购智能体,已找出超过 10 万美元直接节省。SaaS 审计中发现一个产品有 43 个付费席位 90 天无活跃,节省 $14,220,另一个产品每年有 $85,662 未使用 SKU;办公用品比价一次将 $14,629 的订单压到 $6,143,降幅 58%。
推荐理由:原文公开了完整系统提示词与具体省钱数字,读者可以直接参考其意图表达和权限边界的搭建方式。
xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具;头像动效呈现空闲、工作、等待、阻塞、思考、完成等状态;工作区提供状态、预览、接管三级访问。
推荐理由:xAI 官方复盘 Grok Bot 的界面设计决策,读者可以了解持久化智能体产品在组织方式和交互上的取舍思路。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用并邀请全组织成员,包括没有现有席位的员工。
推荐理由:原文给出企业版 Bot 的管控能力、真实使用场景和两周免费安排,企业用户可据此评估是否引入现有工作流。
Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
推荐理由:官方宣布 Claude 可在后台操作电脑,说明其点击、输入、打开应用的具体使用方式,读者可判断是否纳入自己的工作流。
Google 推出 Fairwind Program 限定访问计划,向政府机构、Google Cloud 客户及网络安全合作伙伴开放其最先进的网络防御能力。该计划将 Gemini 3.8 Flash Cyber 与 CodeMender harness 结合,可自主发现、验证并修复漏洞,把原本需数周的手动修复变为几分钟内生成可部署补丁,且运行成本远低于传统前沿模型。
Unsloth 通过 MTP(Multi-Token Prediction)让 Qwen3.8-Flash-Next 本地推理提速约 1.3 至 1.7 倍且精度不变,GGUF 在单张 RTX PRO 6000 上可达 170 tokens/s(基线 100 tokens/s)。
推荐理由:原文给出了 MTP 加速的具体倍数、显存门槛和各量化档位内存需求,读者可以据此判断自己的设备能否跑通。
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
LongCat-2.0 现已在 @cline 中免费试用!🐱 [引用 @cline]:LongCat-2.0 目前在 Cline 中免费使用。 这是一款来自 @Meituan_LongCat 的 1.6T 开源权重 MoE 模型,拥有 1M 上下文,得分与 Claude Opus 4.7 和 Gemini 3.1 Pro 相近。 立即尝试:npm i -g cline /model 在免费模型下选择 LongCat-2.0
推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。
推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。
Cursor 更新支持自托管机器,代码库、构建产物和密钥保留在用户基础设施内的机器上,由智能体在本地处理工具调用。
推荐理由:原文给出自托管机器的池调度、休眠扩缩容和支持的基础设施清单,可帮助评估代码与密钥是否留在自有网络内。
Botika 把全栈生成式 AI 运行在 Modal 上:自研数十亿参数基础模型、100TB 图像数据管道,并在生产环境同时服务约 15 个模型。该管道用数千个并发容器处理 100TB 数据,错误率低于 1%;单个研究员的实验量从每天一两个提升到 50 个。生产推理覆盖 L4、L40S、A100 和 H100,队列、自动扩缩容与冷启动由 Modal 承担。
Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。
推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。
Google 发布 Google Pics,这是 Google Workspace 中基于 Nano Banana 模型的图像生成与编辑工具,将在未来数周面向 Google AI Pro、Ultra 订阅用户和多数 Workspace 商业客户开放。
MiniMax 将 H3 Max 768P、480P 接入开放平台和 MiniMax Design,海外开发者已借此搭建出 Twitch 直播和 24 小时“AI 电视台”。
推荐理由:原文给出 H3 Max 的生成速度、吞吐量提升和接入入口,并梳理了社区围绕它做实时直播的具体玩法。
Midjourney 更新了 V8.2 编辑模型,称图像质量有所提升,并建议过去 24 小时内遇到问题的用户重新尝试。官方表示仍在收集用户反馈,后续还会有更多更新。
Midjourney 开始向所有用户开放 V8.2 图像编辑模型测试,支持按指令编辑图像、用最多 4 张参考图生成图像(取代 omni-reference)、局部重绘(inpainting)和画布扩展(outpainting),也可搭配个性化、moodboards 和 srefs 使用。
Google 在 Search 的 AI Mode 中新增航班价格追踪、积分或里程价格查看与酒店预订三项能力。
Unsloth 发布 GLM-5.3-Flash(ox-alpha)的 GGUF 量化版本,可在 128GB RAM 设备上以 3-bit 运行。该模型为 Z.ai 的 320B-A18B 开源多模态模型,MIT License 发布,原文称其在 DeepSWE、编码和智能体基准上媲美 Claude Opus 4.8。
推荐理由:原文给出了各量化档位的内存需求和精度保留数据,读者可据此判断在 128GB 设备上本地运行该模型的可行性。
LangChain 的 LangSmith LLM Gateway 进入公开测试版,作为智能体与所调用模型之间的集中治理层,提供生产环境的运行时控制。它支持在组织、工作区、API key 和用户四个层级设置消费上限与限流,可用自定义请求头为多租户场景中的每个终端客户单独控制,并定义跨模型和主机的回退路由。
LangSmith 重新设计产品主页,把功能重组为观测、评估与提示工程三大板块,并在主页顶部新增入门引导。Resource Tags 支持按默认的“Application”或自定义标签筛选资源,便于按 dev、staging、prod 等环境隔离。官方称将很快为 Resource Tags 引入 ABAC,提供更细粒度的权限控制。
LangSmith 评估器新增“自我改进”功能:人类对 LLM-as-a-Judge 输出的修正会存为 few-shot 示例并回填提示词,无需提示词工程即可让评判对齐人类偏好。
LangChain 与 Replit 合作为 LangSmith 新增大 trace 性能扩展、trace 内搜索过滤与 thread view 三项能力。Replit Agent 的智能体流程会产生数百步 trace,新能力让 Replit 可直接按输入输出关键词过滤而非逐条翻查。thread view 还能把同一多轮对话中分散的 trace 归并,帮助定位用户卡点与人工介入机会。
LangGraph Platform 正式 GA,为长时运行、有状态的 Agent 提供部署与管理层,自去年 6 月 beta 以来已有近 400 家公司用它把 agent 部署到生产。
LangChain 发布开源、免费使用的 Auto-Evaluator 托管应用与 API,可为给定文档自动生成问答测试集,并对用户指定的 LLM 问答链自动打分。
Eden AI 与 LangChain 集成,用户凭单个 API key 和一行代码即可调用多家厂商的 LLM 与 Embedding 模型,包括未直接接入 LangChain 的模型。集成还让 LangChain Agent Tools 可调用文本与图像内容检测、发票与证件解析、语音合成与语音识别等能力。平台另提供仪表盘监控用量与成本,支持日志调试和 API 缓存。
LangChain 博客介绍了 Michael Chang 的 data-driven-characters 仓库,上传语料库并指定角色名即可生成角色定义和角色聊天机器人。
LangChain 已合并 Xata 的四个集成,Xata 现在可分别作为 LangChain 与 LangChain.js 的向量存储和记忆存储。集成基于 Xata 新 GA 的 Python SDK,支持按元数据过滤,并可将聊天消息历史存入 Xata,为 LLM 应用提供长期记忆。
Airbyte 的 Gong、Hubspot、Salesforce、Shopify、Stripe、Typeform、Zendesk Support 数据源现可作为文档加载器直接在 LangChain 应用中使用,这是 Airbyte 300+ 数据源接入 LangChain 的开端。
LangChain 为 LangServe 新增 Playground 与配置(configuration)能力。部署链或智能体后会自动附带 Playground,支持流式输出、中间步骤完整日志和可调参数,方便发链接给同事协作试用。配置基于 LangChain Expression Language,可通过 URL 保存不同版本,但当前配置尚不持久化,官方正 alpha 测试可持久化的部署平台。
LangChain 发布名为 Plan-and-Execute 的新智能体执行器,先规划步骤再逐步执行,与 ReAct 式 Action Agent 相对。该框架依赖 planner 和 executor 两个组件,executor 初期由 Action Agent 承担,代价是需要更多模型调用,但规划与执行分离便于日后换成更小的微调模型。
Timescale Vector 为 LangChain 提供集成,让 PostgreSQL 充当 AI 应用的向量数据库,在 100 万 OpenAI embeddings 数据集上以约 99% recall 实现比 Weaviate 快 243.77% 的相似度搜索。
LangChain 为 LangSmith 发布 Pytest 与 Vitest/Jest 集成,已随 LangSmith Python 和 TypeScript SDK v0.3.0 以 beta 形式提供。
Cube 与 LangChain 集成,以文档加载器 CubeSemanticLoader 将语义层数据模型的嵌入写入向量数据库。该向量库可用于匹配语义层实体,把自然语言输入映射到数据模型中的视图及其成员,加载时只载入视图。Cube 还提供 chat 演示应用,用 OpenAI 提示词、FAISS 向量库和 Streamlit 界面生成对 Cube SQL API 的查询。