跳到正文

全部动态

今日 5 条
7月1日周三
  1. Apple:Newsroom(RSS)66

    Apple Creator Studio 更新:更智能、更快速、更互联

    Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。

    推荐理由:Final Cut Pro 的自动字幕和遮罩是实打实的工作流提升,Pixelmator Pro 的深度整合也让设计更顺畅,虽然没有颠覆性突破,但创意工作者今天就能用上。

6月30日周二
  1. Dwarkesh Patel:Podcast & Blog(RSS)61

    Grant Sanderson 谈 AI 与数学的未来

    3Blue1Brown 创办人 Grant Sanderson 正在制作记录 AI 在数学领域进展的新项目。他在与 Dwarkesh Patel 的对谈中指出,AI 在 IMO 获金牌并不等于 AGI,只是又一个被攻克的基准。即使 AI 未来解决千禧年大奖难题,仍可能存在大量人类任务无法被自动化。对话还探讨了概念突破验证周期可长达一个世纪、Riemann 假设的 AI 证明能否被人类理解、AI 能否在已有文献间发现隐藏联系,以及现实经济任务难以套用强化学习环境等话题。

    推荐理由:这次对谈没有停留在AI刷数学题的喜报上,而是追问了‘验证循环’和‘定义生成’两个终极难题。Grant Sanderson的视角让人重新思考AI的进展究竟缺什么,数学家未来的角色会是什么。

  2. LangChain:Blog(RSS)68

    LangChain 发布智能体评估就绪检查清单

    LangChain 发布了一份面向 AI 智能体评估的实用检查清单,涵盖错误分析、数据集构建、评分器设计、离线与在线评估以及生产就绪等环节。该清单旨在帮助开发者系统性地验证智能体在真实场景中的表现,降低部署风险。

    推荐理由:如果你在做 Agent 评估,这份检查清单把评估从“随机测试”变成了结构化流程,从错误分析到生产就绪都有覆盖,可以直接对照执行。

  3. Thinking Machines Lab:News(网页)63

    Thinking Machines Lab 用专家标注微调 Qwen3-235B,在金融判断任务上超越前沿模型

    Thinking Machines Lab 与 Bridgewater AIA Labs 发布研究,用专家投资者标注的数据微调 Qwen3-235B,在六项金融信息筛选任务上平均准确率从最佳前沿模型的 78.2% 提升至 84.7%,推理成本降低 13.8 倍。

    推荐理由:原文给出了完整的训练配方和消融数据,读者可以看到专家标注加微调如何在特定任务上超过前沿模型并大幅降低成本。

  4. Claude:Blog(网页)72

    Claude Code 入门:智能体循环

    Claude Code 团队将智能体循环定义为 agent 重复工作直到满足停止条件的过程,并划分出四种主要类型:turn-based 循环(用户提示触发,Claude 自行判断完成或需更多上下文)、goal-based 循环(通过 `/goal` 命令设定可验证完成标准与最大轮次)、time-based 循环(通过 `/loop` 按时间间隔重复执行,可用 `/schedule` 移至云端)、以及 proactive 循环(基于事件或计划自动运行,无人实时参与)。文章还介绍了如何编写 SKILL.md 文件将人工验证步骤编码,让 Claude 进行端到端自检,减少 turn-based 循环中的手动操作。

    推荐理由:Anthropic把agentic loops从模糊概念变成四种可复制的模式,附带SKILL.md和命令示例,Claude Code用户读完就能设计更自主的编码流程。

  5. Anthropic:Newsroom(网页)81

    Claude Sonnet 5 发布

    Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude API 中可用。

    推荐理由:Claude Sonnet 5 把代理能力从 Opus 下放到了 Sonnet,性能接近 Opus 4.8 但价格只有三分之一,这对开发者来说性价比飞跃。虽然还不是最强,但已经能让许多复杂任务从勉强可用变成可靠。

  6. Anthropic:Newsroom(网页)66

    Claude Science 科研工作台正式上线

    Anthropic 推出 AI 科研工作台 Claude Science,整合常用工具与计算资源,支持从文献分析到多步骤研究的全流程。提供超 60 项预配置技能与连接器,覆盖基因组学、单细胞、蛋白质组学、结构生物学、化学信息学等领域;可在macOS/Linux本地运行,或通过SSH/HPC远程使用。生成含代码和环境的可审计成果(3D蛋白质结构、基因组浏览器轨迹等),内置reviewer agent自动检查引用与计算错误。通过NVIDIA BioNeMo接入Evo 2、Boltz-2等模型,也支持连接自有模型与管道。今日以beta版面向Claude Pro、Max、Team和Enterprise用户开放。

    推荐理由:Anthropic 为科学家打造了一个整合 60+ 技能、可管理计算和审计输出的 AI 工作台,让 AI 从顾问变成可复现的实验合作者。

  7. Anthropic:Newsroom(网页)71

    重新部署 Claude Fable 5

    美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。

    推荐理由:Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。

6月29日周一
  1. Cursor Blog75

    从任何地点构建——Cursor for iOS 公测版发布

    Cursor 推出 iOS 原生公测版,所有付费计划可用。开发者可在手机上启动始终在线的云端智能体,或远程操控电脑端智能体。支持语音输入、斜杠命令和选择前沿模型。智能体运行后,锁屏 Live Activities 和推送通知实时更新状态,完成或需要输入时提醒。云端智能体在隔离虚拟机中运行,可自动迭代生成合并就绪的 PR,并输出演示、截图和日志。本地与云端智能体支持双向切换。移动端 Composer 2.5 享受 75% 折扣,优惠至 2026 年 7 月 5 日。

    推荐理由:Cursor 移动端把 Agent 放到了云上,从手机就能启动和合并 PR,通勤灵感不再浪费,对经常离开桌面的开发者是真正的效率杠杆。

  2. Tomer Tunguz 博客(VC 分析)58

    Anthropic:当AI成本超过工程师薪酬

    Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。

    推荐理由:Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。

  3. Nathan Lambert:Interconnects(RSS)60

    Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

    开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。

    推荐理由:这篇文章把开源模型玩家拆成三类,清晰解释了不同动机,Cohere 转向 Apache 2.0 和 NVIDIA 采用 OpenMDW 是许可层面的重要信号,关注开源的值得一读。

  4. LlamaIndex:产品、工程与评测62

    LlamaIndex 发布 Retrieval Harness,扩展 LlamaParse Index 检索能力

    LlamaIndex 宣布扩展 LlamaParse Index,新增 Retrieval Harness,为 Agent 提供文件系统式文档遍历工具,包括 Hybrid Retrieve、List Files、File Grep 和 File Read。

    推荐理由:官方展示了文件系统式检索工具和流水线可观测能力,读者可据此评估企业 Agent 检索方案的选型。

  5. Claude:Blog(网页)64

    Claude 在 Microsoft Foundry 正式可用

    从今天起,Claude 模型在 Microsoft Foundry 上正式可用,托管于 Azure 环境,运行在 NVIDIA GB300 GPU 上。首批提供 Claude Opus 4.8 和 Claude Haiku 4.5,通过 Messages API 调用,支持提示缓存和扩展思考。用户可选择推理处理位置,包括美国数据区域,由 Anthropic 负责推理运营。Azure 用户可使用现有身份验证、计费与治理控制,并获得统一账单;符合条件的 Enterprise Agreement 客户可将 Claude 用量计入 Azure 承诺消费。

    推荐理由:Claude 正式登陆 Azure Foundry 企业版,对于看重数据主权和现有 Azure 合约的企业是个好消息,但本质上是一次渠道铺开而非能力突破。

  6. Meta AI:Blog(网页)70

    Brain2Qwerty v2:Meta 发布无需手术的脑波解码文本新方法

    Meta 发布 Brain2Qwerty v2,一种无需手术植入即可从非侵入性脑记录中实时解码句子的端到端 AI 管线,词准确率达 61%,最佳参与者达 78%,远超其他非侵入方法 8% 的水平。研究基于 9 名志愿者各 10 小时的 MEG 数据训练,Meta 已开源 v1 和 v2 完整训练代码,合作方 BCBL 发布 v1 数据集。

    推荐理由:Meta 的 Brain2Qwerty 展示了不用开颅就能把脑电波转成文字,对渐冻症患者和未来人机交互来说是个重要信号,但离产品化还有距离。

  7. Cognition 模型 / Devin 博客(网页)66

    Cognition 发布 Devin Fusion:多模型路由实现 60% 降本

    Cognition 发布多模型智能体 harness Devin Fusion,在 FrontierCode 1.1 Extended 基准上以最高 60% 更低成本维持前沿模型水平的表现,已开放 preview(app.devin.ai/signup)。

    推荐理由:原文公开了 sidekick 双智能体与上下文压缩时切换模型的路由细节,读者可以直接借鉴这些降本做法。

  8. Claude:Blog(网页)66

    为 Amazon Bedrock 和 Google Cloud 推出的 Claude apps gateway

    Anthropic 今日推出 Claude apps gateway,一个自托管控制平面,让企业能在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。它作为单个无状态容器部署于 Linux,后端使用 PostgreSQL,提供企业级 SSO 登录(通过 OIDC 对接 Google Workspace、Microsoft Entra ID、Okta 等)、集中策略管理、角色权限、路由(支持故障转移)以及按日/周/月、按组织/群组/用户的消费上限。遥测数据通过 OTLP 发送至用户配置的收集器。gateway 不会向 Anthropic 发送推理流量或使用数据(除非配置使用 Claude API)。即日起可用。

    推荐理由:Claude Code企业版有了统一管理入口,SSO和成本控制是团队落地AI编程的关键,对CTO来说值得关注。

6月26日周五
  1. Dwarkesh Patel:Podcast & Blog(RSS)64

    Dwarkesh Patel:下一个突破将是 AI 在工作中学习

    Dwarkesh Patel 撰文提出,下一个重大突破将是 AI 在部署后从真实工作中持续学习,而非仅靠 RLVR 训练。

    推荐理由:作者提出可验证之外还需可反复模拟,并给出 OPSD 与 dreaming 两条通往持续学习的路径,帮助读者判断 RLVR 泛化争论。

  2. Anthropic:Research(发表成果 · 网页)55

    Anthropic Economic Index 报告:使用节奏

    Anthropic 发布 Economic Index 报告,基于隐私保护遥测数据分析了 Claude 的使用节奏。工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示:新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议凌晨 3 点最多。税收相关请求在 4 月 15 日美国报税截止日前激增。调查还发现:使用 Claude 最自动化的用户预计 AI 明年将承担更多任务,但对薪资、工作安全及工作意义的预期最为乐观。

    推荐理由:这是 Anthropic 迄今最详细的 AI 使用经济分析,从使用节律到输出自主性再到用户调查,展示 AI 渗透的真实图景。我最关注调查结果:自动化使用越多的人对职业前景反而更乐观。

  3. OpenAI Developers:Blog(网页)60

    OpenAI 推出 Secure MCP Tunnel 让私有 MCP 服务器无需公网暴露

    OpenAI 发布 Secure MCP Tunnel,让 ChatGPT、Codex 等 OpenAI 产品能在私有 MCP 服务器不暴露公网的情况下与其通信。

    推荐理由:官方讲解了 Secure MCP Tunnel 的设计与安全权衡,企业读者可以借此评估如何在不开放入站端口的前提下接入私有 MCP 服务器。

  4. OpenAI:部署安全与系统卡(网页)71

    OpenAI 发布 GPT-5.6 Preview 系统卡,Sol、Luna、Terra 在生化领域被 precautionarily 判为 High 能力

    OpenAI 发布 GPT-5.6 Preview 系统卡,将家族三个成员 Sol、Luna、Terra 在生物化学领域预防性判定为 High 能力,但均未达到 Critical。

    推荐理由:系统卡披露了 GPT-5.6 家族的生化和网络安全能力评估细节,读者可以据此了解 OpenAI 如何划定 High 与 Critical 阈值并部署防护。

  5. Claude Code:GitHub Releases(RSS)61

    Claude Code v2.1.193 发布

    Claude Code v2.1.193 新增 `autoMode.classifyAllShell` 设置,将全部 Bash/PowerShell 命令经自动模式分类器处理。自动模式拒绝原因现加入转录、拒绝提示及 `/permissions` 页面。新增 `claude_code.assistant_response` OpenTelemetry 日志事件(默认不记录,需设置 `OTEL_LOG_ASSISTANT_RESPONSES=1`)。Bash 模式支持实时文件路径自动补全;MCP 服务器需认证时显示启动提示。新增空闲后台 shell 命令自动内存压力回收(可禁用)。修复 `/model` UI 状态滞后、后台任务误取消、子 agent 隐藏同级等问题,并改进了后台 agent 启动指令、MCP 认证重连、插件自动重命名等行为。

    推荐理由:一次扎实的工具更新,自动模式覆盖所有 shell 命令和 MCP 认证重连是最实用的改进,后台任务内存回收也解决了长期痛点,Claude Code 用户值得更新。

  6. Hugging Face:Blog(RSS)65

    OLMo Hybrid vs Transformer:混合模型在实义词上优势明显,但重复短语上几无优势

    通过对比7B参数的OLMo 3(Transformer)与OLMo Hybrid(混合架构),实验发现混合模型在大多数token上预测损失更低:对名词、动词、形容词等实义词优势明显(loss gap约0.04),功能词上gap约0.02,且在需上下文推理的代词指代上更好。但在重复出现的n-gram和闭合括号(如`}`)上,混合模型的优势几乎消失,Transformer凭借注意力机制更擅长从输入中直接检索精确信息。

    推荐理由:OLMo 团队的 token 级别分析让人看清混合模型到底强在哪里,优势在名词动词等意义词,但在重复 token 上接近消失,这份洞察对做模型架构的人很有启发性。

  7. LMSYS:Blog(Chatbot Arena 团队)58

    SGLang 引入 Waterfill 与 LPLB 提升 DeepEP MoE 负载均衡

    SGLang 为 DeepEP MoE 推理新增两种调度时负载均衡方法:Waterfill 将共享专家分配给负载更低的 rank,在 DeepSeek-V3/R1 服务负载下使总吞吐量提升 1.48% 至 4.66%,在 DeepSeek V4 上最佳点从 49,253 tok/s 提升至 51,677 tok/s(+4.92%);LPLB 基于线性规划优化冗余专家副本的 token 路由,配合 EPLB 在相同集群上实现吞吐量提升 0.84% 至 7.34%。

    推荐理由:SGLang 引入 Waterfill 和 LPLB 两种负载均衡算法,实测 DeepSeek V3/R1 和 V4 吞吐提升最高 7%,用 SGLang 跑 MoE 推理的开发者值得一试。

  8. Google Blog:AI(RSS)57

    Google Finance 全新 Android 应用与投资组合功能上线

    本周,Google Finance 推出正式版 Android 应用,同步上线全球投资组合跟踪功能。用户可通过截图、CSV/PDF 上传或文字描述创建组合,并利用 AI 研究工具提问资产配置、固定收益影响等问题。新增市场情报简报功能:用户设定任务(如每日盘前简报),后台自动生成并推送至 Google 应用(Android/iOS)及网页端。Android 应用包含 watchlist、实时数据、金融新闻 feed、AI 研究工具及 AI 驱动的“关键时刻”解释股价波动。未来数月将把更多 web 功能(如财报电话、投资组合与任务)迁移至移动端,今年晚些推出 iOS 应用。

    推荐理由:虽然对 AI 行业算不上大新闻,但对散户投资者是个实用升级,能自动盯盘、生成个性化简报,还能用对话式研究挖掘持仓问题,比大多数 AI 功能都更落地。

6月25日周四
  1. xAI:News(网页)55

    盈透证券(Interactive Brokers)与 Grok 集成:组合分析、情景建模与实时交易指令生成

    盈透证券(Interactive Brokers)近日与 Grok 集成,用户可在几分钟内免费关联现有账户,无需注册新账户。通过自然语言与 Grok 对话,可完成组合收益分析(如股息与利息预测)、行业/地区/经济事件的风险敞口情景建模、市场趋势研究,并直接生成对冲订单等实时交易指令,实现从数据洞察到执行决策的一体化。

    推荐理由:xAI 把 Grok 接进了盈透证券的交易终端,是个实用的生态扩展,对 IB 用户来说从分析到下单可以一条龙处理,但本质上还是个功能集成,算不上行业大事件。

  2. Cursor Blog65

    Notion 使用 Cursor SDK 嵌入编码智能体

    Notion 通过 Cursor SDK 在数周内将编码智能体嵌入产品。用户可在文档中@Cursor、在讨论串中提及或向数据库指派任务,Cursor 即可端到端完成规划、构建、测试、验证并自动创建 PR。集成基于一套 Provider 无关的智能体框架,Notion 的讨论串对应一个 Cursor 智能体,每条消息对应一次智能体运行;结果通过 SSE 流式传输,支持断连恢复。Cursor SDK 提供与生产环境相同的模型、运行时和远程 MCP 支持,让 Notion 无需自建智能体基础设施即可获得完整栈编码能力。用户还可自定义模板、MCP 服务器、技能和子智能体,并设置自动触发规则。

    推荐理由:我对“嵌入代理”的概念有点怀疑,但Notion用两周集成Cursor SDK,说明其抽象做得不错。文章展示了怎么把一个全栈编码代理塞进产品里,做工具的可以看看SDK设计。

  3. LangChain:Blog(RSS)71

    LangChain 发布 AI 智能体记忆构建实用指南:短期记忆、长期记忆与 LangSmith 追踪分析

    LangChain 发布了一份关于 AI 智能体记忆构建的实用指南,涵盖短期记忆、长期记忆与追踪分析。指南介绍了如何通过 LangSmith 帮助智能体在多次运行间持续改进,并重点讨论了短期记忆(如对话上下文)与长期记忆(如用户偏好存储)的实现方法。该指南为开发者提供了在 LangChain 框架中集成记忆模块的具体技术路径。

    推荐理由:LangChain官方出的代理记忆实践指南,把短期/长期记忆和trace分析讲透了,用LangSmith复盘的方法可以直接落地,做agent的值得存一份。

  4. Runway:News(网页)65

    Runway发布Agent 2.0

    Runway发布Agent 2.0,帮助营销人员创建、测试和优化广告、视频及营销活动。品牌营销人员可在对话中开发活动概念、生成变体并自动本地化;绩效营销人员可上传创意并导入Meta、YouTube、TikTok或Google广告数据,由Agent分析后生成下一轮待测广告。社交媒体营销人员可一次性生成一周内容,自动裁切为9:16、16:9、1:1等格式;产品营销人员可借助Agent确定定位角度并构建活动资产。Agent 2.0面向所有用户开放。

    推荐理由:Runway的Agent 2.0不只是生成视频,它试图打通从广告数据分析到全平台素材生成的闭环,做增长和社交内容的团队可以观望一下。

  5. OpenRouter:Announcements(RSS)68

    OpenRouter 零数据留存(ZDR)实践:97 款新模型,流量占比近半

    OpenRouter 的零数据留存(ZDR)保证用户提示词和模型响应不被存储,元数据一般安全。自 1 月以来新增 97 款支持 ZDR 的模型,月度 token 量增长 4.3 倍,约占全部路由流量一半。ZDR 在三个层面执行:账户级(整个供应商开启)、护栏级(按 API Key 或组织成员限定)、单次请求级(传参数仅路由至 ZDR 端点)。企业用户可灵活选择控制粒度,避免锁定单一供应商。

    推荐理由:ZDR 远不止“不存数据”这么简单,提示、响应、缓存的区分很多人没搞清楚。OpenRouter 的三层执行算是把自由度给足了,做合规服务的人可以仔细看看。

6月24日周三
  1. 腾讯混元:Research(API)80

    Hy3 preview:混元大模型重建的第一步

    2026年4月23日,腾讯混元发布并开源 Hy3 preview 语言模型。该模型为快慢思考融合的混合专家模型,总参数295B,激活参数21B,支持256K上下文。在复杂推理、指令遵循、上下文学习、代码与智能体能力上大幅提升,在 SWE-Bench Verified、Terminal-Bench 2.0、BrowseComp 等基准中取得强竞争力结果。模型已在元宝、CodeBuddy 等产品上线,API 个人版 Token Plan 最低 28 元/月。权重和代码已在 GitHub、HuggingFace 等平台开源,支持 vLLM、SGLang 等推理框架。

    推荐理由:混元重建后的第一个模型 Hy3 preview,快慢思考融合,推理和代码智能体提升明显,开源加低价格,国内开发者做 agent 的可以马上试起来。

  2. Inception Labs:Blog(网页)68

    Inception Labs 推理模型 Mercury 2 上架 Azure AI Foundry

    Inception Labs 宣布 Mercury 2 在 Azure AI Foundry 上线,称其为基于扩散架构的快速推理语言模型,通过并行细化生成而非逐词解码。

    推荐理由:官方宣布扩散架构推理模型登陆 Azure,给出具体速度、价格和企业级部署细节,可供评估生产部署选项。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型65

    inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-0.8b

    inclusionAI 在 HuggingFace 发布 SingGuard 系列模型,首个版本为 SingGuard-0.8b。该模型将安全策略作为运行时输入而非训练时固定分类,支持文本、图像、图文、多语言、查询侧和响应侧六类场景的安全评估。SingGuard 采用动态推理流程,支持快速首 token 路由输出即时安全信号,并在需要深度推理时继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全和多语言响应安全的六类基准测试中,SingGuard 取得平均 SOTA 性能。模型原生兼容 Transformers 和 vLLM 的 chat 消息输入格式。

    推荐理由:蚂蚁这个 SingGuard 把安全策略从固定的分类器变成运行时动态输入,对出海应用的合规审核有实际价值,尤其是多模态场景,我觉得能省掉很多重训成本。

  4. Berkeley RDI:Blog(AI 安全与评测)82

    恶意CDN仍潜伏GitHub Pages,AI让情况恶化

    UC Berkeley研究人员发现,近2000个GitHub Pages站点(18000+页面,累计530K+星标)仍在加载来自polyfill.io及其关联恶意CDN的脚本。这些CDN由已被OFAC制裁的Funnull Technology Inc.(现更名Triad Nexus)运营,2024年被出售后开始条件性注入恶意载荷,劫持移动用户、跳转欺诈站点、伪造认证弹窗窃取凭证。扫描12000+站点确认786个加载polyfill.io,1191个加载其他Funnull CDN。更严峻的是,所有测试的大语言模型在生成前端代码时仍推荐这些被污染的CDN URL,包括CyC2018/CS-Notes(184K⭐)、microsoft/AirSim(18K⭐)等知名项目及多所大学课程页面。

    推荐理由:polyfill.io等恶意CDN仍在GitHub Pages上感染近2000个站点,更可怕的是所有测试的AI模型都还会推荐这些链接,AI编码的便利正在变成供应链投毒的加速器。

  5. Claude:Blog(网页)60

    Anthropic 推出 Claude Tag,构建人机协作团队

    Anthropic 推出 Claude Tag,支持多用户与同一 AI 智能体在同一工作空间协作。智能体具备持久记忆、独立于人类的凭证及广泛信息访问权限。经验:工作公开化并给予智能体广泛上下文,通过工作区级安全边界让信息对人和 AI 均可用;为每位成员(含 AI)分配明确角色与相应工具。用户可通过 @Claude 私信进行敏感交互,对话保持私密。该方法已在 Slack 等团队协作工具中实践,旨在使人类与智能体高效协作完成共享目标。

    推荐理由:Anthropic 内部总结的四个教训——公开透明、明确角色、设北极星、逐步信任,对正在探索人机协作团队的管理者来说,比产品手册更实用。

6月23日周二
  1. GitHub Blog56

    GitHub联合开源联盟呼吁修改加州AI透明度法案以保护开源

    GitHub 联合 Black Forest Labs、Hugging Face 与 Mozilla Corporation 组成开源联盟,呼吁对加州 AI 透明度法案(SB 942,拟由 SB 1000 修正)进行针对性修改。当前草案要求开发者在下游用户未履行义务时撤销开源许可证,这与开源许可证永久不可撤销的性质冲突。联盟认为该要求非必要,已有直接监管和执法机制,并建议参考欧盟 AI 法案的透明度实践规范,以向下游用户通知最佳实践文档的方式替代撤销条款。GitHub 支持这些修正,以在保持透明度目标的同时兼容开源开发模式。

    推荐理由:GitHub 联合 Hugging Face 等开源玩家公开呼吁修正加州 AI 透明法案,核心矛盾是许可撤销条款与开源许可的‘永久不可撤销’冲突,对开源开发者是个明确的政策信号,值得留意。

  2. Hugging Face:Blog(RSS)73

    IBM 开源 CUGA:轻量级智能体框架,提供二十余个单文件示例应用

    IBM 开源了 CUGA(Configurable Generalist Agent),一个处理规划、执行循环、工具调用和状态管理的轻量级智能体框架。开发者只需提供工具列表和提示词即可构建 CugaAgent。内置计划-执行-反思循环,在 AppWorld(2025年7月–2026年2月)和 WebArena(2025年2月–9月)基准上排名第一。支持 Fast / Balanced / Accurate 三种推理模式,代码执行可在本地、Docker 或 E2B 沙箱中运行。可互换工具支持 OpenAPI、MCP 和 LangChain 函数,通过环境变量一键切换 OpenAI、watsonx、Ollama 等提供商。随框架发布二十余个单文件示例应用,涵盖电影推荐、IBM Cloud 架构顾问等场景,每个应用仅需一个 FastAPI 文件。

    推荐理由:CUGA 把 agent 的规划、状态、策略等繁琐工程压缩成配置,开发者只写工具列表和 prompt 就能跑起 agent,配套的二十多个单文件应用是现成的模板库,对自建 agent 的团队来说省去了八成重复工作。

  3. OpenAI Developers:Blog(网页)67

    OpenAI 讲解如何用手机远程掌控 Codex 编码工作

    OpenAI 开发者博客发布长文,讲解如何在 ChatGPT 移动端通过 Codex Remote 启动、引导、审查和管理运行在开发机上的编码任务。文章提出手机是控制平面而非小型终端,介绍了 Queue 与 Steer 两种跟进方式的区别、/side 侧聊、/goal 持久目标、内联代码评论审查、权限审批和 /compact 等上下文管理命令,并给出发布负责人、移动端审查者等五种实用工作流。

    推荐理由:作者以两个月的使用积累为基础,拆解手机端 Remote 的 Queue 与 Steer、侧聊、目标等机制,给出可直接照做的移动端编码工作流。

  4. Qwen:Blog Retrieval(API)81

    Qwen-AgentWorld:面向通用智能体的语言世界模型

    Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

    推荐理由:Qwen把世界模型做成了一个可开源的通用产品,覆盖七域,做agent RL的可以直接拿它仿真训练,可控性甚至超过真实环境,做agent的团队应该认真看看。

  5. 字节 Seed:Research Feed(网页内嵌数据)64

    Seed2.1 正式发布,深入 AI 生产力

    字节Seed发布Seed2.1系列,面向真实生产力场景的智能体,强化通用Agent能力、代码工程交付与多模态理解。Seed2.1 Pro在GDPval基准获最高分,Agents' Last Exam位列参评模型第一梯队;MobileWorld手机GUI任务最高分,CreativeWork多环境任务表现突出。多模态在CharXiv-RQ等多项基准取得SOTA。代码能力上,Seed2.1 Pro在NL2Repo-Bench表现良好,开发者评测相比Claude Opus 4.6获59.1%胜率。模型已在豆包、TRAE上线,API通过火山方舟提供。

    推荐理由:字节 Seed2.1 这次更新把 Agent 和代码交付稳定性提到新高度,官方测评在多个硬核基准上不输 Claude Opus。虽然技术细节少,但豆包和 TRAE 直接可用,做 Agent 和开发的值得上手试试。