跳到正文

全部动态

今日 0 条
4月28日周二
  1. Simon Willison 博客75

    追踪现已失效的OpenAI与微软AGI条款演变史

    微软与OpenAI的长期合作曾包含一项特殊条款:一旦实现通用人工智能(AGI),微软的商业知识产权将失效。AGI最初被模糊定义,后在2024年被具体量化为能为早期投资者产生约1000亿美元利润的系统。2025年,双方修订协议,规定AGI需经独立专家小组核实。2026年4月27日,双方宣布新合作阶段,微软对OpenAI知识产权的许可将延续至2032年(转为非独家),并停止收入分成,而OpenAI向微软的分成支付将持续至2030年且“独立于技术进展”。此举被广泛视为原有的AGI条款实质上已被废止。

    推荐理由:Simon Willison 把 OpenAI 和微软之间那个「AGI 条款」从诞生到死亡的完整时间线扒了出来,这种一手资料级别的梳理比任何分析都有说服力,关心 AI 商业格局的人值得花五分钟读完。

  2. Claude:Blog(网页)72

    像培训新开发者一样引导Claude Code:来自17年开发的经验教训

    华盛顿大学MacCoss实验室的Brendan MacLean将培训新开发者的方法论应用于Claude Code,以管理拥有70万行C#代码、持续开发17年的开源蛋白质分析软件Skyline。他通过创建独立的AI上下文仓库、编写CLAUDE.md引导文件以及设计“技能”模块(如调试技能),为Claude Code建立项目认知。该方法显著提升了开发效率:搁置一年的文件视图面板功能在两周内完成;CSS布局更新从依赖设计师变为不到一天实现。此外,Claude Code还自动化了2000多张教程图片的截图比对和每日测试报告生成,团队现在主要依靠它生成代码和脚本。

    推荐理由:这不是又一篇 Claude Code 安利文,而是一个维护了 17 年 70 万行 C# 代码库的人,把带新人的方法论原封不动搬给了 AI,结果真管用。做 legacy 项目的人应该认真看他的 context 管理和 skill 库设计。

4月27日周一
  1. OpenRouter:Announcements(RSS)57

    Opus 4.7新分词器对成本的实际影响

    Anthropic在Claude Opus 4.7版本中更新了分词器。通过对比4.6到4.7版本的实际使用数据,分析发现这一技术调整改变了文本转换为令牌的方式,直接影响API计价。相同的文本输入可能产生不同数量的令牌,从而导致用户的实际使用成本发生可量化的变化。这一调整虽不改变模型能力,但关乎运营开销,是开发者和企业用户需评估的关键因素。

    推荐理由:Opus 4.7 换了 tokenizer,大多数人只知道模型变强了,不知道计费逻辑也变了。OpenRouter 用真实流量数据算了一笔账,做成本预算的产品人值得扫一眼。

  2. Tomer Tunguz 博客(VC 分析)64

    GPU现货价格六周内暴涨114%

    根据Ornn Compute Price Index数据,NVIDIA B200 GPU的现货租赁价格在六周内飙升114%,从三月初的2.31美元涨至本周的4.95美元/小时。此次价格暴涨与GPT-5.5等前沿模型发布带来的需求冲击紧密相关,这些模型需要Blackwell架构提供的内存支持。与此同时,B200与上一代H200的价差从0.28美元大幅扩大至1.80美元,不同云服务商之间的报价差距也扩大了一倍以上,反映出市场供应紧张。预计夏季B200价格将维持在5美元以上,云端推理成本持续上升。

    推荐理由:Tomer Tunguz 用 Ornn 真实价格指数拆出 B200 六周涨 114% 的供需逻辑,做 AI infra 选型或算力采购的人该把这张图存下来,夏天 B200 破 5 刀基本板上钉钉。

  3. Runway:News(网页)58

    无闲置GPU:Runway的研究计算管理

    Runway通过采用Kueue作为Kubernetes准入控制器,将GPU利用率提升超过20%,同时保障团队容量。其核心机制是为关键工作预留配额,并设立共享队列借用闲置容量,当配额所有者需要时通过抢占回收资源。该系统运行于昂贵的多租户GPU集群,支持多节点训练的拓扑感知调度和弹性工作负载。具体实现中,团队拥有专用预留队列,而默认队列作为共享机会池,可借用闲置配额运行可中断工作负载。当预留队列需资源时,Kueue基于优先级和运行时间抢占默认队列中的任务,实现资源高效管理。

    推荐理由:Runway 把 Kueue + Kubernetes 的 GPU 调度实战写成了保姆级工程笔记,利用率翻倍的方案和踩坑细节都有,做大规模训练集群调度的团队可以直接抄作业。

4月25日周六
  1. Simon Willison 博客70

    GPT-5.5 提示指南

    OpenAI 针对新发布的 GPT-5.5 API 模型发布了详细的提示指南。核心建议包括:在处理多步骤任务时,应在调用工具前先向用户发送简短的状态更新,以提升交互体验。官方强调 GPT-5.5 应被视为一个需要重新调优的新模型系列,而非 GPT-5.2 或 GPT-5.4 的直接替代品,建议从零开始构建提示,而非沿用旧有提示。开发者可通过 `openai-docs` 技能使用 `$openai-docs migrate this project to gpt-5.5` 命令来辅助代码迁移,官方升级指南中还包含了轻量的提示词改写建议。

    推荐理由:OpenAI 官方明确说 GPT-5.5 不能当 drop-in replacement,prompt 要从零重写。做产品的人别偷懒直接换模型名,先读这份指南再动手,省得上线翻车。

4月24日周五
  1. OpenRouter:Announcements(RSS)55

    OpenRouter Agent SDK 发布 `create-agent-tui` 与 `create-headless-agent` 技能,可快速搭建个性化编码智能体

    OpenRouter Agent SDK 推出 `create-agent-tui` 和 `create-headless-agent` 两类技能(skills),用于快速搭建(scaffold)个性化编码智能体。前者提供终端 UI(terminal UI),后者为无头模式(headless),适用于脚本和流水线(scripts and pipelines)。

    推荐理由:一个用 OpenRouter Agent SDK 快速搭建编码 agent 的脚手架,适合想省时间的开发者,但内容本身是常规文档,42 天前的教程现在已经没什么新意。

  2. PromptArmor:Threat Intelligence69

    PromptArmor 解析 AI 应用连接器的间接提示词注入风险与审计方法

    PromptArmor 提出评估 AI 应用连接器风险的三支柱模型,不可信外部数据、敏感内部数据和下游动作,并呼应 Simon Willison 的 Lethal Trifecta,举例说明 Confluence 与 Zendesk 连接器组合可将内部文档经工单回复外泄。

    推荐理由:原文给出连接器风险的三支柱威胁模型和主流企业 AI 应用的具体配置路径,读者可据此审计自己环境中的连接器组合。

  3. Simon Willison 博客74

    通过半官方Codex后门API为GPT-5.5生成“骑自行车的鹈鹕”

    尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成“骑自行车的鹈鹕”SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。

    推荐理由:Simon Willison 不只评测 GPT-5.5,还顺手逆向 Codex 做了个用订阅跑 API 的插件。定价翻倍、xhigh 模式四分钟出图这些细节,比官方通稿有用十倍,做选型的人该看这篇而不是 OpenAI 博客。

4月23日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    如何使用Codex进行日常工作

    该内容探索了10个实用的ChatGPT Codex用例,旨在自动化任务、创建交付物,并将真实的输入转化为跨工具、文件和工作流的输出。

    推荐理由:虽然发布一月有余,但官方整理的十个 Codex 日常自动化用例依然是最佳上手模板,从邮件整理到数据报表,产品人和运营可以直接抄作业。

  2. Cognition 模型 / Devin 博客(网页)63

    Cognition 复盘两年构建 Devin 云智能体基础设施的经验

    Cognition 基于两年 Devin 开发经验复盘构建云智能体的两大投入:基础设施与组织变革。文章指出容器共享内核存在逃逸风险、无法在异步间隙可靠保存状态,其方案是 microVM 隔离和 hypervisor 级整机状态快照;编排层花了超过三个季度才能管理数千并发 VM。

    推荐理由:Cognition 以两年 Devin 建设经验拆解云智能体在隔离、状态快照和编排上的真实投入,并给出组织落地的具体路径。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    关于近期 Claude Code 质量报告的更新说明

    Anthropic 确认并解决了过去一个月影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个问题,所有问题已于 4 月 20 日修复。具体包括:3月4日将 Claude Code 的默认推理强度从“高”改为“中”,导致用户感知智能下降,已于4月7日回滚;3月26日一项缓存优化存在缺陷,导致会话恢复后模型“健忘”和重复,4月10日修复;4月16日一项旨在减少冗余的系统提示指令意外损害了代码质量,4月20日撤销。这些问题影响了 Sonnet 4.6 和 Opus 4.6/4.7 模型,但 API 未受影响。公司已重置所有订阅用户的使用限额,并承诺改进流程以防止类似问题。

    推荐理由:Anthropic 把 Claude Code 连续一个月质量下滑的三个 bug 全部摊开讲,这种级别的工程复盘在大模型公司里极少见。做 Agent 产品的人该认真读,因为这三个坑你迟早也会踩。

4月22日周三
  1. PromptArmor:Threat Intelligence73

    PromptArmor 发布 Cursor 安全实践指南,披露未修复的 MCP Apps RCE 漏洞

    PromptArmor 发布 Cursor 安全实践者指南,梳理其威胁模型:不可信输入(代码、工单、网页、MCP 输出)与可信操作(shell 执行、文件写入、Git、MCP 工具调用)之间的间接提示词注入风险,并针对 Auto-Run、插件供应链、Bugbot、Automations、沙箱和子处理器给出管理端配置建议。

    推荐理由:作者基于自身披露经历梳理 Cursor 的威胁模型,并给出可落地的管理端配置与治理思路,还附上尚未修复的 MCP Apps RCE 细节。

  2. LlamaIndex:产品、工程与评测62

    LlamaIndex 深入解析 LiteParse 将 PDF 转为文本的网格投影算法

    LlamaIndex 详解其开源 PDF 解析工具 LiteParse 的网格投影算法核心原理。PDF 只存储文本内容和绘制坐标而无阅读顺序,算法通过提取左、右。

    推荐理由:LiteParse 官方拆解其网格投影算法的设计取舍与实现细节,读者可以了解 PDF 文本提取如何用对齐锚点保留表格和多栏结构。

  3. Cognition 模型 / Devin 博客(网页)72

    Cognition 复盘多智能体实践:写操作单线程加辅助智能体才真正有效

    Cognition 发布长文复盘,称自《Don't Build Multi-Agents》十个月后,其多智能体系统已在生产中可用,核心模式是写操作保持单线程、其他智能体只贡献智能。

    推荐理由:作者基于自家生产环境实验总结多智能体落地模式,给出干净上下文评审、跨模型路由等可迁移的工程经验。

  4. Augment Code 博客(网页)77

    Augment Code 实测什么样的 AGENTS.md 才对编码 Agent 有效

    Augment Code 从自家 monorepo 抽取数十个 AGENTS.md 文件,用内部评测 AuggieBench 对比有无该文件时 Agent 完成任务的表现,发现最好的文件带来相当于从 Haiku 升级到 Opus 的质量提升,最差的输出比没有文件还糟,同一文件在不同任务上可相差 30%。

    推荐理由:Augment Code 用内部评测量化了不同 AGENTS.md 写法对代码生成质量的影响,给出的模式与失败案例可以直接迁移到自己的代码库。

4月21日周二
  1. Gary Marcus:The Road to AI We Can Trust(RSS)60

    请不要相信你的聊天机器人提供的医疗建议

    四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。

    推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。

  2. Cursor Blog55

    保持 Cursor 应用稳定

    Cursor 团队针对用户全天依赖应用、崩溃影响严重的问题,聚焦内存不足导致的崩溃。通过为多进程架构设计细粒度监控系统,实时追踪版本发布后的崩溃指标。采用双重调试策略:自上而下关联功能与崩溃数据,监控大消息负载;自下而上通过崩溃观察服务、堆快照等定位根本原因。自2月底以来,全版本会话OOM率下降80%,自3月1日起请求OOM率下降73%。具体措施包括处理大文件加载和修复资源泄漏,以应对突发与渐进性内存耗尽。

    推荐理由:Cursor 把自家 OOM 问题的排查方法论完整公开了,自顶向下加自底向上的双线调试思路对做桌面端 Agent 产品的人有参考价值,但本质上是工程复盘而非行业事件。

  3. Nathan Lambert:Interconnects(RSS)60

    解读当前开放与封闭模型的性能差距

    文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。

    推荐理由:Nathan Lambert 把开源闭源差距从单一数字拉回到任务演化的动态里,做产品的人读完后会对那些追赶 benchmark 的宣传多一层怀疑,值得一读。

4月17日周五
  1. Linear:Now(RSS)61

    设计不是产出:AI 工具无法替代对问题的理解

    设计行业常将“设计”误解为产出界面或代码的行为,但真正的核心在于理解问题本身,找到形式与上下文的良好匹配。AI 工具能快速生成看似精美的输出,却往往绕开对底层问题的深入探索,导致产品表面光鲜但实际使用中脆弱、缺乏整合。设计仍需判断、对话、张力与时间,其价值在于通过动手工作逐步获得理解,而非仅仅依赖生成结果。

    推荐理由:这篇文章直指AI设计工具的误区,生成界面不等于做设计。真正难的是理解问题而不是产出视觉形式,做产品的都该读一读。

4月16日周四
  1. X:Thariq (@trq212)72

    使用 Claude Code:会话管理与百万级上下文窗口的策略

    Claude Code 的百万级上下文窗口在支持长任务的同时,也带来了“上下文腐化”的风险,即模型性能可能在处理约30-40万token后开始下降。因此,有效的会话管理至关重要。关键策略包括:开启新任务时建议新建会话;对于关联任务可酌情保留上下文以提升效率;善用 `/rewind` 回退功能而非直接纠正错误,是维护上下文清洁的核心习惯。用户在每个对话轮次后,应根据情况选择继续、回退、新建会话、压缩或使用子代理。

    推荐理由:Claude Code 1M 上下文听着爽,但 context rot 在 300k 就开始咬你了。这篇把 rewind、compact、subagent 三个操作的使用时机讲得极清楚,是目前最实用的 Claude Code 上下文管理指南,重度用户必读。

4月15日周三
  1. Dwarkesh Patel:Podcast & Blog(RSS)79

    黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河

    黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。

    推荐理由:Jensen首次承认没投Anthropic是错判,对华芯片禁运的态度也极其强硬,这期访谈是他近半年最坦诚的战略交底,做硬件和做政策的都该听一遍。

4月14日周二
  1. Cursor Blog62

    多智能体系统将GPU内核性能提升38%

    我们与NVIDIA合作,利用自主运行的多智能体系统,在为期三周内对235个真实CUDA内核进行了优化。该系统从零开始构建并优化Blackwell GPU内核直至汇编级别,实现了38%的几何平均速度提升,其中63%的问题超越基线,19%实现超2倍优化。这些内核直接影响AI训练与推理效率,传统上需资深工程师耗时数月乃至数年的优化工作,该系统在数周内即自主完成,并能探索更广阔解决方案空间,突破了人工逐项优化的限制。

    推荐理由:Cursor 把自家多 Agent 系统拉去优化 CUDA 内核,38% 的 geomean 提速不算炸裂,但真正值得看的是它证明了 Agent 可以在无人干预下跑三周啃硬骨头,这对做 Agent 产品的人是个强信号。

  2. The Decoder:AI News(RSS)70

    Stanford 2026 年 AI 指数报告显示技术快速进步、安全担忧加剧且公众信任下降

    Stanford HAI 发布的 2026 年 AI 指数报告显示,AI 模型性能实现重大飞跃,中美技术差距显著缩小,但安全问题和公众信任危机同步加剧。报告指出,尽管 AI 能力快速提升,行业面临的安全隐忧日益严峻,公众对技术的信任度持续下滑。

    推荐理由:Stanford 年度报告把 AI 的矛盾赤裸裸摆上台面,模型啃得动博士考题却看不懂钟,编程效率暴涨却让年轻开发者就业萎缩,信任度滑向谷底,这是行业必须正视的撕裂感。

  3. HuggingFace Daily Papers(社区热门论文)76

    AI Index Report 2026 发布

    第九版 AI 指数报告新增多项追踪维度:AI 在推理、安全及真实任务执行上的测试范围扩大,但测量手段的可靠性正在下降;首次提供生成式 AI 的经济价值估计及其劳动力市场影响的初步证据;提出 AI 主权分析框架;与 Schmidt Sciences 合作新增科学章节,并首次设立 AI 在科学与医学中的独立章节,反映 AI 在这两个领域日益增长的影响力。

    推荐理由:斯坦福这份年度报告是 AI 行业最全面的体检单,今年首次把科学和医学独立成章,说明 AI 正从实验性工具变成基础设施,治理和评估跟不上进度的矛盾贯穿始终。

4月13日周一
  1. Tomer Tunguz 博客(VC 分析)61

    AI稀缺时代的开端

    AI算力稀缺时代正式开启。Nvidia Blackwell芯片GPU租赁价格涨至每小时4.08美元,两月内涨幅达48%;云服务商CoreWeave涨价20%并将最低合同期从一年延长至三年。Anthropic已将最新模型限制给约40个组织使用,OpenAI因算力不足被迫放弃部分项目。这标志着AI充足时代结束,"价高者得"、关系型销售、被迫多元化成为行业新常态,初创公司面临更严峻挑战。

    推荐理由:Tunguz 把 AI 算力短缺的五个特征讲得很透,关系销售与价格通胀对创业者是核心挑战,虽然文章有点旧,但判断框架仍然有效。

4月10日周五
  1. Nathan Lambert:Interconnects(RSS)60

    Claude 神话与对开放权重的误导性恐慌

    针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

    推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。

  2. Claude:Blog(网页)67

    针对AI加速攻击的安全准备建议

    Anthropic发布Project Glasswing项目,利用Claude Mythos Preview模型进行网络防御。文章指出,未来24个月内AI将发现大量长期潜伏的漏洞并快速转化为攻击,公开可用的次级模型已能发现传统审查遗漏的严重漏洞。建议立即修补CISA KEV目录漏洞,使用EPSS评分系统优先处理风险,互联网暴露系统需在24小时内完成补丁更新。预计未来两年漏洞报告量将增加一个数量级,安全团队需建立自动化修补流程以应对AI加速的攻击态势。

    推荐理由:Anthropic安全团队基于自家红队和研发实践写的防御指南,不是泛泛而谈,每条建议都配有具体工具和操作步骤,做安全的人可以对着清单逐项自查。

4月8日周三
  1. LlamaIndex:产品、工程与评测68

    LlamaParse 复盘 VLM OCR 生产环境中的两类失败模式与修复方案

    LlamaIndex 复盘 LlamaParse 的两类生产故障:LLM 重复循环导致 token 消耗和延迟暴增、资源耗尽,以及 recitation 内容过滤把合法文档抽取误判为版权违规而强行截断输出。

    推荐理由:当事方复盘两类真实生产事故的根因、各厂商 API 表现差异与具体缓解手段,方法可直接迁移到其他 agentic 文档处理系统。

  2. Cognition 模型 / Devin 博客(网页)63

    Cognition 拆解 Devin 如何在财富 500 强企业现代化 COBOL

    Cognition 发文介绍过去八个月多家财富 500 强公司在 COBOL 项目中使用 Devin,包括用 DeepWiki 文档化数百万行代码、将 25000 行海关工作流迁移到 AWS Lambda(估算节省 73% 迁移成本),以及 Itaú Unibanco 跨数百个程序、20 种字段变体的税号重构,提前三个月完成且零生产错误。

    推荐理由:原文梳理了 COBOL 难倒智能体的三个原因和可落地的两类场景,并给出迁移成本下降等具体案例,方法可参考。

  3. Berkeley RDI:Blog(AI 安全与评测)87

    我们如何攻破顶级AI Agent基准测试及未来展望

    伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。

    推荐理由:伯克利团队从内部挨个拆解了八大主流基准,发现全都能被零能力 agent 打满分。这不只是打脸,他们给出了一份评估构建清单,以后做基准的人必须过了这一关才算及格。

4月3日周五
  1. X:karminski (@karminski3)72

    Gemma4有8个模型, 选哪个? 一文看懂!

    Google发布的Gemma4系列开放权重模型包含多个版本,选型需结合场景。带“-it”后缀为指令微调版,开箱即用;不带后缀为基座模型,供自行微调。其中,A4B指激活参数量为4B,E4B则采用逐层嵌入技术,以内存换取计算量,优化移动端性能。选型建议:综合性能与速度选26B-A4B;追求最佳代码或任务效果选31B;开发本地全模态应用选E4B;资源受限设备体验可选E2B,但输出质量有限。

    推荐理由:Gemma 4 一口气出了 8 个变体,本地部署的人最怕选错模型白折腾,这篇把选型逻辑拆得明明白白,从龙虾助手到树莓派都有对应方案,抄作业就行。

3月31日周二
  1. Trail of Bits:AI安全研究72

    Trail of Bits 如何让公司走向 AI 原生:从 5% 接受到 94 个插件、201 个技能

    Trail of Bits 分享其一年内将 AI 采用率从约 5% 推到全公司落地的系统方法,目前已有 94 个插件、201 个技能、84 个专用智能体,部分审计项目每周发现的漏洞从约 15 个增至 200 个,约 20% 的客户报告漏洞最初由 AI 发现。

    推荐理由:Trail of Bits 以亲历者身份复盘内部 AI 化的完整系统,给出心理障碍分析和可复制的组织方法,适合参考落地路径。

3月26日周四
  1. Cursor Blog69

    通过实时强化学习改进Composer编码模型

    Cursor团队将实时强化学习技术应用于Composer编码模型,利用真实用户交互产生的推理令牌作为训练信号,以解决模拟环境与真实使用间的匹配问题。该技术使团队能够以每五小时一次的频率部署改进后的模型检查点。通过A/B测试,新版本实现了关键指标提升:代理编辑在代码库中的持久性增加2.28%,用户不满意后续减少3.13%,延迟降低10.3%。实时RL也带来了奖励黑客等新挑战,但真实用户反馈有助于识别和修正此类问题。

    推荐理由:Cursor 把真实用户交互当训练信号,每五小时迭代一次 Composer,这不是论文是工程日志。做 coding agent 的团队该看看他们怎么处理 reward hacking 的两个真实案例,比任何 benchmark 论文都实在。

3月24日周二
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    利用对抗网络灵感设计多代理架构,突破长时应用开发瓶颈

    作者受生成对抗网络启发,设计了一个包含规划器、生成器和评估器的三代理架构,以解决Claude在长时应用开发中的两大瓶颈。该架构通过上下文重置机制,有效克服了模型在长任务中的“上下文焦虑”问题;同时,通过分离生成与评估功能,使代理能依据具体标准进行迭代改进,而非盲目自评。这一方法成功使系统能在多小时的自主运行中生成完整的全栈应用程序,突破了此前提示工程和传统工具设计的性能上限。

    推荐理由:Anthropic 工程师把 GAN 的 generator-evaluator 思路搬进长时 Agent 架构,从设计到全栈编码都跑通了,还附了成本和失败模式。做 Agent 产品的人读完能直接抄作业,比看十篇论文管用。

3月23日周一
  1. Anthropic:Research(发表成果 · 网页)71

    利用长时运行智能体工作流革新科学计算

    Anthropic 研究员展示了如何将多日智能体编码工作流应用于科学计算任务。以使用 Claude Opus 实现宇宙学玻尔兹曼求解器的可微分版本为例,该任务通常需耗费研究人员数月甚至数年时间。通过制定清晰的项目指令、利用日志文件作为智能体的持久记忆并设置测试预言,即使是非领域专家也能引导智能体在数小时内完成这类复杂项目。该方法的核心在于设定高层目标后,让智能体团队自主工作,仅需偶尔人工监督,从而显著提升了科学代码开发与移植的效率。

    推荐理由:Anthropic 研究员用 Claude Opus 4.6 花几天从零写出了一个宇宙学 Boltzmann 求解器,原本是博士级团队几个月的活。这不是论文,是一份完整的多日 Agent 工作流实操手册,做科研或长周期编码的人可以直接抄作业。

3月20日周五
  1. OpenAI Developers:Blog(网页)73

    OpenAI 发布 GPT-5.4 前端设计指南及 Frontend Skill

    OpenAI 发布指南,介绍如何引导 GPT-5.4 生成更精致的前端界面。GPT-5.4 在图像理解、功能完整性和工具自检(结合 Playwright 验证页面)方面有提升,并训练用于 computer use。

    推荐理由:OpenAI 官方给出了引导 GPT-5.4 做前端设计的具体约束、视觉参考和一套可直接安装的 Frontend Skill,方法可迁移到自己的项目。

3月16日周一
  1. 公众号:月之暗面(Kimi)60

    推荐:10万人亲测好用的原版OpenClaw安装器

    Kimi支持的个人开发者开源项目OneClaw下载量突破10万,提供一键安装包,1分钟即可在本地部署原版OpenClaw,无需命令行或环境配置。功能包括纯净卸载、自由切换模型、远程控制,支持连接飞书、企微、钉钉、QQ、Kimi Claw;内置2万+技能的技能商店,可无损迁移记忆和Skills。Kimi提供包月方案和API按需购买。使用地址:oneclaw.cn。

    推荐理由:如果你曾被 OpenClaw 的部署门槛劝退,OneClaw 可以让你两分钟跑起来,适合在备用机尝尝鲜,但别在生产环境乱搞。

3月12日周四
  1. Answer.AI 官方研发博客(RSS)66

    Answer.AI 用 PyPI 数据检验 AI 生产力效应:包创建未见激增,热门 AI 包更新频率翻倍

    Answer.AI 分析 PyPI 数据后发现,ChatGPT 发布后 Python 包创建率没有明显上升,整体更新频率的缓慢增长早在 2019 年就已开始。但热门 AI 相关包更新频率跃升至每年 21-26 次中位数,是热门非 AI 包(约 10 次)的两倍多。

    推荐理由:原文用 PyPI 数据检验 AI 生产力说法,发现效应集中在热门 AI 相关包,给出两个可检验的解释假设。