跳到正文

全部动态

今日 30 条
5月2日周六
  1. X:Francois Chollet (@fchollet)70

    强化学习双刃剑效应:已知领域提升性能,未知领域易致模型幻觉

    强化学习在已知领域能提升模型性能,但在未知领域可能导致模型产生幻觉,误以为在执行其他训练过的任务。这一现象在GPT-5.5等大模型的ARC AGI 3基准测试中有所体现,其得分仅为0.43%,与Claude 4.6、Gemini 3.1等模型表现相近。分析指出GPT-5.5的主要失败原因包括:局部效应正确但世界模型错误、从训练数据中提取的抽象层级不当,以及虽解决问题却未强化奖励机制。深入分析此类失败案例,有助于全面理解大模型在特定模态上的能力局限与改进方向。

    推荐理由:Chollet 用 ARC AGI 3 冷冰冰的数字撕开了 RL 的局限,GPT-5.5 0.43% 的得分说明在未知领域模型会做完全不相干的事,比任何安全论文都来得更直击要害。

  2. X:Demis Hassabis (@demishassabis)67

    DeepMind创始人Demis Hassabis谈AGI之路与AI科学突破

    DeepMind创始人Demis Hassabis在访谈中回顾了从国际象棋神童到获得诺贝尔化学奖的生涯,并探讨了实现AGI仍需解决的关键挑战,如记忆、推理与持续学习。他分析了小模型能力提升、多模态Gemini设计以及推理成本下降的趋势,强调AI已成为科学研究的强大工具,从蛋白质预测扩展到虚拟细胞研究。Hassabis还为创业者提供了前瞻性建议,指出在AGI到来前应关注的方向及AI驱动科学发现的潜力。

    推荐理由:Demis 这次没聊虚的,直接把 AGI 的瓶颈摊开讲——记忆、推理、持续学习,每个点都是创业者的机会清单,做 Agents 的可以反复看。

5月1日周五
  1. Tomer Tunguz 博客(VC 分析)57

    本周的积极信号:AI在医疗、教育、农业与科研领域的突破性进展

    近期多项进展展现了AI的巨大积极影响。医疗领域,Mayo Clinic的AI能通过常规CT提前最多三年检测胰腺癌,强生利用AI将新药线索生成时间减半。教育方面,哈佛研究显示AI导师使学生学习效果翻倍,泰国培训16万名教师惠及330万学生。农业上,AI能以约88%准确率预测害虫爆发。科研中,AI快速筛查NASA数据,新发现超一万颗系外行星候选。此外,香港推出AI洪水预报系统,Atlassian和Twilio等公司也因AI驱动业绩增长并上调预期。这些案例平衡了AI风险,凸显其创新潜力。

    推荐理由:Tomer 收集了最近两周 AI 在医学、教育、农业的硬核落地案例,对反 AI 恐慌是一剂清醒剂,SaaS 公司的营收也说明行业在回暖。

  2. X:ChatGPT (@ChatGPT)63

    GPT Image 2“笨拙涂鸦”提示词爆红网络

    一条针对GPT Image 2的特定图像生成提示词正在社交媒体上病毒式传播。该提示词的核心要求是:以最笨拙、潦草且极其糟糕的方式重绘所附图像,背景为白色,使其看起来像是用鼠标在MS Paint中绘制。生成效果需与原图似是而非,带有低质量像素感和令人困惑的别扭感,以突出其荒诞的“差劲”。推文引用者指出,这条提示词正引发疯狂传播。

    推荐理由:这 prompt 把 GPT Image 2 从「精美」逼成了「小学生涂鸦」,是近期最有网感的玩法,做内容的可以直接抄。

  3. GitHub Blog59

    GitHub Copilot CLI 入门指南:交互模式与非交互模式

    GitHub Copilot CLI 提供了交互与非交互两种主要使用模式。交互模式允许用户通过对话式指令逐步构建和调整命令,适合探索性任务。非交互模式则支持直接输入完整指令快速执行,适用于自动化脚本或已知命令。理解这两种模式的区别能帮助开发者更高效地利用该工具,提升命令行工作效率。

    推荐理由:如果你总在 Copilot CLI 的交互和非交互模式之间犯迷糊,这篇官方教程算是清晰的速查手册,初学者花五分钟就能搞清楚。

  4. Claude:Blog(网页)64

    零基础项目经理借助Claude Code,六周内独立开发并上线压力管理应用

    毫无编程经验的项目经理Kostiantyn Vlasenko,借助Claude Code在72小时内独立开发出压力管理应用Respiro,并于六周后成功上线苹果应用商店。该应用能通过手机实时检测用户压力信号,并即时引导呼吸练习。其架构由15个以上并行运作的专用子智能体构成,涵盖设计、开发、审查等模块。Claude协助完成了从技术选型、代码重构到苹果账号注册、服务集成乃至界面调试等一系列复杂操作,甚至支持了后续的市场推广工作。

    推荐理由:一个零编程经验的项目经理,用 Claude Code 六周做完压力管理 App 并上架。关键不在技术,而在「管人经验拿来管 AI agent」的思路,对非技术背景的创业者太有参考价值。

  5. ARC Prize:官方博客63

    ARC Prize 用 ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

    ARC Prize 分析了 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的 160 段推理回放,两模型在半私 数据集上的得分分别为 0.43% 和 0.18%,并开源了分析包。

    推荐理由:作者基于 160 段推理回放归纳出三种可复用的失败模式分类,并对比两个模型在压缩策略上的差异。

4月30日周四
  1. X:通义千问 / Qwen (@Alibaba_Qwen)73

    Qwen-Scope开源套件发布:稀疏自编码器助力模型内部特征操控

    Qwen团队推出开源稀疏自编码器套件Qwen-Scope,将SAE特征转化为实用工具。该套件支持四大应用方向:无需提示工程即可通过直接操控内部特征引导模型输出;用极少样本对目标数据进行分类与合成,提升长尾能力;追踪代码切换和重复生成问题的根源并进行修复;通过分析特征激活模式优化评测基准并减少冗余。团队希望社区利用Qwen-Scope深入探索Qwen模型内部机制,并开发出超越现有研究范围的应用。相关资源已开放。

    推荐理由:可解释性工具从学术走向工程,Qwen-Scope 把内部特征操控、数据合成、问题溯源打包成套装,做模型调试和长尾优化的团队值得立刻上手试试。

  2. Cursor Blog55

    持续优化智能体工具链:上下文演进与效果评估

    Cursor团队以构建软件产品的方式迭代优化其智能体工具链,核心围绕上下文窗口的演进。早期模型能力有限,工具链依赖大量静态上下文和防护机制;随着模型能力提升,团队已转向提供更多动态上下文获取方式并移除限制。评估改进效果采用线上线下结合:通过CursorBench等基准测试进行标准化质量评估,同时进行线上A/B测试,使用“代码保留率”和用户反馈语义分析衡量真实场景表现。团队持续监控并修复工具调用错误,以应对日益复杂的工具链状态。

    推荐理由:Cursor 这篇 agent harness 复盘是今年聊 agent 基础设施最好的文章之一,从上下文管理到多 agent 调度,全是实战迭代的血泪经验,做 agent 的团队该逐字读。

  3. X:OpenAI Developers (@OpenAIDevs)63

    轻松构建网页应用

    你完全可以构建网络应用

    推荐理由:OpenAI开发者官方转发了这篇‘直接构建web应用’的文章,说明这可能是他们认可的实践路径,对想用AI快速搭应用的开发者算是个值得收藏的参考。

  4. X:Rohan Paul (@rohanpaul_ai)71

    AI迷雾:预见能力崩溃与短期化未来

    《哈佛商业评论》文章指出,AI的首要经济影响并非自动化,而是制造了巨大的不确定性“迷雾”,导致“预见能力的崩溃”。这动摇了现代资本主义依赖未来“可读性”的根基,使得个人对教育投资、企业对长期雇佣与资本开支、金融市场对终值的评估均陷入犹豫。其结果是行为模式迅速转向短期视野:更倾向于模块化、可调整的投入,而非长期、不可逆的重大承诺。

    推荐理由:HBR这篇文章点明了一个被忽视的效应,AI先动摇的不是就业而是经济决策的可见性。当远期现金流变得不可读,学位、招聘、投资都得重新算账,管理者和投资者的时间窗正在被动缩短。

  5. Dwarkesh Patel:Podcast & Blog(RSS)55

    Reiner Pope – 大语言模型训练与服务的数学原理

    文章揭示了支撑大语言模型(如GPT、Claude、LLaMA)训练与服务的核心数学框架。通过剖析关键方程,可以逆向推导出顶尖AI实验室在模型规模扩展、计算资源分配及服务优化方面的核心策略与实践。这些数学原理不仅解释了模型性能随参数和数据量增长的规律,也量化了训练成本与推理效率之间的权衡,为理解当前大语言模型的发展路径提供了底层逻辑。

    推荐理由:Reiner Pope 把训模型背后的数学摊开讲,听完能反推出大厂在做什么,做训练的人不可多得的一课。

  6. Hugging Face:Blog(RSS)62

    AI评估正成为新的算力瓶颈

    AI评估成本已突破关键阈值,正重塑其可及性。Holistic Agent Leaderboard花费约4万美元运行了2万多次智能体推演,单次前沿模型测试成本可达2829美元。研究显示,相同任务成本差异可达33倍,脚手架选择是核心成本驱动因素。虽然静态基准可通过压缩技术实现百倍成本缩减,但智能体评估因轨迹长、噪声大而压缩有限。高支出未必带来更好结果:例如在GAIA测试中,2828美元方案准确率28.5%,而1686美元方案反达57.6%。当评估包含模型训练时,成本将完全超越常规API框架。

    推荐理由:这篇把分散的评估成本数据拉通了算总账,曾经便宜的评测现在动辄上万美元,独立评估正被价格挤出牌桌,做Agent的人必须意识到排行榜的代价。

  7. Manus:Blog(网页)63

    五大 Replit 替代方案实测:同一提示词对比 Manus AI、Lovable、Vercel v0、Base44 和 Hostinger Horizons

    作者用同一个个人理财应用提示词实测 Replit 及五款替代工具。Lovable 约 5 分钟生成且最易上手,Vercel v0 输出设计质量最强,Base44 约 5 分钟交付最完整全栈功能,Manus 花 40 分钟、763 积分但成品精致,Hostinger Horizons 年付 6.99 美元/月起但构建多次出错、表现最弱;Replit 耗时约 16 分钟,结构扎实但视觉打磨不足。

    推荐理由:作者用同一个理财应用提示词实测五款 AI 应用构建器,给出耗时、价格和真实短板,读者可据此按自身需求挑选工具。

  8. Augment Code 博客(网页)67

    Augment Code 实测 Karpathy 风格规则让编码 Agent 更省时省成本,但代码质量未提升

    Augment Code 在 AGENTS.md 中加入约 2.5k 字符的 Karpathy 风格编码规则,用 Auggie、Claude Code 和 Codex 对 40 个 OpenClaw PR 各跑 6 次对照测试。

    推荐理由:原文以 40 个 OpenClaw PR 的对照实验给出 Karpathy 规则对三个编码 Agent 的效率与质量影响,结论可迁移到自己的 AGENTS.md 配置。

  9. Claude:Blog(网页)64

    Claude Code 构建经验:提示缓存的优化实践

    Claude Code 团队分享了大规模优化提示缓存的核心策略。提示缓存基于前缀匹配工作,能显著降低延迟与成本,高命中率还能支持更宽松的订阅速率限制。关键实践包括:将静态系统提示和工具定义置于提示词前端以最大化共享前缀;通过消息而非修改提示词来传递更新信息,避免缓存失效;在会话中不切换模型、不增删工具,以维持缓存前缀稳定。此外,针对工具过多或“计划模式”等场景,可通过发送轻量存根或设计专用工具来规避缓存失效,从而在复杂功能中持续利用缓存优势。

    推荐理由:Claude Code团队把提示缓存的坑和优化方法全盘托出,从提示顺序、工具加载到压缩技巧,每一个经验都是钱和延迟换来的,做agent的同行可以直接拿去做架构参考。

4月29日周三
  1. Claude:Blog(网页)58

    智能体时代的产品开发:Claude Managed Agents 如何解放产品经理

    Claude产品经理Jess Yan分享了处于测试版的Claude Managed Agents如何改变其工作流程。这套可组合的API能大规模构建和部署云端智能体,使她能在短时间内将想法转化为可运行的原型。她的日常工作由此分流:使用Claude进行开放式探索,然后利用Claude Code基于Managed Agents编写定制智能体来自动化特定任务,如采用分析和舆情监控。这些智能体接管了以往难以规模化的操作性工作,让她能将更多时间投入到与团队和用户的创造性合作中。

    推荐理由:Anthropic PM公开用Claude Managed Agents搭建数据分析、舆情监控和演示生成agent的真实流程,对于想要用agent重构产品开发节奏的团队有实际参考价值,但不算爆炸性更新。

  2. X:通义千问 / Qwen (@Alibaba_Qwen)66

    闪速QLA:基于TileLang构建的高性能线性注意力内核

    FlashQLA是基于TileLang开发的高性能线性注意力内核,专为提升个人设备上智能体AI性能而设计。它实现了2-3倍的前向传播加速和2倍的反向传播加速。其核心技术包括门控驱动的片上自动计算与通信重叠、硬件友好的代数重构,以及TileLang融合的Warp专用内核。该设计通过自动片上通信重叠显著提升了流处理器利用率,在张量并行、小模型和长上下文任务中效果突出。尽管在大批量处理时,其将GDN流程拆分为两个内核的策略会带来额外内存开销,但在边缘设备和长上下文实际场景中性能更优。反向传播部分通过构建16级、严格片上内存限制下的Warp专用流水线,实现了超过2倍的内核级加速。

    推荐理由:Qwen 把线性注意力的推理效率压到了新台阶,2-3 倍加速对想做本地 Agent 的开发者是实打实的,不是论文灌水,是能跑在设备上的代码。

  3. X:洪明 (@hongming731)72

    AI初创公司的独立生存之道:差异化、专注与速度

    针对AI初创公司是否必须被大模型实验室收购的讨论,Cognition公司的经验表明,同行被收购反而会强化剩余独立公司的地位。独立公司在软件工程等动态领域拥有明确市场,客户重视模型灵活性。其成功关键在于三大法则:一是建立清晰差异化,如专注企业市场、加速全开发周期、解决复杂部署难题并保持模型独立;二是极致专注,在特定领域深挖边缘复杂性问题,做到实验室无法比拟;三是保持速度优势,利用小团队决策快、工具链高效和工程文化,通过快速迭代建立竞争壁垒。

    推荐理由:Russell Kaplan 借 Cursor 被收购节点复盘 Cognition 的打法,差异化、专注、速度三条铁律不是空话,全是带数据和细节的实战复盘,做 AI 创业的值得细读。

  4. X:Greg Brockman (@gdb)73

    Codex超级应用七项核心能力详解

    一个很棒的Codex教程: 这些是7种知识工作能力... 在超级应用Codex内部 00:00 介绍 02:19 能力1 - 完整文件访问 07:41 能力2 - 持久记忆 10:46 能力3 - 插件 13:52 能力4 - 技能 19:22 能力5 - GPT图像访问 21:03 能力6 - 浏览器与计算机使用 23:58 能力7 - 自动化 25:31 额外功能 - 编年史 27:21 总结

    推荐理由:Greg Brockman 亲自推荐,Riley Brown 这个 28 分钟速览把 Codex 的 7 大能力拆得干净利落,想做复杂自动化的开发者看完就能直接上手。

  5. Tomer Tunguz 博客(VC 分析)57

    AI推理市场的专业化分化

    AI推理市场正快速分化,各模态如文本、图像、视频和音频发展出独立推理技术栈。自ChatGPT发布后,NVIDIA数据中心收入三年内增长17倍,凸显市场爆发。分化根本原因在于工作负载差异:图像视频生成需高计算力,长上下文消耗更多内存,边缘设备则受功耗限制。市场按延迟分为实时、近实时和批量三层;按模态分为文本、图像视频音频;按部署分为云端和边缘。Hugging Face上已有超9万个图像生成模型,整个AI推理市场规模预计约1000亿美元,这种专业化趋势正为各细分领域创造领导者机会。

    推荐理由:Tomer 把推理市场跟数据库市场做类比,碎片化的逻辑讲得很透,做 AI 基础设施的朋友能直接用来梳理自己的赛道,普通人知道这么回事就行。

  6. Factory 研究 / 产品(RSS)66

    Factory 基准测试 13 个模型,比较 AI 代码审查的质量与成本

    Factory 对 13 个模型在来自 Sentry、Grafana、Keycloak、Discourse 和 Cal.com 的 50 个真实 PR 上做了代码审查基准,每个模型至少跑 3 次。

    推荐理由:原文给出13个模型在50个真实PR上的F1与成本数据,读者可按预算直接挑选代码审查模型。

  7. X:Suno (@suno)70

    60秒制作伴奏指南

    如何在60秒内制作伴奏音轨。

    推荐理由:虽然只是 Suno 的官方教程,但这 60 秒的视频把生成伴奏这件事儿讲得明明白白,对于想快速出 demo 的音乐创作者来说,是个能立刻用上的实用技巧。

4月28日周二
  1. X:OpenRouter (@OpenRouter)61

    Opus 4.7模型成本普遍上涨12-27%

    我们研究了市场上Opus 4.7的数据,发现成本增加了12-27%,但短提示除外,实际上短提示的成本效益更高。 完整文章:https://openrouter.ai/announcements/opus-47-tokenizer-analysis

    推荐理由:OpenRouter 用自家平台数据实测 Opus 4.7 的真实成本变化,不是官方 PR 而是第三方视角,做成本预算的产品人和开发者值得看一眼再决定要不要迁移。

  2. Tomer Tunguz 博客(VC 分析)63

    AI销售中的三个核心问题

    AI销售策略正从询问软件预算转向三个核心问题:软件总预算、劳动力总预算,以及客户期望三年后两者的比例。这一转变将销售对话提升至战略层面。当前数据显示,销售、支持和工程部门的人力与软件成本比分别为10:1、4:1和最高25:1,高比率意味着巨大的AI替代潜力。新的销售流程分为两步:先切入现有软件预算,再拓展至AI所释放的劳动力预算,最终目标是重新定义企业对成本结构的认知。

    推荐理由:Tunguz 用一张劳动力/软件支出比率表把 AI 销售的底层逻辑讲透了,做 ToB SaaS 或 Agent 产品的人看完会重新想自己的定价天花板在哪。

  3. Simon Willison 博客75

    追踪现已失效的OpenAI与微软AGI条款演变史

    微软与OpenAI的长期合作曾包含一项特殊条款:一旦实现通用人工智能(AGI),微软的商业知识产权将失效。AGI最初被模糊定义,后在2024年被具体量化为能为早期投资者产生约1000亿美元利润的系统。2025年,双方修订协议,规定AGI需经独立专家小组核实。2026年4月27日,双方宣布新合作阶段,微软对OpenAI知识产权的许可将延续至2032年(转为非独家),并停止收入分成,而OpenAI向微软的分成支付将持续至2030年且“独立于技术进展”。此举被广泛视为原有的AGI条款实质上已被废止。

    推荐理由:Simon Willison 把 OpenAI 和微软之间那个「AGI 条款」从诞生到死亡的完整时间线扒了出来,这种一手资料级别的梳理比任何分析都有说服力,关心 AI 商业格局的人值得花五分钟读完。

  4. Claude:Blog(网页)72

    像培训新开发者一样引导Claude Code:来自17年开发的经验教训

    华盛顿大学MacCoss实验室的Brendan MacLean将培训新开发者的方法论应用于Claude Code,以管理拥有70万行C#代码、持续开发17年的开源蛋白质分析软件Skyline。他通过创建独立的AI上下文仓库、编写CLAUDE.md引导文件以及设计“技能”模块(如调试技能),为Claude Code建立项目认知。该方法显著提升了开发效率:搁置一年的文件视图面板功能在两周内完成;CSS布局更新从依赖设计师变为不到一天实现。此外,Claude Code还自动化了2000多张教程图片的截图比对和每日测试报告生成,团队现在主要依靠它生成代码和脚本。

    推荐理由:这不是又一篇 Claude Code 安利文,而是一个维护了 17 年 70 万行 C# 代码库的人,把带新人的方法论原封不动搬给了 AI,结果真管用。做 legacy 项目的人应该认真看他的 context 管理和 skill 库设计。

4月27日周一
  1. OpenRouter:Announcements(RSS)57

    Opus 4.7新分词器对成本的实际影响

    Anthropic在Claude Opus 4.7版本中更新了分词器。通过对比4.6到4.7版本的实际使用数据,分析发现这一技术调整改变了文本转换为令牌的方式,直接影响API计价。相同的文本输入可能产生不同数量的令牌,从而导致用户的实际使用成本发生可量化的变化。这一调整虽不改变模型能力,但关乎运营开销,是开发者和企业用户需评估的关键因素。

    推荐理由:Opus 4.7 换了 tokenizer,大多数人只知道模型变强了,不知道计费逻辑也变了。OpenRouter 用真实流量数据算了一笔账,做成本预算的产品人值得扫一眼。

  2. Tomer Tunguz 博客(VC 分析)64

    GPU现货价格六周内暴涨114%

    根据Ornn Compute Price Index数据,NVIDIA B200 GPU的现货租赁价格在六周内飙升114%,从三月初的2.31美元涨至本周的4.95美元/小时。此次价格暴涨与GPT-5.5等前沿模型发布带来的需求冲击紧密相关,这些模型需要Blackwell架构提供的内存支持。与此同时,B200与上一代H200的价差从0.28美元大幅扩大至1.80美元,不同云服务商之间的报价差距也扩大了一倍以上,反映出市场供应紧张。预计夏季B200价格将维持在5美元以上,云端推理成本持续上升。

    推荐理由:Tomer Tunguz 用 Ornn 真实价格指数拆出 B200 六周涨 114% 的供需逻辑,做 AI infra 选型或算力采购的人该把这张图存下来,夏天 B200 破 5 刀基本板上钉钉。

  3. Runway:News(网页)58

    无闲置GPU:Runway的研究计算管理

    Runway通过采用Kueue作为Kubernetes准入控制器,将GPU利用率提升超过20%,同时保障团队容量。其核心机制是为关键工作预留配额,并设立共享队列借用闲置容量,当配额所有者需要时通过抢占回收资源。该系统运行于昂贵的多租户GPU集群,支持多节点训练的拓扑感知调度和弹性工作负载。具体实现中,团队拥有专用预留队列,而默认队列作为共享机会池,可借用闲置配额运行可中断工作负载。当预留队列需资源时,Kueue基于优先级和运行时间抢占默认队列中的任务,实现资源高效管理。

    推荐理由:Runway 把 Kueue + Kubernetes 的 GPU 调度实战写成了保姆级工程笔记,利用率翻倍的方案和踩坑细节都有,做大规模训练集群调度的团队可以直接抄作业。

4月25日周六
  1. Simon Willison 博客70

    GPT-5.5 提示指南

    OpenAI 针对新发布的 GPT-5.5 API 模型发布了详细的提示指南。核心建议包括:在处理多步骤任务时,应在调用工具前先向用户发送简短的状态更新,以提升交互体验。官方强调 GPT-5.5 应被视为一个需要重新调优的新模型系列,而非 GPT-5.2 或 GPT-5.4 的直接替代品,建议从零开始构建提示,而非沿用旧有提示。开发者可通过 `openai-docs` 技能使用 `$openai-docs migrate this project to gpt-5.5` 命令来辅助代码迁移,官方升级指南中还包含了轻量的提示词改写建议。

    推荐理由:OpenAI 官方明确说 GPT-5.5 不能当 drop-in replacement,prompt 要从零重写。做产品的人别偷懒直接换模型名,先读这份指南再动手,省得上线翻车。

4月24日周五
  1. OpenRouter:Announcements(RSS)55

    OpenRouter Agent SDK 发布 `create-agent-tui` 与 `create-headless-agent` 技能,可快速搭建个性化编码智能体

    OpenRouter Agent SDK 推出 `create-agent-tui` 和 `create-headless-agent` 两类技能(skills),用于快速搭建(scaffold)个性化编码智能体。前者提供终端 UI(terminal UI),后者为无头模式(headless),适用于脚本和流水线(scripts and pipelines)。

    推荐理由:一个用 OpenRouter Agent SDK 快速搭建编码 agent 的脚手架,适合想省时间的开发者,但内容本身是常规文档,42 天前的教程现在已经没什么新意。

  2. PromptArmor:Threat Intelligence69

    PromptArmor 解析 AI 应用连接器的间接提示词注入风险与审计方法

    PromptArmor 提出评估 AI 应用连接器风险的三支柱模型,不可信外部数据、敏感内部数据和下游动作,并呼应 Simon Willison 的 Lethal Trifecta,举例说明 Confluence 与 Zendesk 连接器组合可将内部文档经工单回复外泄。

    推荐理由:原文给出连接器风险的三支柱威胁模型和主流企业 AI 应用的具体配置路径,读者可据此审计自己环境中的连接器组合。

  3. Simon Willison 博客74

    通过半官方Codex后门API为GPT-5.5生成“骑自行车的鹈鹕”

    尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成“骑自行车的鹈鹕”SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。

    推荐理由:Simon Willison 不只评测 GPT-5.5,还顺手逆向 Codex 做了个用订阅跑 API 的插件。定价翻倍、xhigh 模式四分钟出图这些细节,比官方通稿有用十倍,做选型的人该看这篇而不是 OpenAI 博客。

4月23日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    如何使用Codex进行日常工作

    该内容探索了10个实用的ChatGPT Codex用例,旨在自动化任务、创建交付物,并将真实的输入转化为跨工具、文件和工作流的输出。

    推荐理由:虽然发布一月有余,但官方整理的十个 Codex 日常自动化用例依然是最佳上手模板,从邮件整理到数据报表,产品人和运营可以直接抄作业。

  2. Cognition 模型 / Devin 博客(网页)63

    Cognition 复盘两年构建 Devin 云智能体基础设施的经验

    Cognition 基于两年 Devin 开发经验复盘构建云智能体的两大投入:基础设施与组织变革。文章指出容器共享内核存在逃逸风险、无法在异步间隙可靠保存状态,其方案是 microVM 隔离和 hypervisor 级整机状态快照;编排层花了超过三个季度才能管理数千并发 VM。

    推荐理由:Cognition 以两年 Devin 建设经验拆解云智能体在隔离、状态快照和编排上的真实投入,并给出组织落地的具体路径。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    关于近期 Claude Code 质量报告的更新说明

    Anthropic 确认并解决了过去一个月影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个问题,所有问题已于 4 月 20 日修复。具体包括:3月4日将 Claude Code 的默认推理强度从“高”改为“中”,导致用户感知智能下降,已于4月7日回滚;3月26日一项缓存优化存在缺陷,导致会话恢复后模型“健忘”和重复,4月10日修复;4月16日一项旨在减少冗余的系统提示指令意外损害了代码质量,4月20日撤销。这些问题影响了 Sonnet 4.6 和 Opus 4.6/4.7 模型,但 API 未受影响。公司已重置所有订阅用户的使用限额,并承诺改进流程以防止类似问题。

    推荐理由:Anthropic 把 Claude Code 连续一个月质量下滑的三个 bug 全部摊开讲,这种级别的工程复盘在大模型公司里极少见。做 Agent 产品的人该认真读,因为这三个坑你迟早也会踩。

4月22日周三
  1. PromptArmor:Threat Intelligence73

    PromptArmor 发布 Cursor 安全实践指南,披露未修复的 MCP Apps RCE 漏洞

    PromptArmor 发布 Cursor 安全实践者指南,梳理其威胁模型:不可信输入(代码、工单、网页、MCP 输出)与可信操作(shell 执行、文件写入、Git、MCP 工具调用)之间的间接提示词注入风险,并针对 Auto-Run、插件供应链、Bugbot、Automations、沙箱和子处理器给出管理端配置建议。

    推荐理由:作者基于自身披露经历梳理 Cursor 的威胁模型,并给出可落地的管理端配置与治理思路,还附上尚未修复的 MCP Apps RCE 细节。

  2. LlamaIndex:产品、工程与评测62

    LlamaIndex 深入解析 LiteParse 将 PDF 转为文本的网格投影算法

    LlamaIndex 详解其开源 PDF 解析工具 LiteParse 的网格投影算法核心原理。PDF 只存储文本内容和绘制坐标而无阅读顺序,算法通过提取左、右。

    推荐理由:LiteParse 官方拆解其网格投影算法的设计取舍与实现细节,读者可以了解 PDF 文本提取如何用对齐锚点保留表格和多栏结构。

  3. Cognition 模型 / Devin 博客(网页)72

    Cognition 复盘多智能体实践:写操作单线程加辅助智能体才真正有效

    Cognition 发布长文复盘,称自《Don't Build Multi-Agents》十个月后,其多智能体系统已在生产中可用,核心模式是写操作保持单线程、其他智能体只贡献智能。

    推荐理由:作者基于自家生产环境实验总结多智能体落地模式,给出干净上下文评审、跨模型路由等可迁移的工程经验。