跳到正文

全部动态

今日 5 条
4月22日周三
  1. PromptArmor:Threat Intelligence73

    PromptArmor 发布 Cursor 安全实践指南,披露未修复的 MCP Apps RCE 漏洞

    PromptArmor 发布 Cursor 安全实践者指南,梳理其威胁模型:不可信输入(代码、工单、网页、MCP 输出)与可信操作(shell 执行、文件写入、Git、MCP 工具调用)之间的间接提示词注入风险,并针对 Auto-Run、插件供应链、Bugbot、Automations、沙箱和子处理器给出管理端配置建议。

    推荐理由:作者基于自身披露经历梳理 Cursor 的威胁模型,并给出可落地的管理端配置与治理思路,还附上尚未修复的 MCP Apps RCE 细节。

  2. Cursor Blog68

    Cursor与SpaceX就模型训练达成合作

    智能编程助手Cursor宣布与SpaceX合作,以突破算力瓶颈,加速其模型训练进程。该公司在不到半年内快速迭代了Composer系列模型:首款智能编码模型Composer问世后,Composer 1.5将强化学习规模扩大20倍以上,而Composer 2通过持续预训练,以极低成本达到了前沿性能水平。此次合作将使Cursor团队利用xAI的Colossus基础设施,大幅提升训练规模,从而显著增强模型的智能水平。

    推荐理由:Cursor 抱上 xAI 的算力大腿,意味着 AI 编程工具的竞争正式进入「谁的 GPU 多」阶段。对开发者来说,Composer 系列模型接下来的进化速度会明显加快,值得持续关注。

  3. Anthropic:Research(发表成果 · 网页)74

    从8.1万用户调查看AI经济学:职业暴露度与替代担忧

    一项针对8.1万名Claude用户的调查显示,从事AI高暴露职业(如软件工程师)的从业者对岗位替代的担忧显著更高,其中早期职业者焦虑感尤为突出。约五分之一受访者明确表达失业忧虑,且职业AI暴露度每增加10%,感知到的岗位威胁就上升1.3%。在生产力方面,受访者平均自评生产力增益较高,最高薪与最低薪群体报告了最大幅度的效率提升,主要体现在工作范围拓展。值得注意的是,从AI中获得速度提升最大的人群,对岗位替代的担忧反而更强烈。

    推荐理由:Anthropic 对 81000 名用户的调查,第一次把 AI 暴露度和就业焦虑直接挂上钩了,高收入者和早期职业者两头挤压,这个数据比任何猜测都硬。

  4. LlamaIndex:产品、工程与评测62

    LlamaIndex 深入解析 LiteParse 将 PDF 转为文本的网格投影算法

    LlamaIndex 详解其开源 PDF 解析工具 LiteParse 的网格投影算法核心原理。PDF 只存储文本内容和绘制坐标而无阅读顺序,算法通过提取左、右。

    推荐理由:LiteParse 官方拆解其网格投影算法的设计取舍与实现细节,读者可以了解 PDF 文本提取如何用对齐锚点保留表格和多栏结构。

  5. Cognition 模型 / Devin 博客(网页)72

    Cognition 复盘多智能体实践:写操作单线程加辅助智能体才真正有效

    Cognition 发布长文复盘,称自《Don't Build Multi-Agents》十个月后,其多智能体系统已在生产中可用,核心模式是写操作保持单线程、其他智能体只贡献智能。

    推荐理由:作者基于自家生产环境实验总结多智能体落地模式,给出干净上下文评审、跨模型路由等可迁移的工程经验。

  6. Augment Code 博客(网页)77

    Augment Code 实测什么样的 AGENTS.md 才对编码 Agent 有效

    Augment Code 从自家 monorepo 抽取数十个 AGENTS.md 文件,用内部评测 AuggieBench 对比有无该文件时 Agent 完成任务的表现,发现最好的文件带来相当于从 Haiku 升级到 Opus 的质量提升,最差的输出比没有文件还糟,同一文件在不同任务上可相差 30%。

    推荐理由:Augment Code 用内部评测量化了不同 AGENTS.md 写法对代码生成质量的影响,给出的模式与失败案例可以直接迁移到自己的代码库。

4月21日周二
  1. Gary Marcus:The Road to AI We Can Trust(RSS)60

    请不要相信你的聊天机器人提供的医疗建议

    四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。

    推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。

  2. Cursor Blog55

    保持 Cursor 应用稳定

    Cursor 团队针对用户全天依赖应用、崩溃影响严重的问题,聚焦内存不足导致的崩溃。通过为多进程架构设计细粒度监控系统,实时追踪版本发布后的崩溃指标。采用双重调试策略:自上而下关联功能与崩溃数据,监控大消息负载;自下而上通过崩溃观察服务、堆快照等定位根本原因。自2月底以来,全版本会话OOM率下降80%,自3月1日起请求OOM率下降73%。具体措施包括处理大文件加载和修复资源泄漏,以应对突发与渐进性内存耗尽。

    推荐理由:Cursor 把自家 OOM 问题的排查方法论完整公开了,自顶向下加自底向上的双线调试思路对做桌面端 Agent 产品的人有参考价值,但本质上是工程复盘而非行业事件。

  3. Nathan Lambert:Interconnects(RSS)60

    解读当前开放与封闭模型的性能差距

    文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。

    推荐理由:Nathan Lambert 把开源闭源差距从单一数字拉回到任务演化的动态里,做产品的人读完后会对那些追赶 benchmark 的宣传多一层怀疑,值得一读。

  4. Moonshot AI:Kimi Blog81

    Kimi K2.6:推动开源编程发展

    Kimi发布K2.6版本,专注提升开源编程能力。新版本在代码生成与理解方面实现优化,发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局,通过改进编程辅助功能,为开源社区提供更高效的代码编写支持。

    推荐理由:Kimi K2.6 把长程编程和 Agent Swarm 能力带到了开源模型里,那几个 12 小时自主优化、13 小时重构旧代码库的工程案例比基准表更有说服力,做 Agent 的可以认真看看。

  5. METR:Notes(网页)62

    METR 分析 NanoGPT speedrun 中 AI 智能体对 AI 研发加速的证据

    METR 对 NanoGPT speedrun 的 77 条纪录分类,评估 AI 智能体在 AI 研发中的贡献:2026 年 3 月前训练时间从 45 分钟降到 1.43 分钟,31 倍加速,其中浅层与中层优化贡献约 21 倍。2025 年底至 2026 年初有 4 条纪录由 AI 智能体与人共同贡献,作者分析均未达到 deep 或突破级,但样本太少,尚不能区分是智能体贡献浅还是基础概率低。

    推荐理由:作者逐条标注了 NanoGPT speedrun 的 77 条纪录,让读者能对照判断 AI 智能体在 AI 研发任务上的贡献深度与局限。

4月20日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库69

    DR-Venus:基于开放数据的边缘级深度研究智能体

    DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。

    推荐理由:4B 参数、仅用 1 万条公开数据就能在多个 deep research benchmark 上碾压 8B 对手,蚂蚁 inclusionAI 这次证明了小模型做 Agent 的关键不在参数量而在数据管线,做端侧 Agent 的团队值得拆一下它的 SFT+RL 流程。

  2. 英国 AI Security Institute:Blog(网页)63

    AISI 实验显示沙箱中的 OpenClaw Agent 能推断出评估环境信息

    英国 AI Security Institute 在沙箱中部署开源编码 Agent OpenClaw 并提示其探索部署原因,发现它能识别 AISI、推断运营者姓名、还原部分云基础设施并重建研究活动时间线。

    推荐理由:AISI 以实测展示沙箱内 Agent 如何还原评估环境身份与研究活动,读者可据此理解评估意识和沙盒加固的局限。

4月17日周五
  1. Anthropic:Newsroom(网页)75

    Anthropic Labs 推出 Claude Design

    Anthropic Labs 推出 Claude Design,由 Claude Opus 4.7 驱动的视觉设计工具,面向 Claude Pro、Max、Team 及 Enterprise 订阅者开放研究预览。用户可通过对话快速创建设计原型、幻灯片及营销物料,支持自动应用企业设计系统、多格式导入导出,并能与 Claude Code 无缝衔接。据 Brilliant 反馈,复杂页面设计从 20 余条提示缩减至 2 条,设计到生产周期从数周缩短至单次对话。

    推荐理由:Anthropic 把 Claude 变成了设计协作工具,从草图到代码的链路打通,对非设计师做原型是个实用入口,但能否撼动 Figma 还早。

  2. Linear:Now(RSS)61

    设计不是产出:AI 工具无法替代对问题的理解

    设计行业常将“设计”误解为产出界面或代码的行为,但真正的核心在于理解问题本身,找到形式与上下文的良好匹配。AI 工具能快速生成看似精美的输出,却往往绕开对底层问题的深入探索,导致产品表面光鲜但实际使用中脆弱、缺乏整合。设计仍需判断、对话、张力与时间,其价值在于通过动手工作逐步获得理解,而非仅仅依赖生成结果。

    推荐理由:这篇文章直指AI设计工具的误区,生成界面不等于做设计。真正难的是理解问题而不是产出视觉形式,做产品的都该读一读。

  3. 蚂蚁 inclusionAI:GitHub 新仓库56

    inclusionAI发布LLaDA2.0-Uni模型

    LLaDA2.0-Uni是一个统一的多模态模型,具备对世界的理解与生成能力。该模型通过整合视觉、语言等多模态信息,实现了跨模态的语义理解和内容生成。其架构支持从图像理解到文本生成、跨模态检索等复杂任务,标志着多模态人工智能向更通用、统一的方向演进。

    推荐理由:蚂蚁 inclusionAI 推出 LLaDA2.0-Uni,主打理解与生成统一架构,但距发布已过两周且信息极少,建议等官方技术报告出来再决定是否跟进。

  4. xAI:News(网页)72

    Grok语音转文本与文本转语音API发布

    xAI发布Grok语音转文本(STT)与文本转语音(TTS)两款独立API,采用与Grok Voice、Tesla及Starlink相同技术栈。STT支持批量(0.10美元/小时)与实时流式(0.20美元/小时)转录,电话实体识别词错率仅5.0%,整体6.9%,优于竞品,支持25种以上语言及说话人分离。TTS定价4.20美元/百万字符,可通过[laugh]等标签精细控制情感语调。

    推荐理由:xAI 把 Grok 的语音能力拆成独立 API 放出,STT 在实体识别上碾压几个老牌竞品,定价也不算贵,做语音 agent 的可以直接加进方案里对比。

  5. Google Blog:AI(RSS)72

    Chrome 推出 AI Mode:全新的网页探索方式

    Chrome 浏览器今日升级 AI Mode 功能,通过人工智能技术深度改变用户与网页的交互方式。此次更新提供了全新的网络探索体验,将传统浏览行为转变为智能化交互模式,使用户能够更高效地获取和处理网络信息,标志着 Chrome 在浏览器 AI 化进程中的重要进展。

    推荐理由:在Chrome里直接侧边栏浏览搜索结果,不用反复切标签,对天天用搜索的人是个小但实在的改进。

  6. Google Developers Blog(RSS)67

    A2UI v0.9:便携、框架无关的生成式UI新标准

    A2UI v0.9发布了一个框架无关的新标准,旨在帮助AI代理依据公司现有设计系统,实时生成定制化的UI组件。本次更新通过提供全新的Python版Agent SDK、共享的Web核心库,以及对React、Flutter和Angular等渲染器的官方支持,显著简化了开发体验。该版本将UI意图与具体平台解耦,实现了生成式界面在Web和移动应用间的无缝、低延迟流式传输。通过集成AG2和Vercel等更广泛的生态系统,A2UI v0.9致力于推动生成式UI从实验演示走向可用于生产环境的成熟产品。

    推荐理由:Google 把生成式 UI 推向标准化,A2UI v0.9 让代理能用任何组件库实时生成界面,前端开发者不用换轮子就能玩起来,这是 AI 应用落地的关键拼图。

  7. Google Blog:AI(RSS)71

    Gemini 应用推出个性化图像创建新功能

    Nano Banana 2 现支持结合个人上下文与 Google Photos 数据生成图像,通过分析用户独特的生活场景,创建反映个人经历的个性化视觉内容。该功能已在 Gemini 应用中上线,使 AI 图像生成能够基于真实生活语境,输出更贴合用户个人故事的定制化结果。

    推荐理由:Gemini把个人照片和偏好直接揉进图像生成,不用再写长篇提示,对想快速出个人化图片的用户挺实用,可惜目前只对美国部分订阅者开放。

4月16日周四
  1. Anthropic:Newsroom(网页)79

    Claude Opus 4.7 正式发布

    Claude Opus 4.7 全面上线,在高级软件工程任务上实现重大飞跃,93项编码基准测试解决率较 Opus 4.6 提升 13%,并首次解决四项前代无法完成的难题。新版本支持更高分辨率图像识别,在研究代理基准测试中总分达 0.715,长上下文性能表现最为稳定。模型定价维持每百万输入 token 5 美元、输出 25 美元不变。出于安全考量,其网络攻击能力较 Claude Mythos Preview 有所削弱,并配备自动拦截高风险网络安全请求的防护机制,合法安全研究人员可通过 Cyber Verification Program 申请使用权限。

    推荐理由:Opus 4.7 不是最炫的模型,但多家真实用户反馈指出它在复杂工程任务上的可靠性提升是实打实的,尤其长链自主执行和指令遵循,对开发 Agent 的团队是一次直接的生产力升级。

4月15日周三
  1. Dwarkesh Patel:Podcast & Blog(RSS)79

    黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河

    黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。

    推荐理由:Jensen首次承认没投Anthropic是错判,对华芯片禁运的态度也极其强硬,这期访谈是他近半年最坦诚的战略交底,做硬件和做政策的都该听一遍。

  2. Google Blog:AI(RSS)70

    Gemini 3.1 Flash TTS:下一代表现力AI语音技术

    Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

    推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

  3. Cursor Blog70

    更强AI模型推动开发者转向更高复杂度工作

    一项针对500家公司开发者使用Cursor的八个月研究发现,在Opus 4.5和GPT-5.2等先进模型发布后,人均周AI使用量增长44%。开发者初期用更强模型完成更多同复杂度任务,4-6周后开始转向更高复杂度工作,高复杂度任务量激增68%,远超低复杂度任务的22%。媒体广告、软件工具和金融科技行业增长最为显著。任务分布呈现结构性变化:文档编写、架构设计等管理性任务增长超50%,而UI设计等独立任务仅增15%,表明开发者角色正从代码生成转向代码库管理。研究揭示了类似杰文斯悖论的效应——AI效率提升反而刺激了总需求,并可能创造新的经济活动空间。

    推荐理由:Cursor 拿 500 家公司八个月的真实数据证明了一个反直觉结论,AI 越好开发者用得越多,而且是从做更多简单活慢慢转向啃硬骨头。做 AI 产品的人该认真想想这个杰文斯效应。

  4. Google Developers Blog(RSS)67

    Subagents 已登陆 Gemini CLI

    Gemini CLI 引入了子代理功能,这是一种专门的专家代理,能在独立的上下文窗口中处理复杂或高吞吐量任务,从而保持主会话的快速与专注。用户可通过 Markdown 文件自定义这些代理,并支持并行运行以提高效率。使用 @agent 语法即可轻松调用,实现精准的任务委派。该架构通过将复杂的多步骤执行过程整合为简洁的摘要反馈给主协调器,有效防止了“上下文腐化”。

    推荐理由:Gemini CLI 把 agent 拆成了可自定义的专家小队,developer 可以把自己的开发流程切成可复用的 subagent,并行跑起来对大型代码库的效率提升会很明显。

  5. Cursor Blog69

    在画布中与智能体创建的可视化界面交互

    Cursor新增画布功能,可将信息转化为可视化、可交互的界面,替代难以阅读的长篇文本。智能体能利用画布为真实数据创建仪表盘,或定制带逻辑的交互界面,应用于代码审查、学习库文档乃至管理其他智能体。该功能基于React组件库构建,包含表格、图表等原生组件。在数据密集型任务中尤为高效,例如聚合多源数据生成统一分析图表,或在代码审查中智能分组并优先展示关键变更。Cursor团队已借此显著提升了模型评估分析和复杂问题研究的效率,成为扩展人机协作信息带宽的关键工具。

    推荐理由:Cursor 把 agent 输出从纯文本拉到可交互的可视化画布,PR review、eval 分析这些高频场景立刻能用上。做 coding agent 的同行该想想自己的 agent 输出形态是不是该升级了。

  6. OpenRouter:Announcements(RSS)57

    宣布推出视频生成功能

    OpenRouter平台现已上线视频生成服务。用户可通过单一API接口,直接调用顶级的视频生成模型。这一集成简化了开发流程,使开发者无需分别对接不同厂商,即可便捷地访问和使用当前领先的视频AI模型能力。

    推荐理由:OpenRouter 把视频生成塞进统一 API,对已经在用它做多模型路由的开发者来说是零成本扩展,但对大多数人只是又一个聚合入口,不算必须关注的节点。

  7. Midjourney:Updates(RSS)72

    V8.1 Alpha 发布

    V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。

    推荐理由:Midjourney V8.1 把 HD 模式提速 3 倍且变成默认,对设计师意味着每次出图成本骤降,探索速度接近 draft。加上图像提示回归,实用性跨了一大步。

  8. Claude:Blog(网页)72

    Claude Code 推出 Routines 自动化功能

    Claude Code 发布 routines 研究预览版,支持配置包含提示词、代码仓库及连接器的自动化工作流,可按定时计划(每小时/每晚/每周)、API调用或GitHub Webhook事件触发,并在云端基础设施运行,无需本地电脑保持在线。适用于自动处理积压工单、代码审查、部署验证及告警分类等场景。目前向Pro、Max、Team及Enterprise订阅用户开放,每日运行次数限制分别为5次、15次和25次。

    推荐理由:Claude Code 的 routines 让 AI 助手进入自动值守模式,定时修 bug、响应告警、审查 PR,很可能会改变开发者的工作流,可惜每日运行次数限制让重度用户有点不爽。

  9. Google Blog:AI(RSS)71

    Chrome 推出 Skills 功能:将优质 AI 提示词变为一键工具

    Chrome 浏览器新增 Skills 功能,支持用户发现、保存和重新组合 AI 工作流,实现一键即时复用。该功能可将常用 AI 提示词转化为可重复调用的自动化工具,避免重复输入复杂指令,提升浏览器内的 AI 使用效率。用户能够保存优质提示词并灵活改造,在 Chrome 中快速构建个性化 AI 工具库。

    推荐理由:把AI prompt存成浏览器一键工具,这个思路很直接但确实管用,省掉了每次重新输入的麻烦,对常用AI任务的效率提升是实打实的。

  10. 字节 Seed:Research Papers(网页内嵌数据)66

    字节 Seed 发布 Seedance 2.0 音视频联合生成模型

    字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。

    推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。

4月14日周二
  1. Cursor Blog62

    多智能体系统将GPU内核性能提升38%

    我们与NVIDIA合作,利用自主运行的多智能体系统,在为期三周内对235个真实CUDA内核进行了优化。该系统从零开始构建并优化Blackwell GPU内核直至汇编级别,实现了38%的几何平均速度提升,其中63%的问题超越基线,19%实现超2倍优化。这些内核直接影响AI训练与推理效率,传统上需资深工程师耗时数月乃至数年的优化工作,该系统在数周内即自主完成,并能探索更广阔解决方案空间,突破了人工逐项优化的限制。

    推荐理由:Cursor 把自家多 Agent 系统拉去优化 CUDA 内核,38% 的 geomean 提速不算炸裂,但真正值得看的是它证明了 Agent 可以在无人干预下跑三周啃硬骨头,这对做 Agent 产品的人是个强信号。

  2. PromptArmor:Threat Intelligence64

    PromptArmor 披露 Ramp Sheets AI 提示词注入可外泄财务数据,Ramp 已修复

    PromptArmor 披露 Ramp 的 Sheets AI 存在间接提示词注入漏洞:隐藏在外部数据集中的白底白字注入可诱导 AI 插入恶意 IMAGE 公式,把用户工作区机密财务数据外传至攻击者服务器,全程无需用户批准。

    推荐理由:原文完整拆解了通过隐藏提示词注入诱导 AI 表格公式外泄数据的攻击链,并给出厂商修复时间线,读者可对照理解表格式 Agent 的风险面。

  3. Anthropic:Research(发表成果 · 网页)74

    自动化对齐研究者:利用大语言模型扩展可扩展监督

    Anthropic部署9个Claude Opus 4.6作为自动化对齐研究者(AARs),在弱到强监督框架下自主研究800小时。通过自主提出、测试并优化对齐方案,AARs将性能差距恢复率(PGR)从0.23提升至0.97,成本约1.8万美元。该研究表明当前大模型已能独立开展对齐研究,为解决超人类AI的可扩展监督问题提供了可行路径。

    推荐理由:Anthropic 让 Claude 自主探索对齐方法并接近完美恢复性能,自动化对齐研究的实证终于来了,代码开源,对齐研究者该认真看一遍。

  4. Anthropic:Alignment Science Blog(网页)65

    Anthropic 构建 Automated Weak-to-Strong Researcher,AI 智能体在弱到强监督研究上超越人类基线

    Anthropic 团队构建了基于 Claude Opus 4.6 的自动化对齐研究智能体(AAR),9 个并行智能体在 5 天内(累计 800 小时)将弱到强监督的 performance gap recovered(PGR)提升至 0.97,而两位人类作者花 7 天调优四种先前方法的最好成绩仅 0.23,总成本约 18,000 美元。

    推荐理由:Anthropic 用实测数字说明自动化对齐研究已可落地,还记录了智能体的 reward hacking 手法与工程经验,方法可迁移。

  5. Cognition 模型 / Devin 博客(网页)61

    Cognition 调整 Devin 自助订阅:推出 Free/Pro/Max/Teams/Enterprise 五档并开始对 Ask Devin、DeepWiki、Devin Review 收费

    Cognition 更新 Devin 自助定价,淘汰原 Core 和 Team 计划,改为 Free、Pro($20/月)、Max($200/月)、Teams(用量计费、最低 $80/月)和 Enterprise 定制价。

    推荐理由:官方公布了具体档位价格和老用户迁移安排,想要评估 Devin 采用成本变化的团队可以据此对照现有用法。

4月13日周一
  1. Tomer Tunguz 博客(VC 分析)61

    AI稀缺时代的开端

    AI算力稀缺时代正式开启。Nvidia Blackwell芯片GPU租赁价格涨至每小时4.08美元,两月内涨幅达48%;云服务商CoreWeave涨价20%并将最低合同期从一年延长至三年。Anthropic已将最新模型限制给约40个组织使用,OpenAI因算力不足被迫放弃部分项目。这标志着AI充足时代结束,"价高者得"、关系型销售、被迫多元化成为行业新常态,初创公司面临更严峻挑战。

    推荐理由:Tunguz 把 AI 算力短缺的五个特征讲得很透,关系销售与价格通胀对创业者是核心挑战,虽然文章有点旧,但判断框架仍然有效。

  2. Together AI 研究与产品博客(RSS)62

    Together AI 发布 EinsteinArena,AI 智能体协作刷新 11 项数学问题纪录

    Together AI 发布 EinsteinArena,一个供 AI 智能体在开放问题(从数学起步)上互动、讨论与竞争的平台,包含实时 API、公开排行榜和验证器,已完全开源。

    推荐理由:原文给出了平台机制与真实数学发现案例,读者可以据此了解多智能体协作如何推进开放问题的求解。