跳到正文

全部动态

今日 5 条
6月2日周二
  1. Microsoft AI:官方博客(网页)75

    Microsoft 发布七款新 MAI 模型并推出 Frontier Tuning 微调方案

    微软 MAI 团队发布七款新 MAI 模型,将通过 OpenRouter、Fireworks、Baseten 向开发者开放,并首次允许开发者自行调整模型权重。官方称基于强化学习环境(RLEs)的 Microsoft Frontier Tuning 可让模型学习企业自身工作流,其针对 Excel 微调的 MAI 模型可匹敌 GPT 5.4 且效率最高提升 10 倍。

    推荐理由:微软官方发布七款新 MAI 模型,并给出 Frontier Tuning 微调方案与具体效率数字,读者可据此评估其对企业和开发者工作流的影响。

  2. Anthropic:Transformer Circuits(可解释性研究)63

    Anthropic可解释性研究:区分因果效应相似的特征

    Anthropic可解释性团队介绍了其Circuits研究的新进展。为区分那些激活模式相似但因果效应不同的模型特征,团队提出一种新方法。该方法通过分析特征的下游连接来预测其实际影响,并使用基于共激活统计的TWERA(虚拟权重)对连接进行加权排序。实验表明,借助下游连接信息能更准确地判断哪个特征会引导特定输出。此方法为识别模型内部真正的因果组件提供了新途径。

    推荐理由:做可解释性研究的同学值得读,它用下游连接区分看似相同的特征,比只看激活例子更能预测因果作用,对齐审计里能省不少试错。

  3. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Code-1-Flash 编码模型,基准全面超越 Claude Haiku 4.5

    Microsoft 发布编码模型 MAI-Code-1-Flash,直接用生产环境 GitHub Copilot harness 训练,主打真实开发工作流而非仅优化基准。

    推荐理由:官方说明了用生产环境 Copilot harness 训练和评测的思路,并给出与 Claude Haiku 4.5 的基准对比数据,可据此评估其在真实编码工作流中的价值。

  4. Tomer Tunguz 博客(VC 分析)61

    开放模型的繁荣生态

    根据OpenRouter平台数据,自2025年以来,开放模型使用量显著增长。最新数据显示,开放权重模型产生了69.1%的token使用量,闭源模型为30.9%。新模型的发布会吸引开发者测试,推动token使用量达到新的平台期。开放模型市场内部竞争激烈,领导地位频繁更迭,如DeepSeek的早期优势在2025年末至2026年初被MiniMax与Kimi模型取代,随后MiMo、Qwen、腾讯Hy3、阿里巴巴及Arcee等模型的发布再次改变了份额格局。尽管开放模型目前仍只占推理总量的一小部分,但激烈的竞争与增长表明,开发者正越来越愿意将生产流量路由至开放模型。

    推荐理由:开放模型在OpenRouter上的token份额已到69%,而且每轮新模型发布都会把使用量推上一个台阶,做推理基础设施的应该重视这个信号。

  5. Claude:Blog(网页)77

    Claude Code 新增动态工作流功能

    Claude Code 新增动态工作流功能,允许模型在运行时即兴创建和协调多智能体框架来处理复杂任务。该功能通过执行特定的 JavaScript 文件来生成和协调拥有独立上下文窗口的子代理,可解决单一上下文窗口中长时间执行任务可能出现的智能惰性等问题。工作流适用于研究、安全分析、代码审查等场景,通常消耗更多 token,更适合高价值复杂任务,其最佳实践仍在发展中。

    推荐理由:Claude Code 现在能自己动态生成多代理协调器,这在调试、审查、研究等复杂任务上是个真正的生产力跃迁,但普通编码工作用它反而是杀鸡用牛刀。

  6. Cognition 模型 / Devin 博客(网页)65

    Cognition 推出 Devin Desktop,作为 Windsurf 的下一代产品

    Cognition 宣布推出 Devin Desktop,定位为 Windsurf 的下一代产品,将 Agent Command Center 设为 IDE 默认界面,可在一处管理本地和云端智能体、PR 和上下文。

    推荐理由:官方说明把 Agent Command Center 设为默认界面并开放 ACP,读者可以判断团队向智能体管理迁移时的具体工作流变化。

6月1日周一
  1. Nathan Lambert:Interconnects(RSS)67

    开源与闭源模型在不同的增长曲线上

    当模型智能的微小提升能直接转化为实际价值时,开源与闭源模型正沿着不同的增长路径发展。闭源模型通过在特定场景下提供更高的边际智能来创造价值,而开源模型则在其他维度寻找增长点,两者形成了差异化的竞争格局。

    推荐理由:Lambert 用「不同指数级」框架理解开放与封闭模型的未来分化,观点鲜明且有推演,是近期较值得读的行业判断,投资人、产品人都该看一眼。

  2. Runway:News(网页)61

    Runway 在伦敦设立欧洲总部及世界模型研究中心

    Runway 宣布在伦敦建立新的欧洲总部和专注于通用世界模型的研究中心。公司计划在未来18个月向英国AI生态投资$100M,到2028年投资额将翻倍以上。过去12个月,其在欧洲的订阅销量增长了50%,企业客户占比超20%。新总部将扩大其在欧洲的研究与商业布局,公司正招聘欧洲负责人以组建跨研究、产品、工程和销售的团队,并深化与BBC、Fremantle、WPP等企业的合作。世界模型是其研究的核心,旨在将生成式AI的应用扩展至机器人、科学研究与工业模拟等领域。

    推荐理由:Runway 把世界模型研发带到伦敦并承诺 1 亿美元投资,不是新品但战略意义清晰,欧洲的视频创作者和工业仿真团队离顶尖工具更近了,做影视、游戏和机器人的可以关注后续落地。

  3. Cursor Blog64

    Cursor Teams计划定价方案更新

    Cursor Teams计划推出三项更新:增加Composer特定使用池,将第一方模型(Composer和Auto)与第三方API的使用额度分开计费;推出Premium席位,提供5倍于标准席位($40/月)的使用量,价格为$96/月(年付);仪表盘现可实时显示用户额度使用情况,管理员可通过Slack或邮件配置智能提醒。

    推荐理由:Cursor这个定价更新把「用不用得起第三方模型」的问题从团队开支里切出去了,标准席位加量不加价,重度用户直接上Premium可能比现在更划算,做Agent开发的团队不妨算算账。

  4. Runway:News(网页)55

    介绍Cosmos Coalition

    Runway宣布作为创始成员加入Cosmos Coalition,该联盟与NVIDIA及多家领先AI实验室合作,旨在构建并开源面向物理AI的前沿世界模型。首个项目将由Runway与NVIDIA共同开发一个基础模型,以推动下一代开放世界模型的研究与发展。

    推荐理由:Runway 和 NVIDIA 等联手成立 Cosmos Coalition,要开源世界模型,这份声明是视频生成和物理 AI 走向基础设施化的信号,但眼下没有可用的模型或代码,更像一份生态宣言。

  5. MiniMax:Blog(网页)83

    MiniMax M3:前沿编码、100万token上下文与原生多模态一体模型

    MiniMax M3 是一个开源前沿模型,具备先进的编码与AI智能体能力。它支持100万token的超长上下文窗口,并采用名为MSA(MiniMax Sparse Attention)的新型稀疏注意力架构。该架构使模型在100万token上下文下的每token计算成本降至前代的1/20,预填充速度提升9倍以上,解码速度提升15倍以上。在SWE-Bench Pro编码基准上,MiniMax M3得分59.0%,超越GPT-5.5和Gemini 3.1 Pro,性能接近Opus 4.7。该模型可通过MiniMax Code、Token Plan和API服务使用。

    推荐理由:MiniMax M3 把开源模型的编码能力推到了 GPT-5.5 和 Opus 4.7 这条线上,还附带 1M 上下文和原生多模态,这是开源社区真正能打的前沿选项,做 Agent 的值得立刻跑一下。

  6. Qwen:Blog Retrieval(API)81

    Qwen3.7-Plus:多模态智能体模型发布

    阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenWorldBench 62.1,GPQA Diamond 90.3,MMLU-Pro 88.5。通过阿里云 Model Studio API 提供。

    推荐理由:Qwen3.7-Plus 把视觉感知、GUI 操作和编码能力整合进同一个 agent 模型,在 ScreenSpot 和浏览器操作上的提升很实在,做自动化的开发者值得上手试试。

  7. OpenRouter:Announcements(RSS)71

    OpenRouter 5月发布亮点:语音与转录API、模型融合及20款新模型

    OpenRouter 发布5月更新,推出语音与转录API、模型融合功能、私有模型支持和企业工作区控制,并新增20款模型,包括Gemini 3.5 Flash和Claude Opus 4.8。

    推荐理由:OpenRouter 这次月度发布把安全护栏、多模型融合和语音 API 全补上了,Model Fusion 和 Pareto Code Router 对做 agent 的团队尤其实用,成本控制与质量权衡变得更直接。

  8. Tomer Tunguz 博客(VC 分析)62

    AI看跌情绪地图

    金融市场对AI的看跌情绪正从整体上升转向板块分化。上季度,软件、半导体、云及超大规模公司的空头比例中位数上升约24%。GPU数据中心业务空头股份在过去一年激增60%。AI云与新型云公司的当前空头比例中位数最高,达16.8%,SaaS与开发工具领域随后,分别为9.5%和8.9%。相比之下,超大规模公司和NVIDIA的空头比例极低,仅为1.1%和1.2%。市场怀疑主要针对那些AI业务仍依赖未来资本、需求或运营杠杆的中小型公司。

    推荐理由:这份AI做空地图把市场怀疑论的矛头指向了谁说得明明白白,GPU云和AI SaaS被看空得最狠,但NVIDIA和超大规模云商几乎没被碰,做投资或者关心谁在裸泳的可以认真看看。

  9. OpenRouter:Announcements(RSS)77

    OpenRouter 5月发布亮点

    OpenRouter 发布5月更新,推出语音与转录API、模型融合(Model Fusion)功能,并为平台添加了私有模型和企业工作区管控能力。此次更新共上线20个新模型,其中包括 Gemini 3.5 Flash 和 Claude Opus 4.8。

    推荐理由:OpenRouter 五月交付了一整套平台级能力,从安全护栏到语音 API 再到模型融合,Pareto Code Router 按质量阈值选廉价模型这个思路,对 coding agent 的成本控制很实用。如果你重度依赖 OpenRouter,这次更新值得细读。

  10. xAI:News(网页)78

    xAI发布Composer 2.5

    xAI的最新编程模型Composer 2.5现已在Grok Build中可用,用户可通过`/models`菜单选择使用。这是一款快速、先进的模型,擅长处理长时间运行的任务和复杂指令。该模型面向SuperGrok和X Premium+用户开放。

    推荐理由:xAI 的 Composer 2.5 主攻长任务和复杂指令,如果你在用 Grok 搭 Agent,这模型值得切过去试试,可能比之前的编码模型更稳。

  11. Anthropic:Newsroom(网页)86

    Anthropic 保密向 SEC 提交 S-1 草案

    Anthropic, PBC 今日保密向美国证券交易委员会提交了 S-1 表格草案,计划进行普通股的首次公开发行。这使其在 SEC 完成审核后拥有上市的选择权。IPO 的具体发行股数和价格尚未确定,将取决于市场条件等因素。公司近期刚完成由 Altimeter Capital 等领投的 650 亿美元 H 轮融资,估值达 9650 亿美元,并发布了 Claude Opus 4.8 模型。

    推荐理由:Anthropic 秘密提交 IPO 申请,是继 OpenAI 之后最值得盯的 AI 公司上市信号,不管最终定价多少,都会重新校准整个行业的估值坐标系。

  12. Dario Amodei:Blog(网页)56

    Anthropic CEO Dario Amodei:AI指数级发展呼唤政策紧急应对

    Anthropic CEO Dario Amodei 发表博客指出,AI 以指数级速度发展——四年内模型从勉强写出一行连贯代码到编写主流 AI 公司的大部分代码,而政策制定周期却极其缓慢。Claude Mythos Preview 证明了前沿模型对网络安全构成真实威胁,可能冲击金融、关键基础设施和国家安全。Amodei 认为生物风险与 AI 自主风险即将接踵而至,呼吁全球重新审视监管、宏观经济、科学创新、国家权力和地缘政治五大领域。Anthropic 同日发布了前沿模型测试立法提案和就业替代政策框架,并承诺提供实质性资金支持。

    推荐理由:虽然是十天前的文章,但 Dario 的长文仍是理解 AI 政策方向最完整的框架,还附带了立法提案,做安全或监管的产品人该细读。

5月30日周六
  1. Claude Code:GitHub Releases(RSS)67

    v2.1.157 更新

    此版本主要改进了插件系统,现可自动加载 `.claude/skills` 目录中的插件,并通过 `claude plugin init` 创建;`/plugin` 命令增加了自动补全。`claude agents` 现在会应用 `settings.json` 中的 `agent` 字段,并支持 `--agent` 参数覆盖。更新修复了多个具体问题,包括处理不可用图片导致的崩溃、在 tmux 中的剪贴板复制失效(2.1.153 回归)、后台会话恢复后日期不正确等。此外,优化了长对话及恢复对话的性能,并改进了在 VS Code、Cursor 和 Windsurf 等 IDE 中的体验。

    推荐理由:Claude Code 这个版本把插件从市场限制中解放出来,自动加载本地 skills 目录,对喜欢自己鼓捣定制工作流的开发者是个实实在在的便利。

  2. Google Blog:AI(RSS)55

    参与我们的 I/O 2026 测验:该测验由 Google AI Studio 氛围编程生成

    Google 使用其开发工具 Google AI Studio,通过氛围编程(vibe coding)方式,创建了一个关于 Google I/O 2026 主要公告的在线测验。

    推荐理由:Google 用 AI Studio 自己 vibe code 了个 I/O 测验,是想展示普通人也玩得转,但 quiz 本身信息量不大,想体验 vibe coding 的可以顺手玩玩。

  3. OpenRouter:Announcements(RSS)77

    OpenRouter融合预算模型性能超越GPT-5.5与Claude Opus 4.7

    一组预算模型通过OpenRouter平台进行模型融合,在包含100个复杂研究任务的评估中,得分超过了GPT-5.5与Claude Opus 4.7。

    推荐理由:OpenRouter 的 Fusion 功能把模型融合做成了 API 调用,实测用便宜模型组合就能逼近 Fable 5 的性能,成本却只有一半,这对做复杂推理和深度研究的开发者来说是个很实用的新工具。

  4. Google Blog:AI(RSS)74

    Gemini Omni 与 Gemini 3.5 的 11 个实战展示

    Google 在 2026 年 Google I/O 大会上发布了新一代多模态模型 Gemini Omni 与 Gemini 3.5,并同步提供了 11 个视频,集中演示了这两款模型在实际场景中的能力。

    推荐理由:Google 官方放出的这组视频演示,直接展示了 Gemini Omni 和 3.5 的实际表现,比参数和 benchmark 更直观,做多模态应用的可以逐帧研究。

5月29日周五
  1. OpenRouter:Announcements(RSS)70

    OpenRouter Guardrails 发布:可配置安全与治理工具,保护 AI 智能体、数据与成本

    OpenRouter 推出 Guardrails,一套可配置的安全与治理工具,支持预算执行、零数据保留、模型与提供商限制、提示词注入防御及数据丢失防护等策略,用于保护 AI 智能体、数据和成本。

    推荐理由:OpenRouter 这波补上了 API 代理的安全短板,提示注入防御和 DLP 直接堵住了企业用户最担心的两个口子,配置方式也足够灵活,做 agent 的团队值得立刻上。

  2. OpenRouter:Announcements(RSS)69

    Guardrails:保护你的智能体、数据与成本

    Guardrails 是一套可配置的安全与治理工具,提供预算执行、零数据保留、模型与提供商限制、提示词注入防御及数据丢失预防等功能,旨在保护智能体(Agents)、数据与控制成本。

    推荐理由:OpenRouter 把预算管控、注入防御和敏感信息脱敏打包成一套 guardrail 配置,让投喂给 Agent 的流量有了护栏,用 OpenRouter 做生产级应用的团队可以立刻用上,不用自己搞中间件。

  3. Qwen:Blog Retrieval(API)66

    Qwen-VLA:从理解世界到付诸行动

    通义千问推出通用视觉-语言-动作模型Qwen-VLA,基于Qwen多模态骨干,将视觉感知、语言理解与空间推理扩展至连续动作生成和轨迹预测。训练分四阶段:文本到动作预训练(T2A)、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在LIBERO上达97.9%,Simpler-WidowX达73.7%,RoboTwin-Easy/Hard达86.1%/87.2%,匹配或超越专精模型。数据涵盖超10,000小时公共机器人轨迹、1,000+小时内部真实轨迹及800万+合成仿真轨迹。

    推荐理由:Qwen-VLA 把机器人操作、导航和跨实体控制统一进一个模型,在多个基准上打平甚至超越专用模型,这是通用具身智能的一个重要信号,但离实际可用还有距离。

  4. Tomer Tunguz 博客(VC 分析)65

    技能提炼

    “技能提炼”是一种知识转移方法,由前沿大模型(如 Opus 4.7、GPT-5.1、Gemini 3 Pro)负责撰写并优化标准化的 SKILL.md 流程文件。然后,本地运行的小模型(如 Qwen 35B、Gemma 26B)直接执行这些文件。此过程不同于压缩模型权重的知识蒸馏、训练权重的指令微调或检索事实的 RAG,其核心是提取并转移操作流程,让小模型按步骤执行,从而形成前沿模型作教师、小模型作执行者的循环。

    推荐理由:Tomer 把个人代理的完整工作流摆了出来,用大模型写 skill 小模型执行,这条蒸馏思路比调 prompt 高级,想认真跑本地代理的人该盯一下。

  5. Claude Code:GitHub Releases(RSS)73

    Claude Code v2.1.154 发布:新增 Opus 4.8 与动态工作流

    Claude Code 更新至 v2.1.154 版本,正式引入 Opus 4.8 模型。新功能包括“动态工作流”,可通过 `/workflows` 指令让 Claude 在后台编排数十到数百个 AI 智能体协同处理复杂任务。Opus 4.8 的快速模式现已可用,成本降低为 2 倍标准费率可实现 2.5 倍速度提升。其他更新有:精简系统提示词成为默认设置(除 Haiku、Sonnet 及 Opus 4.7 及更早版本外),优化多选题决策逻辑,简化 `/simplify` 命令。此次更新修复了包括后台会话管理、终端渲染在内的多个 bug,并增强了自动模式对数据外泄的检测能力。

    推荐理由:Claude Code 这版把多 agent 编排做成了产品功能,动态工作流让一个 prompt 能调度上百个 agent,再加上 Opus 4.8 快速模式只要 2 倍价格,做复杂任务的开发者可以试一下。

  6. LMSYS:Blog(Chatbot Arena 团队)61

    LMSYS与Intel合作通过异构CPU+GPU EPD架构提升视觉语言模型服务性能

    LMSYS团队(Intel与SGLang)通过Dynamo和SGLang框架,为视觉语言模型(VLM)启用了异构编码-预填充-解耦(EPD)架构。该方案将视觉编码任务从GPU卸载至CPU(如Intel Xeon 6747P),与GPU协同工作。在Qwen3-VL-8B-Instruct模型的测试中,采用4 CPU + 1 GPU作为编码器、4 GPU作为预填充解码器(能力比R=12)的配置,在ISL/OSL 128/256、1080p 8张图像的负载下,实现了P99 TTFT和请求吞吐量约1.2倍至1.3倍的提升,并将P99 TPOT降低了约1.3倍至30倍。

    推荐理由:做VLM服务部署的可以认真看一下,用CPU头节点做异构EPD分离,几乎零成本换来了TTFT和TPOT的显著提升,有完整脚本和benchmark,能直接上手试。

5月28日周四
  1. Google Developers Blog(RSS)64

    社区如何利用Tunix和TPU训练Gemma学会“思考”

    Google在Kaggle举办的Tunix黑客马拉松,挑战开发者利用TPU和有限算力,将小型基础模型转变为通用推理引擎。获胜团队通过多阶段后训练流程实现了这一目标,该流程结合了监督微调(SFT)与GRPO、SimPO等先进对齐技术。比赛结果表明,社区能够借助开源资源成功训练出高能力的结构化推理模型。

    推荐理由:Google 官方比赛总结,证明用 Kaggle TPU 和开源工具就能把 Gemma 训练出不错推理能力,对想自己微调模型的小团队是个实用参考。

  2. OpenRouter:Announcements(RSS)63

    OpenRouter 完成 1.13 亿美元 B 轮融资

    OpenRouter 宣布获得 1.13 亿美元 B 轮融资,由 CapitalG 领投,NVentures、ServiceNow Ventures 等多家机构参投,现有投资者 Andreessen Horowitz 和 Menlo Ventures 继续跟投。

    推荐理由:OpenRouter融了1.13亿美元,领投方CapitalG,跟投名单里几乎全是云计算巨头,这不是一家公司的钱,是基础设施层的一次战略布局,开发者选模型的路由成本可能因此改写。

  3. ElevenLabs:Blog(网页)62

    ElevenLabs 发布 Dubbing v2 AI 配音模型,保留原始情感表演并支持 90+ 语言

    ElevenLabs 发布 Dubbing v2 AI 配音模型,通过直接以原说话者的表演为条件生成语音,保留语气、节奏、停顿和情感意图,并同步适配到 90+ 语言的口语表达。

    推荐理由:原文说明了模型直接基于原表演生成配音的思路,以及面向创作者、营销团队和工作室的不同入口,可用于判断是否替代现有配音流程。

  4. OpenRouter:Announcements(RSS)72

    OpenRouter 获得1.13亿美元B轮融资

    AI模型聚合平台OpenRouter宣布完成1.13亿美元B轮融资。本轮融资由CapitalG领投,NVentures、ServiceNow Ventures等多家机构参投,现有投资者Andreessen Horowitz与Menlo Ventures也参与了本轮融资。

    推荐理由:OpenRouter 融了 1.13 亿美元,说明模型路由从「小工具」变成正经防线了,开发者选模型不再单一绑定,这个方向钱和战略意义都上来了。

  5. Claude Code:GitHub Releases(RSS)67

    Claude Code v2.1.153 版本更新

    Claude Code 发布 v2.1.153 版本。主要新增 `skipLfs` 选项以跳过 Git LFS 下载;优化了 `claude agents` 的自动补全建议和 PR 列显示格式。本次更新修复了大量问题,包括:MCP 服务器的连接与重连、子代理的配置策略与严格模式行为、后台会话的管理与权限提示(如恢复、输入响应、临时文件处理),以及跨 macOS/Windows/VSCode 平台的稳定性。此外,还修复了 Windows 更新回滚、内存占用、会话恢复等多个具体问题。`/model` 命令现在会将选择设为新会话的默认模型。

    推荐理由:Claude Code 的一次日常小修小补,但修复了 OAuth 凭证泄露和内存泄漏这种真影响使用的 bug,且 /model 现在可以记住默认模型了,升级一下不亏。

  6. xAI:News(网页)82

    Grok Build 0.1 on API

    xAI 的最新编码模型 Grok Build 0.1 已通过 xAI API 进入公开测试阶段。该模型专为智能体编码任务训练,支持网页开发、调试和 MCP,同时也是驱动 Grok Build CLI 的同一模型。其推理速度超过 100 tokens/秒,定价为输入 $1/m tokens,输出 $2/m tokens。除编码外,它也适用于通用智能体及工具调用场景,并可通过 OpenRouter 和 Vercel AI Gateway 获取。

    推荐理由:xAI 把编码模型卷到了 100+ t/s 和 $2/M 输出,专攻 agentic coding,这是直接在叫板 Claude Code 和 Cursor,做开发工具的同行该重新算账了。

  7. vLLM 官方博客(RSS)60

    vLLM 推出原生 RL 权重同步 API 并修复异步 RL 死锁

    vLLM 引入原生权重同步 API,将 RL 训练器到推理引擎的权重传输标准化为初始化、开始、更新、结束四阶段,采用可插拔 WeightTransferEngine 抽象,目前支持 NCCL 和 IPC 两种后端并支持 packed tensor 优化。

    推荐理由:vLLM 官方说明原生权重同步 API 的四阶段设计与 DPEP 死锁修复,对搭建在线 RL 训练流程的团队有直接参考价值。

  8. Tomer Tunguz 博客(VC 分析)61

    AI智能体时代下的安全变革

    Lemonade的CISO Jonathan Jaffe探讨了AI智能体时代的安全新挑战。他指出,AI对攻击者和防御者同样强大,但可被利用的漏洞窗口正在缩小,因为AI能更快地生成、审查和修补代码。为此,安全团队正向工程团队转型,例如Lemonade的安全部门均由工程师组成,并构建了包含智能体的内部AI平台。同时,每个智能体(单个终端上可能运行200到10000个)都需要被赋予身份,并在操作点由策略进行更复杂的管控,这超越了当前身份与访问管理系统的能力。

    推荐理由:Jaffe 给出的结论很提气,AI 对防御方的加成被市场严重低估了,尤其每个 Agent 必须拥有身份和策略控制这个预判,值得所有在做 Agent 架构的人看一遍。

  9. Midjourney:Updates(RSS)59

    Web 更新

    对话模式在文本和语音输入方面进行了改进。语音会话开始时,可访问用户的图像提示、风格参考、侧边栏设置和最近任务。图像提示功能现可从托盘和侧边栏直接使用。在语音提交过程中,托盘中的图像将保持不变,直至用户手动移除。

    推荐理由:Midjourney给语音模式补了一课——现在它能记住你正在用的图片参考和风格设置,语音创作不用反复翻找,用完即走的轻量用户可能无感。

  10. Hugging Face:Blog(RSS)70

    ITBench-AA:前沿大模型在首个智能体企业IT任务基准测试中得分均低于50%

    由Artificial Analysis和IBM推出的ITBench-AA SRE基准测试显示,所有前沿大模型得分均未超过50%。Claude Opus 4.7(自适应推理,最大努力)以47%领先,GPT-5.5(xhigh)和Qwen3.7 Max分别得46%和42%。该测试包含59个需要通过Shell命令调查Kubernetes事件快照并提交根因诊断的智能体任务。关键发现是模型推理轮次差异近3倍,但更长的轨迹并不转化为更高准确率,过度调查的模型会因提交误报而受罚。在成本方面,开源模型Gemma 4 31B(Reasoning)以每任务$0.14的成本获得37%得分,优于成本更高但得分更低的闭源模型。

    推荐理由:IT运维这事儿,AI还是新手。ITBench-AA这份基准把Claude Opus 4.7逼到47%,开源模型GLM-5.1却用五分之一成本拿到40%,企业场景性价比可能不在闭源那边。

  11. Liquid AI 模型与工程博客(网页)70

    Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B

    Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B,专为消费级硬件上的快速可靠工具调用打造,Base 和 post-trained 版本已在 Hugging Face 开放。

    推荐理由:官方给出了与上一版和同类模型的对比数据,以及本地部署路径,适合评估端侧工具调用模型的选型。

  12. Claude:Blog(网页)78

    在Claude Code中引入动态工作流

    Claude Code 推出“动态工作流”功能,使 Claude 能端到端处理复杂任务。该功能通过动态编写脚本,在单个会话中并行运行数十到数百个子智能体来完成工作,并会在结果呈现前进行验证。它适用于跨代码库的 bug 查找、大规模迁移(如将 Bun 从 Zig 移植到 Rust)等需要多角度分析的任务。该功能现已在研究预览阶段可用,支持 Claude Code CLI、桌面端、VS Code 扩展以及 API、Amazon Bedrock、Vertex AI 等平台,面向 Max、Team 及已启用的 Enterprise 计划用户。

    推荐理由:动态工作流第一次让 Claude Code 能独立搞定需要并行协调的大规模工程任务,Bun 从 Zig 到 Rust 只用了十一天,这对复杂代码库的维护和迁移是降维打击。