跳到正文

全部动态

今日 8 条
1月23日周五
1月21日周三
  1. Cognition 模型 / Devin 博客(网页)66

    Cognition 发布 AI 代码审查工具 Devin Review

    Cognition 发布 Devin Review,一款针对 GitHub PR 的 AI 代码审查工具,称代码审查已成为 AI 编程时代的瓶颈。

    推荐理由:原文给出三项具体能力和免登录试用入口,读者可以直接对照现有 GitHub 审查流程判断是否值得替换。

12月24日周三
12月18日周四
  1. OpenRouter:Announcements(RSS)61

    Response Healing:将 JSON 缺陷减少 80% 以上

    OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。

    推荐理由:做 Agent 的人最怕 JSON 解析炸掉整个 pipeline,OpenRouter 这个 Response Healing 相当于在网关层加了自动纠错,接入成本几乎为零,值得试试。

12月12日周五
  1. Thinking Machines Lab:News(网页)67

    Thinking Machines Lab 宣布 Tinker 全面开放并支持视觉输入

    Thinking Machines Lab 宣布 Tinker 正式开放(GA),取消候补名单,并新增四项更新:支持微调 Kimi K2 Thinking(万亿参数。

    推荐理由:官方宣布 Tinker 全面开放并新增视觉输入,附上 VLM 与传统视觉基线在少样本分类下的对比数据,可作选型参考。

12月3日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁集团开源AState:面向强化学习的高性能状态管理系统

    蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部署。

    推荐理由:蚂蚁把万亿参数 RL 训练的权重同步从分钟级压到 6 秒,这套 AState 系统是真刀真枪的工程解法,做大规模 RL infra 的团队值得拆一拆它的 RDMA P2P 架构。

11月25日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 上线 Black Forest Labs 的 FLUX.2 多参考图生图模型

    Together AI 将 Black Forest Labs 的 FLUX.2 图像模型接入 Model Library,面向 100 万以上开发者提供多参考输入、hex 色号颜色匹配和文本渲染能力。

    推荐理由:原文列出了多参考输入、hex 色号匹配和三个型号的具体参数,读者可据此判断是否接入现有生成工作流。

  2. LlamaIndex:产品、工程与评测65

    LlamaIndex 发布 LlamaSheets Beta,将杂乱电子表格转为 AI 可用数据

    LlamaIndex 发布 LlamaParse 新 API LlamaSheets(Beta,免费),把任意 .xlsx 电子表格语义化结构为 Parquet 文件,供 Agent 或下游应用使用。

    推荐理由:原文介绍了将杂乱表格转为 Parquet 的多阶段处理方法与接入方式,读者可据此评估是否嵌入自己的表格自动化流程。

11月24日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude开发者平台推出高级工具使用功能,提升AI代理效率

    Anthropic在Claude开发者平台发布三项新功能,以解决传统工具调用消耗大量上下文、易出错的问题。工具搜索工具允许按需加载工具,内部测试中将上下文消耗从约7.7万令牌降至8700令牌,降幅达85%,并将准确率从49%提升至74%。程序化工具调用支持在代码环境中调用工具,减少对上下文窗口的影响,例如Claude for Excel可借此处理数千行数据。工具使用示例则提供了展示工具有效使用方法的通用标准。这些功能共同提升了AI代理处理大规模工具库的能力。

    推荐理由:做 Agent 的人都卡在工具一多上下文就爆、调用就错这两个坑上,Anthropic 这三个功能直接把工具管理从「全塞进去」变成「按需加载+代码编排+示例纠错」,是目前最工程化的解法。

11月18日周二
  1. Inception Labs:Blog(网页)62

    Inception Labs 的 Mercury 扩散大语言模型上线 Azure AI Foundry

    Inception Labs 宣布 Mercury 上线 Azure AI Foundry,将其称为首个商用规模的扩散大语言模型(dLLM)。该模型采用扩散架构并行生成多个 token,推理速度最高达可比自回归模型的 10 倍,官方称其在知识、编码、指令遵循和数学基准上与 Gemini 2.5 Flash、Claude 4.5 Haiku 相当。

    推荐理由:原文给出扩散架构的并行生成原理、与同类模型的延迟和基准对比及许可定价,读者可据此评估实时应用的部署价值。

  2. Manus:Blog(网页)67

    Manus 发布浏览器操作员扩展,可在本地浏览器中执行任务

    Manus 推出浏览器操作员(Browser Operator),一个让 Manus 在用户本地浏览器环境中运行的浏览器扩展,弥补云浏览器无法使用已登录会话的不足。

    推荐理由:官方说明解释了本地浏览器与云浏览器的分工和授权控制方式,读者可以判断这类登录态自动化是否适合自己的工作流。

11月17日周一
  1. ElevenLabs:Blog(网页)62

    ElevenLabs 推出 Image & Video (Beta),整合视觉生成与音频创作

    ElevenLabs 发布 ElevenLabs Image & Video (Beta),将图像和视频生成纳入其创作平台。

    推荐理由:官方宣布音频平台扩展到图像与视频,整合多家视觉模型并在同一工作流完成配音和导出,可关注其统一创作流程的实际体验。

11月4日周二
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 发布 Windsurf Codemaps:AI 生成的代码结构地图

    Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动,生成 AI 标注的代码结构地图,帮助工程师在调试、重构和上手新代码库前理解代码。

    推荐理由:官方介绍了 Codemaps 的入口、模型选择和 Cascade 引用方式,读者可以据此判断它如何用于代码库理解和上下文工程。

10月29日周三
  1. Manus:Blog(网页)65

    Manus 推出 Wide Research,用并行子代理突破上下文窗口限制

    Manus 面向所有订阅者推出 Wide Research,用多个并行子代理替代单模型顺序处理大规模研究任务。主控制器将请求分解为可并行的子任务,每个子代理作为功能齐全的 Manus 实例运行,拥有完整虚拟机、工具库和全新上下文窗口,完成后由主控制器综合结果。

    推荐理由:官方解释了多项目研究中 AI 编造的架构成因,并说明并行子代理如何缓解,可帮助读者判断是否适合自己任务。

10月21日周二
  1. OpenRouter:Announcements(RSS)68

    Provider Variance: Introducing Exacto

    同一AI模型在不同服务提供商上的性能表现可能存在显著差异。为了量化这种“提供商方差”,研究团队推出了Exacto评估平台。该平台通过标准化测试揭示,即使是相同的模型(如GPT-4、Claude或LLaMA),在不同云服务或API提供商处运行时,其输出质量、响应速度和稳定性都可能产生高达30%的波动。这一发现对企业和开发者的模型部署策略具有直接影响,强调在选择服务商时需进行针对性性能基准测试。

    推荐理由:OpenRouter 推出 Exacto,直接回答了开发者最头疼的问题:同一个模型换家供应商跑出来的结果到底差多少。做 Agent 或多模型路由的产品人,这个工具能帮你少踩很多坑。

  2. Together AI 研究与产品博客(RSS)66

    Together AI 上线 40 多个图像与视频生成模型,新增视频生成 API

    Together AI 宣布扩展模型库,通过 Runware 合作集成 20 多个视频模型(含 OpenAI Sora 2、Google Veo 3、Minimax Hailuo、Kling v2.1)和 15 个以上图像模型(含 Google Imagen 4.0 Ultra、Nano Banana、Qwen Image),共 40 多个。

    推荐理由:Together AI 官方给出了 40 多个图像与视频模型的名称、时长和逐模型定价,开发者可据此评估能否用一个平台替代多家供应商。

10月20日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    超越权限提示:让Claude Code更安全、更自主

    Claude Code引入沙盒化技术,通过文件系统与网络双重隔离来增强安全性,并大幅减少权限提示。内部测试显示,该技术将权限提示安全地降低了84%。新推出的沙盒运行时(作为开源研究预览版)允许开发者自定义目录和网络访问权限,使Claude能在限定范围内自主运行命令。同时,网页版Claude Code在云端隔离沙盒中运行,即使遭遇提示注入或代码入侵,也能有效保护Git密钥等敏感凭证不被泄露,从而提升开发安全性与效率。

    推荐理由:Claude Code 的沙箱方案把安全和自主性这对矛盾解开了,权限提示减少 84% 不是数字游戏,是真把 agent 从「每步都要你点确认」变成「在笼子里自己跑」,做 coding agent 的团队该认真看看这套 OS 级隔离思路。

10月17日周五
  1. OpenAI Developers(RSS)68

    OpenAI 展示 Codex 在代码编辑器中的使用方式

    OpenAI 发布视频,演示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的开发工作流。内容涉及 Codex 与 IDE 扩展(codex, IDE extension),视频链接为 https://www.youtube.com/watch?v=sd21Igx4HtA。

    推荐理由:OpenAI 官方演示视频,展示如何把 Codex 接入主流代码编辑器并简化编辑器内工作流。

10月16日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体配备现实世界技能:Agent Skills 开放标准

    Anthropic 推出了“Agent Skills”开放标准,旨在为通用智能体(如Claude)提供可组合、可扩展且可移植的领域专业知识。一个Skill是一个包含指令、脚本和资源的文件夹,其核心SKILL.md文件采用渐进式披露设计,智能体可根据任务动态加载所需信息,从而最小化上下文占用。例如,PDF技能赋予了Claude直接操作PDF表单的新能力。该框架允许用户通过封装和共享程序性知识来定制智能体,无需为每个用例构建碎片化的定制代理。

    推荐理由:Agent Skills 把「给 Agent 喂知识」从手写 prompt 变成了可复用的文件夹协议,做 Claude Code 或 Agent 产品的人现在就该动手试,这比 MCP 更轻量也更贴近日常开发。

  2. Manus:Blog(网页)69

    Manus 发布 1.5 版本,任务完成速度提升近四倍

    Manus 推出 Manus 1.5 与 Manus-1.5-Lite 两个新代理,平均任务完成时间从4月的15分钟缩短到不到4分钟,内部基准测试显示任务质量提高15%、用户满意度提升6%。新版本支持全栈 Web 应用开发(含后端、数据库、用户认证和嵌入式 AI 功能)、更长上下文窗口、团队协作与资料库;Manus-1.5-Lite 向所有用户开放,Manus-1.5 面向订阅用户。

    推荐理由:原文给出任务提速近四倍、质量提升15%等具体数据,以及全栈Web开发和协作等功能细节,读者可据此评估其工作流适用性。

10月7日周二
  1. Anthropic:Alignment Science Blog(网页)71

    Anthropic 开源 AI 安全审计工具 Petri,用智能体自动测试模型对齐行为

    Anthropic 发布开源自动审计框架 Petri(Parallel Exploration Tool for Risky Interactions),用 AI 审计智能体在多轮场景中测试目标模型,工具地址为 github.com/safety-research/petri。

    推荐理由:Anthropic 开源了用 AI 智能体自动审计目标模型行为的 Petri 框架,读者可以直接复用其审计流程和评分维度设计。

10月1日周三
  1. OpenRouter:Announcements(RSS)60

    每月 100 万次免费 BYOK 请求

    所有客户每月可免费获得 100 万次“自带密钥”(BYOK)请求。这一政策将 BYOK 功能从付费服务转变为免费提供的基础配额,大幅降低了企业使用自有密钥管理数据安全的技术与成本门槛。免费额度覆盖了绝大多数中小规模企业的典型月请求量。

    推荐理由:OpenRouter 给 BYOK 用户每月免 100 万次请求,对用自己 API key 跑 Agent 的开发者来说是实打实的成本减免,值得顺手薅。

  2. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy,让 notebook 中 LLM 调用快 60 倍

    Answer.AI 发布开源 Python 包 cachy(pip install pycachy),通过补丁 httpx 的 send 方法,把 Anthropic 和 OpenAI SDK 的 LLM 调用响应自动缓存到本地并在相同请求时复用,无需编写 mock。

    推荐理由:原文给出了补丁原理和提速数据,读者可以直接复用这个零代码缓存方案加速自己的 LLM 测试和 notebook 工作流。

  3. Thinking Machines Lab:News(网页)60

    Thinking Machines Lab 发布语言模型微调 API Tinker

    Thinking Machines Lab 于 2025 年 10 月 1 日发布 Tinker,一个用于微调语言模型的灵活 API,官方处理分布式训练的复杂性,用户可控制算法和数据。

    推荐理由:原文来自官方发布,说明了 Tinker 的微调能力、LoRA 成本方式和早期用户实例,可据此判断其对研究者的可用性。

9月29日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/dInfer

    inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。

    推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。

  2. OpenAI Developers(RSS)65

    OpenAI 发布 Agentic Commerce Protocol 开放标准,连接商家与 ChatGPT 用户

    OpenAI 推出 Agentic Commerce Protocol(ACP),一个连接商家与 ChatGPT 用户的开放标准,作为两者之间的基础设施。它让 ChatGPT 能接收结构化商品目录数据、理解商家库存并在对话中呈现相关商品。文档提供了带示例 payload 的入门指引,以及关于商品文案、变体建模和归因的 feed 质量优化最佳实践。

    推荐理由:OpenAI 官方文档介绍了 ACP 的定位和接入路径,商家可据此了解如何让商品出现在 ChatGPT 中。

  3. Cognition 模型 / Devin 博客(网页)65

    Cognition 为 Claude Sonnet 4.5 重构 Devin:新版本快 2 倍、评测提升 12%

    Cognition 发布基于 Claude Sonnet 4.5 重构的新版 Devin,速度提升 2 倍,Junior Developer Evals 提升 12%,已在 Agent Preview 上线,旧版 Devin 仍可用。

    推荐理由:来自一线 Agent 团队的适配复盘,给出了 Sonnet 4.5 的具体新行为和对应的工程应对,可迁移到类似智能体架构。

9月12日周五
  1. OpenAI Developers:Blog(网页)72

    OpenAI 发布 Realtime API GA 版与 gpt-realtime 模型开发者说明

    OpenAI 介绍 gpt-realtime 语音模型和 Realtime API 正式可用(GA)后的接口变化与新功能。

    推荐理由:官方逐一解释了 GA 版接口变化和新功能的使用场景,对正在接入 Realtime API 的开发者有直接参考价值。

9月9日周二
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedChat 全自托管全双工语音交互方案

    FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。

    推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。

9月3日周三
  1. Linear:Now(RSS)61

    Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

    Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。

    推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

8月21日周四
  1. Linear:Now(RSS)60

    Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体

    Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。

    推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。

8月7日周四
  1. OpenRouter:Announcements(RSS)66

    GPT-5 现已上线

    GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。

    推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。

  2. 英国 AI Security Institute:Blog(网页)65

    英国 AISI 开源 Inspect Sandboxing Toolkit 用于安全的 AI 智能体评估

    英国 AI Security Institute 开源 Inspect Sandboxing Toolkit,一套用于安全运行智能体 AI 评估的沙箱插件。

    推荐理由:原文给出三个沙箱插件和三层隔离协议,并说明架构如何分离推理与工具执行,读者可据此选择评估隔离方案。

7月15日周二
7月11日周五
6月30日周一
  1. LlamaIndex:产品、工程与评测61

    LlamaIndex 发布 Workflows 1.0:面向智能体系统的轻量编排框架

    LlamaIndex 正式发布 Workflows 1.0,一个用 Python 和 TypeScript 构建多步骤智能体应用的轻量事件驱动框架,首次以独立包和独立仓库发布。

    推荐理由:官方发布说明列出了 1.0 的具体新能力和独立包入口,开发者可据此评估是否把 Workflows 用于现有编排场景。

6月26日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    Claude Desktop推出“桌面扩展”新格式,实现MCP服务器一键安装

    Claude Desktop推出了名为“桌面扩展”的新打包格式(.mcpb文件),旨在彻底简化MCP服务器的安装流程。该格式将服务器代码、所有依赖项和配置清单打包成一个ZIP压缩包。用户只需下载.mcpb文件并用Claude Desktop打开点击安装即可完成,无需手动配置环境、安装运行时或处理依赖冲突。此举解决了以往需要开发者工具、手动编辑配置文件和依赖管理等复杂问题,显著降低了非技术用户使用强大本地MCP服务器的门槛。

    推荐理由:MCP 服务器装机从「开发者手动改 JSON」变成「双击 .mcpb 一键安装」,Anthropic 把 MCP 生态的用户门槛砍掉了一大截,做 MCP server 的开发者现在该认真考虑打包分发了。

6月23日周一
  1. Prime Intellect(网页)61

    Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

    Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。

    推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

6月3日周二
  1. Suno:Blog(网页)76

    更高水平的创意控制 · Suno团队

    Suno发布了新的创作工具,旨在将创意控制权完全交还给艺术家。新功能包括支持上传最长8分钟的音频、具备行业首创编辑工具(如歌词替换、段落修改和重混)的升级版歌曲编辑器,以及可调节创作风格的“创意滑块”。创作完成后,用户可利用前沿技术将轨道分离为12条独立音轨(如人声、鼓、贝斯)进行预览和下载,便于在数字音频工作站(DAW)中进行后续编辑。

    推荐理由:Suno 这次不是加几个 style,而是给了波形编辑和 12 轨分离,把 AI 音乐从生成器变成了制作工具,音乐创作者可以进来真正干活了。

5月22日周四