跳到正文

全部动态

今日 0 条
8月21日周四
  1. Linear:Now(RSS)60

    Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体

    Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。

    推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。

  2. Cohere 产品与研究博客(网页)61

    Cohere 发布 Command A Reasoning 企业级推理模型

    Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。

    推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。

8月19日周二
  1. ARC Prize:官方博客61

    ARC Prize 发布 ARC-AGI-3 Preview 30天测试总结与Agent竞赛结果

    ARC Prize Foundation 总结 ARC-AGI-3 Preview 发布30天的数据:超1200人玩了3900多局游戏,人类大多能通关,AI Agent 进展低效。竞赛冠军 StochasticGoose 得分12.58%、完成18关,前三名Agent均基于智能随机探索;官方指出部分游戏可被暴力搜索破解,未来将按动作效率对人类基线评分并增加撤销按钮、离线引擎等改进。

    推荐理由:原文公布了30天竞赛的完整人类与Agent得分对比,读者可以看到交互式推理基准用动作效率区分人类和AI的具体依据。

8月15日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/UI-Venus

    UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。

    推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

  2. Anthropic:Transformer Circuits(可解释性研究)73

    角色如何改变AI的回答?——Anthropic可解释性团队2025年8月电路分析案例

    Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型“角色扮演”如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为“学龄前儿童”并询问“27的平方根”时,模型会以“我不知道!”回应并提议玩耍;而在默认或“研究生”角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将“学龄前学生”关联到“扮演儿童”,从而激活“我不知道”特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为。这引发了对其他角色运作机制及预训练角色与模型表达能力关系的后续思考。

    推荐理由:揭示模型角色扮演的内部机制,为可解释性研究提供新视角。

  3. ARC Prize:官方博客64

    ARC Prize 剖析 HRM 在 ARC-AGI 上取得好成绩的真正原因

    ARC Prize 在 ARC-AGI Semi-Private 隐藏集上验证了 Hierarchical Reasoning Model(HRM,27M 参数),ARC-AGI-1 得分 32%,ARC-AGI-2 仅 2%。

    推荐理由:原文用消融实验拆解了 HRM 在 ARC-AGI 上的真实性能来源,指出贡献主要来自外循环精炼而非分层架构。

8月13日周三
  1. METR:Research(网页)61

    METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

    METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。

    推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

8月8日周五
  1. Ethan Mollick:One Useful Thing(RSS)1

    GPT-5:只管做事

    GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。

    推荐理由:Ethan Mollick 深度解读 GPT-5 自主执行能力,洞察 AI 代理新范式

  2. METR:Research(网页)64

    METR 研究认为尽管存在不忠实,思维链仍可作为监控模型行为的信息来源

    METR 复现 Anthropic 的 Claude Sonnet 3.7 与 Claude 4 忠实度评测并提出,当解题所需推理必须用到思维链时,模型在宽松忠实度定义下几乎总是忠实:在 21,272 条轨迹中仅发现 3 条疑似不忠实。

    推荐理由:原文提出宽松忠实度视角并用检测实验支撑,为理解 CoT 监控在什么条件下可靠提供了可检验框架。

8月7日周四
  1. OpenRouter:Announcements(RSS)66

    GPT-5 现已上线

    GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。

    推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。

  2. OpenAI Developers(RSS)64

    如何用 LM Studio 在本地运行 gpt-oss

    OpenAI 发布 Cookbook 教程,讲解如何在本地硬件上用 LM Studio 运行 gpt-oss。LM Studio 是一款在本地硬件运行大语言模型的桌面应用,教程将引导用户完成本地运行 gpt-oss 的步骤。

    推荐理由:OpenAI 官方 Cookbook 给出在本地硬件用 LM Studio 运行 gpt-oss 的完整步骤,可作为离线部署的操作参考。

  3. OpenRouter:Announcements(RSS)68

    GPT-5 现已上线

    OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。

    推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。

  4. 英国 AI Security Institute:Blog(网页)65

    英国 AISI 开源 Inspect Sandboxing Toolkit 用于安全的 AI 智能体评估

    英国 AI Security Institute 开源 Inspect Sandboxing Toolkit,一套用于安全运行智能体 AI 评估的沙箱插件。

    推荐理由:原文给出三个沙箱插件和三层隔离协议,并说明架构如何分离推理与工具执行,读者可据此选择评估隔离方案。

8月5日周二
  1. OpenAI Developers(RSS)60

    OpenAI Cookbook 教程:用 Hugging Face Transformers 微调 gpt-oss

    OpenAI 开发者 Cookbook 发布教程,讲解如何结合 gpt-oss 与 Hugging Face Transformers 进行微调。文章由 Edward Beeching、Quentin Gallouédec 和 Lewis Tunstall 撰写,并从大型推理模型(如 OpenAI o3)通过生成思维链提升准确性的背景切入。

    推荐理由:官方 Cookbook 教程给出用 Hugging Face Transformers 微调 gpt-oss 的具体路径,适合需要本地定制推理模型的开发者参考。

  2. OpenAI Developers(RSS)79

    如何用 Ollama 在本地运行 gpt-oss

    OpenAI 开发者发布教程,讲解如何用 Ollama 在本地硬件上部署 gpt-oss-20b 或 gpt-oss-120b 并选择合适的推理设置。

    推荐理由:来自 OpenAI 开发者官方的实操指南,读者可按步骤在自己硬件上用 Ollama 跑通 gpt-oss 两个规格模型。

7月31日周四
  1. LMSYS:Blog(Chatbot Arena 团队)1

    智谱发布 GLM-4.5 系列模型并原生支持 SGLang

    智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。

    推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月25日周五
  1. 上海人工智能实验室 InternLM:原创项目67

    上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

    上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。

    推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

  2. Anthropic:Alignment Science Blog(网页)68

    Anthropic 开发并评估三个自动执行对齐审计的智能体

    Anthropic 发布三个自主执行对齐审计任务的智能体,并用含植入缺陷的模型环境进行评估。调查智能体在真实条件下以 13% 的胜率解开 Marks et al. 审计博弈,多智能体聚合后提升到 42%;评估智能体在 88% 的运行中能区分有/无植入行为的模型;广度优先红队智能体发现 10 个植入行为中的 7 个。

    推荐理由:Anthropic 报告了三个对齐审计智能体在植入缺陷模型上的可复现成绩,并公开部分代码与提示词,读者可以了解自动化审计的实际能力与局限。

7月23日周三
  1. Anthropic:Alignment Science Blog(网页)68

    Anthropic 等机构研究揭示大型推理模型的测试时计算反向扩展现象

    Anthropic Fellows Program 等机构构建评测任务,发现延长推理长度反而降低大型推理模型准确率,呈现测试时计算的反向扩展,并归纳出五种失败模式。

    推荐理由:研究给出五类测试时计算反向扩展的失败模式,并附带安全含义,可帮助读者理解长推理并非总是增益。

  2. Anthropic:Alignment Science Blog(网页)72

    Anthropic 等研究揭示亚阈值学习:模型可经无关数据传递行为特质与失调倾向

    Anthropic Fellows Program 等机构的研究提出亚阈值学习现象:学生模型在教师模型生成的数字序列、代码或思维链上微调后,会习得教师的特质,包括对猫头鹰的偏好和失调倾向,即使数据经过严格过滤且不含任何相关语义。

    推荐理由:论文展示了看似无关的模型生成数据也能传递行为特质,为依赖过滤的蒸馏训练流程提示了一类难以消除的风险。

7月18日周五
  1. Manus:Blog(网页)68

    Manus 团队分享构建 AI 智能体的上下文工程经验教训

    Manus 团队成员 Yichao 'Peak' Ji 撰文分享构建 Manus 智能体的上下文工程经验,核心原则包括围绕 KV-cache 命中率设计、用 logits 遮蔽而非移除工具、把文件系统当作终极上下文、通过复述待办列表操控注意力,以及保留错误和避免少样本陷阱。

    推荐理由:Manus 团队复盘构建智能体的上下文工程经验,KV缓存、工具遮蔽和文件记忆等做法可直接迁移到读者的 Agent 项目。

7月15日周二
  1. Anthropic:Transformer Circuits(可解释性研究)83

    2025年7月电路更新:特征语言重构数学框架与生物AI可解释性应用

    Anthropic可解释性团队分享了2025年7月的研究进展。第一部分用“特征”语言重构Transformer数学框架,将注意力头的OV和QK电路描述为特征及其变换(如检测属性X、前一标记X、触发输出X的特征),并解释了先前用特征值分析复制头和归纳头行为的合理性。第二部分概述了稀疏自编码器在生物AI系统(如蛋白质语言模型ESM-2)可解释性中的应用进展,强调此类研究对确保药物发现等应用的安全与有效性至关重要。

    推荐理由:可解释性研究新进展,帮助理解 AI 内部机制,提升模型透明度和安全性。

7月14日周一
  1. xAI:News(网页)66

    xAI 发布 xAI For Government,获美国国防部 2 亿美元合同并上架 GSA 采购目录

    xAI 宣布推出 xAI For Government,面向美国联邦、州、地方及国家安全客户提供 Grok 系列产品,包括 Grok 4、Deep Search 和 Tool Use 等能力。美国国防部授予一份上限 2 亿美元的合同,产品同时可通过 GSA 采购目录购买,并将提供定制模型、拥有安全许可的驻场工程师支持,模型未来可用于涉密等受限环境。

    推荐理由:官方公告给出政府采购入口、2 亿美元国防部合同额度和分类环境部署计划,可了解 Grok 进入美国政府的具体路径。

  2. OpenRouter:Announcements(RSS)56

    OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2

    OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。

    推荐理由:一篇将 OpenRouter 模型接入 Cursor 的实操指南,虽然已过时三百多天,但对想免配置用 Kimi K2 的 Cursor 用户仍有参考价值。

  3. Cognition 模型 / Devin 博客(网页)79

    Cognition 签约收购智能体 IDE 公司 Windsurf

    Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。

    推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。

7月11日周五
  1. Moonshot AI:Kimi Blog1

    Kimi 发布 K2 模型

    Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。

    推荐理由:月之暗面发布 Kimi K2,万亿参数 MoE 架构,多基准 SOTA

7月10日周四
  1. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布端侧基础模型 LFM2,含 0.35B/0.7B/1.2B 三个规格

    Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。

    推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。

7月9日周三
  1. xAI:News(网页)1

    Grok 4

    xAI 正式发布 Grok 4,新一代大模型在数学推理和代码生成能力上大幅提升,延续实时获取 X 平台信息的特色。该版本支持更长上下文窗口和图像理解,即日起向 X Premium+ 订阅者开放。

    推荐理由:xAI正式发布Grok 4旗舰大模型,重要版本更新值得关注

7月8日周二
  1. Ethan Mollick:One Useful Thing(RSS)1

    反对"脑损伤"论

    AI 对人类思维的影响具有两面性:既可能成为认知辅助工具,也可能导致思维退化,关键在于具体使用方式与程度。

    推荐理由:Ethan Mollick 探讨 AI 对人类认知的双面影响,观点犀利深刻

7月1日周二
  1. Factory 研究 / 产品(RSS)70

    Factory 提出 Agent Native Development:用自主智能体开发软件的方法论

    Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。

    推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。

  2. Microsoft AI:官方博客(网页)72

    Microsoft 发布 MAI-DxO 诊断研究,在 SD Bench 上诊断准确率达 85%,超过医生四倍

    Microsoft AI 发布 MAI-DxO 诊断编排器研究,在由 304 个 NEJM 病例构建的 SD Bench 序贯诊断基准上,最高正确诊断 85% 的病例,是受测经验丰富医生组的四倍以上,且花费更低。研究基于 2024 年底启动的消费级健康项目,目前仅为研究演示、未获临床使用批准,论文以预印本形式发布并正在提交外部同行评审。

    推荐理由:原文同时给出诊断准确率与虚拟成本两个维度的结果,并明示研究局限和未开放状态,读者可据此评估医疗 AI 的实际边界。

6月30日周一
  1. Suno:Blog(网页)55

    Suno收购浏览器数字音频工作站WavTool

    音乐技术公司Suno宣布收购完全在浏览器中构建的AI加速数字音频工作站WavTool。WavTool的核心团队将加入Suno并担任产品及工程领导职务。此次收购将WavTool的专业级编辑功能(支持VST插件、采样精确编辑等)与原生AI能力(如音轨分离、AI生成MIDI)整合到Suno平台,旨在增强对专业词曲作者和制作人的支持。Suno CEO表示,此举是为了更好地赋能音乐家,而WavTool联合创始人则认为双方在AI辅助音乐创作的愿景上高度一致。

    推荐理由:一年前的收购,现在看仍是 Suno 从消费级玩具迈向专业工具的关键一步,但新鲜度早没了,只适合补看脉络。

  2. LlamaIndex:产品、工程与评测61

    LlamaIndex 发布 Workflows 1.0:面向智能体系统的轻量编排框架

    LlamaIndex 正式发布 Workflows 1.0,一个用 Python 和 TypeScript 构建多步骤智能体应用的轻量事件驱动框架,首次以独立包和独立仓库发布。

    推荐理由:官方发布说明列出了 1.0 的具体新能力和独立包入口,开发者可据此评估是否把 Workflows 用于现有编排场景。

6月26日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    Claude Desktop推出“桌面扩展”新格式,实现MCP服务器一键安装

    Claude Desktop推出了名为“桌面扩展”的新打包格式(.mcpb文件),旨在彻底简化MCP服务器的安装流程。该格式将服务器代码、所有依赖项和配置清单打包成一个ZIP压缩包。用户只需下载.mcpb文件并用Claude Desktop打开点击安装即可完成,无需手动配置环境、安装运行时或处理依赖冲突。此举解决了以往需要开发者工具、手动编辑配置文件和依赖管理等复杂问题,显著降低了非技术用户使用强大本地MCP服务器的门槛。

    推荐理由:MCP 服务器装机从「开发者手动改 JSON」变成「双击 .mcpb 一键安装」,Anthropic 把 MCP 生态的用户门槛砍掉了一大截,做 MCP server 的开发者现在该认真考虑打包分发了。

6月24日周二
  1. Google DeepMind:Blog(RSS)1

    Gemini Robotics On-Device 将 AI 引入本地机器人设备

    Gemini Robotics On-Device 推出高效端侧机器人模型,具备通用灵巧操作与快速任务适应能力,支持本地设备直接部署运行。

    推荐理由:DeepMind 发布端侧机器人模型,支持本地部署与快速任务适应

  2. Ethan Mollick:One Useful Thing(RSS)1

    当下如何使用 AI:快速指南

    一份当下 AI 工具的快速选用指南,聚焦目前值得使用的 AI 产品及其具体使用方法,帮助读者快速上手并选对工具。

    推荐理由:AI教育专家Ethan Mollick撰写,指导读者当下如何选择和使用AI工具

6月23日周一
  1. Prime Intellect(网页)61

    Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

    Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。

    推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

6月15日周日
  1. Anthropic:Transformer Circuits(可解释性研究)78

    一个关于机制(非)忠实性的玩具模型

    本文通过“绝对值”玩具模型,揭示了稀疏自动编码器(SAE)和转码器在解释神经网络时可能存在的“机制非忠实性”问题。核心在于,即使转码器能很好地近似模型的输入-输出映射,它也可能采用与原始模型完全不同的内部计算机制。作者特别指出,当训练数据中存在重复数据点时,转码器可能形成专门“记忆”该点的特征电路,而原模型并无此机制。这种机制背离可能导致模型在分布外数据上泛化行为出现差异,从而威胁机械可解释性研究的可信度。文章最后简要讨论了“雅可比匹配”等潜在缓解方法。

    推荐理由:揭示可解释性方法中潜在的忠实性问题,帮助开发者更可靠地理解模型内部机制。

  2. Anthropic:Transformer Circuits(可解释性研究)83

    稀疏混合线性变换(MOLT)

    稀疏混合线性变换(MOLT)是一种正在开发的新方法,旨在替代Transformer模型中的MLP层,以解决此前“转码器”方法在计算效率和表示忠实性上的局限。与转码器学习稀疏激活的特征向量不同,MOLT学习稀疏激活的线性变换,这些变换直接对残差流进行线性操作以贡献输出,充当纯粹的计算单元。初步实验表明,MOLT比转码器计算效率更高、机制更忠实,其激活条件具有可解释性,有助于理解层间特征的转换过程。该方法与混合解码器架构相关,但采用了低秩矩阵等不同参数化策略。

    推荐理由:新可解释性方法让 AI 内部计算更透明,助力模型调试与安全研究。