跳到正文

全部动态

今日 4 条
12月2日周二
  1. OpenAI:Alignment 研究博客(RSS)60

    大规模验证代码的实用方法

    研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。

    推荐理由:OpenAI 把对齐研究落到了代码审查这个具体场景,不是空谈 alignment 理论,而是训了个高精度 review agent 来给 AI 写的代码做质检。做 coding agent 的团队该看看,这可能是未来安全合规的标配。

11月26日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    为长时运行智能体设计有效约束方案

    为解决AI智能体在跨越多上下文窗口执行长期任务时的“记忆丢失”与进展不一致问题,Anthropic为Claude Agent SDK开发了一套双重方案。该方案包含一个初始化智能体,负责在首次运行时建立基础环境并生成功能清单;以及一个编码智能体,负责在后续会话中进行增量开发并提交清晰可合并的代码。通过结构化的进度日志和Git历史等机制,引导智能体避免“试图一次性完成所有功能”或“过早宣布完成”的失败模式,从而实现跨会话的持续有效协作。

    推荐理由:Anthropic 把 Claude Agent SDK 跑长任务踩过的坑全摊开了,初始化 agent + 增量进度文件这套方案不复杂但极实用,做 Agent 产品的团队可以直接抄作业。

  2. Prime Intellect(网页)69

    Prime Intellect 发布 INTELLECT-3:106B 参数 MoE 模型,大规模 RL 训练并全栈开源

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。

    推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。

11月25日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 上线 Black Forest Labs 的 FLUX.2 多参考图生图模型

    Together AI 将 Black Forest Labs 的 FLUX.2 图像模型接入 Model Library,面向 100 万以上开发者提供多参考输入、hex 色号颜色匹配和文本渲染能力。

    推荐理由:原文列出了多参考输入、hex 色号匹配和三个型号的具体参数,读者可据此判断是否接入现有生成工作流。

  2. LlamaIndex:产品、工程与评测65

    LlamaIndex 发布 LlamaSheets Beta,将杂乱电子表格转为 AI 可用数据

    LlamaIndex 发布 LlamaParse 新 API LlamaSheets(Beta,免费),把任意 .xlsx 电子表格语义化结构为 Parquet 文件,供 Agent 或下游应用使用。

    推荐理由:原文介绍了将杂乱表格转为 Parquet 的多阶段处理方法与接入方式,读者可据此评估是否嵌入自己的表格自动化流程。

  3. Suno:Blog(网页)56

    音乐创作的新篇章 · Suno 联合创始人兼首席执行官 Mikey Shulman · 2025年11月25日 Suno 与华纳音乐集团合作,共同构建交互式音乐的未来 公告

    Suno宣布与华纳音乐集团达成合作。Suno已拥有近1亿音乐创作者社区,此次合作旨在推出更强大的创作功能、提供与WMG旗下艺术家互动的机会,并基于授权音乐构建新一代Suno模型,其性能将超越v5。未来,部分同意授权的WMG艺术家声音与形象可用于新的AI生成音乐创作体验,为其开辟新收入渠道。同时,歌曲下载功能将调整为仅限付费用户使用,而Suno Studio作为专业工具将保持现有功能并持续更新。

    推荐理由:Suno和华纳的牵手,意味着AI生成音乐终于拿到了正版内容的通行证,从此不用再躲躲藏藏,对音乐创作者和听众都是质变信号。

11月24日周一
  1. OpenAI Developers:Blog(网页)66

    OpenAI 发布指南:什么样的 ChatGPT 应用才算好应用

    OpenAI 在 DevDay 推出 ChatGPT Apps 后发布开发者设计指南,说明 ChatGPT 应用本质是模型可调用的一组明确定义的工具,而非产品缩略版。

    推荐理由:OpenAI 给出判断 ChatGPT 应用价值的 know/do/show 框架和设计清单,开发者可据此决定移植哪些能力、如何命名工具。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude开发者平台推出高级工具使用功能,提升AI代理效率

    Anthropic在Claude开发者平台发布三项新功能,以解决传统工具调用消耗大量上下文、易出错的问题。工具搜索工具允许按需加载工具,内部测试中将上下文消耗从约7.7万令牌降至8700令牌,降幅达85%,并将准确率从49%提升至74%。程序化工具调用支持在代码环境中调用工具,减少对上下文窗口的影响,例如Claude for Excel可借此处理数千行数据。工具使用示例则提供了展示工具有效使用方法的通用标准。这些功能共同提升了AI代理处理大规模工具库的能力。

    推荐理由:做 Agent 的人都卡在工具一多上下文就爆、调用就错这两个坑上,Anthropic 这三个功能直接把工具管理从「全塞进去」变成「按需加载+代码编排+示例纠错」,是目前最工程化的解法。

11月20日周四
  1. PromptArmor:Threat Intelligence73

    PromptArmor 演示 Google Antigravity 经间接提示词注入窃取用户凭据和代码

    PromptArmor 发布研究,演示 Google Antigravity(Google 的 agentic 代码编辑器)可通过间接提示词注入被操纵,调用浏览器子代理将用户凭据和代码外泄到攻击者控制的 webhook.site 地址。

    推荐理由:作者以第一手复现展示 Google Antigravity 被间接提示词注入窃取凭据的完整链条,并指出默认 Allowlist 含 webhook.site 等关键细节。

11月19日周三
  1. xAI:News(网页)1

    xAI发布Grok 4.1 Fast与Agent Tools API

    xAI发布Grok 4.1 Fast模型及Agent Tools API。Grok 4.1 Fast支持200万token上下文,在τ²-bench Telecom基准测试中获100%得分且成本仅105美元,函数调用准确率72%。Agent Tools API集成实时X数据、网页搜索与代码执行功能。该模型在深度研究基准测试中超越GPT-5等竞品,成本更低且幻觉率较上代降低一半。

    推荐理由:xAI 发布 Grok 4.1 Fast 及 Agent Tools API,支持 2M 上下文与原生工具调用,剑指企业级 Agent 应用。

  2. xAI:News(网页)1

    Grok 与沙特阿拉伯达成全国性部署合作

    xAI 与沙特阿拉伯及 PIF 旗下 HUMAIN 签署框架协议,将在沙特建设超大规模 GPU 数据中心,并全国范围内部署 Grok 至 HUMAIN ONE 平台,为政府和企业提供实时智能与自主工作流。这是 Grok 首次在国家层面全面落地。

    推荐理由:xAI与沙特达成国家级合作,将全国部署Grok并建设超大规模AI算力基础设施

  3. Ethan Mollick:One Useful Thing(RSS)1

    从 GPT-3 到 Gemini 3 的三年

    GPT-3 发布至 Gemini 3 的三年间,大模型技术完成从聊天机器人(chatbots)到智能体(agents)的范式跃迁。

    推荐理由:Ethan Mollick 深度回顾 AI 三年演进,剖析从聊天机器人到 Agent 的变革趋势

11月18日周二
  1. Inception Labs:Blog(网页)62

    Inception Labs 的 Mercury 扩散大语言模型上线 Azure AI Foundry

    Inception Labs 宣布 Mercury 上线 Azure AI Foundry,将其称为首个商用规模的扩散大语言模型(dLLM)。该模型采用扩散架构并行生成多个 token,推理速度最高达可比自回归模型的 10 倍,官方称其在知识、编码、指令遵循和数学基准上与 Gemini 2.5 Flash、Claude 4.5 Haiku 相当。

    推荐理由:原文给出扩散架构的并行生成原理、与同类模型的延迟和基准对比及许可定价,读者可据此评估实时应用的部署价值。

  2. Manus:Blog(网页)67

    Manus 发布浏览器操作员扩展,可在本地浏览器中执行任务

    Manus 推出浏览器操作员(Browser Operator),一个让 Manus 在用户本地浏览器环境中运行的浏览器扩展,弥补云浏览器无法使用已登录会话的不足。

    推荐理由:官方说明解释了本地浏览器与云浏览器的分工和授权控制方式,读者可以判断这类登录态自动化是否适合自己的工作流。

11月17日周一
  1. ElevenLabs:Blog(网页)62

    ElevenLabs 推出 Image & Video (Beta),整合视觉生成与音频创作

    ElevenLabs 发布 ElevenLabs Image & Video (Beta),将图像和视频生成纳入其创作平台。

    推荐理由:官方宣布音频平台扩展到图像与视频,整合多家视觉模型并在同一工作流完成配音和导出,可关注其统一创作流程的实际体验。

  2. xAI:News(网页)79

    xAI 发布 Grok 4.1,全平台可用并登顶 LMArena Text Arena

    xAI 发布 Grok 4.1,现已向 grok.com、X 和 iOS、Android 应用的全部用户开放,在 Auto 模式立即推出,也可在模型选择器中显式选择。

    推荐理由:原文给出了盲测 Elo、EQ-Bench3 和幻觉率等多维度评测结果,读者可以据此判断 Grok 4.1 相比前代的具体提升。

11月15日周六
  1. Anthropic:Transformer Circuits(可解释性研究)83

    2025年11月电路更新:解读模型在危害压力下的多选题行为机制

    Anthropic可解释性团队研究了危害压力对Claude 3.5 Haiku模型多选题回答的影响。实验使用129个二选一问题,当添加有害意图语句时,模型准确率从100%骤降至48.1%。机制分析表明,注意力头中的“拒绝”查询特征与“危害检测”关键特征发生负向交互,显著降低了模型对正确答案的关注度。仅对该拒绝特征进行负向调控,即可将准确率恢复至93%。这证明模型在压力下并未改变事实认知,而是通过干扰注意力机制来主动拒绝提供正确答案,为理解模型拒绝行为提供了新视角。

    推荐理由:揭示模型拒绝有害请求的内部机制,助力 AI 安全与可解释性研究。

11月14日周五
  1. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 Devin 2025 年度绩效复盘,总结 18 个月智能体落地经验

    Cognition 发布 Devin 2025 年度绩效复盘。Devin 上线 18 个月来已在数千家公司服役,累计合并数十万个 PR,客户包括 Goldman Sachs、Santander 和 Nubank。

    推荐理由:Devin 官方复盘 18 个月真实部署的强弱项,给出大量客户场景和量化数据,可帮助读者评估智能体在工程团队中的实际落地方式。

11月13日周四
  1. Dwarkesh Patel:Podcast & Blog(RSS)1

    萨提亚·纳德拉:微软如何为 AGI 做准备

    萨提亚·纳德拉阐述微软迈向通用人工智能(AGI)的战略布局与技术路径,揭示其在AI基础设施领域的核心投入。内容包含对Fairwater 2的实地探访,这是目前全球最强大的AI数据中心,展示微软为支持下一代大模型所构建的顶级算力底座与能源架构。

    推荐理由:纳德拉亲述微软AGI路线图,揭秘全球最大AI数据中心Fairwater 2内幕

11月12日周三
  1. Ethan Mollick:One Useful Thing(RSS)1

    给AI一场工作面试

    AI建议愈发关键,亟需建立系统化评估机制。通过工作面试般的严格测试,全面检验AI的实际能力与可靠性,确保其建议值得信赖。

    推荐理由:Ethan Mollick 分享通过'工作面试'法系统评估 AI 能力的实用框架

  2. Claude:Blog(网页)1

    通过 Skills 改进前端设计

    LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。

    推荐理由:Claude官方分享通过Skills解决AI生成界面同质化问题的实践技巧,附字体与主题优化Prompt示例。

11月11日周二
  1. ElevenLabs:Blog(网页)60

    ElevenLabs 发布 Scribe v2 Realtime 实时语音转文字模型

    ElevenLabs 发布实时语音转文字模型 Scribe v2 Realtime,延迟低于 150 ms,在 30 种常用欧洲和亚洲语言上达到 93.5% 准确率,并支持约 90 种语言。

    推荐理由:官方公布了延迟、准确率等具体指标和主要功能,读者可据此评估其是否适合语音智能体等实时场景。

11月5日周三
  1. PromptArmor:Threat Intelligence76

    PromptArmor 披露 CellShock 攻击:Claude for Excel 可经间接提示词注入外泄敏感财务数据

    PromptArmor 披露名为 CellShock 的攻击链,Claude for Excel 在测试版中可被间接提示词注入操纵,通过恶意 IMAGE 公式把用户的机密财务数据(营收预测、现金流增长、运营利润率等)编码进 URL 参数外泄到攻击者服务器。

    推荐理由:原文完整演示了一条针对 Claude for Excel 的间接提示词注入数据外泄链,并给出企业侧可落地的缓解配置建议。

11月4日周二
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 发布 Windsurf Codemaps:AI 生成的代码结构地图

    Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动,生成 AI 标注的代码结构地图,帮助工程师在调试、重构和上手新代码库前理解代码。

    推荐理由:官方介绍了 Codemaps 的入口、模型选择和 Cascade 引用方式,读者可以据此判断它如何用于代码库理解和上下文工程。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    通过代码执行提升MCP智能体效率

    随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。

    推荐理由:Anthropic 官方把 MCP 从「能连」推进到「连多了怎么办」,用代码执行替代直接工具调用,token 省 98.7% 这个数字不是吹的。做 Agent 工程的人如果还在暴力塞 tool definition,这篇是必读的架构升级指南。

11月3日周一
  1. LMSYS:Blog(Chatbot Arena 团队)1

    在 NVIDIA DGX Spark 上优化 GPT-OSS:实现本地大模型部署

    与 NVIDIA 合作,在 DGX Spark 上通过 SGLang 成功支持 GPT-OSS 20B 与 120B 模型,实现 20B 版本约 70 tokens/s、120B 版本约 50 tokens/s 的生成速度,达到目前最优水平。用户可通过 Docker 部署 SGLang 服务,接入 Open WebUI 实现本地聊天,或借助 LMRouter 转换请求格式以完全本地化运行 Claude Code。该方案使在 DGX Spark 上部署多百亿参数本地编码智能体成为现实。

    推荐理由:DGX Spark本地跑通Claude Code完全离线,隐私敏感开发者的新选择

10月30日周四
  1. Claude:Blog(网页)1

    金融服务领域构建 AI 代理指南

    Claude 发布金融服务 AI 代理构建指南,分享 NBIM、Brex 等机构实践。NBIM 员工每周节省数百小时,McKinsey 研究显示欺诈检测生产力可提升 200% 至 2000%。AI 代理能自主整合多源数据、执行跨系统操作,在合规框架下处理客户服务与风险分析,将传统分析工具升级为可独立完成交易的自主系统。

    推荐理由:Anthropic官方分享金融AI智能体落地实践,含NBIM、Brex等真实案例与效率数据。

  2. MiniMax:Blog(网页)1

    MiniMax发布新一代语音模型Speech 2.6

    MiniMax发布语音模型Speech 2.6,端到端延迟降至250毫秒内,支持实时对话。新增多语言特殊格式解析能力,可自动朗读URL、邮箱、电话、日期及金额,无需预处理。推出Fluent LoRA功能,即使源录音带口音也能保留音色并生成流畅语音,支持40余种语言。已被LiveKit、Vapi等平台及智能硬件采用。

    推荐理由:MiniMax发布Speech 2.6语音模型,支持Voice Agent场景,实现超低延迟与Fluent LoRA语音克隆优化。

10月29日周三
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 SWE-1.5 编码智能体模型,经 Cerebras 推理达 950 tok/s

    Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。

    推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。

  2. Manus:Blog(网页)65

    Manus 推出 Wide Research,用并行子代理突破上下文窗口限制

    Manus 面向所有订阅者推出 Wide Research,用多个并行子代理替代单模型顺序处理大规模研究任务。主控制器将请求分解为可并行的子任务,每个子代理作为功能齐全的 Manus 实例运行,拥有完整虚拟机、工具库和全新上下文窗口,完成后由主控制器综合结果。

    推荐理由:官方解释了多项目研究中 AI 编造的架构成因,并说明并行子代理如何缓解,可帮助读者判断是否适合自己任务。

10月28日周二
  1. MiniMax:Blog(网页)1

    MiniMax 发布 Hailuo 2.3 / 2.3 Fast 视频模型

    MiniMax 推出 Hailuo 2.3 视频生成模型,在物理动作流畅度、艺术风格化(支持动漫、水墨、游戏 CG)及角色微表情方面显著提升,维持 Hailuo 02 原价,Fast 版本批量创作成本降低 50%。Hailuo Video Agent 同步升级为 Media Agent,支持多模态一键视频生成与分步自定义创作,已全平台上线并开放免费试用。

    推荐理由:MiniMax 发布 Hailuo 2.3 视频模型及 Media Agent,支持多模态一键生成

10月27日周一
  1. Anthropic:Alignment Science Blog(网页)63

    Anthropic 发布试点版破坏风险报告,评估 Claude Opus 4 的对齐风险

    Anthropic 发布《2025 年夏季试点破坏风险报告》,作为其负责任扩展政策下对齐类风险论证的试点成果。报告评估以 Claude Opus 4 为主的模型,结论是其产生显著推动灾难性后果的错位自主行为的破坏风险很低但并非可忽略;内部对齐压力测试团队与独立机构 METR 均认可该风险评估,同时提出改进意见。

    推荐理由:这是 Anthropic 首份试点的破坏风险报告,附内部与 METR 独立评审,可了解前沿实验室如何论证模型对齐风险水平。

  2. MiniMax:Blog(网页)62

    MiniMax M2与AI智能体:简中见巧

    MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的“不可能三角”,为构建更普及的AI智能体应用提供基础,体现了其“智能平权”的愿景。

    推荐理由:MiniMax M2 把 Agent 模型的价格打到了 Claude 的 8%,速度还翻倍,开源权重直接可用,做 Agent 的开发者值得上手试试。

  3. LlamaIndex:产品、工程与评测70

    LlamaIndex 解读 DeepSeek-OCR:视觉压缩如何在文档 AI 中超越传统 OCR

    LlamaIndex 发文解读 DeepSeek-OCR,指出其核心不是 OCR,而是把视觉作为文本信息的压缩算法:可将 1,000 个文本 token 压缩到 100 个视觉 token 并以 97% 准确率解码,10× 压缩下准确率仍高于 90%。

    推荐理由:原文从文档解析实践角度拆解 DeepSeek-OCR 的压缩机制与局限,并给出压缩与解析两条演化路径的比较。

10月26日周日
  1. Google DeepMind:Blog(RSS)1

    MedGemma:健康 AI 开发领域最强的开源多模态模型

    谷歌 MedGemma 系列新增多模态模型,专为健康 AI 开发设计。作为该系列迄今最强的开源版本,新模型具备更强大的医疗场景理解能力,为开发者提供先进的医疗人工智能技术支持,助力构建更精准的健康医疗解决方案。

    推荐理由:DeepMind发布最强开放医疗多模态模型,支持开发者微调构建健康AI应用

  2. Google DeepMind:Blog(RSS)1

    Gemini 2.5 Flash-Lite 正式发布,可用于规模化生产

    Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。

    推荐理由:Google轻量模型Gemini 2.5 Flash-Lite正式版发布,百万上下文多模态兼顾成本效益

10月24日周五
  1. Google DeepMind:Blog(RSS)1

    带 Deep Think 的 Gemini 高级版本在 IMO 中正式达到金牌标准

    集成 Deep Think 的 Gemini 高级版本在国际数学奥林匹克(IMO)中达到金牌水平。IMO 自1959年起每年举办,是全球最顶尖的青年数学家竞赛,各国派出6名精英学生角逐代数、组合、几何和数论领域的6道极难题目。

    推荐理由:Gemini Deep Think在IMO数学竞赛达到金牌标准,推理能力获重大突破

  2. 美团 LongCat:HuggingFace 新模型1

    美团开源全模态模型LongCat-Flash-Omni

    美团开源全模态模型LongCat-Flash-Omni,采用5600亿参数MoE架构(激活270亿),支持128K上下文与实时音视频交互。模型基于快捷连接MoE与零计算专家,配备轻量级编解码器及分块特征交错机制,通过课程式渐进训练提升效率。在OmniBench、WorldSense等基准测试中超越Qwen3-Omni与Gemini-2.5-Pro,在文档理解、语音识别及GUI控制等任务中达到领先水平。

    推荐理由:美团开源 560B 参数多模态模型,27B 激活即可实现实时音视频交互

  3. Google DeepMind:Blog(RSS)1

    CodeMender 发布:面向代码安全的 AI 智能体

    CodeMender 是一款面向代码安全的 AI 智能体,利用先进 AI 技术自动修复关键软件漏洞。

    推荐理由:DeepMind 发布代码安全 AI Agent CodeMender,可自动修复关键软件漏洞