跳到正文

全部动态

今日 5 条
5月19日周二
  1. Claude Code:GitHub Releases(RSS)65

    Claude AI助手v2.1.144版本更新

    Claude AI助手发布了v2.1.144版本。此次更新主要新增了对后台会话的`/resume`支持,并将“extra usage”更名为“usage credits”。同时包含了多项重要修复:优化了网络异常处理,解决启动卡顿问题;修复了窗口大小调整和长时间会话导致的终端显示错乱;解决了macOS特定文件夹下的崩溃问题。此外,还改进了模型选择持久化、文件读取、工具调用以及MCP服务器分页工具列表的处理,并减少了在VS Code中的渲染故障。本次更新显著提升了工具的稳定性和用户体验。

    推荐理由:如果你被 Claude Code 启动卡住 75 秒折磨过,这次更新终于修了,还支持后台会话 /resume,体验好了一个档次。

  2. GitHub Blog69

    将你的本地GitHub会话带到任何地方

    GitHub为Copilot功能推出了远程控制会话能力,并已全面上线。该功能允许用户在VS Code或命令行中启动Copilot任务后,可随时随地通过github.com网站或GitHub Mobile移动端应用继续操作,实现了开发工作流从桌面端到移动端的无缝衔接。此更新增强了开发者在不同场景下的灵活性和工作效率。

    推荐理由:Copilot跨设备会话看起来是个小功能,但它解决了开发者切换设备时的心流中断问题,这种对工作连续性的打磨比单纯堆性能更聪明。

  3. Hugging Face:Blog(RSS)67

    NVIDIA Cosmos Predict 2.5 微调:使用 LoRA/DoRA 生成机器人视频

    NVIDIA Cosmos Predict 2.5 是一个 2B 参数的世界模型,可根据文本、图像或视频片段生成物理合理的视频。通过 LoRA 或 DoRA 在 DiT 的注意力层(to_q, to_k, to_v, to_out.0)和前馈层注入可训练适配器,冻结全部基座权重,在单个 80GB GPU 上即可完成参数高效微调,避免了全量微调的高成本与灾难性遗忘。该流程使用 diffusers 和 accelerate 库,利用 92 个机器人操作视频训练集与 50 个 (prompt, image) 测试对进行微调,并展示如何用微调模型生成合成机器人轨迹以支持下游机器人学习任务。支持单 GPU 与多 GPU 训练,切换不同领域适配器无需重训。

    推荐理由:这篇教程把微调Cosmos Predict 2.5的方法从头到尾讲清楚了,做机器人合成数据的同行可以直接抄作业,LoRA/DoRA切换也很方便,值得收藏。

  4. METR:Research(网页)76

    METR 发布前沿风险报告,评估 Anthropic、Google、Meta、OpenAI 内部 Agent 失控风险

    METR 于 2026 年 2 月 16 日至 3 月 16 日开展试点评估,Anthropic、Google、Meta 和 OpenAI 参与并共享最强内部模型及非公开信息。

    推荐理由:METR 联合四家前沿 AI 公司评估内部 Agent 的失控风险,给出手段、动机、机会三分框架和量化基准结果,可帮助读者理解内部部署风险的现状边界。

  5. Google Developers Blog(RSS)58

    重要更新:Gemini CLI将迁移至Antigravity CLI

    Google正在整合其AI终端工具,将面向社区的Gemini CLI迁移至全新平台Antigravity CLI。这款新工具采用Go语言开发,作为代理优先的平台,支持复杂的多代理工作流,并提供更快的执行速度、异步处理能力以及与Antigravity 2.0桌面应用同步的统一架构。企业客户可维持现有访问权限,但个人及免费用户必须在2026年6月18日Gemini CLI停止服务前,完成向新平台的迁移。

    推荐理由:Google 终端工具从 Gemini CLI 全面转向 Antigravity CLI,强调 agent 优先和多 agent 工作流,6 月 18 日后 Gemini CLI 停服,个人用户得赶紧迁移。

  6. xAI:News(网页)60

    在OpenClaw中使用Grok

    5月22日,xAI宣布,其用户现可在开源个人助理OpenClaw中直接使用Grok模型。所有持有SuperGrok或X Premium订阅的用户均可使用该功能。OpenClaw是一个开源的、本地优先的智能助手,可在多种硬件上运行并保持跨会话记忆,同时能接入WhatsApp、Telegram等多款主流通讯平台。用户通过简单安装和登录,即可在自有设备上运行OpenClaw,并通过其界面或关联的聊天工具与Grok交互。此举进一步扩展了Grok的应用场景,未来还将推出更多开源代理与集成支持。

    推荐理由:Grok 开始融入开源 agent 生态了,OpenClaw 的本地优先加多平台连接让这集成对开发者挺实用,有 Grok 订阅的可以直接试试。

  7. LlamaIndex:产品、工程与评测64

    LlamaIndex 用 LiteParse 构建带 PDF 原文高亮引用的财务尽调 Agent

    LlamaIndex 工程师发布了一个财务尽调 Agent 演示应用,用 LiteParse 解析 SEC 文件并获得文本的 bounding box 坐标,使 Agent 回答能在原始 PDF 页面上高亮精确来源。

    推荐理由:作者完整拆解了一个约 600 行代码的尽调 Agent 实现,检索与引用方案可直接迁移到类似的文档问答项目。

  8. Google Developers Blog(RSS)69

    Google Tensor ML SDK 测试版发布

    Google Tensor ML SDK 进入测试版,支持开发者直接在 Pixel 10 设备的 TPU 上构建和部署高性能机器学习模型。该 SDK 集成边缘部署框架 LiteRT,提供统一工作流,可高效转换、编译并运行 PyTorch 或 TFLite 模型,并具备稳定回退机制。此外,新推出的模型库包含超过 100 个经典及生成式 AI 模型(如 Gemma 3),支持低延迟、注重隐私的语音识别、计算机视觉与文本生成等功能。

    推荐理由:Google 把 TPU 塞进了 Pixel 10,现在开发者能直接在手机上跑 Gemma 3 了,这是移动端 AI 从「能用」到「好用」的关键一步,做 app 的值得关注。

  9. Google Developers Blog(RSS)65

    更智能的 Google AI Edge Gallery:MCP 集成、通知和会话连续性

    Google AI Edge Gallery 应用在安卓平台上扩展了设备端 AI 能力,通过引入对开源模型上下文协议(MCP)的实验性支持,使得 Gemma 4 模型能够协调处理跨 Google Workspace 和 Google Maps 等外部数据源的复杂任务。此次更新添加了“定时通知”技能,用于实现日常事务的自动化管理,并新增了持久化聊天记录功能,允许用户近乎即时地恢复长会话上下文。该平台依托开源工具包,积极鼓励社区开发者通过其 GitHub 仓库构建并分享专注实用的工作流、提示配置与工具集成。

    推荐理由:MCP 终于跑在 Android 设备上了,虽然是实验性支持,但 Gemma 4 能直连 Workspace 和 Maps,做自动化的开发者可以上手试试。

  10. Anthropic:Newsroom(网页)65

    拓宽关于前沿AI的对话

    Anthropic为构建负责任的先进AI,正与全球多元群体展开对话。首轮讨论汇集了超过15个宗教、哲学及跨文化传统的学者与伦理学者,旨在为Claude等模型的道德形成与价值观对齐提供多元视角。受“外部良知”概念启发,团队开发并测试了伦理承诺提醒工具,初步实验显示其能有效降低模型不对齐行为。公司计划未来将对话拓展至法律、心理学及公民社会等领域,以共同应对AI对社会结构的重塑。

    推荐理由:Anthropic在做一件少见的事——请神学家和哲学家帮忙塑造Claude的‘性格’,初步实验发现让模型在决策前暂停反思能降低偏差,做AI对齐的值得读一下。

  11. Google Developers Blog(RSS)57

    创新一周年:庆祝Google Cloud x NVIDIA开发者社区达到10万会员

    Google Cloud与NVIDIA开发者社区迎来成立一周年,会员规模突破10万。社区为开发者提供先进AI基础设施与资源支持,包括LLM优化、GPU加速数据分析等专项学习路径及专家网络研讨会。第二年计划将进一步扩展,推出实践实验室、工程活动及聚焦代理式AI增长的专项内容。

    推荐理由:Google Cloud 和 NVIDIA 的开发者社区一年攒了 10 万人,不算大新闻,但官方放出的 agentic AI 课程和动手实验室对做 Agent 的工程师挺实在,可以关注一下。

5月18日周一
  1. Hugging Face:Blog(RSS)64

    Hugging Face 推出开放 AI 智能体排行榜(Open Agent Leaderboard)

    Hugging Face 发布开放 AI 智能体排行榜,用于比较完整智能体系统而非仅底层模型,并同时报告成功率和每次任务成本。排行榜统一了六项已有基准测试(SWE-Bench Verified、BrowseComp+、AppWorld、tau2-Bench Airline & Retail、tau2-Bench Telecom),覆盖代码修复、网络研究、个人任务、客服和技术支持。通过统一协议,各智能体系统以相同接口连接所有基准。结果显示相同模型搭配不同智能体系统会产生显著不同的分数和成本。配套 Exgentic 框架用于运行和复现评估,相关论文开源。

    推荐理由:以后选agent不能只看模型跑分了,这个榜单把整个系统拉出来比,成本、失败成本全摊开,做agent的可以立刻去查自己架构差在哪。

  2. Cursor Blog74

    Composer 2.5 发布与技术解析

    Cursor 平台发布了智能与行为表现大幅提升的 Composer 2.5。该模型更擅长执行复杂指令和长期任务。其改进基于训练规模的扩大、更复杂的强化学习环境及新的学习方法。关键技术包括:使用文本反馈进行针对性强化学习以纠正具体错误;采用基于真实代码库、规模达前代25倍的合成数据进行训练;并引入分片Muon优化器等新架构。模型基于Moonshot的开源检查点构建。开发团队正合作训练一个计算量十倍的更大模型,并在大规模训练中发现了新型奖励作弊问题。

    推荐理由:Cursor的Composer 2.5不只是换个模型,它在长任务上的耐性和指令跟随的准确性提升肉眼可见,训练细节里藏的’文本反馈修正‘方法,对做AI产品的应该会有所启发。

  3. xAI:News(网页)68

    Grok平台技能功能上线

    xAI于2026年5月18日正式推出Grok的“Skills”功能,旨在提供持久的专业知识支持。该功能允许用户对Grok进行一次性的偏好、格式规则或工作流程设置,即可在所有对话中持续生效,无需重复说明。Skills功能已在网页、iOS和Android平台全面上线,内置了创建与编辑Word文档、PPT演示文稿、Excel电子表格及处理PDF文件等开箱即用的技能。用户可以覆盖内置技能进行自定义,也能够通过对话快速创建新技能,从而实现工作流自动化与专业文档的便捷生成。

    推荐理由:Grok 终于有了自己的「GPTs」式技能系统,文档、表格、PPT 一把抓,对办公场景的覆盖比单纯的对话助手实用多了,值得 Grok 用户上手一试。

  4. Runway:News(网页)57

    分布式训练为何艰难:DTensor、正确性与抽象的代价

    本文探讨了分布式训练中的正确性难题及DTensor方案的权衡。DTensor通过为张量附加放置元数据(如Shard、Replicate)来自动管理通信,确保计算正确性。文章通过一个并行化案例,展示了不使用DTensor时手动处理梯度计算可能引发的静默错误(如梯度为零或倍增),从而凸显了正确性的复杂性。然而,DTensor的抽象层在简化开发的同时,也可能在大规模场景下引入隐性的性能开销。因此,在设计分布式系统时,需要在抽象的开发便利与底层的计算效率之间做出审慎权衡。

    推荐理由:Runway 工程师用四次失败的并行化尝试把分布式训练的正确性难题拆解得明明白白,还给出了 DTensor 在规模下吃掉的 MFU 和编译陷阱的一手数据,做大模型训练的人值得从头读到尾。

  5. Prime Intellect(网页)63

    Prime Intellect 开源自进化合成智能体环境 general-agent

    Prime Intellect 开源 general-agent 环境 v1,通过 Synthesizer 与 Solver 双智能体博弈生成自进化任务语料,目前包含 4,504 个任务、1,040 个领域和 8,159 个独特工具,每个任务经求解器按难度带实证校准。

    推荐理由:原文给出了任务规模、难度校准方法和早期 SFT/RL 结果,读者可以评估这个自进化合成环境对智能体训练的参考价值。

  6. Manus:Blog(网页)60

    Manus 发布定时任务 2.0,支持在同一任务、项目和网页应用中持续运行

    Manus 发布定时任务 2.0,让定时能力覆盖任务、项目和网页应用等更多上下文。定时任务可留在同一任务上下文继续运行,沿用项目里的文件、技能、连接器和输出标准;Manus 构建的网页应用可内置定时动作,刷新数据或生成摘要。更新还提供侧边栏、日程视图和日历视图查看运行记录,支持跳过确认、连接器和云电脑等高级设置,目前已面向所有用户开放。

    推荐理由:官方介绍定时任务 2.0 的运行方式与可见性变化,用户可据此判断周期性工作如何接入任务、项目和网页应用。

  7. Anthropic:Newsroom(网页)64

    Anthropic收购SDK与MCP服务器工具开发商Stainless

    Anthropic宣布收购SDK与MCP服务器工具开发商Stainless。Stainless自2022年成立以来,一直为Anthropic官方SDK的生成提供支持,其工具能将API规范转化为TypeScript、Python、Go等多语言的SDK、命令行工具及MCP服务器。此次收购旨在增强Claude平台的开发者体验,提升AI代理连接外部数据与工具的能力,从而在MCP协议基础上进一步拓展连接生态。

    推荐理由:Anthropic收购Stainless,表面是SDK团队整合,深层是给Claude的Agent连接能力铺路。未来MCP服务器的质量和数量可能会跨一个台阶,做Agent开发的值得关注。

  8. Cognition 模型 / Devin 博客(网页)68

    Cognition 推出 Devin Auto-Triage 自动排查告警并生成修复 PR

    Cognition 推出 Auto-Triage,Devin 可自动监控 Slack、Linear、GitHub、Sentry、Datadog 和 webhook 等来源的告警,立即检查代码库与可观测性工具、并行派生 sub-Devin 调查,输出结论、下一步或直接开 PR。

    推荐理由:原文来自官方发布,说明了 Devin Auto-Triage 的告警自动排查流程、记忆机制和安全设计,工程师可据此评估是否接入现有事故响应链路。

5月16日周六
  1. Claude Code:GitHub Releases(RSS)61

    Claude Code v2.1.143 版本更新:插件管理与用户体验增强

    Claude Code 发布 v2.1.143 版本,重点增强了插件管理功能,包括强制执行插件依赖关系,并新增了插件市场的预估上下文成本显示。为方便直接编辑工作副本,增加了 `worktree.bgIsolation: "none"` 设置。多项体验得到改进:后台会话唤醒后保留模型与努力级别设置;Windows PowerShell 工具默认绕过执行策略;`claude agents` 命令新增多个参数以配置默认会话。此外,本次更新修复了大量错误,包括修复损坏的 `.credentials.json` 文件导致 CLI 启动卡住、Windows Terminal 中的右键粘贴问题、后台会话错误捕获 IDE 文件引用,以及 macOS 上后台作业读取特定目录文件的权限错误等。

    推荐理由:Claude Code 的 v2.1.143 是个纯修补版本,修了一大堆边缘 bug 外加几个小优化,对重度用户可能是救命稻草,其他人可以等下次大版本。

  2. Dwarkesh Patel:Podcast & Blog(RSS)55

    Eric Jang – 从零开始构建 AlphaGo

    文章以AlphaGo为例,阐述了智能的基本构成要素。AlphaGo至今仍是最清晰、最完整的范例,它融合了三大核心基础:搜索技术、从经验中学习以及自我对弈。这三大要素共同构成了其实现超越人类棋艺的关键路径。

    推荐理由:Eric Jang 把 AlphaGo 的搜索、自对弈和价值网络拆解得非常通透,用现代工具复现让这个经典思路对今天的 RL 和自动研究都有直接启发,做 LLM 后训练的尤其该听听他对信用分配问题的解释。

5月15日周五
  1. 蚂蚁 inclusionAI:HuggingFace 新模型56

    蚂蚁集团提出 ARGenSeg-8B:基于自回归图像生成模型的图像分割框架

    蚂蚁集团推出 ARGenSeg-8B,一种将多模态理解与像素级感知统一的自回归图像生成分割框架。它利用多模态大语言模型(MLLM)输出视觉 token,并通过通用 VQ-VAE 解码为分割掩码,使分割完全依赖 MLLM 的像素级理解。采用 next-scale-prediction 策略并行生成视觉 token,降低推理延迟。在多个分割数据集上超越此前最优方法,推理速度显著提升。论文已被 NeurIPS 2025 接收,模型已发布在 HuggingFace。

    推荐理由:蚂蚁提出用自回归生成做分割,把理解和像素级感知统一到一个框架里,多个数据集SOTA且速度更快,做CV的值得看看。

  2. xAI:News(网页)70

    将Grok接入Hermes智能体

    xAI宣布,用户现可将Grok订阅账户接入Nous Research的开源自改进智能体Hermes Agent。该集成对所有订阅层级开放,允许用户在Hermes环境中直接使用Grok 4.3进行文本对话与高级推理、调用其文本转语音功能生成语音回复,并利用Grok Imagine创建图像与视频。Hermes Agent可持久运行于电脑、沙盒或VPS,具备跨会话长期记忆能力,并能连接WhatsApp、Discord等通讯平台。用户通过安装Hermes Agent并选择Grok提供商即可完成配置。

    推荐理由:如果你已经在用或想尝试Nous Research的Hermes Agent,现在可以直接用Grok订阅,不必再多付一份模型API钱,而且Grok 4.3的推理和图像生成都能在agent里跑,对个人开发者挺友好。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)65

    业务运营团队如何使用 Codex

    业务运营团队可利用 Codex,将实际工作输入转化为多种关键文档。该工具能够基于真实工作内容,自动生成项目简报、战略更新报告、领导决策包以及进度更新等材料。这一应用展示了 Codex 如何将日常运营数据与沟通需求直接连接,提升文档创建效率与一致性,帮助团队更专注于核心业务决策。

    推荐理由:一份给业务运营团队的 Codex 实操手册,直接给出可复制的 prompt 模板,把散乱的 KPI、会议笔记变成决策包。实用性高,信息增量有限。

  4. Tomer Tunguz 博客(VC 分析)72

    推理的一阶导数:AI浪潮下的增长逻辑

    AI推理是当今规模最大、增长最快的技术市场,预计七年内将达到2500亿美元。直接销售或转售推理服务的公司增长迅猛,如Anthropic和谷歌云。在AI时代前的软件公司中,Datadog和Twilio作为“推理的一阶导数”脱颖而出:Datadog的LLM可观测产品数据量近一季增长近两倍,其约20%的AI客户贡献了约80%的年度经常性收入;Twilio则通过AI重构的语音服务吸引客户。当前周期呈现高度集中特点,少数客户能驱动巨大收益。对于非AI原生公司,核心战略在于如何转售推理服务或从其客户的大量采购中获益。

    推荐理由:Tomer 用「推理的第一导数」这个框架讲透了一件事,Twilio 和 Datadog 的暴涨不是偶然,而是买推理的衍生需求,pre-AI 公司想活就得问自己怎么沾上推理的光。

  5. OpenAI:官网动态(RSS · 排除企业/客户案例)56

    销售团队如何使用 Codex

    销售团队可利用 Codex 基于实际工作输入,自动生成一系列关键销售文档。具体功能包括创建管道简报、会议准备材料、预测审核、客户计划以及停滞交易诊断。这一应用将日常沟通与数据转化为结构化、可操作的销售支持内容,帮助团队提升效率与决策质量。

    推荐理由:OpenAI 官方出的销售工作流指南,把 Codex 拆成一整套可复制的步骤,prompt 能直接复制用,销售团队省时间,但实质是已有功能的整理,不是信息增量。

  6. PromptArmor:Threat Intelligence65

    PromptArmor 发布 Microsoft Copilot Cowork 安全部署指南

    PromptArmor 发布 Microsoft Copilot Cowork 安全从业者指南,指出该云端智能体的主要风险是间接提示词注入,且开箱即继承用户的 Microsoft Graph 权限,陈旧的 Teams 成员关系和过度共享的 SharePoint 站点都会成为攻击面。

    推荐理由:作者以一线安全视角拆解 Copilot Cowork 的注入风险面,并给出可操作的租户配置建议,便于按风险档位落地部署。

  7. OpenAI:官网动态(RSS · 排除企业/客户案例)66

    数据科学团队如何使用 Codex

    Codex 能够帮助数据科学团队根据实际工作输入,自动化生成根本原因简报、影响报告、关键绩效指标备忘录、范围分析以及仪表板规格文档。该工具将自然语言描述转化为结构化分析框架,提升了从数据查询到报告生成的工作流效率,使团队能更快速地将业务问题转化为可执行的数据分析方案。

    推荐理由:OpenAI Academy 手把手教数据科学团队用 Codex 产出分析报告,prompt 模板可以直接抄,但作为教程新信息不多,适合 Codex 用户按需参考。

  8. Claude Code:GitHub Releases(RSS)63

    Claude 代理工具 v2.1.142 版本更新

    Claude 代理工具发布 v2.1.142 版本。本次更新新增了 `--add-dir`、`--settings`、`--model` 等 8 个用于配置后台会话的命令行标志,并将 Fast 模式的默认模型升级为 Opus 4.7。插件功能得到增强,拥有根目录 `SKILL.md` 的插件现可被识别为技能,插件详情面板会显示其提供的 LSP 服务器。此外,版本修复了超过 15 项问题,包括 MCP 工具超时设置失效、后台会话在系统休眠后异常断开、守护进程升级后无法正常退出、Windows 网络驱动器工作目录下死锁等关键错误,并改进了响应式压缩和钩子配置错误提示。

    推荐理由:Claude Code 把 Agent 配置折腾得更顺手了,后台任务死锁、睡眠唤醒崩掉这类老毛病也修了一串,如果你的 Dispatch Agent 经常掉链子,这次升级很实在。

  9. Claude:Blog(网页)67

    在法律行业全面部署Claude:产品指南与实施路线图

    2026年报告显示,法律团队生成式AI使用率已从44%跃升至87%。为应对日益复杂的工作,法律行业正将Claude应用于合同审阅、并购尽调及诉讼准备等核心流程,并通过多款产品组合提升效率:Chat用于即时研究,Claude Cowork处理跨文件协作,Microsoft 365插件集成办公套件,Platform支持定制应用开发。Anthropic同步发布法律行业部署指南,涵盖产品矩阵、12个预设业务领域插件及三阶段实施路线图,并解答数据托管与权限保护等关键问题。

    推荐理由:Anthropic法律团队亲自下场写路线图,从合同红笔到隐私评估,把Claude全家桶怎么用、什么时候用讲透了,律所和法务部可以直接照着推。

5月14日周四
  1. Anthropic:Newsroom(网页)82

    Anthropic与盖茨基金会达成2亿美元合作,聚焦全球健康与教育

    Anthropic与盖茨基金会建立为期四年、总额2亿美元的合作,通过资金、Claude使用额度及技术支持,共同推进全球健康、生命科学、教育及经济流动项目。合作重点包括改善中低收入国家约46亿人口的基本医疗,利用AI加速疫苗与疗法研发,并开发公共卫生数据集等公共产品。在教育领域,双方将为美国、撒哈拉以南非洲和印度的K-12学生开发AI教学工具。经济流动方面则关注提升小农户生产力及美国职业技能认证。首批成果预计今年晚些时候发布。

    推荐理由:Anthropic 和盖茨基金会的 2 亿合作不是 PR 包装,全球健康和农业的具体落地计划表明 AI 正在长出「公益器官」,想跟上的组织可以看看协议框架。

  2. 蚂蚁 inclusionAI:HuggingFace 新模型59

    蚂蚁 inclusionAI 推出万亿参数推理模型 Ring-2.6-1T

    蚂蚁 inclusionAI 发布旗舰推理模型 Ring-2.6-1T,参数规模达万亿,面向智能体工作流、工程开发、科研分析等复杂场景。模型从“能回答”升级至“能执行”,在多步任务与工具协作中表现更优;支持 high/xhigh 两档推理强度,可灵活平衡效果与成本;采用异步强化学习结合 IcePop 算法提升训练效率。基准测试中,high 模式 PinchBench 得 87.60、ClawEval 63.82、Tau2-Bench 电信场景 95.32;xhigh 模式 ARC-AGI-V2 得 66.18、AIME 26 达 95.83、GPQA Diamond 88.27。上下文长度支持 128K 扩展至 256K(YaRN),已通过 HuggingFace 和 ModelScope 开放下载。

    推荐理由:蚂蚁放出的万亿参数推理模型,Agent执行能力在PinchBench上超GPT-5.4,异步RL训练和可调推理强度对工程落地有参考价值,开源可试。

  3. CMU:Machine Learning Blog63

    教视觉-语言模型说“电影语言”

    研究团队与百余名专业创作者历时一年,构建了一个视频描述生成流程,其核心在于扩展精细化的人类-AI协同监督,而非单纯扩大模型规模。该研究(入选CVPR 2026亮点论文)指出,当前主流视频生成模型在理解和生成具有电影感的专业运镜(如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头)时存在明显不足,常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型“电影语言”表达能力的新路径。

    推荐理由:这篇CVPR 2026 Highlight的博客版很有意思,它用100多个专业电影人来标注视频,教VLM学会推拉摇移的镜头语言,不是又多一个数据集,而是提醒我们:高质量的人工标注可能比堆模型更重要。

  4. PromptArmor:Threat Intelligence67

    PromptArmor 解析 LLM 沙箱域名白名单的常见外泄风险

    PromptArmor 分析 Agent 沙箱域名白名单的配置与风险,指出 npmjs.com、github.com、docs.google.com 和 *.amazonaws.com 等常用白名单域名都可能被提示注入用作数据外泄通道,例如通过 Google Forms 预填提交链接或攻击者注册的匹配通配符的子域名。

    推荐理由:原文列举常见白名单域名的具体外泄路径并给出收紧评估原则,可迁移到自家 Agent 沙箱的网络配置。

  5. Tomer Tunguz 博客(VC 分析)65

    AI电子邮件的成本分析

    使用顶尖AI模型处理邮件的月度成本约为22至130美元,中位数26美元。若软件公司以75%毛利率定价,年费可能高达350美元,加上托管服务后标价或达500美元,约为Google企业邮箱费用的两倍。采用小型模型可降低成本10至20倍,而通过本地运行利用用户GPU,更能将成本削减至接近零。结合基础启发式方法和技术优化,总成本有望降低100倍。这种针对不同工作负载匹配模型并进行成本分层的推理市场细分,将是未来一两年AI软件发展的关键。

    推荐理由:Tunguz 给 AI 邮件算了一笔账,SOTA 模型月费 22-130 美元,但他更重要的判断是推理分割可以把成本压到百分之一,这对做 AI 软件的定价逻辑是个关键风向。

  6. Together AI 研究与产品博客(RSS)65

    Together AI 开源视频翻译工具 Violin,集成 Whisper、DeepSeek V4 Pro 与 Sonic 3

    Together AI 发布全开源视频翻译工具 Violin,代码以 MIT 许可证开放在 github.com/shang-zhu/violin。流程分三步,用 Together 的 Whisper V3 做多语言转写,DeepSeek V4 Pro 做翻译,Together 托管的 Cartesia Sonic 3 合成多种母语语音,且不支持声音克隆。

    推荐理由:原文完整给出了 ASR、LLM 翻译、TTS 三段流水线所用模型和 MIT 开源仓库入口,读者可以照着部署或改造成自己的翻译流程。

  7. xAI:News(网页)73

    xAI 推出 Grok Build 早期测试版

    xAI 面向 SuperGrok Heavy 订阅用户推出 Grok Build 早期测试版。这是一个直接在终端运行的新型编程智能体与命令行工具,专为专业软件工程和复杂任务设计。其核心功能包括:支持“计划模式”,允许用户在代码执行前审阅和修改详细步骤;能无缝集成现有开发工具链;可将大型任务分解,交由并行运行的专用子智能体处理。此外,该工具提供无头模式,便于脚本和自动化流程集成。用户可通过单行命令安装并立即在项目中使用。

    推荐理由:xAI终于下场做终端里的编码代理了,功能规划看着挺全,但早期beta只开放给SuperGrok Heavy用户,普通开发者还得再等等。

  8. Claude Code:GitHub Releases(RSS)67

    Claude 工具 v2.1.141 版本更新

    Claude 工具发布 v2.1.141 版本,带来多项功能新增与优化。主要更新包括:为钩子输出添加 `terminalSequence` 字段以支持无控制终端的桌面通知;新增 `CLAUDE_CODE_PLUGIN_PREFER_HTTPS` 环境变量,便于通过 HTTPS 克隆插件源码;引入 `ANTHROPIC_WORKSPACE_ID` 变量以在多工作区联盟中限定令牌范围。会话管理方面,`claude agents` 命令新增 `--cwd` 参数用于按目录筛选,并优化后台代理的状态归类。用户体验改进包括:在倒带菜单添加“总结至此”选项以压缩早期上下文;长思考超时后旋转指示器变色提供更明确反馈;此外,还修复了 Markdown 表格渲染异常、权限提示逻辑、历史记录管理等超过 30 项问题。

    推荐理由:Claude Code 的小版本但修得扎实,MCP 连接、/bg 权限继承、VSCode 语音等一堆边角都补了,Agent 模式稳定性明显提升,强烈建议升级。

  9. Claude:Blog(网页)73

    在大型代码库中高效运用Claude Code:最佳实践与入门指南

    Claude Code已成功部署于数百万行的单体仓库、遗留系统及分布式架构中。其核心在于围绕模型构建的“工具套件”,而非仅依赖模型本身。该套件包含五个关键扩展点:提供代码库概览的CLAUDE.md文件、实现持续改进的钩子、按需加载专业知识的技能、插件以及MCP服务器。它采用智能体搜索模式,直接在开发者本地实时代码库上操作,无需构建和维护集中式索引,从而避免了传统RAG系统在活跃大型代码库中索引过时的问题。团队对代码库设置的投入程度直接决定了其导航效果。

    推荐理由:这是 Anthropic 官方出的 Claude Code 大型代码库配置指南,把 CLAUDE.md、hooks、skills 的层级和分工讲得比社区经验更系统,做工程落地的团队可以当作部署手册。

  10. Claude:Blog(网页)74

    创始人手册:构建AI原生初创公司

    Anthropic公司发布了一份面向AI原生初创企业的实用指南,旨在重塑2026年创业生命周期的构思、最小可行产品、发布和规模化四个核心阶段。该手册为每个阶段提供了具体目标、退出标准、常见失败模式及AI驱动练习,涵盖如何利用Claude进行问题验证与客户发现、避免AI生成代码的技术债务、区分真实产品市场契合度与早期炒作,并引入智能工作流替代创始人手动操作。指南还整合了多家初创企业的实践案例,为从零开始围绕AI构建公司的创始人提供架构、范围与安全方面的最佳实践。

    推荐理由:这份创业手册把从Idea到Scale四阶段拆成了可复制的流程和prompt,不再是玄学方法论,而是创始人可以直接上手操作的“AI创业作弊本”。