跳到正文

全部动态

今日 5 条
6月5日周五
  1. Ethan Mollick:One Useful Thing(RSS)61

    共存与协同智能的终结

    Ethan Mollick 在 One Useful Thing 博客中,以“共存与协同智能的终结”为题,并附带介绍了如何向 AI 推销一本书。

    推荐理由:Mollick 这篇比单纯的新书预告有料,用自己给 AI 写推荐语的实验,把「AI 不再是助手而是守门人」这个新现实讲得很具体。对还在纠结怎么跟 AI 合作的人,是一个挺及时的视角更新。

  2. Dwarkesh Patel:Podcast & Blog(RSS)63

    Alex Imas 和 Phil Trammell:AGI 后什么仍然稀缺?

    经济学家 Alex Imas 和 Phil Trammell 指出,AGI 时代机器人数量可以快速复制增长,但人类独特技能(以芭蕾舞演员为例)的数量保持不变,揭示了即使技术大幅进步,某些稀缺资源仍不可替代。

    推荐理由:Alex Imas和Phil Trammell用经济学框架推演AGI后稀缺性,我没想到资本份额可能上升也可能下降,他们对“关系部门”的定义比简单说“人类服务值钱”更精准,值得一看。

  3. Claude:Blog(网页)76

    Claude Cowork 产品指南

    Anthropic 发布 Claude Cowork,一款运行在 Claude 桌面应用中的知识工作智能体。它可读写本地文件、跨 Slack 和 Google Drive 等应用协作,执行多步骤任务并生成带引用的实际交付物。核心能力包括本地文件访问、子智能体、长时间运行和定时任务。Claude Cowork 区别于对话式 AI 工具,支持用户描述目标与期望结果后自动规划执行。指南还介绍了产品矩阵(对话聊天、Claude Code 编程、Claude Cowork 跨应用知识工作)、设置要求、权限模型、七种常见工作流(如研究简报、会议准备、定期报告)以及营销和产品管理等插件。

    推荐理由:把 Claude 从问答工具升级成能读写本地文件、跨应用交付可交付物的知识工作代理,这份官方指南给出了明确上手路径和七个真实工作流,做产品、做调研的都能直接照抄。

  4. Google Developers Blog(RSS)75

    Google Colab CLI 发布

    Google 推出 Colab 命令行界面(CLI),允许开发者和 AI 智能体将本地终端连接到远程 Colab 运行时,实现无摩擦执行。该轻量级 CLI 支持请求高性能 GPU、远程运行本地 Python 脚本,并检索工件日志或模型(如微调后的 Gemma 3 适配器)。工具可直接集成到标准终端环境,可被 Antigravity、Claude Code 等 AI 智能体调用以管理复杂机器学习流水线。

    推荐理由:对于习惯在 Colab 上薅免费 GPU 的开发者,这个 CLI 把本地开发、远程跑训练这套流程的摩擦降到了几乎为零,而且直接对接 AI agent,实验自动化往前迈了一大步。

  5. Anthropic:Research(发表成果 · 网页)65

    Anthropic:让Claude成为化学家

    Anthropic与顶尖化学家合作,提升Claude在化学领域的实用性。首个白皮书测试Claude在NMR谱图分析上的表现:在20个化合物上,对比Claude Opus 4.7、Opus 4.6、Sonnet 4.6与ChemDraw、MestReNova的正向预测(从结构预测谱图)和反向结构解析(从实验谱图推断结构)能力。所有化合物选自模型训练截止日期后发布的ChemRxiv预印本,以避免选择偏差。

    推荐理由:化学家可能几年后回头看会记起这篇,Claude Opus 4.7 在 NMR 预测上追平了 ChemDraw,还顺手做了反向结构解析——专业软件不干的事,它用更接近人类日常输入的方式做到了。

  6. LMSYS:Blog(Chatbot Arena 团队)62

    不再遗漏任何Token:解析Miles中的Token-In-Token-Out(TITO)

    Miles框架提出Token-In-Token-Out(TITO)原则,解决智能体强化学习中训练-推理不匹配:确保rollout过程token序列与训练器评估序列逐位一致。TITO将多轮轨迹视为一个连续序列(每任务一个样本),节省一个数量级计算开销并维持on-policy性。三种破坏场景:反分词-再分词不匹配、聊天模板修剪推理内容、有损模板重新渲染。Miles通过推理会话服务器、三级只追加保证、可插拔TITO分词器和序列比较器实现。典型任务(如SWE-Bench)轨迹含30-50轮。

    推荐理由:LMSYS团队把agent RL里最隐秘的训练-推理不一致问题解释透了,TITO原则直接告诉你为什么之前训练不稳,做agent训练的都该看看这篇。

6月4日周四
  1. Hugging Face:Blog(RSS)75

    Nemotron 3.5 ASR:为你的语言、领域或口音进行微调

    Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,单个检查点覆盖 40 种语言-地区(含英、西、德、法、意、日、韩、中、阿拉伯等)。采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,缓存内部状态避免重复计算,实现低延迟流式转录且不损失精度。模型原生输出带标点和大写的生产级文本,无需后处理。支持指定语言(target_lang=es-ES)或自动语言检测(target_lang=auto)。通过注意力上下文大小(att_context_size)可在推理时直接调节延迟-准确率权衡,范围从 80ms 到 1.12s,无需重新训练。模型以 NeMo 检查点形式发布,可用于微调以适配特定语言、领域或口音。

    推荐理由:一个模型搞定40种语言的实时语音转文字,NVIDIA还给了完整微调代码和实测数据,做语音Agent和字幕的可以照着抄作业。

  2. Hugging Face:Blog(RSS)65

    EVA-Bench Data 2.0 发布:覆盖三大领域、121 个工具、213 个场景

    EVA-Bench Data 2.0 将评估范围从单一企业领域扩展至航空公司客户服务管理(CSM)、企业 IT 服务管理(ITSM)和医疗 HR 服务交付(HRSD)三个领域,共涵盖 121 个工具、213 个场景,场景数较原始版本增长约 4 倍。每个场景均经 OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6 验证可解性。数据集遵循语音优先、真实性、多样性、认证流程和可复现性五项设计原则,包含单意图、多意图(最多 4 个意图)和对抗性呼叫类型。所有三个数据集已开源,可通过 `load_dataset` 从 Hugging Face 直接下载。后续将推出多语言扩展。

    推荐理由:语音代理评测缺的就是这种真实场景的数据集,EVA-Bench 2.0 把航空、IT、医疗三个最棘手的领域打包了,生成流水线也开源,做评测的可以直接拿来用。

  3. ElevenLabs:Blog(网页)60

    ElevenLabs 在 ElevenCreative Flows 中推出 Flows Agent 对话式创作助手

    ElevenLabs 在 ElevenCreative 的节点式创作画布 Flows 中推出 Flows Agent,用户在聊天侧栏描述需求后,Agent 会选择合适模型、创建并连接节点、执行图像、视频、配音、口型同步等完整生成流程。

    推荐理由:原文介绍了对话式 Agent 如何在节点画布中搭建并迭代多模态流水线,还给出 assist 模式和后台运行等控制方式。

  4. OpenRouter:Announcements(RSS)75

    OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?

    OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。

    推荐理由:这场大逃杀实验把模型对齐税摆上了台面,Grok因少斟酌、多行动而胜出,Claude的犹豫反而是现实场景里更需要的品质,选模型不能只看赢不赢,要看任务需要什么性格。

  5. OpenRouter:Announcements(RSS)66

    OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔

    OpenRouter 用总价 482 美元的推理花费,让 11 款大语言模型在 30 轮实时决策的“大逃杀”挑战中正面竞争。实验结果表明,传统的静态 benchmark 排名无法反映模型在需要即时反应的智能体任务(如自主控制机器人)中的真实表现,Claude 和 Grok 系列模型在决策速度与任务成功率上表现突出,而多项高分模型的实时调度能力未达预期。

    推荐理由:Jacky 把 11 个模型丢进大逃杀,发现 Grok 4.1 Fast 以 27 倍成本优势击败 Sonnet,而获胜关键不在基准分数,在于模型被训练时压制的攻击性。对任何不再只看排行榜选模型的人,这是今年最值得读的实验。

  6. Hugging Face:Blog(RSS)68

    Nemotron 预训练的任务种子合成问答生成

    在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotron Ultra 和 Super 训练。

    推荐理由:NVIDIA 公开了 Nemotron 训练中造合成数据的详细方法论,用 70 个公开任务训练集做种子生成新题目,100B token 实验把 GPQA 拉高 11 个点,做预训练的人值得看看他们怎么造的数据。

  7. vLLM 官方博客(RSS)61

    NVIDIA 发布开源推理模型 Nemotron 3 Ultra,vLLM 提供 Day-0 支持

    NVIDIA 发布开源模型 Nemotron 3 Ultra,采用 Hybrid Transformer-Mamba MoE 架构,总参数 550B、激活 55B,上下文最长 1M token,主打长时程自主智能体工作流,vLLM 提供 Day-0 支持。

    推荐理由:原文给出架构细节、部署配置和与 GLM 5.1、Kimi K2.6、Qwen3.5 的基准对比,读者可据此评估其在长时程智能体工作流中的适用性。

  8. Claude Code:GitHub Releases(RSS)59

    Claude Code v2.1.162 发布

    Claude Code v2.1.162 发布,主要包含 Bug 修复和体验优化。`claude agents --json` 新增 `waitingFor` 字段,`/effort` 命令确认级别持久化,远程控制固定底部显示,`/ide` 菜单中 Windsurf 更名为 Devin Desktop。修复了配置文件只读导致启动黑屏、Windows 权限规则不匹配、LSP 的 `workspaceSymbol` 无结果、API 400 错误、MCP 超时低于 1000ms 被截断等十余项问题。

    推荐理由:一系列扎实的修复,尤其是 Windows 权限匹配和启动挂死问题的解决,对于日常用 Claude Code 做开发的来说稳定性提升明显,可以升级。

  9. LMSYS:Blog(Chatbot Arena 团队)77

    Boson AI 与 LMSYS 发布基于 SGLang-Omni 的 Higgs Audio v3 TTS 端到端服务

    Boson AI 与 LMSYS 联合推出基于 SGLang-Omni 推理框架的 Higgs Audio v3 TTS 端到端服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持 100 种语言(内部评测覆盖 111 种),在 Seed-TTS、CV3、MiniMax-Multilingual 及 Higgs-Multilingual 零样本语音克隆任务中达到单字级 WER/CER。开发者可通过文本内控制标签实时调整情感(20+种)、风格、韵律(语速/音高/停顿)及音效。模型支持流式合成,文本未完整时即可开始生成语音并保持一致性。SGLang-Omni 专为多阶段生成模型设计,统一调度 AR 解码与轻量计算,实现低延迟推理。

    推荐理由:Higgs v3 把多语言和实时可控制整合进一个流式 TTS 模型,SGLang-Omni 为它搭好了多阶段推理的底座,做语音 Agent 的可以直接抄作业,这比多数论文落地快半拍。

6月3日周三
  1. Anthropic:Newsroom(网页)59

    介绍 Claude Partner Network 的 Services Track 和 Partner Hub

    Anthropic 扩展 Claude Partner Network,推出 Services Track 分级体系和 Partner Hub 门户。Services Track 设 Select、Preferred、Global Premier 三级,按认证人数、投产客户数及客户推荐信量化评定。Partner Hub 提供每日更新仪表盘和公开目录,方便合作伙伴查看进展、客户寻找供应商。该网络三月启动以来已有超 4 万家公司申请,逾 1 万顾问获认证;Accenture 训练 3 万人,Cognizant 部署约 35 万员工,Deloitte 惠及 47 万人,KPMG 覆盖 27.6 万,Infosys 构建行业智能体,PwC 先在美推广再扩至全球。

    推荐理由:Anthropic 给合作伙伴画了一条明确的爬升阶梯,从 Select 到 Global Premier,企业客户终于有个公开透明的渠道找靠谱的实施团队,做 AI 咨询的可以认真评估入局了。

  2. Cursor Blog60

    Cursor Enterprise 推出 Organizations 组织管理功能

    Cursor Enterprise 正式推出 Organizations 结构,允许企业在统一面板中管理多个团队。每个团队可独立设置预算、安全策略、模型访问和功能控制。新增 Groups 作为跨团队或团队内的轻量级用户集合,用于分段管理模型访问、花销上限和智能体权限,不同设置取最宽松权限生效。管理员可创建沙箱团队预先测试新功能,再向全公司推送;也可按部门划分模型访问和预算。组织级仪表盘汇总所有团队的 token 用量与花费,支持按团队、用户等维度筛选。身份提供商和 SCIM 目录在组织层面一次配置,成员自动同步。该功能现已全面开放给所有 Enterprise 客户。

    推荐理由:这是 Cursor 企业版在治理能力上的关键补丁,把多团队预算、模型权限和沙盒测试管了起来,对想把 AI 编程推到千人规模的团队是实打实的基建更新。

  3. Anthropic:Research(发表成果 · 网页)69

    Anthropic 分析 832 个 AI 恶意账户:中高风险攻击者半年从 33% 跃至 56%

    Anthropic 分析 2025 年 3 月至 2026 年 3 月间 832 个被封禁的恶意账户,映射至 MITRE ATT&CK 框架。67.3% 使用 AI 编写恶意软件,6.5% 用于横向移动。六个月间中高风险攻击者占比从 33% 升至 56%。AI 用于账户发现增长 8.9%,AI 辅助钓鱼下降 8.6%。传统基于技术数量或平台(Claude Code、API、聊天界面)的威胁评估失效,而 MITRE ATT&CK 框架尚未收录此类智能体编排行为。

    推荐理由:这份报告用一整年的真实案例揭示了AI攻击正从初始入侵转向深度潜伏,连MITRE ATT&CK框架都开始跟不上。安全从业者值得一读,它告诉你下一波威胁长什么样。

  4. OpenAI:部署安全与系统卡(网页)66

    OpenAI 发布 GPT-Rosalind-5.5 系统卡,定位生命科学高能力模型并设可信访问门槛

    OpenAI 发布 GPT-Rosalind-5.5 系统卡,该模型从 GPT-5.5 增量训练生命科学相关数据,不再拒绝复杂生物学查询,并以可信访问审查作为主要安全防护。

    推荐理由:系统卡说明了模型训练目标、评测结果与可信访问门槛,读者可以据此了解其在生命科学场景的能力边界和安全机制。

  5. xAI:News(网页)75

    xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)

    xAI 通过 API 发布了图像转视频模型 `grok-imagine-video-1.5-preview`(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。

    推荐理由:xAI的新视频模型从单张图像生成电影级短片,支持自然语言控制运镜和氛围,对视频创作者和开发者是个值得一试的工具。

  6. Tomer Tunguz 博客(VC 分析)66

    智能性价比

    微软在模型发布卡中首次加入平均token使用量指标。其模型在SWE-Bench Verified上达71.6分,仅消耗约Claude Haiku 4.5三分之一的token。Artificial Analysis的Intelligence Index显示GPT 5.5与Claude Opus 4.8得分相近(约60分),但Opus 4.8运行成本高出40%($4,685 vs $3,357)。Uber因四个月内AI预算超支而限制员工使用;Salesforce花费$3亿购买Anthropic tokens并冻结工程招聘。模型公司如今需同时在性能和成本两个维度竞争。

    推荐理由:微软在模型发布卡上悄悄加了“平均token消耗”这个指标,这不是小改动,而是宣告AI从堆算力转向算账时代。Uber和Salesforce的预算教训已经很清楚了。

  7. xAI:News(网页)72

    Grok 成为 Vapi 的默认语音引擎

    xAI 宣布与 Vapi 合作,Grok 将作为 Vapi 平台上 12 种核心语音的默认引擎,覆盖超过 250 万个语音智能体。在 Vapi 独立盲测中,Grok Voice 位列第一;X 平台上的人机语音盲猜中,超 4500 名用户有一半无法区分 Grok 与真人。现在,Grok Speech-to-Text 和 Text-to-Speech 已集成至 Vapi Dashboard,团队还可通过 Grok Voice API 获取高级定制选项(含语音克隆),用于旁白、播客、广告等场景。

    推荐理由:xAI 把 Grok 的语音能力直接接入了 Vapi,250 万+语音代理一夜升级,语音交互的“自然度”竞赛从实验室卷到了生产环境。

  8. vLLM 官方博客(RSS)61

    vLLM 与 DeepLearning.AI 推出免费课程《Fast & Efficient LLM Inference with vLLM》

    vLLM 与 Red Hat、Andrew Ng 的 DeepLearning.AI 联合推出免费课程《Fast & Efficient LLM Inference with vLLM》,约 1.5 小时,含 9 节视频和 3 个 JupyterLab 动手实验。

    推荐理由:课程覆盖压缩、部署、基准测试全流程,用可视化讲清 KV cache 和量化原理,并配三个可动手的实验。

  9. PromptArmor:Threat Intelligence78

    PromptArmor 披露 ChatGPT for Google Sheets 数据外泄漏洞,OpenAI 移除 Apps Script 生成能力

    PromptArmor 披露 ChatGPT for Google Sheets 存在间接提示词注入漏洞,一次良性查询即可触发工作簿外泄、钓鱼弹窗、侧边栏劫持和恶意编辑,演示中共外泄 12 个工作簿,且在用户明确要求人工审批时攻击仍可成功。

    推荐理由:原文完整披露了攻击链、演示和 OpenAI 的修复回应,读者可以据此评估 ChatGPT for Google Sheets 的间接提示词注入风险面。

  10. Gary Marcus:The Road to AI We Can Trust(RSS)60

    突发:AI理智的梦想成真时刻

    Gary Marcus在其个人专栏中分享了一个真实的瞬间,以此反映了他对于人工智能实现稳定、可靠(即“理智”)发展的思考与期许。

    推荐理由:Gary Marcus 三年前的参议院建议如今变成总统行政命令,AI 预检制度从呼吁走向落地,是美国 AI 监管的一个标志性转折点。

  11. Microsoft:Official Blog(RSS)66

    微软:企业成功的关键在于围绕AI构建集成智能体平台

    微软认为,企业成功的关键在于围绕AI构建一个集成的智能体平台,而非仅拥有强大模型。该平台需遵循三大原则:单一集成系统、安全与治理内建、持续改进。微软正构建一个支持多种模型、以开发者为中心的开放平台,让智能体在软件交付、支持、财务等职能中执行长期工作。

    推荐理由:微软把agent平台从散装工具升级成统一系统,这个「企业AI操作系统」的思路让治理和持续进化成为内置能力,而不只是模型和算力。

  12. GitHub Blog72

    GitHub Copilot应用:智能体原生的桌面体验

    在微软 Build 2026 大会上,GitHub 发布了新的工具和更新,并将 Copilot 应用定位为“智能体原生的桌面体验”。其核心目标是让 AI 智能体能够以用户已经习惯的方式进行工作。

    推荐理由:GitHub 把 Copilot 从插件变成了独立桌面应用,Agent 不再躲在 IDE 背后,这是 AI 编程从辅助工具走向桌面中枢的标志,开发者现在可以直接在桌面上跟 AI 协作了。

  13. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Voice-2 语音合成模型,支持 15 种语言与零样本声音克隆

    Microsoft 发布文本转语音模型 MAI-Voice-2,官方称在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升,并列对比偏好测试中 72% 的场景优于 MAI-Voice-1。

    推荐理由:原文给出语言扩展、情感控制、零样本克隆与偏好测试数据,读者可以据此评估它在语音产品里的实际可用性。

  14. Claude:Blog(网页)74

    Claude Code团队实践:智能体编程如何重塑工程组织与流程

    在Code w/ Claude SF 2026活动上,Claude Code工程团队分享了将智能体编程设为默认工作方式后带来的流程与结构变革。核心变化包括:规划转向即时(JIT)模式,强调快速原型与反馈;上下文收集变为“先问Claude”;代码审查中Claude处理风格与测试,人工专注于法律、安全等专业判断。新范式下,工程瓶颈从编写代码转向验证、审查与安全维护。

    推荐理由:Anthropic 工程总监把 Claude Code 团队流程全晒了出来,从抛弃半年路线图到代码审查只留专家复审,每一步都反直觉但实战有效,工程领导者直接抄作业。

  15. Claude:Blog(网页)73

    Anthropic 用 Claude 赋能自助数据分析

    Anthropic 使用 Claude 自动化了 95% 的业务分析查询,整体准确率约 95%。其关键在于构建智能体分析栈(agentic analytics stack),通过数据基础层、维护验证流程和技能(skills)分别解决概念-实体歧义、数据过时和检索失败三大错误来源。相比编码场景,数据分析的难点在于将用户问题映射到正确的数据实体,而执行 SQL 反而是简单的。Anthropic 的数据科学团队因此得以专注于因果建模、预测和机器学习等战略工作。

    推荐理由:Anthropic 把内部用 Claude 搞自助分析踩过的坑全摊开,技能模板和「语义层优先」的强制流程是实打实的干货,做数据 agent 的团队可以直接抄作业。

  16. Anthropic:Research(发表成果 · 网页)77

    AI驱动的网络威胁映射:LLM ATT&CK Navigator的洞察

    Anthropic分析了832个因违反政策被封禁的恶意账户(2025年3月至2026年3月),将其活动映射到MITRE ATT&CK框架的全部14种战术和482种子技术。风险评分显示,中等及以上风险行为者比例从上半年的33%跃升至下半年的56%,增长集中在横向移动、凭证窃取、webshell等高危技术。Agentic scaffolding使攻击链实现自主编排——2025年11月一次间谍活动风险评分达100,所用技术数量却与中等风险者相当。MITRE ATT&CK框架尚未覆盖这种自主攻击。该报告与Verizon合作,已纳入2026年数据泄露调查报告;Anthropic据此更新了Claude的检测分类器以拦截高风险行为。

    推荐理由:Anthropic 首次把一年内 832 个恶意账户的 AI 辅助攻击行为完整映射到 MITRE ATT&CK 框架,并给出风险评分工具,数据表明高风险攻击者半年内增长了七成,关键驱动力不是技术高低而是编排与自主执行,威胁情报团队应该马上拿来校准自己的检测规则。

  17. Claude:Blog(网页)76

    Claude Cowork 入门最佳实践

    Anthropic 增长营销负责人 Austin Lau 介绍了非技术知识工作者使用 Claude Cowork 的最佳实践。Claude Cowork 是面向文档、电子表格等多步骤任务的 AI 助手,用户无需编程技能,将其指向文件夹或连接已有应用即可委托任务。与用于快速问答和头脑风暴的 Chat 以及面向开发者的 Claude Code 不同,Claude Cowork 适用于需要产出交付物、涉及多个文件或应用、可重复执行的场景。Lau 给出了判断任务是否适合的五项检查清单,并预告将于6月4日分享具体营销用例。

    推荐理由:Anthropic 官方教你如何把 Claude Cowork 用到极致,从每日摘要到自动报表,非技术人员看完就能上手,比自己硬摸索省十倍时间。

  18. Claude:Blog(网页)68

    Claude Code技能使用经验:Anthropic内部实践

    Anthropic 分享了内部使用 Claude Code 的 Skills(技能)功能的经验。Skills 是指令、脚本和资源的文件夹,智能体可发现并调用它们以提升准确性和效率。Anthropic 内部已有数百个活跃使用的技能,它们可归为九类,包括库和 API 参考、产品验证、数据获取与分析、业务流程与团队自动化、代码脚手架与模板、代码质量与审查等。最佳技能专注于单一类别,涵盖过多功能会混淆智能体。团队发现,投入时间优化验证类技能对 Claude 输出质量的提升最显著。

    推荐理由:这不是产品公告,而是从几百个内部技能中血泪总结出的实战手册。如果你想让Claude Code真正变成你的工程副驾驶,这9类技能和‘gotchas’章节至少省你三个月踩坑。

  19. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月2日周二
  1. Gary Marcus:The Road to AI We Can Trust(RSS)55

    Gary Marcus:为什么事情终将崩塌

    知名人工智能批评者Gary Marcus在其关于可信赖AI的专栏中,探讨了人工智能发展面临的根本性挑战。文章开篇即指向问题的核心,指出相关数学理论的局限性与人类心理的复杂性,是导致AI系统最终可能出现问题的根源。

    推荐理由:Gary Marcus 把 AI 行业缺乏护城河、价格战、ROI 存疑的经济死结讲得很直白,金融圈越来越认同。虽然观点不新,但这回时机恰好卡在 Google 融资和 Anthropic 取消无限 API 的时候,信号意义很强。

  2. Microsoft AI:官方博客(网页)63

    Microsoft 发布 MAI-Image-2.5,登 Arena 图像编辑榜第 2

    Microsoft Superintelligence 团队发布 MAI-Image-2.5 和 MAI-Image-2.5-Flash 两款图像模型,MAI-Image-2.5 在 Arena 图像编辑榜排第 2(超过 Nano Banana 2),文本生成图像排第 3,比 MAI-Image-2 总分提升 75 分。

    推荐理由:官方给出 Arena 排名、编辑能力细节和 Foundry 定价,开发者可据此评估其在生产图像工作流中的性价比。

  3. Anthropic:Newsroom(网页)72

    Anthropic扩展Project Glasswing计划

    Anthropic正将其Project Glasswing计划扩展至约150个新组织,此前首批约50个合作伙伴。新伙伴分布于十五个多国家,覆盖电力、水务、医疗、通信和硬件等关键基础设施行业。这些合作伙伴的共同点在于,其代码库若遭成功攻击,后果可能极其严重,影响或超1亿人。项目旨在利用Claude Mythos Preview等前沿模型扫描漏洞并协助修复,以应对AI驱动的网络安全挑战。同时,Anthropic推出了基于Claude Opus 4.8等公开模型的Claude Security产品,用于扫描代码并建议补丁。

    推荐理由:Anthropic把AI漏洞扫描从软件公司扩展到电力、医疗等命脉行业,这是一次攻防格局的真实倾斜,安全从业者该紧盯后续。

  4. 蚂蚁 inclusionAI:HuggingFace 新模型61

    蚂蚁 inclusionAI 开源万亿参数 MoE 基座模型 Ling-2.6-1T-base

    Ling-2.6-1T-base 是蚂蚁 inclusionAI 开源的万亿参数 MoE 基座模型(总参约 1T,激活 63B)。它由 Ling-2.0-1T-base 升级而来,采用 Lightning Attention 与 MLA 以 7:1 混合的线性注意力架构,经约 9.6T token 的迁移预训练、持续预训练和中训练,上下文窗口从 4K 分阶段扩展至 256K。在 MMLU(86.82)、SimpleQA、LongBenchv2(43.54)等基准上超越前代。该模型仅供研究(继续预训练、微调、蒸馏等),不直接提供对话功能。

    推荐理由:Ling-2.6 用混合线性注意力把万亿 MoE 基座模型的上下文能力推到了 256K,对于研究长上下文和 MoE 的团队是个有价值的基座,但它是未对齐的预训练模型,不能直接当对话助手用。