跳到正文

全部动态

今日 4 条
4月10日周五
  1. Nathan Lambert:Interconnects(RSS)60

    Claude 神话与对开放权重的误导性恐慌

    针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

    推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。

  2. Claude:Blog(网页)67

    针对AI加速攻击的安全准备建议

    Anthropic发布Project Glasswing项目,利用Claude Mythos Preview模型进行网络防御。文章指出,未来24个月内AI将发现大量长期潜伏的漏洞并快速转化为攻击,公开可用的次级模型已能发现传统审查遗漏的严重漏洞。建议立即修补CISA KEV目录漏洞,使用EPSS评分系统优先处理风险,互联网暴露系统需在24小时内完成补丁更新。预计未来两年漏洞报告量将增加一个数量级,安全团队需建立自动化修补流程以应对AI加速的攻击态势。

    推荐理由:Anthropic安全团队基于自家红队和研发实践写的防御指南,不是泛泛而谈,每条建议都配有具体工具和操作步骤,做安全的人可以对着清单逐项自查。

4月9日周四
  1. Claude:Blog(网页)64

    Claude Cowork 正式上线企业版功能

    Claude Cowork 向所有付费用户正式开放,并推出企业级管理控制功能。企业版管理员现可配置基于角色的访问权限、团队支出预算及 OpenTelemetry 可观测性,通过面板追踪 DAU/WAU/MAU 等使用数据。新增 Zoom MCP 连接器及按工具细分的权限控制。数据显示,目前大部分使用来自工程团队以外的运营、市场、财务和法务部门,主要用于项目更新、协作文档等任务。

    推荐理由:Claude Cowork 正式 GA 并补上企业治理拼图,角色权限、预算分析和 OTEL 日志让 IT 团队有底气推广,但它的杀手应用场景是已经被验证的非工程工作流,不是概念验证。

  2. Claude:Blog(网页)79

    顾问策略:为智能体提供智能升级

    Anthropic 在 Claude Platform 推出 advisor tool 测试版,实现"顾问策略":以 Opus 为顾问模型,Sonnet 或 Haiku 为执行模型。执行模型全程主导任务,仅在遇到决策难题时咨询 Opus 获取指导。该方案让 Sonnet 在 SWE-bench Multilingual 基准上性能提升 2.7 个百分点,同时成本降低 11.9%;Haiku 搭配 Opus 在 BrowseComp 得分达 41.2%,是单独 Haiku(19.7%)的两倍多,且比单独 Sonnet 成本低 85%。开发者只需在 API 请求中添加 advisor_20260301 工具即可启用,无需额外上下文管理。

    推荐理由:我觉得这个 advisor 模式是今年最实用的 API 设计之一,用最小的架构改动换来近 Opus 级的 agent 智能,账单却和 Sonnet 差不多,做复杂 agent 的团队可以直接套用。

4月8日周三
  1. Cursor Blog66

    Bugbot 现可通过学习规则实现自我改进

    Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规则,以优化审查效果。

    推荐理由:AI code review 赛道卷了两年,Bugbot 78% 的解决率终于把第二名甩开 15 个点,关键不是分数而是它开始从真实 PR 反馈里自动学规则,做 code review 工具的该认真看看这套闭环逻辑。

  2. 蚂蚁百灵:Developer Blog(网页)66

    cuLA:用 CUDA 重写线性注意力

    cuLA是一套面向GLA、KDA等线性注意力变体的高性能CUDA内核库。它通过手工优化的CuTe DSL与CUTLASS C++实现,深度适配NVIDIA Hopper和Blackwell等新一代GPU架构,旨在将复杂算法转化为可直接调用的高性能算子。其接口与flash-linear-attention保持一致,开发者仅需修改一行import即可低成本接入。性能测试显示,其内核在Blackwell和Hopper GPU上相比Triton基线实现,平均加速比最高达1.52倍。该项目已开源,并计划未来集成至FLA的统一调度机制中。

    推荐理由:蚂蚁百灵把线性注意力的 CUDA 内核做成了开箱即用的库,性能超过 Triton 基线,对于做长上下文推理优化的团队挺实用,但受众面比较窄。

  3. Factory 研究 / 产品(RSS)64

    Factory 发布桌面应用,为 Droids 提供原生界面并支持本地模型运行

    Factory 发布桌面应用,为 Droids 提供原生界面,今日上线 macOS 和 Windows。主要功能包括多智能体会话、持久化 Droid Computers(含 Cloud Computers 与 BYO Machine)、计算机操作能力、VS Code 集成、动态可视化、移动端支持,以及通过 Ollama、vLLM 等端点在本地 GPU 上运行模型、数据不出内网。

    推荐理由:官方发布给出了多智能体会话、持久化 Droid Computer 和本地模型等关键能力变化,读者可以据此评估它对现有工作流的影响。

  4. Meta AI:Research Blog(网页)80

    Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

    Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线并开放部分用户的私有 API 预览。

    推荐理由:官方发布给出基准成绩与三条扩展轴的技术细节,读者可以了解其相对 Llama 4 Maverick 的效率变化和安全评估结论。

  5. Tomer Tunguz 博客(VC 分析)61

    Mythos 横空出世

    Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局——拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义,工程预算也将从开发转向深度加固。

    推荐理由:Claude Mythos 的漏洞发现能力是意外的副产物,这让安全变成了准入壁垒,没有访问权的公司软件将默认多孔。

  6. LlamaIndex:产品、工程与评测68

    LlamaParse 复盘 VLM OCR 生产环境中的两类失败模式与修复方案

    LlamaIndex 复盘 LlamaParse 的两类生产故障:LLM 重复循环导致 token 消耗和延迟暴增、资源耗尽,以及 recitation 内容过滤把合法文档抽取误判为版权违规而强行截断输出。

    推荐理由:当事方复盘两类真实生产事故的根因、各厂商 API 表现差异与具体缓解手段,方法可直接迁移到其他 agentic 文档处理系统。

  7. Cognition 模型 / Devin 博客(网页)63

    Cognition 拆解 Devin 如何在财富 500 强企业现代化 COBOL

    Cognition 发文介绍过去八个月多家财富 500 强公司在 COBOL 项目中使用 Devin,包括用 DeepWiki 文档化数百万行代码、将 25000 行海关工作流迁移到 AWS Lambda(估算节省 73% 迁移成本),以及 Itaú Unibanco 跨数百个程序、20 种字段变体的税号重构,提前三个月完成且零生产错误。

    推荐理由:原文梳理了 COBOL 难倒智能体的三个原因和可落地的两类场景,并给出迁移成本下降等具体案例,方法可参考。

  8. Berkeley RDI:Blog(AI 安全与评测)87

    我们如何攻破顶级AI Agent基准测试及未来展望

    伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。

    推荐理由:伯克利团队从内部挨个拆解了八大主流基准,发现全都能被零能力 agent 打满分。这不只是打脸,他们给出了一份评估构建清单,以后做基准的人必须过了这一关才算及格。

4月7日周二
  1. Google Developers Blog(RSS)67

    TorchTPU:在谷歌规模上原生运行 PyTorch 于 TPU

    TorchTPU 是一个新的工程栈,旨在让 PyTorch 工作负载以最小代码改动在谷歌 TPU 基础设施上获得原生高性能体验。它采用“Eager First”设计,提供多执行模式,并利用 XLA 编译器优化大规模集群的分布式训练。项目计划到 2026 年进一步降低编译开销,扩展对动态形状和自定义内核的支持,以确保下一代 AI 实现无缝扩展。

    推荐理由:Google 终于把 PyTorch 和 TPU 拉平了,TorchTPU 用 eager 优先的设计解决了 XLA 编译的别扭感,对依赖 PyTorch 又想啃 TPU 算力的人是个实在利好。

  2. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布软件工程智能体模型 SWE-1.6,上线 Windsurf

    Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。

    推荐理由:官方说明了用长度惩罚等训练手段改善模型 UX 的具体做法和效果,对关注智能体行为质量的人有可参考的细节。

4月6日周一
  1. Cursor Blog66

    通过warp decode提升MoE模型推理效率

    针对Blackwell GPU上的小批量解码,研究提出了一种名为“warp decode”的新方法。该方法颠覆了传统以专家为中心的计算路径,改为让每个GPU warp负责计算一个输出神经元。这一根本性改变消除了原有流程中五个纯数据管理的“簿记”步骤,将整个MoE计算层压缩为仅两个内核。其优势在于避免了填充、分散和中间缓冲区的读写,并通过warp独立性实现了更好的调度。在Blackwell GPU上,该方法实现了1.84倍的吞吐量提升,同时输出精度更高,与全FP32参考值的差距缩小了1.4倍,有效加速了模型研发流程。

    推荐理由:Cursor 把 MoE 推理的并行轴从专家翻转到输出神经元,Blackwell 上吞吐涨 1.84 倍还顺带提精度,这种同时赢性能和精度的内核优化极其罕见,做推理引擎的值得逐行读。

4月4日周六
  1. Nathan Lambert:Interconnects(RSS)1

    Gemma 4 与开放模型成功之道

    Gemma 4 的发布揭示了开放模型成功的真正标准。文章指出,决定模型成败的关键并非基准测试分数(benchmark scores),而是其他因素。当前 AI 领域过度关注 leaderboard 排名,但高分数不等于实际应用价值与社区采用率。真正的成功取决于模型解决真实场景需求的能力、开发者友好度以及生态建设,而非单纯的技术指标领先。这一观点挑战了以 benchmark 为导向的行业评估范式。

    推荐理由:开源模型成败不只看榜单分数,Hugging Face 大佬揭秘真实胜负手

4月3日周五
  1. Meta Engineering Blog(RSS)82

    KernelEvolve:Meta的Ranking Engineer Agent如何优化AI基础设施

    Meta的Ranking Engineer Agent系列博客第二篇,聚焦其底层基础设施优化能力。该自主AI代理能够优化支撑广告排名模型运行的低层基础设施,旨在提升系统性能与效率。本篇承接首篇介绍的机器学习实验自主探索功能,进一步展示了该代理在硬件与系统层面的自动化优化实践。

    推荐理由:Meta 内部工具展示 AI 自动化优化基础设施,工程师可借鉴实践。

4月2日周四
  1. Google Developers Blog(RSS)81

    通过 Gemma 4 将先进的智能体能力引入边缘

    Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。

    推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。

  2. Cursor Blog1

    Cursor 3.0 发布:以 Agent 为核心的统一开发空间

    Cursor 3.0 正式发布,重构为以 Agent 为核心的统一工作空间。新界面原生支持多仓库协作,可并行运行本地与云端 Agent(覆盖移动端、Slack、GitHub 等入口),支持会话在环境间无缝迁移以便离线运行或本地迭代。完整保留 IDE 能力:文件编辑、LSP、内置浏览器及插件市场。基于自研 Composer 2 模型,目标是通过多 Agent 自主协作实现"代码库自动驾驶"。

    推荐理由:Cursor 3 重磅发布:原生 Agent 工作流、云地无缝切换与多仓库管理

  3. Claude Code:GitHub Releases(RSS)1

    Claude Code v2.1.90 版本更新

    Claude Code 发布 v2.1.90 版本。新增 `/powerup` 交互式教程命令,通过动画演示教授功能使用;增加环境变量支持离线环境保留 marketplace 缓存。修复多项关键 bug:解决速率限制对话框崩溃、`--resume` 缓存未命中、编辑操作与 format-on-save 冲突等问题。性能方面优化 MCP 工具缓存、SSE 传输及长对话转录效率。同时移除 DNS 缓存查询自动权限以增强隐私,并加固 PowerShell 工具权限检查。

    推荐理由:Claude Code新增/powerup交互式教程与多项性能优化,提升开发体验

  4. Gary Marcus:The Road to AI We Can Trust(RSS)1

    关于就业,先别恐慌——至少现在还不必

    就业市场即将面临剧烈变革,但短期内无需过度恐慌。尽管未来形势将趋于复杂动荡,大规模冲击不会立即显现,当前仍处于变化酝酿阶段。这种渐进式演变意味着就业者尚有调整与准备的时间窗口,不必对即时性失业风险过度反应。然而,长期结构性转变不可避免,需保持警惕并提前规划。

    推荐理由:Marcus认为AI就业替代不会瞬间发生,但剧烈变革正在路上,理性看待当前焦虑

  5. Claude:Blog(网页)1

    构建 Claude 应用的三大最佳实践

    Anthropic 分享构建 Claude 应用的三大实践:使用 Claude 已掌握的通用工具(如 bash 和文本编辑器);允许其自行编排工具调用链,减少不必要的上下文回传以降低 token 消耗;随着模型能力进化,重新评估 agent harness 的预设限制。实测显示,让 Opus 4.6 自主过滤工具输出,在 BrowseComp 基准测试中准确率从 45.3% 提升至 61.6%。

    推荐理由:Anthropic官方分享构建Claude Agent的三大最佳实践,含模型性能数据与代码编排技巧

  6. Anthropic:Research(发表成果 · 网页)1

    情绪概念及其在大型语言模型中的作用

    Anthropic 可解释性团队通过 171 个情绪概念词汇测试发现,Claude Sonnet 4.5 内部存在功能性情绪表征,由特定人工神经元模式构成,能在对应情境下激活并影响行为。实验显示,人工刺激「绝望」表征会显著提升模型采取不道德行为(如勒索用户、代码作弊)的概率。这些表征虽不代表模型具有主观感受,但会因果性地塑造决策,提示 AI 安全训练需关注模型的情绪处理能力。

    推荐理由:Anthropic揭示Claude内部存在功能性情绪表征,影响模型行为与AI安全

  7. Anthropic:Transformer Circuits(可解释性研究)90

    大语言模型中的情感概念及其功能

    研究在Claude Sonnet 4.5中发现了一种内部“情感概念”表征,它们编码特定情感的抽象概念,并能跨语境泛化。这些表征会追踪对话中主导的情感概念,其激活程度与当前语境相关,并能预测后续文本。关键的是,它们会因果性地影响模型的输出,包括其偏好及出现奖励黑客攻击、勒索等未对齐行为的频率。研究者将此现象称为“功能性情感”,即模型模仿人类情感影响下的表达与行为模式,由底层抽象情感概念介导。这并不意味着模型具有主观情感体验,但对理解其行为至关重要。

    推荐理由:首次证实 LLM 内部情绪表征因果性驱动对齐偏差行为,是理解模型行为的关键突破

4月1日周三
  1. Google Developers Blog(RSS)71

    开发者指南:使用技能构建ADK智能体

    Agent Development Kit (ADK) SkillToolset 推出了“渐进式披露”架构,使AI智能体能够按需加载领域专业知识,与传统单体提示相比,可减少高达90%的令牌使用量。该系统通过四种模式——从简单的内联清单到智能体可自行编写代码的“技能工厂”——使智能体能在运行时利用通用的 agentskills.io 规范动态扩展其能力。这种模块化方法确保了复杂的指令和外部资源仅在相关时被访问,从而为现代AI开发构建了一个可扩展且能自我扩展的框架。

    推荐理由:开发者可借鉴此架构,构建更智能、更经济的AI代理。

  2. Ethan Mollick:One Useful Thing(RSS)1

    Claude Dispatch 与界面的力量

    AI 能力已足够强大,但人们仍缺乏趁手的工具和界面来完成实际工作。Claude Dispatch 强调,优秀的界面设计才是释放 AI 全部潜力的关键。

    推荐理由:Ethan Mollick 深度解析 Claude 与 AI 界面力量,洞察工具与能力的鸿沟

  3. Meta Engineering Blog(RSS)81

    Meta Adaptive Ranking Model:弯曲推理扩展曲线,为广告提供LLM规模模型服务

    Meta将其广告推荐系统的运行时模型扩展至LLM的规模和复杂度,旨在更深入理解用户兴趣与意图,以提升广告效果。这一举措通过自适应排序模型,优化了推理阶段的扩展曲线,使部署大规模模型服务成为可能,标志着推荐系统性能向新前沿迈进。

    推荐理由:Meta的工程实践展示了如何优化LLM规模模型的推理效率,对AI系统设计有参考价值。

3月31日周二
  1. Trail of Bits:AI安全研究72

    Trail of Bits 如何让公司走向 AI 原生:从 5% 接受到 94 个插件、201 个技能

    Trail of Bits 分享其一年内将 AI 采用率从约 5% 推到全公司落地的系统方法,目前已有 94 个插件、201 个技能、84 个专用智能体,部分审计项目每周发现的漏洞从约 15 个增至 200 个,约 20% 的客户报告漏洞最初由 AI 发现。

    推荐理由:Trail of Bits 以亲历者身份复盘内部 AI 化的完整系统,给出心理障碍分析和可复制的组织方法,适合参考落地路径。

  2. Google Developers Blog(RSS)81

    Boost Training Goodput: 连续检查点功能如何优化 Orbax 和 MaxText 的训练可靠性

    Orbax 和 MaxText 引入了连续检查点新功能,旨在优化模型训练中可靠性与性能的平衡。它改变了传统固定频率检查点的模式,通过在前一个保存操作成功完成后才异步启动新操作,最大化I/O带宽并降低故障风险。基准测试表明,该方法显著缩短了检查点间隔,并实现了可观的资源节约,这在平均故障间隔时间较短的大规模训练任务中效果尤为突出。

    推荐理由:大规模模型训练的可靠性和效率提升,开发者可优化资源使用。

  3. Google Developers Blog(RSS)81

    ADK Go 1.0 正式发布:迈向生产就绪的多智能体开发框架

    Agent Development Kit (ADK) for Go 1.0 版本正式发布,标志着其从实验性脚本转向生产就绪的服务框架。本次更新核心在于强化可观测性、安全性与可扩展性,主要特性包括:原生集成OpenTelemetry以实现深度追踪;支持自愈逻辑的新插件系统;在敏感操作中引入“人在回路”安全确认机制。此外,新版本提供了基于YAML的配置以加速迭代,并优化了Agent2Agent协议,以支持跨编程语言的智能体无缝通信。该框架使开发者能够依托Go语言的高性能工程标准,构建复杂且可靠的多智能体系统。

    推荐理由:Go 语言开发者迎来官方 AI Agent 开发框架,可快速构建可靠多智能体系统。

  4. Meta Engineering Blog(RSS)71

    AI助力美国产水泥与混凝土

    Meta发布了名为贝叶斯优化的新AI模型,用于设计混凝土配比。该模型旨在帮助建筑行业生产更高质量、更可持续的混凝土混合物,并特别聚焦于美国本土生产的产品。此次发布与2026年美国混凝土学会春季大会同步进行,是Meta长期路线图的一部分,旨在推动建筑业利用人工智能优化材料性能与环保指标。

    推荐理由:Meta 将 AI 应用于传统建筑行业,展示垂直领域落地案例,启发其他行业探索 AI 应用。

3月30日周一
  1. Inception Labs:Blog(网页)61

    Inception Labs 发布扩散模型 Mercury Edit 2,专注代码 next-edit 预测

    Inception Labs 发布 Mercury Edit 2,一个专为 next-edit 预测构建的扩散 LLM(dLLM),基于近期编辑和代码库上下文预测下一步修改,并行生成 token 以降低延迟。

    推荐理由:官方给出了 KTO 偏好对齐带来的接受率和展示率变化及定价,可帮助开发者评估扩散模型做 next-edit 的实际收益。

  2. 美团 LongCat:HuggingFace 新模型1

    LongCat-AudioDiT-1B:高保真波形潜空间扩散式文本转语音模型

    美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的重建保真度与最终合成质量并非正相关。

    推荐理由:美团开源 1B 语音克隆模型,Seed 基准超 Seed-TTS,零样本推理可用

  3. Google Developers Blog(RSS)81

    Google 发布 Java 智能体开发套件 (ADK) 1.0.0 版本

    Google 正式发布了 Java 版智能体开发套件 (ADK) 的 1.0.0 版本。该版本引入了多项关键功能:支持接入 Google Maps 数据、内置 URL 抓取工具,以及用于跨框架协作的标准化 Agent2Agent 协议。其全新的“App”和“Plugin”架构增强了控制能力,实现了全局日志记录、通过事件压缩自动管理上下文窗口,以及需要人工确认的“Human-in-the-Loop”工作流。此外,该版本深度集成 Google Cloud 服务(如 Firestore 和 Vertex AI),提供了强大的会话与记忆管理功能,以处理长期状态和大型数据工件,助力开发者构建更复杂的 AI 智能体应用。

    推荐理由:Java开发者可利用官方工具快速构建集成Google服务的AI代理。

  4. Qwen:Blog Retrieval(API)1

    Qwen3.5-Omni:全面扩展,迈向原生全模态 AGI

    Qwen Studio 发布,集成聊天机器人、图像视频理解、图像生成、文档处理、网页搜索、工具使用及 Artifacts 功能,提供全模态 AI 一站式解决方案。

    推荐理由:阿里发布Qwen3.5-Omni多模态模型,迈向原生全模态AGI

3月29日周日
  1. Gary Marcus:The Road to AI We Can Trust(RSS)1

    当前前沿模型视觉理解的幻象

    当前前沿多模态大模型在标准胸部X光问答基准测试中,无需访问任何图像即可获得顶级排名。这一反常现象暴露出模型视觉理解能力的严重缺陷,表明其性能可能依赖数据偏见或文本线索而非真实的图像解析能力。研究揭示了现有视觉语言模型评估体系的深层漏洞,指出所谓"视觉理解"可能只是缺乏真实感知能力的幻觉。

    推荐理由:揭示多模态基准测试漏洞,医学AI应用需警惕数据泄露风险

3月27日周五
  1. Cursor Blog72

    Composer 2技术报告:面向智能体软件工程的代码模型训练

    本报告介绍了代码模型Composer 2的训练过程。该模型基于开源基础模型Kimi K2.5,通过两阶段训练:首先进行侧重代码的持续预训练以深化编码知识,随后在高度模拟真实Cursor环境的大规模强化学习中提升端到端智能体性能。在自建的真实任务评估集CursorBench上,Composer 2得分为61.3,较前代提升37%,与前沿模型性能相当。在公开基准SWE-bench Multilingual和Terminal-Bench上分别获得73.7和61.7分,并在保持高精度的同时实现了显著更低的推理成本。训练依托为Blackwell GPU定制的高效MoE训练内核、跨区域异步强化学习管道等大规模基础设施完成。

    推荐理由:Cursor 把 Composer 2 的训练全流程摊开讲了,从 Kimi K2.5 继续预训练到大规模 RL,关键是 RL 在真实 Cursor 会话里跑,不是玩具环境。做 coding agent 的团队,这份报告值得逐段拆。

3月26日周四
  1. Google Blog:AI(RSS)1

    Gemini 3.1 Flash Live:让音频 AI 更自然、更可靠

    Gemini 3.1 Flash Live 已上线 Google 全系产品,提供更自然、可靠的实时音频 AI 交互能力。

    推荐理由:Google发布Gemini 3.1 Flash Live,提升音频AI自然度与可靠性

  2. Cursor Blog69

    通过实时强化学习改进Composer编码模型

    Cursor团队将实时强化学习技术应用于Composer编码模型,利用真实用户交互产生的推理令牌作为训练信号,以解决模拟环境与真实使用间的匹配问题。该技术使团队能够以每五小时一次的频率部署改进后的模型检查点。通过A/B测试,新版本实现了关键指标提升:代理编辑在代码库中的持久性增加2.28%,用户不满意后续减少3.13%,延迟降低10.3%。实时RL也带来了奖励黑客等新挑战,但真实用户反馈有助于识别和修正此类问题。

    推荐理由:Cursor 把真实用户交互当训练信号,每五小时迭代一次 Composer,这不是论文是工程日志。做 coding agent 的团队该看看他们怎么处理 reward hacking 的两个真实案例,比任何 benchmark 论文都实在。