跳到正文

全部动态

今日 29 条
7月29日周三
  1. TechCrunch:AI(RSS)73

    Martha Stewart 联合创办 AI 初创公司 Hint,为房主提供家居管理 AI 助手

    Hint 今日上线,利用 AI 技术帮助房主管理维护计划、能耗、土壤与空气质量、保险理赔等事务,并支持存储和查询房屋相关合同与文件。该应用基于公开数据为每栋房屋建立档案,通过 AI 聊天机器人回答个性化问题,并提供主动维护提醒与“房屋评分”。Hint 目前免费提供 iOS 版,无订阅或广告,未来计划推出付费高级功能。

    推荐理由:Martha Stewart 以联合创始人身份加入 Hint 绝非挂名,她亲自打磨体验,这个 AI 家居助手整合了图像识别和文档查询,让房主终于有了一个可用的家庭管理中枢,是 AI 从聊天走向实用的一次有趣尝试。

  2. X:腾讯混元 (@TencentHunyuan)74

    腾讯混元开源 AngelSpec 投机解码框架

    腾讯混元开源端到端投机解码框架 AngelSpec,支持训练与部署。在 Hy3-A21B 模型上,其 DFly 方案相比自回归解码实现 1.98–2.40 倍端到端加速,吞吐量比 DFlash 高 10.5–11.8%。训练代码及 Hy3-A21B MTP/DFly 草稿模型权重已开源。

    推荐理由:做推理加速的可以试试这个端到端推测解码框架,腾讯开源了完整代码和权重,在 Hy3 上提速近 2.4 倍且吞吐更高,拿来即用。

  3. 公众号:腾讯混元72

    腾讯混元开源 AngelSpec:投机解码推理加速最高 2.4 倍

    腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。

    推荐理由:AngelSpec 将投机解码从训练到部署全链路开源,DFly 和 D-cut 在真实流量下带来额外加速,对需要优化推理成本的团队有直接落地价值。

  4. 公众号:卡尔的AI沃茨73

    烧了一万块API后,我找到了同时适用于Fable5和GPT5.6的AI工作流

    作者将Claude Code与Codex的协作工具搭子升级至2.0版,通过deep_reasoner、fast_worker、arbiter三种身份及跨项目模型混编,把每周500美元的API账单压缩至400美元。2.0新增本地配置UI、一键试跑、Goal哈希校验和带证据链的小票,并支持按host分命名空间独立配置两个Agent。

    推荐理由:从两个Agent的串行交接升级为三身份团队的并行协作,把模型按推理、执行、仲裁分派任务,为多模型工作流提供了可复用的成本控制方案。

  5. Hacker News 热门(buzzing.cc 中文翻译)76

    在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

    Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。

    推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。

  6. X:Tibo (@thsottiaux)77

    OpenAI 发布 Codex 安全 CLI 与 SDK

    更多开源福利。我们刚刚发布了一个 CLI 和 TypeScript SDK,用于查找、验证和修复代码中的安全漏洞。扫描仓库、审查变更、随时间追踪发现,并在 CI 中运行安全检查。 https://github.com/openai/codex-security

    推荐理由:OpenAI Codex团队把代码安全扫描做成开源CLI和SDK,直接能跑在CI里,对在意AI生成代码安全的开发者来说,算是个实用工具,不妨一试。

  7. Google Blog:AI(RSS)72

    Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子与免费套餐

    Google DeepMind 将 Gemini API Managed Agents 的默认模型升级为 Gemini 3.6 Flash,并支持显式选择 3.5 Flash 或 3.5 Flash-Lite。新增环境钩子允许在沙箱内工具调用前后执行自定义脚本,用于安全审查或代码格式化。此外,还推出了免费套餐、预算控制和基于 cron 的定时触发功能。

    推荐理由:Gemini 的 managed agents 把钩子机制和预算控制做进了官方 API,对重度依赖 agent 做代码审计和任务的团队是个实用升级,Offdeal 已经用上了。

7月28日周二
  1. X:Perplexity (@perplexity_ai)65

    Perplexity 推出 Windows 版个人电脑智能体

    Personal Computer 现已在 Perplexity Windows 应用中可用。 Personal Computer 是面向你工作的本地智能体工具。它协调跨本地文件、已连接应用和网络的智能体。 研究、编码、浏览和构建,全部在一个统一系统中完成。

    推荐理由:Perplexity 把本地代理带到 Windows,让 AI 能直接操控文件和应用,这是助手从对话框走向桌面的关键一步,做办公工具的值得关注。

  2. 公众号:火山引擎68

    豆包搜索开放服务,为Agent提供实时、权威、可信的搜索能力

    火山引擎正式上线豆包搜索服务,为企业和开发者构建AI Agent提供跨语言、多模态、多垂类的联网信息查询引擎。该服务支持API、Skill、MCP等多种接入形态,也可在Agent Plan中一键配置启用,并提供每月500次免费搜索额度。豆包搜索已在SimpleQA、FreshQA、BrowseComp-ZH等多项公开评测中表现优异,并服务国内9成TOP手机厂商的智能助手。

    推荐理由:搜索服务从单次查询升级为 Agent 的持续信息流,权威分级过滤低质内容,Agent Plan 一键接入降低了企业构建深度联网 Agent 的集成成本。

  3. 公众号:火山引擎61

    火山引擎上线豆包搜索服务,为AI Agent提供实时可信搜索能力

    火山引擎正式上线豆包搜索服务,为AI Agent提供跨语言、多模态、多垂类联网信息查询,融合全域互联网信息、行业知识与字节跳动独家内容资源。该服务从网站站点和创作者维度建立权威分级体系,过滤低质信息,在SimpleQA、FreshQA、BrowseComp-ZH等评测中表现优异。豆包搜索支持API、Skill、MCP等多种接入形态,面向企业和开发者提供每月500次免费搜索额度。

    推荐理由:豆包搜索为Agent提供实时、可信的搜索能力,直接输出结构化信息,对国内开发者很实用。但宣发通稿缺少具体评测数据和对比,信服力有限。

  4. X:Kimi.ai (@Kimi_Moonshot)73

    Kimi 发布视觉感知基准 PerceptionBench

    Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

    推荐理由:从模型失败中反向定义原子感知,把视觉感知从推理里拆出来很聪明,开源数据和方法对做视觉评测的产品人很有参考价值。

7月27日周一
  1. X:Kimi.ai (@Kimi_Moonshot)69

    Kimi K3 开源分布式智能体环境 AgentENV

    我们与 kvcache-ai 合作开源了 AgentENV。 AgentENV 是一个用于大规模运行智能体环境的分布式系统。其组件为 Kimi K3 的智能体强化学习训练提供支持,具备快速快照、恢复和分支功能,适用于大规模并行智能体工作流。 在 GitHub 上探索:http://github.com/kvcache-ai/AgentEnv

    推荐理由:月之暗面开源了自家训练Kimi K3用的智能体环境,带快照和分叉,做agent训练的人可以直接上手抄作业,比看论文实在。

  2. 通义 QwenAudio:原创语音项目66

    QwenAudio 开源 qwen-audio-agent 实时语音 Agent 运行时

    QwenAudio 开源 qwen-audio-agent,一个让 Agent 保持在线的实时语音运行时,前台对话与后台任务并行,任务结果自动回到当前对话。

    推荐理由:原文给出了前台语音对话加后台 Agent 执行的架构设计与多款后端 Agent 接入方式,读者可据此评估是否接入自己的工作流。

  3. vLLM 官方博客(RSS)75

    vLLM 发布 Kimi K3 Day-0 支持:2.8T 混合 MoE 的部署指南与性能数据

    vLLM 官方宣布 Day-0 支持 Kimi K3,这是一个 2.8 万亿参数的 MoE 模型(每 token 激活 896 专家中的 16 个),基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口和原生视觉。

    推荐理由:vLLM 团队亲述 Day-0 支持 Kimi K3 的工程细节与部署配方,读者可以据此判断混合线性注意力模型在实际服务中的可行路径。

  4. X:Suno (@suno)68

    Suno 推出多项新功能,含MIDI导出等

    我们一直在以比以往更快的速度构建!🚀 以下是网页端和移动端的新功能一览: • 高级音轨分离 • 将音轨导出为 MIDI • 歌词合写与自动保存 • 截图生成歌曲 • Apple CarPlay 与 Android Auto 你最期待 Suno 的哪些新功能?

    推荐理由:Suno 这波更新把之前缺失的后期编辑能力补了上来,stem 分离和 MIDI 导出对音乐人来说是实际生产力提升,screenshot to song 这种脑洞功能也许能拓展用户群。

7月26日周日
  1. Fireworks AI(网页)61

    Fireworks 发布 Fireworks Nexus:为工程团队提供可路由的开源模型智能层

    Fireworks 发布 Fireworks Nexus,将开发者现有 AI 工具接入由开源权重模型(如 Kimi-K3、GLM-5.2)组成的托管层,提供企业级成本管控、FireConnect 一行安装接入和基于难度的智能路由。

    推荐理由:原文给出具体组件、开源入口和第三方评测数字,读者可对照自己的工程负载估算替换成本收益。

7月24日周五
  1. X:Runway (@runwayml)71

    Runway Agent 推出自然语言工作流功能

    在 Runway Agent 中引入工作流。现在你可以通过自然语言构建、运行或编辑基于节点的工作流。工作流可大规模解锁高质量输出。 立即尝试,点击下方链接调用 / Workflow 技能。

    推荐理由:我觉得Runway这次把工作流放进Agent里,是从‘生成片段’到‘组装生产线’的跨越,视频团队可以直接用自然语言搭流水线,规模化内容生产终于有了低门槛入口。

  2. 公众号:百度智能云(文心)67

    百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行

    百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%;简单任务完成度达100%,复杂任务高交付率94%,积分消耗最高降低75%。

    推荐理由:百度搭子这次把跨端协同和浏览器自动化做成了标配,从'能不能用'到'好不好用',真正解放打工人的复杂工作流,实用度很高。

  3. X:OpenAI (@OpenAI)79

    ChatGPT 桌面版上线语音控制多智能体

    ChatGPT 语音功能现已登陆桌面应用。 只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。 该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。 今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。

    推荐理由:ChatGPT 的语音助手正式上岸桌面,关键是能同时指挥多个代理干活,一边写代码一边查资料,全程动嘴就行。对重度用户来说,这可能比任何新模型都更直接影响工作流。

  4. X:Greg Brockman (@gdb)69

    ChatGPT 向美国用户推出健康功能

    OpenAI 宣布向美国用户推出 ChatGPT 健康功能,支持安全连接 Apple Health 及受支持的医疗记录。每周有 3 亿用户使用 ChatGPT 进行健康咨询,新功能可让 ChatGPT 理解个人健康上下文,追踪变化并提供更个性化的帮助。

    推荐理由:ChatGPT 正式接入医疗记录,300M 周活健康查询用户终于有了上下文,对产品人是高频场景的粘性升级,对行业则是平台化健康能力的信号。

7月23日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

    GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。

    推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

  2. X:Microsoft Research (@MSFTResearch)73

    微软 MagenticLite 模型全面开源

    MagenticLite 的模型现已完全开源。 此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。 该应用、测试工具以及堆栈中的每个模型现已全部开放。

    推荐理由:微软把这些模型全开源了,从 Foundry 搬到 Hugging Face,对不想被平台锁定的开发者是个好信号,但模型能力本身不算顶尖,更偏生态布局。

  3. Runway:News(网页)69

    Runway 推出 Media Router,首个面向生成式媒体的偏好优化路由模型

    Runway 发布 Media Router,这是首个为生成式媒体模型设计的模型路由器,已集成至 Runway Dev 平台。该路由器可根据用户设定的成本、质量和延迟偏好,自动为每次视频、图像或音频生成请求选择最优模型,支持 Gen-4.5、Seedance、GPT Image 2 等第一方及第三方模型。用户只需配置一次偏好并调用单一端点,即可避免手动选型与持续更新代码的麻烦。

    推荐理由:Runway Dev 首次把智能路由引入生成媒体,开发者不用再手工选模型,跑量时成本与延迟优势明显,但这是平台内生态能力,对非 Runway 用户意义不大。

  4. Claude:Blog(网页)75

    Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言

    即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。

    推荐理由:Claude 语音模式终于能调用最强模型了,深度思考不再受限于轻量版,加上工具集成和多语言,移动端从随口问答升级为实时脑力伙伴,值得立即上手。

7月22日周三
  1. NVIDIA Blog(RSS)60

    NVIDIA 开源首个 GPU 加速医疗物理仿真框架

    NVIDIA 宣布开源 Medical Physics Simulation 框架,这是 Isaac for Healthcare 中首个 GPU 加速的医疗物理仿真能力。该框架可并行运行 8,192 个机器人训练环境,将训练时间从超过 5 小时缩短至不到 2 分钟。CMR Surgical、Johnson & Johnson MedTech 等机构已在使用该框架。

    推荐理由:首个 GPU 加速的开源医疗物理仿真框架,能把数千个训练环境并行跑,把训练从五小时压到两分钟,做手术机器人的团队可以直接拿来用,但对通用 AI 从业者影响不大。

  2. 公众号:小红书技术(dots.llm)70

    小红书 dots infra 开源 BigMac:突破多模态大模型训练的帕累托前沿

    小红书开源 BigMac,一种面向原生多模态场景的流水并行训练新范式。它通过依赖安全的嵌套流水线,在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。相比基线,BigMac 训练速度提升 1.08~1.9 倍,并在 global batch size 增大时保持稳定显存占用,目前已应用于 dots 多模态模型生产训练。

    推荐理由:通过在成熟的LLM流水线中嵌入依赖安全的编码器与生成器计算,BigMac让多模态大模型训练不再需要在速度和显存之间做非此即彼的选择,适合正在纠结训练策略的工程团队检查调度逻辑。

  3. 公众号:数字生命卡兹克77

    腾讯设计Agent平台Miora全面开放

    腾讯设计Agent平台Miora今日全面开放,无需邀请码即可使用。该平台由WorkBuddy团队打造,提供品牌设计、影视创意等五大场景模式,支持自定义多模态模型和Agent推理深度,并内置Skill市场与记忆系统。

    推荐理由:腾讯用WorkBuddy的底子做了设计Agent,记忆系统和Skill市场让设计流程有了Agent的基因,设计师和产品人可以上手试试。

  4. Cursor Blog70

    Cursor 发布智能模型路由系统 Cursor Router

    Cursor 推出 Cursor Router,可自动将每个编码请求分配给最合适的模型。在线 A/B 测试显示,Auto Intelligence 模式在用户满意度接近 Fable 的同时,成本降低约 60%;Auto Balance 模式满意度超过 Opus 4.8,成本降低约 36%。

    推荐理由:Cursor Router 把模型路由从个人选择变成团队策略,实测成本降低 30-50% 且满意度不降,对管理 AI 预算的工程 Leader 来说是个值得立刻试点的新功能。

  5. X:OpenRouter (@OpenRouter)72

    OpenRouter 上线 Gemini 3.6 Flash 与 3.5 Flash-Lite

    今日在 OpenRouter 上线:Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite! 两者均为其模型系列的重大更新,具备高吞吐量(150+ tok/s),适用于智能体场景,从高效 token 的编码与知识工作,到低延迟、高并发的子智能体。 详情如下 🧵

    推荐理由:Google Gemini Flash 系列更新到 3.6,150+ tok/s 的吞吐量对 agent 场景是实际提升,OpenRouter 第一时间上线,开发者可以直接调。

  6. Hacker News 热门(buzzing.cc 中文翻译)77

    OpenAI 在 ChatGPT 中正式推出广告服务

    OpenAI 在 ChatGPT 中推出原生广告服务,允许广告主在用户探索选项、比较选择和做出决策时投放相关广告。广告在体验中明确标注并与回答区分,首批广告主包括 Best Buy、Lowe's 和 VistaPrint。广告主可通过 Ads Manager 创建广告系列、设置预算并优化效果。

    推荐理由:ChatGPT正式开放广告投放,这是AI助手从订阅制转向广告收入的标志性一步,对于广告行业是震撼弹,用户体验却可能面临考验。早期测试数据虽乐观,但真正考验在于广告与回答的边界能否守住。

  7. X:opencode (@opencode)56

    Laguna S 2.1 免费开源上线 OpenCode

    Laguna S 2.1 现已在 OpenCode 上免费提供 1M 上下文窗口 · 完全开源 Poolside 迄今为止最强大的模型

    推荐理由:OpenCode 免费上了 Poolside 的最强模型,1M 上下文且完全开源,对写长代码的开发者是实打实的顺手工具,可以省一笔算力开销。

  8. Anthropic:Newsroom(网页)70

    Claude 新增 Anthropic Economic Index 连接器,可直接查询 AI 对经济与职业的影响数据

    Anthropic 为 Claude 推出 Anthropic Economic Index 连接器,用户可在 claude.ai 中直接向 Claude 提问“哪些职业使用 AI 最多”等问题,答案基于 Index 的真实数据。该连接器无需安装,适用于任何 Claude 模型,并会引导用户查看原始数据及其局限性。完整数据集仍免费开放。

    推荐理由:Anthropic把自家经济指数直接接入了Claude对话,用自然语言就能挖出AI影响就业的真实数据,对关注职业变化的研究者和产品人来说是个顺手的小工具。

  9. Prime Intellect(网页)64

    Prime Intellect 整合 23 个任务集,提供超 365,000 个智能体 RL 环境

    Prime Intellect 发布 research-environments,通过 verifiers v1 的 taskset API 将 SWE、终端和搜索三类共 23 个任务集统一到一套运行时和沙箱钩子下,总计约 365,000 个任务,包括约 198,000 个软件工程任务、约 28,600 个终端任务和约 137,600 个搜索任务。

    推荐理由:原文给出 23 个任务集统一为一套 API 的整合方法,以及 gold patch 验证和 reward hack 防护的具体做法,可复用于 RL 环境搭建。

  10. Manus:Blog(网页)64

    Manus 推出 Plan Mode,执行前先审阅方案

    Manus 推出 Plan Mode,在执行开始前引入审阅步骤,Manus 会暂停并进行可行性检查,将目标、步骤和约束整理成一份 Markdown 计划文档,用户在确认前 Manus 不会开始构建。该功能仅手动启用,可在任务中途随时开启或关闭,今日起在 Web 和移动端向所有用户开放。

    推荐理由:官方介绍Plan Mode的审阅流程与激活方式,读者可以据此判断它能否减少构建方向错误带来的返工。

  11. Google Cloud:Databases(RSS)71

    AlloyDB 推出列式引擎加速 HNSW,pgvector 向量搜索 QPS 提升最高 4.9 倍

    Google Cloud 的 AlloyDB 在预览版中推出列式引擎加速的 HNSW 索引,使 pgvector 向量搜索的每秒查询数(QPS)相比标准 PostgreSQL HNSW 提升最高 4.9 倍,在固定 QPS 下召回率可提升 0.163。该加速通过将索引固定在列式引擎内存中、使用向量化内存布局并绕过标准 PostgreSQL 缓冲管理器开销实现,无需修改应用即可获得性能提升。

    推荐理由:AlloyDB 把 pgvector 的 HNSW 搜索提速 4 倍,不是靠 GPU 而是靠内存架构,对已经在 PostgreSQL 上跑 RAG 的团队可能是个省钱又提精度的实用升级,点开看看基准测试。

7月21日周二
  1. X:Claude (@claudeai)71

    Claude Cowork 新增技能录制功能

    Claude Cowork 新功能:教 Claude 一项技能。 录制你执行任务时的屏幕操作,边做边讲解,Claude 会将其转化为可重复运行的技能。在 Claude 桌面应用的 + 菜单中找到“录制技能”即可使用。 适用于 Pro、Max 和 Team 套餐。

    推荐理由:Claude 现在能通过录屏学会你的操作流程,这是从「回答问题」到「执行任务」的关键步。如果你有重复性操作,把它教给 Claude 的成本几乎为零,Pro 用户值得立刻试试。

  2. 公众号:腾讯混元70

    Hyra发布:一个简单有效的科学发现智能体

    腾讯混元推出 Hyra-1.0,一个能递归自我改进、专为性能导向研究与工程任务打造的智能体。其 Harness 采用双层循环架构,在 NanoChat、NanoGPT Speedrun、SOL-ExecBench 三项任务上均超过 Recursive 报告的结果,并在 55 个数学开放问题中的 29 个上刷新历史最好成绩。相关产物已在 Github Repo 开源。

    推荐理由:展示了同一套循环在AI研发、数学、量子计算和药物设计中的迁移能力,更关键的是通过双层循环将评估器与solution共进化,使模糊目标也能被纳入搜索。

  3. 公众号:腾讯混元64

    腾讯混元推出Hyra-1.0递归自我改进研究智能体

    腾讯混元推出Hyra-1.0,一个能递归自我改进的研究智能体,在NanoChat等三项任务上均超越Recursive公开结果。Hyra在55个数学开放问题中刷新29个历史最好结果,并设计出仅含15个可训练参数即可完成10位数加法的Transformer。所有产物已在GitHub开源。

    推荐理由:腾讯自己下场做递归自我改进的科研智能体,而且一口气在数学、量子、药物设计多个方向刷榜,这比发个单一模型更有想象空间。

  4. HuggingFace Daily Papers(社区热门论文)71

    AgentDebugX:面向LLM智能体的开源故障调试框架

    AgentDebugX是一个开源调试框架,将LLM智能体调试组织为“检测-归因-恢复-重跑”闭环。其核心DeepDebug在Who&When基准上对qwen3.5-9b达到精确的智能体与步骤归因准确率,在GAIA上单次重跑即可修复失败任务。该工具提供Python库、CLI、Web控制台和可安装的智能体技能。

    推荐理由:这个框架把调试从单步检测变成归因-恢复的闭环,DeepDebug的多轮诊断在GAIA上修好了13个失败案例,我觉得做agent开发的都可以装一个试试。

  5. X:Elon Musk (@elonmusk, xAI)67

    Grok for Excel 上线,支持金融建模与图表生成

    Grok for Excel 现已上线。

    推荐理由:Grok 进 Excel 这步看似浅,但对整天和表格打交道的人,能直接在应用里调用 Grok 4.5 建模画图,比开网页版方便太多,是用 AI 改造办公的一个务实信号,非 Excel 用户可略过。