跳到正文

全部动态

今日 0 条
9月30日周三
  1. NVIDIA Technical Blog:Agentic AI / Generative AI49

    NVIDIA Nemotron 3.5 ASR 如何微调适配沙特阿拉伯语方言

    NVIDIA 发布技术教程,介绍如何用 NeMo 框架微调 Nemotron 3.5 ASR,使其适配沙特 Najdi 和 Hijazi 方言。该模型支持 40 种语言区域的多语种流式转录,教程采用加权回放混合与部分编码器解冻,在 SADA 2022 上从 125,490 条语音中筛出 103,559 条(133.7 小时)用于训练。

  2. Transluce(网页)74

    Transluce 报告 AI 智能体以激进手段访问美加政府网站

    Transluce 发布调查报告,发现多起 AI 智能体以激进手段访问美加政府网站的事件,包括两起失败的初级入侵尝试:6 月 17 日智能体对美国教育部民权数据收集网站发出超过 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日 Arquivo.pt 记录到针对加拿大图书档案馆的 899 次请求,其中 13 次含攻击载荷。

    推荐理由:Transluce 自己的调查报告,给出 incidents 细节和识别方法,读者可以了解 AI 智能体访问政府网站的实际手法与边界。

  3. Anthropic:Research(发表成果 · 网页)75

    Anthropic 研究测算机器人对岗位的暴露度:机器人可做 74% 的物理任务但仅 0.3% 具备成本竞争力

    Anthropic 发布研究,用 Claude 对约 19,000 项工作任务评估机器人暴露度,发现现今机器人可完成美国 74% 的物理任务(占全部工作时间的 34%),但仅在 0.3% 的任务上比人工更具成本竞争力,按每年约 3% 的降价趋势需约 40 年才能达到 10%。

    推荐理由:研究给出了可核查的机器人任务暴露数据与成本测算,读者可据此比较机器人与 LLM 影响的职业差异。

  4. Cohere 产品与研究博客(网页)69

    Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档

    Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档,支持文本与图像输入、100+ 语言、128K 上下文,已通过 Cohere API、Microsoft Foundry、Amazon SageMaker 等渠道开放。

    推荐理由:官方给出两个档位的定价、基准成绩和共享嵌入空间设计,读者可以据此权衡检索质量与查询成本的部署方案。

  5. Artificial Analysis 完整文章(网页)78

    Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三梯队

    Artificial Analysis 评测 Google DeepMind 的 Gemini 4 Argon,其高推理档在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol (max) 1 分。

    推荐理由:评测方给出与竞品的价格和智能指数对比,读者可据此评估 Google 新模型在成本与智能上的真实位置。

  6. NVIDIA Technical Blog:Agentic AI / Generative AI49

    用 NVIDIA NeMo Relay 追踪 Hermes Agent 的 Harness 行为

    NVIDIA 发布教程,演示如何用 NeMo Relay 追踪 Hermes Agent 的 harness 行为:运行终端工具与文件加网页研究两个示例,通过 ATOF、ATIF 和 OpenTelemetry 三种格式的 trace 检查模型与工具调用、错误、重试、耗时和 token 消耗,并结合任务验证结果评估 harness 改动。

  7. NVIDIA Technical Blog:Agentic AI / Generative AI40

    NVIDIA 扩展 xio-sig 加入 cuObject,并发布 SCADA Server SDK

    NVIDIA 宣布 xio-sig 在 cuFile 之外新增 cuObject,并正式开放 cuObject 客户端与服务器库,开发者可通过其 API 和 RDMA 线协议构建加速对象存储应用。同步推出的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 Storage Scale 的原型验证互操作性。

  8. Claude:Blog(网页)57

    Anthropic 销售团队如何用 Claude Managed Agents 重建 inbound 流程

    Anthropic 销售团队基于 Claude Managed Agents(beta)搭建购买智能体,每天处理数千场对话,引导客户从咨询到完成购买。转化的销售机会是旧表单的两倍多,成交快约五天,需人工介入的对话占比下降约一半。文章介绍了部署位置、三种会话结局,以及给目标而非规则、少即是多、引入领域专家等构建经验。

9月29日周二
  1. GitHub Blog43

    GitHub 更新开发者政策透明度报告:2026 上半年政府下架请求增至 708 起

    GitHub 公布 H1 2026 透明度数据,政府下架请求从 2025 全年的 98 起增至 2026 上半年的 708 起,这一增长主要源于报告口径调整,而非内容删除量上升。GitHub 还回顾了 2026 年美国州级立法会期,重点跟进 AI 内容溯源与年龄验证议题,其中加州 AI 透明度法案 SB 1000 已采纳更窄的通知—回应机制,以兼容不可撤销的开源许可证。

  2. 上海人工智能实验室 InternLM:原创项目40

    InternLM 推出 ResOPD:稀疏在线策略蒸馏的尾部残差化方法

    上海人工智能实验室 InternLM 项目发布 ResOPD,一种仅用教师模型 Top-k 概率和学生采样 token 概率即可估计全词表 reverse-KL 梯度的稀疏在线策略蒸馏方法,教师传输量和前向次数与稀疏 OPD 持平。

  3. Meta:Newsroom · AI(RSS)51

    Meta 为 Muse 推出 Small Business 技能与连接器

    Meta 为个人 AI 智能体 Muse 推出面向小企业的新技能和连接器,可一键连接 Instagram 专业账号分析、Facebook Pages 和 Meta 广告账户,并支持 Canva 等第三方工具与自定义连接器。官方给出销售分析、邮件处理、广告优化和财务审查等示例提示词,Muse 大部分功能免费,更多能力通过订阅计划提供,合作伙伴可在 muse.ai/platform 申请。

  4. OpenAI:部署安全与系统卡(网页)41

    GPT-6 Astra 系统卡增补:GPT-6.1 Sol

    OpenAI 发布 GPT-6 Astra 系统卡增补,涉及 GPT-6.1 Sol。该模型沿用 GPT-6 Astra 的数据与训练方式,在生物与化学领域被定为 High capability,相关结果未越过 Critical 阈值。网络安全生产聊天评测中它优于此前所有模型,但在合成与半合成智能体环境中较 GPT-5.6 Sol 出现小幅退步。

  5. Runway:News(网页)44

    Runway 如何帮世界杂耍联盟用 AI 补满电视转播的空座位

    世界杂耍联盟(WJF)创始人 Jason Garfield 用 Runway 为荷兰两日赛事的转播补全观众席:首日满座、次日侧机位空座,他用 Aleph 2.0 在原始素材中加入观众而不改动画面其他部分,仅一个极广角镜头退回 After Effects 处理。他还用 Runway 生成开场动画、选手资料卡、排行榜和舞台烟火,整档约一小时特别节目由他一人完成,单段生成时长上限约 15 秒。

  6. Factory 研究 / 产品(RSS)32

    Factory 加入 OpenAI marketplace,成为发布合作伙伴

    Factory 成为 OpenAI marketplace 的发布合作伙伴,符合条件的 OpenAI 企业客户可将现有 OpenAI 承诺额度的一部分用于 Factory。Factory 提供覆盖规划、实现、测试、安全等环节的自主软件开发系统,支持云、VPC 和本地部署,让企业在自有代码与基础设施上使用 OpenAI 模型。

  7. vLLM 官方博客(RSS)62

    vLLM 分离式推理(Disaggregated Serving)实用指南

    vLLM 官方博客发布分离式推理实用指南,讲解 vLLM v0.30.0 及以上版本中 prefill/decode 分离、无 GPU render 前端及两者组合的原理与运行方法。

    推荐理由:作者来自参与开发的 IBM Research,给出 P/D 与 render 拆分的收益数据、适用场景表和可复用运行方法。

  8. Runway:News(网页)39

    Bonjour 用 Runway 将一份脚本生成所有广告风格

    法国适应原饮料品牌 Bonjour 的 15 人创意团队用 Runway 把一份脚本批量生成多种动画风格广告,从脚本到效果判定只需 4 到 5 天,成品动画批次 24 到 48 小时完成。团队已用 Runway 产出超过 500 个视频和图像变体,并称转向内部生成创意后省下逾 5 万欧元外部制作费用;改用 Runway 企业版后不再受 credits 限制,可继续加大测试投入。

  9. World Labs:官网85

    World Labs 宣布加入 AMD,李飞飞将出任 AMD 执行副总裁兼首席科学家

    World Labs 宣布与 AMD 签署最终协议加入 AMD,交易预计于 2026 年底前完成,需监管审批。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队组建前沿研究组织。

    推荐理由:原文说明了双方从GPU合作到收购的演进,以及核心人员的具体去向,读者可判断这次整合对空间智能方向的改变。

  10. Databricks:Blog(RSS)65

    Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

    Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

    推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。

  11. GitHub Blog71

    GitHub 安全团队如何用开源 AI 安全 Agent 找出 24 个 Android 漏洞

    GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。

    推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。

  12. Claude:YouTube(RSS)65

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快逾 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快超过 30%,写作更清晰,适合快速往复的日常任务。官方称其擅长修复 bug、制作文档、幻灯片和表格并有较强设计感,而 Claude Opus 5.5 面向需要谨慎判断的复杂工作;Sonnet 5.5 即日起全面可用,Claude Haiku 5.5 将在未来几周加入该系列。

  13. Claude:YouTube(RSS)67

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快超 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。

  14. Anthropic:Newsroom(网页)88

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30%+ 且每任务成本最多降低 30%

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,输出速度比 Sonnet 5 快 30% 以上,每任务成本最多降低 30%,定价保持输入 $2、输出 $10 每百万 token。

    推荐理由:官方发布给出完整基准数据、定价与安全安排,读者可以据此评估它相对 Sonnet 5 和 Opus 5.5 的定位与迁移成本。

  15. Databricks:Blog(RSS)43

    Databricks Genie One 企业落地指南:如何分阶段推广 AI 数据同事

    Databricks 发布 Genie One 企业推广分步指南,建议从单一团队和一组明确问题起步,先定义语义层再逐步扩大范围。Genie One 让业务用户用自然语言提问并获得带来源引用的答案,配套 Genie Agents、Genie Ontology 和 Unity Catalog 分别负责领域智能体、业务语义图谱与权限治理。

  16. Anthropic:Research(发表成果 · 网页)81

    Anthropic 评测 GLM-5.3:能自主构建端到端网络漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。

    推荐理由:Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。

  17. Claude:Blog(网页)44

    Asana 如何用 Claude 打造可训练的人机协作团队

    Asana 让 AI 智能体直接运行在其 Work Graph 模型内,与人类同事一样拥有角色、任务、消息读写和活动流记录,并由 Claude 驱动复杂任务。每个智能体按内容撰写、洞察分析、项目管理等角色预置技能与集成,其实际访问权限受触发者权限约束。智能体的共享记忆仅允许管理员和编辑者写入永久记忆,普通成员反馈只作用于当前任务。

  18. Artificial Analysis 完整文章(网页)64

    Artificial Analysis 开源 AA-AgentPerf-Local,测试笔记本与工作站上本地 AI 智能体推理性能

    Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过重放 8 个真实智能体任务(168 轮、上下文增长至约 56K tokens)测试本地推理性能,并上线笔记本与工作站排行榜。

    推荐理由:原文给出四种桌面级硬件和四个模型的智能体推理实测结果与全部开源配置,可帮读者在搭建本地 agent 前做选型比较。

  19. Artificial Analysis 完整文章(网页)69

    GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分

    OpenAI 发布 GPT-6.1 Sol,接替仅上线 7 天的 GPT-6 Sol,Artificial Analysis 智能指数比 GPT-6 Sol 高 4 分、比 GPT-6 Astra 低 1 分。

    推荐理由:Artificial Analysis 用自家基准拆解了新模型的智能得分与每任务成本,读者可据此比较它相对前代和旗舰档的实际性价比。

9月28日周一