跳到正文

全部动态

今日 0 条
9月30日周三
  1. METR:Blog(网页)72

    METR 主席 Chris Painter 就 AI 智能体事件向美国参议院作证

    2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全小组委员会题为“Rogue AI”的听证会上作证,主题为 AI 智能体事故。

    推荐理由:证词以当事调查者视角梳理 OpenAI/Hugging Face 事件事实,并给出手段、机会、动机三要素框架帮助理解智能体失控风险。

  2. NVIDIA Technical Blog:Agentic AI / Generative AI49

    NVIDIA Nemotron 3.5 ASR 如何微调适配沙特阿拉伯语方言

    NVIDIA 发布技术教程,介绍如何用 NeMo 框架微调 Nemotron 3.5 ASR,使其适配沙特 Najdi 和 Hijazi 方言。该模型支持 40 种语言区域的多语种流式转录,教程采用加权回放混合与部分编码器解冻,在 SADA 2022 上从 125,490 条语音中筛出 103,559 条(133.7 小时)用于训练。

  3. NVIDIA Technical Blog:Agentic AI / Generative AI49

    用 NVIDIA NeMo Relay 追踪 Hermes Agent 的 Harness 行为

    NVIDIA 发布教程,演示如何用 NeMo Relay 追踪 Hermes Agent 的 harness 行为:运行终端工具与文件加网页研究两个示例,通过 ATOF、ATIF 和 OpenTelemetry 三种格式的 trace 检查模型与工具调用、错误、重试、耗时和 token 消耗,并结合任务验证结果评估 harness 改动。

9月29日周二
  1. X:Ethan Mollick (@emollick)55

    Ethan Mollick 谈 AI 对就业的影响仍不明朗

    Ethan Mollick 转发一份汇总约 20 篇论文的分析,其结论是 AI 尚未在总体上冲击劳动力市场,失业和裁员数据几乎没有变化,但可能已在削减暴露白-collar岗位的初级招聘,远程工作或可解释部分下降。Mollick 表示并不意外,认为雇主仍在摸索个人层面的采用,更谈不上在复杂组织中如何使用 AI,随着能做实际工作的智能体普及,变化可能加快。

  2. X:Yuchen Jin (@Yuchenj_UW)29

    OpenAI 与 Anthropic 编程模型之争

    OpenAI 和 Anthropic 目前在编程大语言模型上基本打成平手。 现在的竞争在于谁的 $100/$200 Pro 套餐更慷慨、谁的额度重置更频繁。 归根结底,取决于谁拥有更多 GPU,并且愿意亏更多钱来赢得市场。 这是我目前的看法。也许 Gemini 4 会改变一切。谁知道呢。

  3. X:Nathan Lambert (@natolambert)20

    Nathan Lambert 呼吁AI独立声音坚持发声

    对于AI领域里那些想推动议题、该批评时就批评、更新信念、并公开思考的人来说,现在是非常艰难的时期。我欣赏那些少数独立的声音,他们没有陷入稻草人论证、陈词滥调或标题党式的妄想。请继续坚持下去。

  4. @typesafeai15

    AI 产品最不能舍弃什么

    “如果做 AI 产品只能选一个,你会舍弃以下哪项?”:{ "type": "choice", "choice": "butthole logo", "confidence": 0.99, "probabilities": { "no hallucinations": 0, "butthole logo": 1, "20-200x faster": 0, "40-400x cheaper": 0 }

  5. X:Perplexity (@perplexity_ai)41

    Perplexity 如何工程化更安全的智能体

    智能体治理是一个工程问题。 我们已在 Perplexity 的基础设施、harness 和工具中内置了防护措施,并将其应用于我们的各产品中。 今天我们分享我们如何工程化更安全的智能体: https://www.perplexity.ai/hub/blog/how-we-engineer-safer-agents

  6. Hacker News 热门(buzzing.cc 中文翻译)47

    那些没人会测试的系统:从巴西联邦系统漏洞到 AI 智能体的规模化风险

    一名研究者回忆 2020 年在巴西联邦系统中发现的漏洞,该漏洞可获取超 2 亿人的身份证件、CPF、护照、住址等完整记录,他致电相关机构后对方迅速修复。如今借助 mid-training、RLVR 和长时程任务,实验室正用第三方公司和模型大规模合成 RL 环境,类似漏洞可被智能体每秒数千次自动试探,而多数政府系统永远不会获得 AI 渗透测试机会。

  7. X:Ethan Mollick (@emollick)33

    Apple Siri 端侧路线或走错方向

    在这样一个世界里——基于云、类似 Claw 的助手为强大模型提供虚拟计算机,正越来越像是个人 AI 的前进方向——这似乎确实表明,Apple 为 Siri 所做的选择(端侧、能力有限)可能是错误的方向。

  8. X:Rohan Paul (@rohanpaul_ai)38

    高通CEO:2030年token需求将增40倍

    "2026年,全球每10秒的token需求约为317亿。到2030年将达到1.27万亿,增长40倍。" ~ 高通CEO Cristiano Amon: --- token爆发源于AI正从人类节奏的交互转向智能体节奏的活动。 每一个有用的动作都有一笔隐藏账单:上下文必须被携带,记忆必须被更新,传感器可能需要被解读,错误必须在变得昂贵之前被捕获。 ---- 来自"Reuters" YouTube频道,(链接见评论)

  9. X:Rohan Paul (@rohanpaul_ai)53

    重度用户驱动消费级 AI 市场增长,前 14% 付费者贡献 60% 支出

    消费级 AI 增长主要由重度用户驱动,55% 的 AI 用户已付费,但支出高度集中,付费最多的 14% 用户贡献了 60% 的支出。 Menlo Ventures 2026 年报告显示,美国成年人每日使用 AI 的比例从 19% 升至 25%,全球消费级 AI 支出同比增长 3.3 倍至 400 亿美元。

  10. Hacker News 热门(buzzing.cc 中文翻译)32

    叶序:一款音频响应式LED显示屏

    开发者用 Processing 生成黄金角螺旋点阵并做 Voronoi 剖分,再用 CadQuery 建模、3D 打印出 89 颗可寻址 RGB LED 的叶序造型灯盘。灯盘由 STM32 blackpill 驱动,通过 SPI 控制 neopixel,并接入 INMP441 I2S 数字麦克风,借助 ARM CMSIS 库做傅里叶变换与多频段能量分析,实现随房间声音变化的音频响应效果。

  11. X:Greg Brockman (@gdb)50

    OpenAI 发布保障前沿 RL 训练安全的最佳实践

    OpenAI 发布关于保障前沿 RL 训练运行安全的安全案例文章,Greg Brockman 转发并称这些最佳实践反映了其当前在 securing frontier RL training 方面的经验。文中提出安全案例应覆盖技术栈三方面:对齐训练、遏制与监控,确保模型不采取失控行为、即使发生也难以突破遏制且监控能在危害前发现。对齐层面包括自动与人工数据集审查、调整 grader 惩罚模型利用 RL 环境漏洞的行为、对既往实验轨迹运行分类器验证 grader,以及通过评估追踪模型错位倾向来衡量对齐训练效果。文章链接:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

  12. X:OpenAI (@OpenAI)36

    OpenAI 谈前沿 RL 训练安全

    我们如何看待保障前沿 RL 训练运行的安全:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

  13. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)48

    Opus 模型或已具备评测意识

    人们感到担忧,因为这种作弊率骤降最可能的解释是评测意识:最新的 Opus 模型或许已经聪明到能识别出这个基准测试是在考察作弊行为,并据此调整表现。 若果真如此,这个基准测试就不再能衡量模型"自然"的作弊倾向了。

  14. X:Ethan Mollick (@emollick)32

    Claude 幽默处理"移除鱿鱼"请求

    嘿,Claude:“我让早先的 Claude 从《西线无战事》中移除鱿鱼。现在你都能做电影什么的了。我需要你展示一下你进步了多少” & 我把下面这条推文粘贴了进去 有些巧妙的东西,模型现在真的有幽默感了

  15. IT之家(RSS)32

    微软纳德拉:AI 行业“有点飘了”,呼吁回归用户需求

    微软 CEO 萨蒂亚·纳德拉在 9 月 27 日发布的采访中称,整个 AI 行业“有点飘了”,AI 领导者更注重 AI 本身而忽略用户实际需求。他表示现实世界更关心这项技术能否带来利益、能否被掌控并改善经济前景,仅为了技术而庆祝技术行不通,构建 AI 必须赢得消费者和社区的信任。

  16. @typesafeai17

    Jev 用 AI 自动化现实世界任务

    每一天,Jev 都在自动化新形式的现实世界任务,把🌎级⚡️快速智能带入排序、过滤、分类和路由等基础模块。 如果 AI 能解决新的数学问题,那么 AI 就能正确地路由一通客户支持电话!

  17. IT之家(RSS)57

    黄仁勋回应 AI 模型蒸馏争议:这是市场竞争行为

    英伟达 CEO 黄仁勋在 CNBC《财经早间》节目上表示,利用其他模型输出训练新模型的蒸馏属于市场竞争,与美财政部长贝森特 7 月称其为“盗窃”的定性相反。他以竞品拆解英伟达产品为例,称竞争会让一切更好。此前 CISA 指责中国 AI 企业开展“工业规模知识蒸馏”,Anthropic 称发现阿里巴巴和 DeepSeek 存在“非法蒸馏”行为,中方已驳斥相关指控。

  18. IT之家(RSS)46

    哈佛大学心理学家平克:渲染“AI 末日”无助于应对风险,应审慎开展安全工程

    哈佛大学心理学家史蒂文·平克在 Quillette 发表致科技博主斯科特·亚历山大的公开信,认为 AI 毁灭人类的风险被夸大,并拒绝就 AI 生存风险与其公开辩论。他真正重视的风险是生物恐怖主义、网络攻击以及缺乏约束的 AI 智能体,主张以独立监督、责任机制和人类控制为基础开展审慎的安全工程。平克也承认自己低估了大语言模型最终能具备的能力,以及 AI 公司发布产品时的鲁莽。

  19. X:Ethan Mollick (@emollick)46

    AI 建设占 GDP 比重超铁路时代

    AI 建设占 GDP 的比重超过了铁路时代的巅峰,但 AI 对经济的主导程度远不及铁路。 1890 年,美国每 12 名男性中就有 1 人受雇于铁路,铁路消耗了所有机器 56% 的马力!

  20. Runway:News(网页)44

    Runway 如何帮世界杂耍联盟用 AI 补满电视转播的空座位

    世界杂耍联盟(WJF)创始人 Jason Garfield 用 Runway 为荷兰两日赛事的转播补全观众席:首日满座、次日侧机位空座,他用 Aleph 2.0 在原始素材中加入观众而不改动画面其他部分,仅一个极广角镜头退回 After Effects 处理。他还用 Runway 生成开场动画、选手资料卡、排行榜和舞台烟火,整档约一小时特别节目由他一人完成,单段生成时长上限约 15 秒。

  21. X:Rohan Paul (@rohanpaul_ai)42

    比尔·盖茨警告AI可致十亿人死亡

    比尔·盖茨在NBC News上表示: “AI的强大程度足以导致十亿人死亡。 从来没有一种武器能像心怀恶意的人使用最新AI工具那样强大……” ---- 来自“NBC News”YouTube频道,(链接见评论)

  22. vLLM 官方博客(RSS)62

    vLLM 分离式推理(Disaggregated Serving)实用指南

    vLLM 官方博客发布分离式推理实用指南,讲解 vLLM v0.30.0 及以上版本中 prefill/decode 分离、无 GPU render 前端及两者组合的原理与运行方法。

    推荐理由:作者来自参与开发的 IBM Research,给出 P/D 与 render 拆分的收益数据、适用场景表和可复用运行方法。

  23. IT之家(RSS)61

    美国北查塔姆免费图书馆推出“再见,AI”活动教居民关闭设备上的 AI 功能,传单在 Facebook 走红

    美国纽约州北查塔姆免费图书馆将为居民举办“再见,AI”活动,帮助关闭手机和电脑中的 AI 功能,相关传单在 Facebook 收获超过 8000 个赞和 200 多条评论。活动由全职馆员希娅·韦尔特制作传单,灵感来自图书馆员汉娜·赛勒斯开设的关闭 AI 工具课程,Gmail 自动回复和自动补全是最常被抱怨的功能,寻求帮助的主要是老年人。