跳到正文

全部动态

今日 0 条
10月1日周四
  1. X:SemiAnalysis (@SemiAnalysis_)41

    SemiAnalysis 评估 GLM-5.3 网络能力

    我们在 ExploitGym 上评估了 GLM-5.3 的网络能力,并分析了执行轨迹。GLM-5.3 将大部分执行预算用于测试隐藏的运行时条件是否改变了其结论。在问题 arvo5665 中,GLM-5.3 通过 sanitizer 构建、语料测试和目标 fuzzing 探索了更多周边程序。(1/3)🧵 https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

  2. X:Rohan Paul (@rohanpaul_ai)26

    Stability AI 创始人称经济寿命仅剩两年

    “你的经济寿命实际上将在两年内终结。(因为 AI 正变得如此强大)。 人类团队(在工作场景中)只会让情况更糟,因为他们要睡觉,他们会犯错,他们醒来时没喝咖啡还会有点脾气。所以你的认知价值会变成负数。 所以,你的经济寿命实际上将在两年内终结。” —— Emad Mostaque,Stability AI 创始人 --- 来自 YouTube 频道 “The Peter McCormack Show”(链接见评论)

  3. X:Rohan Paul (@rohanpaul_ai)23

    OpenAI CFO 谈 Dots 与 Muse 对比

    OpenAI 的 CFO Sarah Friar 回答 CNBC 的提问: “Dots 与 Muse 在市场上的产品相比如何?” ---- 来自“CNBC Television”YouTube 频道,(链接见评论)

  4. Hacker News 热门(buzzing.cc 中文翻译)34

    上次我的家人被科技取代时

    一位开发者在 AI 冲击下回顾家族史:其高祖父原是法国乡村铁匠,看到汽车后转行成为机械师,家族此后世代以“帮人出行”为目的。他认为许多开发者真正热爱的并非写代码本身,而是创造、解决问题和看人使用成果,因此应放下“怎么做”,守住“为什么做”。

  5. X:Arena (@arena)35

    Claude Sonnet 5.5 与 GPT-6.1 Sol 成本对比测试

    Claude Sonnet 5.5 和 GPT-6.1 Sol 能否以 Fable、Opus 或 Astra 成本的一小部分,交出强劲的结果? 我们刚刚在多个提示词上对它们进行了并排测试,追踪每一代模型的实际成本,并将结果与各自实验室的更大模型进行对比。 结果来自 @petergostev,详见我们的 YouTube。 https://youtu.be/r0ymhRtcTeI?si=hyomPcmon3yHLo6h

  6. X:Noam Brown (@polynoamial)43

    Noam Brown 回忆与 Sokota 的相识经历

    5 年前我在一个会议的 poster session 上遇到了 @ssokota。他的讲解让我印象深刻,于是我给了他一个实习机会。我们持续合作,他现在在 @OpenAI 和我一起工作。后来他告诉我,整场 session 里我是唯一一个在他 poster 前停下来的人。

  7. X:Ethan Mollick (@emollick)26

    AI 智能体代用户谈判砍价

    每家公司的客服智能体即将被 Dots & Muses 等用语音/聊天来谈判争取更优惠价格的智能体淹没。人们把这类事情委托给自己的智能体、并因此省钱的报道正在不断涌现,而且只会越来越火。

  8. X:Rohan Paul (@rohanpaul_ai)34

    Box CEO 谈 FDE 需求:AI 转型催生部署工程师大军

    Box CEO Aaron Levie 认为,无论 50 人小公司还是数十万人大企业,AI 转型都需要一支 FDE(前向部署工程师)队伍上门协助。Rohan Paul 判断,模型厂商的 FDE 初期会集中服务大客户,1 万人的银行足以支撑专职 FDE,50 人律所则多由独立顾问或小型集成商承接。

  9. X:Ethan Mollick (@emollick)38

    谁来决定AI的未来走向?

    这是当今时代最重要的问题之一:谁来决定AI的发展方向? Daron主张在AI决策过程中引入更多民主参与,尽管这伴随着诸多挑战。

  10. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)26

    Anthropic 研究:机器人能做什么工作

    请阅读 @rclegateyang 和 Maxim 撰写的这份非常出色的报告:https://www.anthropic.com/research/what-work-can-robots-do

  11. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)24

    Anthropic:机器人普及或慢于AI

    机器人技术在经济中的扩散,可能比 AI 的采用需要更长时间。 在近期的情景建模工作中,我们只考察了 AI 到 2030 年的影响。 若要展望更远的未来,则需要对机器人投资与采用的经济学进行更细致的建模。

  12. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)39

    Anthropic:机器人成本竞争力仅覆盖0.3%任务

    与 AI 不同,机器人的相对成本非常高。他们估计,机器人仅在 0.3% 的工作任务上具备成本竞争力。 如果机器人价格下降遵循过去的趋势,这一比例需要 40 年才能达到 10%。

  13. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)37

    Anthropic:34%工时可被机器人替代

    他们发现,对于美国经济中大多数体力任务,已存在能够执行这些任务的机器人——尽管是在有限场景下。总体而言,他们发现 34% 的工作时长面临机器人替代的暴露风险。

  14. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)30

    Anthropic 研究:机器人能力预示工资就业下降

    为什么这是一项有用的练习? 他们发现,过去 50 年里,基线机器人能力可以预测相关暴露工人随后的工资和就业下降。随着成本下降、采用率上升,这一过程在数十年间逐步显现。

  15. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)21

    Anthropic 研究机器人可胜任哪些工作

    如今机器人能完成哪些工作?这对未来数年的经济结构又意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。

  16. X:Peter McCrory(Anthropic 首席经济学家,@PeterMcCrory)21

    Anthropic 构建新机器人暴露指数

    他们构建了一个新的机器人暴露指数,基于现有机器人在日益通用和非结构化条件下完成各种工作任务的能力。

  17. X:Peter Steinberger (@steipete)26

    OpenClaw 调整智能体通信显示

    我越来越觉得聊天流里的智能体间通信很烦人。把 OC harness 里的可见性改成只显示一行,可以展开。 很确定其他人也会跟进。https://github.com/openclaw/openclaw/pull/161656

  18. X:Rohan Paul (@rohanpaul_ai)33

    Sherpa 用多智能体架构解决 AI 小说连载难题

    Sherpa 用分离的智能体分别负责创意、结构、研究、行文和审校,并以独立的“Narrative World Model”追踪故事历史,解决单个聊天窗口无法维持长篇连载一致性的问题。推文指出 AI 小说读起来像流水线产物,原因在于聊天机器人一次只回答一个提示词、上下文窗口有限,无法记住 40 集前埋下的伏笔,也难以持续抓住读者。

  19. X:Eric Zakariasson (@ericzakariasson)48

    用新模型构建游戏的技能

    这是我一直在用的、用新模型构建游戏的技能 npx skills add ericzakariasson/skills --skill game-builder

  20. X:Rohan Paul (@rohanpaul_ai)25

    Anthropic CFO 谈文化面试筛选

    Anthropic CFO Krishna Rao 谈 Anthropic 员工选拔流程中的文化面试环节。 “有人可能在其他所有方面都表现出色,确实是你在这个岗位上见过的最聪明的人。但如果他们过不了文化关,我们就不会录用。” ---- 来自 “Invest Like The Best”(@patrick_oshag)YouTube 频道,(链接见评论)

  21. @typesafeai30

    Jev 重排序销售数据性能提升

    给后排的朋友们: • 用 Jev 对销售数据做生产级重排序 • 快 20 倍 • 便宜 10 倍 • 准确率提升 12% 你们懂了吗?

  22. Hacker News:AI 热帖29

    Claude Says:AI 反馈为何引发开发者反感

    一篇 Hacker News 热帖批评开发者用 Claude 等 LLM 代替自己思考:把提示词跑一遍就当作掌握话题,实为虚假的权威诉求。作者指出,AI 热潮让"氛围编程"出的糟糕方案无需共识即可推进,而修改已部署方案的一个设置却要层层审批,并称堆砌信息不等于智能,照搬 AI 输出只会让大脑退化。

  23. Hacker News 热门(buzzing.cc 中文翻译)43

    JBR-001:基于 Arduino UNO Q 的开源可 3D 打印桌面机器人

    JBR-001 是一款基于 Arduino UNO Q 的开源、可 3D 打印桌面陪伴机器人,集摄像头、距离传感器、蜂鸣器、动画显示屏和三个舵机于一体,可支持计算机视觉与边缘 AI 实验。其 STL 文件已开放下载,用户可自行打印、组装和编程扩展。

  24. X:Nathan Lambert (@natolambert)39

    Interconnects 图表揭示开源模型推理经济指数增长

    最新一期 Interconnects 图表——展示开源模型推理经济的指数级增长。图表显示的是领先公司每日处理的 token 量,数据基于公开披露(Together、Baseten 和 Fireworks)以及 OpenRouter API。我低估了 OpenRouter 的增长。

  25. X:Elvis Saravia (@omarsar0, DAIR.AI)36

    Lucas 主动发消息的 AI 智能体

    我认为智能体的消费级突破,会出现在它们主动发起对话的时候。 Lucas 住在 iMessage 和 WhatsApp 里,有事需要处理时会先给你发消息,比如取消航班的退款,或者你一直拖着没订的预订。主动能力很棒。

  26. X:Thariq (@trq212)25

    Anthropic 员工用 AI 辅助做游戏原型

    作为一个个人副业项目,我一直在做一款电子游戏的原型。 作为一名前游戏创始人,做游戏的过程极具满足感和创造力,不要把这件事外包给 AI。用 AI 与你协作,把你的构想变为现实。 以下是我的尝试方式:

  27. X:Ethan Mollick (@emollick)43

    前沿模型实验室可发布半成品

    关于 AI 生意,有一件事需要知道:拥有前沿模型的实验室可以发布半成品,而它们的效果出奇地好,因为 AI 自己能搞明白并随机应变。这就像在产品里内置了一名前线部署工程师和客服人员。

  28. Artificial Intelligence News(网页)27

    AI 学习平台如何改变 L&D 团队的角色

    AI 驱动的学习平台正把 L&D 团队从课程制作、评估生成、翻译和进度追踪等重复事务中解放出来,转向技能发展战略与员工能力规划。LinkedIn 2025 职场学习报告显示,49% 的学习与人才发展从业者称高管担忧员工缺乏执行业务战略所需技能,71% 的 L&D 从业者已在探索、试验或整合这类技术。平台可基于角色、技能和学习活动数据推荐内容并个性化学习路径,但生成内容仍需人工审核把关。

  29. Manus:Blog(网页)63

    Manus 介绍 Game Dev 的调参与多人游戏工作流

    Manus 在 9 月 28 日发布 2.0 后,进一步介绍其中已有的 Game Dev:可在游玩时实时调整速度、重力等参数,管理和替换角色、画面及声音素材,并由平台承担多人游戏的服务器部署、网络与状态同步。本文是对既有能力和创作方式的说明,不是一次新的功能发布。

  30. Manus:Blog(网页)72

    Manus 分享视频生成与时间线编辑工作流

    Manus 分享使用既有视频能力的创作经验:先由 AI 搜索参考、制作镜头与代码视觉元素,再在 Manus Studio 的视频编辑器中逐轨调整画面、字幕、配乐和音效。教程还演示导入本地素材、自动转录与编排初剪,以及将长视频剪成短片;作者以 125 段旅行素材整理成约 11 分钟成片为例,说明如何把生成初稿继续打磨为可发布作品。

    推荐理由:作者结合真实项目,介绍从导入素材、转录和编排初剪,到逐轨调整字幕、画面与音频的工作流,读者可将这些方法用于自己的视频制作。

9月30日周三
  1. Hacker News:AI 热帖55

    The AI Race Just Got Awkward:西方模型悄然采用 DeepSeek 的 KV cache 优化

    作者认为西方实验室已悄然采用中国实验室公开的模型优化成果。DeepSeek 持续公开 KV cache 压缩技术,从 MLA 的约 15 倍压缩到 DeepSeek-V4.1-Flash 的 CSA2、跨层 cache 复用与 FP4 缓存,将全局 KV cache 降至每 token 890 字节,较 DeepSeek-V1 在长上下文编码场景降低约 437 倍。

  2. X:Nathan Lambert (@natolambert)20

    Nathan Lambert 谈 X 平台人机标注

    如果 X 允许使用 App 的人把他们的回复标记为人类撰写,或者你可以把回复限制为通过人类验证的用户,整个体验会好上 10 倍。 我不想不得不把回复限制在我关注网络内的账号。所有机器人也都是认证的。