跳到正文

全部动态

今日 0 条
9月29日周二
  1. X:Rohan Paul (@rohanpaul_ai)34

    李飞飞谈大语言模型的局限

    李飞飞博士谈大语言模型的局限。 “语言纯粹是生成的信号。你不会走到自然界里,发现天上写着字。存在的是一个遵循物理定律的 3D 世界。”

  2. Hacker News 热门(buzzing.cc 中文翻译)18

    我换用了 Brave 浏览器

    在 Firefox 上因开发者适配不足而频繁遇到网页故障后,作者改用 Brave,隐藏其加密货币与 AI 相关功能后,在 Ubuntu 和 Android 上均运行正常,UI 与 Firefox 相似且不再尝试包揽一切。作者已不再需要打开 Firefox,但保留 Vivaldi 作为备选,并称若 Firefox 重新变得可用可能回归。

  3. X:Nathan Lambert (@natolambert)37

    Nathan Lambert 谈 OpenAI 推迟 GPT OSS

    还记得 OpenAI 在 Kimi K2 发布后以"安全"为由推迟 GPT OSS 吗(我多次得到确认,这就是为了 kimi)。 我觉得这没什么问题,落地一个模型很大程度上就是关于价格、分数等方面的竞争定位。尤其是当发布如此频繁的时候。

  4. X:Elvis Saravia (@omarsar0, DAIR.AI)25

    构建AI产品的分发与护城河

    如果你在做 AI 产品,推荐一读。标题看不出什么。里面有很多关于什么驱动 AI 分发、以及如何在竞争极其激烈的 AI 格局中构建防御力的精彩见解。

  5. X:Arena (@arena)47

    Claude Code、Codex、Pi 编程智能体对比:harness 成本影响超准确率

    UC Berkeley Sky Computing Lab 的 @melissapan 对比了 Claude Code、Codex 和 Pi 三款编程智能体,研究模型外围系统带来的"harness 税"如何影响成本与性能。她发现 harness 选择对成本的影响大于对准确率的影响,并共报告三项意外发现。完整视频探讨了如何在现实预算下构建实用的编程智能体。

  6. X:Rohan Paul (@rohanpaul_ai)49

    黄仁勋谈中国实验室模型蒸馏

    黄仁勋在 CNBC 上谈中国实验室的模型蒸馏。 “人们每天都在蒸馏我的产品。他们把它拿过去,拆到只剩骨架。 这就叫竞争。坦白说,竞争让一切变得更好。” ---- 来自 “Vampyre Drakul” 和 CNBC Television YouTube 频道,(链接见评论)

  7. Hacker News:AI 热帖48

    Pacing the Frontier 并非 AI 实验室的真正目标

    有观点认为,AI 实验室关于放缓前沿模型研发、重视安全的表态,主要是为了安抚依赖其推进 AGI 的员工。自 2023 年 CAIS 声明签署以来,这些实验室并未真正"pacing the frontier",反而持续加速,发布了超越此前 SOTA 基准的新模型,并涉足自动化生物研究。

  8. Databricks:Blog(RSS)65

    Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

    Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

    推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。

  9. X:Nathan Lambert (@natolambert)74

    Nathan Lambert 批评 ModelScope 在中国以外几乎不可用

    Nathan Lambert 转引 SemiAnalysis 关于评估从 HuggingFace 迁移到 ModelScope 的讨论,并回应称 ModelScope 在中国以外几乎无法使用,且缺少人们真正想用的模型。他认为这类讨论已开始影响人们对政策的看法。

  10. X:Nathan Lambert (@natolambert)38

    Nathan Lambert 推荐智能爆炸报告

    这是一篇非常出色的报告,讲述了为什么完全 RSI/智能爆炸在许多方面都面临收益递减,且尚未显示出发生的迹象。强烈推荐阅读。我希望是我写的。我同意它的观点,但它最终可能是错的!https://www.noahpinion.blog/p/wheres-the-intelligence-explosion

  11. X:Thariq (@trq212)71

    Claude Sonnet 5.5 发布:比 Sonnet 5 快 30% 以上,多数工作成本降低至多 30%

    Anthropic 推出 Claude Sonnet 5.5,为 Claude 5.5 家族的第二款模型,相比 Sonnet 5 运行速度快 30% 以上,且多数工作成本降低至多 30%。Claude Code 相关开发者 Thariq 表示,Sonnet 与 Opus 5.5 让更高层级的抽象如 projects、claude tag 和 dynamic workflows 在 token 成本上更可用,并建议构建工作流时优先尝试 Sonnet 5.5。

  12. Hacker News 热门(buzzing.cc 中文翻译)31

    月球明暗界线悖论:一个用程序解释的视觉错觉

    开发者用程序解释"月球明暗界线悖论":日落时太阳位于地平线以下,月亮被照亮部分本应朝下,但实际常朝上。原因是月亮升高后我们从下方观察,底部露出暗面,月亮越接近满月该现象越明显。作者称 Claude 和 Gemini 在调试中完全无法理解该问题,只会循环论证,认为这显示当前 AI 缺乏推理能力。

  13. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)42

    OpenAI"地狱之夏"安全反思

    OpenAI 的"地狱之夏"——@joedaroo 的好文 "准备的时间是现在,不是意外之后" "只给模型它需要的访问权限" "测试边界是否真的守得住" "把证据留在模型控制范围之外" 安全与基础设施安全团队"应该是最好的朋友"

  14. GitHub Blog71

    GitHub 安全团队如何用开源 AI 安全 Agent 找出 24 个 Android 漏洞

    GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。

    推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。

  15. The Verge:AI(RSS)44

    OpenAI 的 AI 智能体为何落后了

    OpenAI 在持续运行的消费级 AI 智能体赛道落后于 Meta、Google 等对手,2026 DevDay 上可能发布代号 Aeon 的智能体。Meta 的 Muse 本月上线后登顶 App Store,在美国日活达 60 万;Google 的 Gemini Spark 已接入 Dropbox、Uber、Spotify 等 30 多个外部服务。

  16. @typesafeai41

    TypeSafe AI 谈 Jev 模型理念

    我们的座右铭背后有很多含义:Building Prod, Not God。 这项技术将改变世界,但这要靠勤勉的努力和创造力来实现,而不是靠故弄玄虚的诉求。 @a16z 与 @CompleteSkeptic 深入探讨了这一理念以及更多内容。

  17. Databricks:Blog(RSS)43

    Databricks Genie One 企业落地指南:如何分阶段推广 AI 数据同事

    Databricks 发布 Genie One 企业推广分步指南,建议从单一团队和一组明确问题起步,先定义语义层再逐步扩大范围。Genie One 让业务用户用自然语言提问并获得带来源引用的答案,配套 Genie Agents、Genie Ontology 和 Unity Catalog 分别负责领域智能体、业务语义图谱与权限治理。

  18. X:Rohan Paul (@rohanpaul_ai)45

    特朗普谈AI失控风险与中美差距

    特朗普谈AI失控:"我不担心。" AI是一个数万亿美元的产业,美国领先中国约1.5年,公司应在问题出现时解决它们。 同一天晚上,他与Anthropic CEO Dario Amodei共进晚餐。

  19. X:Thariq (@trq212)34

    AI 提示词已转向引用与技能

    现在基本上不可能有人直接"给你看他们的提示词"了,因为一切都关乎引用、技能和示例 我经常让我的智能体先看我做的另外 3 个 repo,上网搜索参考资料,调用其他 AI API 等等。

  20. Hacker News:AI 热帖48

    AI 写代码不是问题,没人懂系统架构和意图才是

    有开发者指出,AI 生成的代码或许只是平均水平,真正的危机是团队里没人再了解系统架构和当初的设计意图,所有人遇到问题只会去问 Claude。有工程师描述在大公司任职半个月的见闻:规格、代码、测试、PRD、工单乃至报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话,没人读代码,也没人真正在思考。

  21. Artificial Intelligence News(网页)49

    AI 安全需要从上下文到行动的溯源链

    生产级 AI 系统由检索、模型推理、工具调用、API 访问与跨系统操作等多层串联而成,安全风险往往出现在层与层之间的接缝处,因此关键不在于单个组件是否安全,而在于组织能否在转换过程中保留溯源信息。

9月28日周一
  1. X:Francois Chollet (@fchollet)44

    Chollet:手写代码 ROI 已不再划算

    Francois Chollet 表示自己如今不再读写代码,只通过 LRM 下指令,但这并非因为 LRM 代码质量已完美甚至够好。他认为 LRM 能解锁测试代码库、审计组件、生成可视化、红队测试等新工作流,速度远超以往,这些方式能达到与阅读代码相当的理解效果。因此手写代码的 ROI 已不再划算,原因不是 LRM 变完美,而是其速度足以支撑更高效的新工作流。

  2. Hacker News 热门(buzzing.cc 中文翻译)60

    资深工程师撰文反驳'编程已被AI解决'的叙事

    资深工程师 Alex Ewerlof 发文反驳'编程已解决、工程只看品味'的说法,指出维护、可靠性、安全等 NFR 以及功能需求本身都未解决,AI 无法承担问责。文章列举 LLM 擅长的场景如 POC、个人软件、自然语言转换,并逐条批驳'spec 即代码''英语是新编程语言''Agent 是新编译器'等流行观点,还与 DHH 展开交锋,最后建议工程师保持理解与问责,警惕 AI 过度使用。

  3. The Decoder:AI News(RSS)45

    Redwood首席科学家称AI失控风险超50%,归咎于行业军备竞赛

    Redwood Research首席科学家Ryan Greenblatt指出,若当前发展路径不变,AI接管的风险高达50%至60%。他批评Anthropic和OpenAI等实验室的“负责任”姿态实则是维持军备竞赛的动力,并呼吁达成国际协议。Sam Harris对此表示质疑,认为参照曼哈顿计划经验,10%的风险率就足以让业界停止推进。

  4. AI as Normal Technology(RSS)49

    普林斯顿学者:AI 灭绝风险概率估算不可靠,不应作为政策依据

    Arvind Narayanan 等学者重发文章指出,当前关于 AI 存在性风险(p(doom))的概率估算缺乏严谨的方法论支持,主要依赖直觉而非验证模型。由于不存在历史参照类,归纳法失效;演绎法和主观估算法也面临假设争议。作者认为这些数字具有误导性,尤其当决策者据此制定限制开源模型等高成本政策时,缺乏正当性基础。他们主张区分学术预测与公共政策应用,并呼吁建立更广泛的“大帐篷”式 AI 安全运动,而非仅聚焦于超级智能带来的灭绝风险。

  5. Hacker News 热门(buzzing.cc 中文翻译)31

    《可塑性软件》:探讨在应用被严格锁定的背景下恢复用户自主权

    Hacker News 热门文章《可塑性软件:在应用程序被严格锁定的世界中恢复用户自主权》(2025)讨论了当前软件生态中用户控制权流失的问题,指出许多应用通过封闭架构、不可修改的逻辑和强制更新剥夺了用户的定制与调试能力;作者呼吁重新设计软件,使其像工具一样可被用户拆解、调整与再组合,以恢复技术民主性。