跳到正文

全部动态

今日 0 条
10月3日周六
  1. X:Ethan Mollick (@emollick)31

    Ethan Mollick 新书《Co-Existence》为 AI 读者设专页

    我觉得我即将出版的新书《Co-Existence》可能是第一本专门为 AI 读者撰写推荐语的书,这次来自 @tylercowen(我以为 AI 会尊重他) 这本书的网站(含精心准备的预购奖励)也有一个面向 AI 的页面:https://co-existence.ai/

  2. X:Yuchen Jin (@Yuchenj_UW)42

    Sam Altman 谈 AI 模型与人类判断

    @sama:我对人们试图将宗教般的力量或对人类判断力的屈服归附于 AI 模型感到非常不安,我认为这是一个真实的安全问题。

  3. X:Sam Altman (@sama)30

    Sam Altman 谈 AI 模型安全

    我对人们试图将宗教般的力量或对人类判断力的屈服归附于 AI 模型感到非常不安,并认为这是一个真实的安全问题。

  4. Hacker News 热门(buzzing.cc 中文翻译)51

    Mat Duggan 设想让 Tmux 式任务管理成为操作系统界面

    作者受 Scott Jenson 演讲启发,提出把 tmux 的可滚动、会话持久、任务导向体验带给普通人的桌面 UI 构想。他引用 Rooms(1986)、WindowScape、Grudin 等研究指出窗口管理问题二十多年未解,给出无限画布、视口、隐私标志和本地 LLM 辅助组织任务的方案,并承认隐私遥测、无限画布堆积等设计缺陷,仍在尝试做 Linux demo。

  5. TechCrunch:AI(RSS)59

    TechCrunch 盘点可以直接用短信对话的 AI 智能体:从 Instinct 到 Caddy 等 15 款

    TechCrunch 盘点可通过 iMessage、SMS、WhatsApp 等短信渠道直接使用的多款 AI 智能体,覆盖通用助理、家庭、旅行和工作场景。其中 Instinct 最新融资 10 亿美元、估值 100 亿美元,并为助手提供专用邮箱;Caddy 自 2026 年 4 月起公开测试;Fambot 融资 350 万美元;Wajo 的 Fo 拥有独立邮箱、电话号码和支付卡。

  6. X:Rohan Paul (@rohanpaul_ai)47

    Yann LeCun:靠扩展 LLM 实现 AGI 不可能

    Yann LeCun 在 ETH Zürich 最新演讲中称,靠扩展 LLM 实现 AGI 是"不可能的"。他指出 LLM 训练约 30 万亿 token(约 10^14 字节文本,人类需读约 40 万年),而 4 岁儿童仅靠视觉在约 1 年 10 个月内就接收同等数据量。他认为智能是快速学习新任务的能力,如青少年约 20 小时学会开车,扩展只增加存储知识,并不产生这种适应能力。

  7. X:Elon Musk (@elonmusk, xAI)34

    马斯克:量变本身即质变

    足够大的数量本身就是一种质量。 一个单细胞细菌和拥有35万亿个细胞的人之间差别巨大,尽管两者都由细胞构成。

  8. Hacker News 热门(buzzing.cc 中文翻译)33

    面向软件工程师的 Lean 证明剖析:用 Lean 形式化验证 DFA 加法器识别二进制加法语言

    一位软件工程师用 Lean 及其 Mathlib 形式化验证了 Sipser《计算理论导引》习题 1.32:证明由三比特列组成的语言 B(底行等于上两行之和)是正则语言。作者通过构造加法器 DFA 并证明其恰好接受 B 的逆 BR,再借助正则语言反转封闭性完成证明,旨在向软件工程师展示形式化验证系统属性的完整过程。

  9. IT之家(RSS)74

    路透社长文分析 AI 投资热潮:30 万亿美元投入能否在资金耗尽前改变世界

    路透社发文指出,AI 吸引的资本规模已超过铁路和互联网时代,普华永道预计到 2050 年全球数据中心累计投入可能超过 30 万亿美元。文章汇总摩根大通、贝恩和哥伦比亚商学院的测算,认为现有市场不足以支撑投入,美国超大规模云服务商未来 5 年需增加超过 4.2 万亿美元收入,且美国广泛的生产率提升仍未出现。

  10. IT之家(RSS)56

    OpenAI 发布 GPT-6 系列模型使用指南,讲解选模型与提示词优化

    OpenAI 于 10 月 2 日发布博文,分享 GPT-6 系列模型指南,介绍如何选择模型、优化提示词、管理长任务并准备投产。指南建议按工作负载选型:GPT-6 Astra 适合最高难度推理,GPT-6.1 Sol 适合复杂编程、研究和计算机使用任务,GPT-6 Luna 适合大规模特定任务如提取发票字段、分类请求和生成结构化摘要。

  11. X:Rohan Paul (@rohanpaul_ai)45

    Eric Schmidt 谈 AI 竞赛为何无法暂停

    Eric Schmidt 解释 AI 竞赛无法相互暂停:美国缺乏停止动力,本地实验室或中国可能作弊,联合国核查机制也无法审查由计算机编写的代码。他认为核查不可行,检查员需进入包括军事实验室在内的秘密实验室审查全部代码库,而这些代码由计算机编写,没有人类团队能逐行读懂。

  12. X:Yuchen Jin (@Yuchenj_UW)30

    旧金山房租与AI经济

    旧金山房租已经疯了。 我那个小小的1居室两年前是$4000/月。我搬走后重新挂牌$6000。瞬间就租出去了。 一个朋友在旧金山租了个没有洗碗机的单间公寓,月租$5K。 现在CS应届毕业生怎么负担得起旧金山? 欢迎来到AI经济。

  13. X:Rohan Paul (@rohanpaul_ai)39

    Cathie Wood 谈 AI 中的杰文斯悖论

    Cathie Wood 解释了杰文斯悖论在 AI 中如何愈演愈烈: 同样的答案每年成本降低 99.99%,而用量却在爆炸式增长。 即便价格暴跌,OpenAI 的年化收入仍在约一年内从 $20B 增至 $70B,超过了 Anthropic 报告的 $65B。更便宜的调用并没有让业务萎缩。用量爆炸了。 她还说,这就是 GDP 爆发式增长的引擎。 ---- 来自 "ARK Invest" YouTube 频道,(链接见评论)

  14. X:Tibo (@thsottiaux)19

    OpenAI 智能体从用户反馈中持续学习

    很确定在这个小世界里,点(dots)已经比机器人(bots)还多了。 酷的是我们每天都在改进它们,而且它们直接从你的反馈中学习。

  15. Hacker News 热门(buzzing.cc 中文翻译)61

    Harness 即公司:SaaS 企业将把组织重构为模型的外层工具

    作者提出每一家 SaaS 公司最终都会变成围绕无状态大语言模型的 harness,即所有基础设施、界面、上下文和状态的总和。文章给出从工程师与 Agent 结对到 harness 编排个人的五阶段演进路径,认为公司应自研顶层 harness、把厂商产品嵌入具体工作流,人只负责在关键节点提供品味和审查。

  16. Hacker News 热门(buzzing.cc 中文翻译)24

    大家都在收拾行李:从 Reddit、WordPress、Discord 到 GitHub,用户为何集体出走

    近期大量用户发文宣布离开 Reddit、WordPress、Discord、GitHub、Codeberg、Photoshop 等平台,转向个人网站、自托管应用和 Gopher、Gemini 等 smallweb。出走原因包括定价变动、内容被用于 AI 训练、平台易主或新政策,以及平台不再为个人而建的感觉。作者指出,这些人并非投奔更大的平台,而是选择更小、更可控的去处。

  17. @typesafeai19

    校准置信度更性感

    自信很性感。 校准后的置信度更性感! 我们公开我们的置信度计算方法 💅

  18. X:洪明 (@hongming731)28

    BestBlogs 早报:GPT-6 选型与企业 Agent 部署

    BestBlogs 10-03 早报聚焦 GPT-6 系列模型选型指南,OpenAI 实操文档将 GPT-6 Astra、Sol、Luna 的选择落到任务难度、延迟与成本,并给出推理强度、提示词与技能边界调整建议。

  19. X:洪明 (@hongming731)38

    BestBlogs 早报:GPT-6 选型、LEO 智能体采购与 Airbnb AI 改造

    OpenAI 发布 GPT-6 系列选型指南,按任务区分 Astra(最难推理)、Sol(复杂编码、研究与电脑操作)、Luna(目标明确的重复执行)三档,并建议同时衡量成功率、延迟与每次成功任务成本,提示词缓存输入最高可比非缓存便宜 95%。

  20. X:Ethan Mollick (@emollick)51

    Ethan Mollick 转述研究综述:AI 或已影响初级白领招聘,但总体劳动力市场冲击尚未显现

    Ethan Mollick 引用 aleximas.substack.com 的研究综述称,现有证据仅支持一个窄结论:AI 可能已影响最暴露岗位的初级白领招聘边际,但这一归因仍有争议,总体劳动力市场扰动尚未在数据中出现。配图汇总了多项研究,如 ADP 数据显示 AI 暴露职业的初级招聘 10 月起下降约 16%,而北欧多地行政数据未发现显著负面影响。

  21. IT之家(RSS)43

    微软 CEO 纳德拉重申 Copilot AI 定位:面向工作的新操作系统

    微软 CEO 纳德拉再次将 Copilot 称为“面向工作的新操作系统”,称其适用于所有模型、所有工作场景和所有任务。技术拆解显示,Copilot 桌面应用主程序 copilotapp.exe 仅 4.99MB,实为重新命名的 Microsoft Edge 启动器,安装目录含完整 Edge 154 构建,体积约 520MB。

  22. X:SemiAnalysis (@SemiAnalysis_)35

    SemiAnalysis 周报:GPU 是印钞机吗

    GPU 是印钞机吗? InferenceX 团队拆解了 Engram 内存卸载、AgentX 的利润计算器、TPU v7、Vera Rubin 对比 Blackwell,以及更快的 token 是否值得溢价。 另外:TileRT 正在进一步压榨 NVIDIA GPU。这对专用芯片意味着什么? Jordan Nanos(@JordanNanos)与 Cam Quilici(@noslawextratost)、Bryan Shan 和 Alec Ibarra 一起带来新一期 SemiAnalysis Weekly。

  23. X:Sam Altman (@sama)31

    OpenAI 与 Cerebras 合作关系回应

    关于我们与 Cerebras 的合作关系,有一些猜测。 Cerebras 是我们的紧密合作伙伴,我们有着深入的合作,共同推进速度的前沿。

  24. Hacker News 热门(buzzing.cc 中文翻译)50

    alkjash 谈中国的社会现实与 AI 安全传播的文化障碍

    一位美籍华人作者在 LessWrong 发文,从个人经历出发讨论中国社会的四个文化特征:社交媒体高度饱和与内容滤镜化、羞耻和面子的首要地位、对人性持悲观怀疑的 Dark World 心态,以及与百年屈辱叙事相关的民族主义。

  25. X:Elvis Saravia (@omarsar0, DAIR.AI)44

    OpenAI DevDay:优化智能体应用的4个关键杠杆

    OpenAI DevDay 笔记指出,构建智能体应用优化成本与性能的4个关键杠杆是:prompt caching、reasoning effort、programmatic tool calling 和 batch request。OpenAI 开发文档提供了大量相关信息,建议熟悉这些杠杆并用 evals 进行测量。

  26. X:OpenRouter (@OpenRouter)41

    OpenRouter 发布路由与模型组合基准

    路由器并不总是更好。切换模型需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑还会增加延迟。 这些基准能帮你找到最适合自己工作、且符合所需成本水平的路由器与模型组合。

  27. X:马东锡 NLP (@dongxi_nlp)47

    Hinton 谈智能爆炸与递归自我改进

    如果这个月只能读一篇文章,就是这篇! 如果自动化 AI 研发触发了智能爆炸,会怎样? @geoffreyhinton: 由递归自我改进引发智能爆炸的想法已经存在很久,但直到最近它似乎都不迫在眉睫。如今许多顶尖研究者认为它可能很快就会发生。你可以在这里读到我们关于此的论文: https://casp.ac/reports/intelligence-explosion

  28. X:Rohan Paul (@rohanpaul_ai)41

    KPMG CEO:不用AI就没有未来

    “在KPMG,用AI不是可选项。这是我们期望的,如果你不用AI,那KPMG就不是你的未来” ~ KPMG美国CEO Timothy Walsh ---- (视频来自Yahoo finance - finance. yahoo. com/video/ai-adoption-absolutely-essential-kpmg-110039751.html)

  29. Baseten 工程博客(网页)64

    Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%

    Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen,单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。

    推荐理由:作者亲测用智能体生成定制推理引擎,给出了相对 vLLM 的具体性能数据和成本,可帮助读者评估自动优化的实际可行性。