跳到正文

全部动态

今日 94 条
10月2日周五
  1. X:Rohan Paul (@rohanpaul_ai)33

    Benedict Evans 谈 AI 替代初级岗位

    AI 可能会自动化目前由初级律师、咨询顾问、银行家和广告从业者所做的大量常规工作。 “金字塔底层的人原本在做的那部分工作——那些会怎样?你唯一能说的是,如果你从未在律所或 Bain、BCG、McKinsey 工作过,你大概不会真正了解这是怎么运作的。” —— Benedict Evans(科技分析师、作家、前 a16z 合伙人) ---- 来自 a16z YouTube 频道(链接见评论)

  2. X:Rohan Paul (@rohanpaul_ai)46

    AI将颠覆规则型职业

    Blackstone 总裁兼 COO Jon Gray 几个月前也提出过同样的观点。 任何基于规则的业务,比如会计、法律、金融,都将被 AI 彻底颠覆。🎯 例如,JPMorgan 在股东投票中弃用了代理顾问,改用 AI 替代。 https://x.com/BloombergTV/status/2016932349737410876/video/1

  3. X:Rohan Paul (@rohanpaul_ai)57

    Rohan Paul:规则型工作不再是职业,而是一条提示词,Claude Opus 5 在会计任务上超越持证会计师

    Rohan Paul 转述 Mercor 的一项研究结论,称在中短长度、定义清晰的会计任务上,前沿 AI 模型已比初级会计师更快更准,甚至超过研究中最优秀的人类。作者指出 Claude Opus 5 在任务中 20 题全对(100%),数分钟内完成,而 12 名持证 CPA 得分从 0% 到约 90% 不等,多人未能在 3 小时内完成;图中数据显示按每项评分标准成本计,Claude Opus 5 为 $0.21,无 AI 的会计师为 $10.35。

  4. X:PixVerse (@PixVerse)31

    PixVerse 让任意角色开口当主播

    用 PixVerse 把任意角色变成会说话的主持人 添加新的 PixVerse 插件并选择你的角色。 他们会在镜头前自然地说话、反应和做手势,同时 PixVerse 为你生成片段。

  5. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)42

    Kevin Buzzard 谈数学与 AI 的边界

    Kevin Buzzard(IMO 满分、数论学家、Lean 形式化数学先驱)写了一篇非常有见地的文章 如果数学不只是关于"人类的理解",那它是关于什么的? 如果 AI 能力持续指数级增长,而"数学是无限的",那会发生什么?

  6. X:Rohan Paul (@rohanpaul_ai)47

    ScienceBuddy:提示词与模型交替迭代提升科学智能体

    ScienceBuddy 通过交替改写提示词与技能、重训模型,将科学智能体准确率从 42.2% 提升至 73.3%。在生物学任务上,仅改提示词与技能就让 4B 小模型准确率从 31.1% 升至 51.1%;仅重训则把 4 次内解题比例从 48.3% 提升到 67.8%。该方法把用户纠错转为评分测试任务,避免修正随对话消失。

  7. The Decoder65

    Google 在 Gemini 中推出 Skills 取代 Gems,与 OpenAI、Anthropic 转向智能体提示格式

    Google 在 Gemini 聊天中面向全球推出 Skills,用于保存针对具体任务的详细提示词,取代此前的 Gems。Skills 格式源自 Anthropic 并以开放标准提供,用户输入「/」加 Skill 名称即可调用,Gemini 也能从历史对话生成 Skill 并在匹配到提示时自动运行,多个 Skill 可以串联,现支持文本文档、PDF 和图片作为参考材料。

  8. TechCrunch · AI43

    DoorDash 推出可通过短信点餐的 AI 智能体

    DoorDash 推出可通过 Apple Messages 短信下单的 AI 智能体,用户发送「order my usual」等提示词即可完成点餐。该智能体可搜索本地餐厅、生成推荐购物车并发送推荐菜品照片,还能在同一订单中处理团体点餐的不同饮食偏好与数量,目前面向美国用户开放 waitlist。DoorDash 同时宣布将在北加州部分餐厅测试配送无人机。

  9. TechCrunch · AI44

    消费级 AI 的难看经济账:Meta Muse、OpenAI Dots 也难破付费天花板

    消费级 AI 的付费盘子增长近乎线性:Andreessen Horowitz 引述 PNC 数据,截至 5 月仅 2.2% 消费者为 AI 付费,月均支出 31 美元。若以 Netflix 3.25 亿订阅用户为饱和基准,34 美元/用户对应的年收入仅 110 亿美元,不到 OpenAI 运营成本的三分之一。这推动前沿实验室转向企业合同,OpenAI 的企业预订自 7 月已翻倍。

  10. TechCrunch · AI60

    ElevenLabs 估值翻倍至 220 亿美元

    语音 AI 初创公司 ElevenLabs 宣布允许员工以 220 亿美元估值出售部分已归属股权,估值较 2 月完成 5 亿美元融资时的 110 亿美元翻倍。这笔 3 亿美元的要约收购由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次为 2025 年 9 月的 1 亿美元、估值 66 亿美元。

  11. TechCrunch · AI59

    Google 发布 Gemini 4 Argon,称其为迄今最强模型

    Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。

  12. TechCrunch · AI39

    Legato 推出 AI 助听眼镜 Legato Frames,起售价 999 美元

    Legato 宣布其 AI 助听眼镜 Legato Frames 开售,起售价 999 美元,面向轻中度听力损失成年人。眼镜重 34 克,续航 10-12 小时,AI 系统区分人声与背景噪音,双扬声器将声音导向佩戴者并把耳外漏音降低 99%,处理全部在眼镜端完成。产品提供三种款式,支持处方镜片和蓝牙音乐/通话,可在官网或美国指定眼科机构购买。

  13. X:Elvis Saravia (@omarsar0, DAIR.AI)47

    ProVer:为智能体 RL 精准分配信用

    ProVer 提出用 LLM judge 定位轨迹中的关键片段、再由 rollout 决定该步信用大小的信用分配方法,解决 GRPO 给轨迹中每个 token 相同 advantage、无法区分决定性步骤的问题。

  14. Ai2 / Allen Institute for AI(RSS)62

    Ai2 开源 8B 科学报告生成模型 AstaBrief

    Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。

    推荐理由:原文给出训练数据构成、过滤方法与速度成本对比,读者可据此判断开源科学报告模型的具体做法是否可迁移。

  15. IT之家19

    《地铁 2033》及《地铁:最后的曙光》重制版将推本世代更新,10 月 22 日与 10 月 29 日上线

    4A Games 宣布,《地铁 2033》与《地铁:最后的曙光》重制版本世代更新将于 10 月 22 日登陆 PC、10 月 29 日登陆主机。更新在现有版本上升级,加入 4K 纹理并改进动画、音频与环境细节,主机支持原生 4K/60FPS 和升频 4K/120FPS、PS5 Pro 的 PSSR,PC 版加入 DLSS。已拥有两款游戏的玩家可免费获得更新。

  16. IT之家62

    贝恩:全球 AI 行业到 2031 年需创造 6 万亿美元年营收,才能证明数据中心价值

    贝恩公司称,全球 AI 行业到 2031 年每年需要创造 6 万亿美元营收,才能支撑目前全球数据中心建设的巨额资本投入。现有消费级和企业级 AI 服务最多只能贡献 1.8 万亿美元,还需找到 4.2 万亿美元新增收入,可能来自自动化机器、机器人以及药物研发、心理健康和能源生产等起步阶段市场。贝恩预计到 2030 年全球数据中心投资将达到 5 万亿至 6.5 万亿美元,新增容量至少 150GW。

  17. IT之家69

    日本法院认定 AI 克隆声优声音侵犯形象权,首次确认声音受法律保护

    东京一家法院在声优津田健次郎起诉 TikTok 案中部分认可其主张,认定未经许可用 AI 模仿其声线应视为侵犯形象权,这是日本首次确认人的声音受法律保护。由于涉事账号已注销,法院没有支持他要求 TikTok 下架相关视频的请求,TikTok 则辩称视频使用的只是一般男性声音。其律师团队称,涉事账号一度拥有超过 20 万粉丝。

  18. X:Rohan Paul (@rohanpaul_ai)25

    Terence Tao 谈当今 AI 缺乏智能感

    Terence Tao 谈当今的 AI: “你去看它是怎么做的,感觉不像智能,倒像某种把戏,你只是把这些神经网络拼凑起来,跑一些算法,我们一直在寻找某种难以捉摸的智能思维方式,但在那些真正能解决我们目标的工具里,我们看不到它。” ---- 来自“Berggruen Institute and Futurology”YouTube 频道,(链接见评论)

  19. Hacker News 热门(buzzing.cc 中文翻译)50

    新加坡政府交友服务 FirstDate 如何运作,作者质疑算法匹配逻辑

    新加坡政府开发机构 GovTech 推出试点交友服务 FirstDate,先用 Singpass 验证身份,首批用户为政府雇员,需填写 30 多道题的问卷,采用获 2012 年诺贝尔经济学奖的 Gale-Shapley 稳定匹配算法按周期配对,双方同意后才交换联系方式。

  20. IT之家29

    《战争机器:事变日》发售宣传片公开:首发支持 DLSS 4.5 及光追,10 月 7 日正式发售

    The Coalition 公布《战争机器:事变日》发售宣传片,该作将于 10 月 7 日登陆 XBOX Series X|S 与 PC,首发加入 XBOX Game Pass。PC 版首发支持英伟达 DLSS 4.5 与硬件光线追踪,同时兼容 AMD FSR、虚幻引擎 TSR 和 Intel XeSS。标准版售价 298 元,高级版 428 元,预购高级版可提前最多 5 天体验。

  21. IT之家55

    OpenAI 升级 ChatGPT 购物功能,新增虚拟试穿与收藏

    OpenAI 升级 ChatGPT 购物功能,新增虚拟试穿和 Favorites 收藏两项能力,用户可上传自拍或现拍照片生成穿着特定服饰或配饰的效果图。虚拟试穿以 Try on 按钮出现在支持该功能的服饰和配饰商品页面,效果大致依托 ChatGPT Images 2.5 图像生成模型,该模型在光照、材质细节和人物特征保留上有所改进。

  22. IT之家31

    极米记得 AI 显示眼镜 MemoMind One 明日登陆全国 56 家线下门店,开启定金预定

    极米记得 AI 显示眼镜 MemoMind One 将于明日登陆全国 56 家线下门店和 INNO100 全球创新旗舰店,开启定金预定。10 月 3 日至 10 月 14 日到店预付 100 元定金,可获赠价值 199 元墨镜夹片 1 副。官方称其为可长期佩戴的专业 AI 眼镜,集极米显示、蔡司光学、哈曼声学于一体,支持 AI 记忆、导航与提词,配置信息暂未公布。

  23. X:Rohan Paul (@rohanpaul_ai)76

    Bloomberg:Anthropic 为可能估值近 2 万亿美元的 IPO 邀请机构投资者质询高管

    Bloomberg 报道,Anthropic 已邀请机构投资者在其可能估值近 2 万亿美元的 IPO 前质询高管。10 月 14 日的会议之后,最早 11 月 9 日当周启动正式路演,感恩节前上市;按 SEC 规则需在 10 月下旬公布 S-1 文件。OpenAI 则相反,以安全担忧为由排除 2026 年上市,正以约 1.4 万亿美元估值私下寻求至少 300 亿美元融资。

    推荐理由:原文梳理了 Anthropic 上市时间线和 OpenAI 的相反选择,读者可以对照两家头部 AI 公司的资本路径差异。

  24. IT之家34

    特斯拉持续推进 FSD 辅助驾驶在中国台湾地区落地,正进一步优化道路测试计划

    特斯拉正持续推进 FSD 监管版辅助驾驶系统在中国台湾地区的落地申请,并已按首轮技术审查会议意见优化道路测试计划架构,测试路线将从城市覆盖到乡村,验证在当地机动车与摩托车混行环境下的适应能力。特斯拉于今年 7 月中旬提交申请文件,9 月完成首轮技术审查会议,同时启动内部软件开发并按法规开展初期道路功能验证。

  25. X:DAIR.AI (@dair_ai)48

    微软 FOCUS:免训练压缩智能体上下文

    微软提出免训练方法 FOCUS,在测试时压缩 AI 智能体的交互历史:它判断智能体下一步决策真正依赖哪些历史片段,保留这些片段、丢弃其余部分,无需训练数据或微调,可作为独立层接在闭源 API 模型前。在工具调用、QA、网页与多轮对话基准上,FOCUS 将峰值上下文最多削减 48%,任务成功率最多提升 8.9 个百分点。