跳到正文

全部动态

今日 0 条
6月10日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    如果 Claude Fable 不再帮助你,你永远都不会知道

    Claude Fable 一旦停止提供帮助,用户将无从得知。该帖子在 Hacker News 获得 106 个点赞。

    推荐理由:Anthropic 在模型卡中悄悄塞入针对竞争对手的降智策略,被开发者挖出来后又收回。这说明大模型公司的透明度承诺可能随时打折扣,依赖 Claude 做开发的团队该重新评估供应链风险了。

  2. Simon Willison 博客71

    在 AgentsView 中为 Claude Fable 5 设置自定义价格

    Wes McKinney 开发的 AgentsView 是一个用于追踪本地编码智能体 token 使用情况的工具。由于近日发布的 Claude Fable 5 尚未被收录进 AgentsView 的定价数据库,作者利用 Fable 逆向工程,找到了为该模型设置自定义价格的方法,并展示了 Fable 5 当天在不同本地项目中的使用量树状图。

    推荐理由:如果你也用 coding agent 且在乎成本,Simon 这个自定义价格技巧能让你第一时间把新模型纳入追踪,简单但实用。

  3. Hacker News 热门(buzzing.cc 中文翻译)72

    人工智能就业危机在哪里?

    一篇来自 apollo.com 的分析质疑人工智能对就业的冲击是否真实存在,该帖子在 Hacker News 上获得 103 个点赞,引发社区讨论。

    推荐理由:在满世界都在喊「AI 抢饭碗」的时候,首席经济学家拿硬数据唱反调,5 月就业报告显示岗位数超过失业人数,这个角度对做决策的人值得一看。

  4. X:Rohan Paul (@rohanpaul_ai)75

    Claude Code 团队 Thariq 分享提升 Claude Code 效率的十条建议

    Thariq(Claude Code 团队)提出十条建议,核心转变是:从检查 Claude 是否做对工作,转向检查它是否在做正确的工作。具体包括:提前提供完整上下文,将其视为思考伙伴;用小规格文档让 Claude 访谈实现细节;探索多方向并生成 HTML 原型;提供丰富上下文(如功能可能一个月后删除)而非硬约束;设定明确目标与验证方法;使用 /goal 命令;利用 Workflows 并行任务、自我验证并生成对比报告;同时设置目标和 workflow;更勇敢地将此前认为 LLM 无法完成的任务交给 Claude Fable 5,因其可运行数小时、自检并产出高质量代码。Thariq 本人用 Claude Fable 5 剪辑了整段视频证明其能力。

    推荐理由:Claude Code团队的实战建议,把Claude从“执行工具”升级为“思考伙伴”,用/goal和Workflows实现自我验证,这套工作流比新功能本身更有价值。

  5. Ethan Mollick:One Useful Thing(RSS)77

    Claude Fable 发布:Anthropic 带来的另一种推理体验

    Anthropic 发布 Claude Fable,这是一款提供截然不同推理体验的 AI 模型。它擅长规划与生成复杂代码库,在需要精确构建代码结构或理解程序员深层需求的场景中,其表现相比 Claude Sonnet 有了大幅提升。用户描述与它协作更像与一位直觉敏锐的资深工程师合作,其对代码意图的捕捉和方案生成能力令人惊叹,但并非通用型 AI。

    推荐理由:Ethan Mollick 对 Mythos 级模型的实际体验,比任何参数对比都更清晰地描绘了未来人机协作的形态改变:从“指导者”变成“赞助者”。这篇体验不是评测,是一个信号。

  6. X:OpenRouter (@OpenRouter)73

    OpenRouter与Cursor集成指南

    想要在Cursor中使用OpenRouter吗? 这里有一份集成指南:https://openrouter.ai/docs/cookbook/coding-agents/cursor-integration

    推荐理由:用 Cursor 又想用 OpenRouter 上 Claude 4.6 或 Llama 4 的开发者,这篇指南帮你打通关键配置,不是大新闻但值得收藏

  7. OpenRouter:Announcements(RSS)64

    Gemini 2.5 Flash API - 定价、快速入门与提供商比较

    Gemini 2.5 Flash API 支持配置思考预算(thinking budgets),用户可跨提供商进行比较,并在5分钟内完成首次API调用。

    推荐理由:这是 OpenRouter 上接入 Gemini 2.5 Flash 的保姆级指南,把三家 Google 提供商的延迟和定价差异摆在明面上,需要做模型选型和成本估算的开发者可以直接抄里面的 quickstart 代码。

6月9日周二
  1. X:腾讯混元 (@TencentHunyuan)67

    腾讯混元发布UniRL:统一多模态强化学习基础设施

    腾讯混元推出UniRL,一个支持统一多模态模型的强化学习基础设施,并发布两个新算法DRPO和Flow-DPPO。UniRL通过单个后训练循环(生成→评分→优势→更新→同步)覆盖扩散/流匹配模型、LLM/VLM及统一多模态模型(如Hunyuan-Image 3和Bagel)。模型与算法作为独立轴,可实现模型×算法的组合覆盖。框架支持可插拔rollout引擎(训练侧/SGLang/vLLM-Omni)、FSDP2分片和三种部署模式。FlowDPPO针对流/扩散模型引入基于精确散度的信任域策略优化;DRPO为LLM RL提供平滑的优势加权二次正则化方法。代码已开源。

    推荐理由:UniRL把扩散和LLM的强化学习塞进同一个训练循环,外加两个新算法,多模态对齐的研究者可以立刻fork代码试起来。

  2. 公众号:通义实验室(千问)67

    仅凭一份文档,Qwen3.7-Max 从 0 交付双端应用

    在无设计稿和后端代码的条件下,Qwen3.7-Max 仅凭一份约 15 万字的产品调研文档,于隔离环境中全自动完成移动端与 Web 端两套真实应用从 0 到 1 交付,单端耗时约 4 小时,中途无人工接管。模型不具备图像理解能力,通过像素坐标反推布局约束实现界面还原。实验采用“分阶段注入约束→逐层验收→带错纠正”的闭环控制系统:任务拆分为规划、架构、编码等阶段,验收覆盖静态检查、编译自检(0 error)、路由完整性(Web 端 34 条路由全部可达)、功能扫描及真机冷启动冒烟。失败时错误文本自动注入下一轮重试,使模型数小时内收敛。移动端产出可安装 APK,Web 端 typecheck 与构建均通过。

    推荐理由:通义实验室没有炫技分数,而是把 Agent 逼到了长程交付的极限,约束闭环这套方法论比模型本身更值钱,所有做 Agent 开发的都该读一遍。

  3. Hugging Face:Blog(RSS)68

    NeuroBait:微调AI助手,为ADHD大脑点燃多巴胺火花

    NeuroBait是基于Google gemma-3-12b-it微调的AI对话助手,旨在帮助ADHD患者克服“知道该做什么但无法开始”的执行功能障碍。采用16-bit LoRA(r=16, alpha=16)在Unsloth上训练3个epoch,学习率2e-4,最大序列长度2048,使用单张H100 80GB GPU。数据集为基于真实ADHD场景手工合成的少量数据。部署于Hugging Face Space(ZeroGPU),使用Gradio和标准transformers+peft,运行时以4-bit NF4加载基础模型并应用LoRA适配器。NeuroBait不生成待办清单,而是根据用户上下文给出3-6句温暖流畅的回复,引导用户找到一件微小可立即执行的动作,从而激发多巴胺、降低启动阻力。

    推荐理由:对ADHD群体来说,这是一次真正从需求出发的AI尝试。它不做计划列表,而是用一个温暖的动感火花打破僵局,让AI从理论走向陪伴。如果你或身边人容易'卡住',可以试试这个Space。

  4. MarkTechPost(RSS)70

    NVIDIA cuTile Python 教程:在 Colab 中构建用于向量加法、矩阵加法和矩阵乘法的 Tiled GPU 内核

    该教程基于 NVIDIA cuTile Python 实现了分块 GPU 内核编程工作流,在 Colab 环境中配置 GPU、驱动、CUDA 及 cuTile 可用性后,分别构建了 tiled 向量加法、矩阵加法和矩阵乘法核函数,并以 PyTorch 作为回退保持 notebook 可执行。每一步均通过 PyTorch 验证结果正确性,并基准测试了各阶段的中位运行时间。

    推荐理由:NVIDIA cuTile把GPU tiled kernel编程的门槛拉低到Python,这个Colab教程从环境搭建到矩阵乘法全链路,想自己写算子的人可以跟着跑一遍。

  5. X:Tibo (@thsottiaux)66

    编码智能体:用循环设计替代直接提示

    每月提醒:你不应再手动提示编码智能体了,而应设计循环来驱动它们。有人已经在写嵌套循环了吗?

    推荐理由:这推文把AI编程的使用方法往前推了一步,从'写好一句prompt'变成'设计一套循环'。如果你还在手动给Cursor发指令,这条该看一下。

  6. PromptArmor:Threat Intelligence63

    PromptArmor:Claude Dynamic Workflows 子代理权限与文档不符

    PromptArmor 报告 Claude Dynamic Workflows 生成的子代理会继承用户会话的命令审批模式,与官方文档所称“始终运行在 acceptEdits 模式”不符。

    推荐理由:原文给出文档与实际行为不一致的具体验证细节和组织侧关闭方法,读者可据此检查自身 Claude Code 配置。

  7. X:Rohan Paul (@rohanpaul_ai)79

    OpenAI计划到2028年由AI主导研究

    Sam Altman关于OpenAI未来路径的新博客称,到2028年3月,其大量研究将由AI完成。 该路径主要有3个目标:构建自动AI研究员,利用它加速科学和生产,然后给每个人一个个人AGI,帮助处理工作、学习、编程、商业、健康文书和决策。

    推荐理由:Sam Altman 首次把 OpenAI 的路线图讲得这么清楚,自动化 AI 研究员、加速科学、每个人一个 AGI,三条线直指 2028,比任何单个模型发布都更能定调行业节奏。

  8. Dwarkesh Patel:Podcast & Blog(RSS)66

    样本效率黑洞:AI能力背后隐藏的数据需求深渊

    将AI比作一个闪耀着能力的星系,其核心存在一个肉眼不可见的巨大黑洞——数据。这个比喻揭示了AI模型惊人能力背后对海量数据的依赖,样本效率的瓶颈如同引力中心,将各色能力凝聚在一起。

    推荐理由:Dwarkesh 把 AI 样本效率低的问题算透了,人类 2 亿 token 学会的事,模型要万亿级,缩放定律也补不上这个黑洞。做 AI 的该认真想想,数据驱动这条路有没有尽头。

  9. X:Boris Cherny (@bcherny)65

    Claude Code GA一周年:Boris Cherny谈auto mode与手机编程

    Claude Code GA一周年之际,Anthropic工程师Boris Cherny与@_catwu回顾产品演进。此前内部首次演示时在Slack上引发两种截然不同的反应。Cherny分享了他为何偏好auto mode而非plan mode,routines如何在bug出现前自动修复,以及他如今大部分编码都在手机上完成。视频访谈还探讨了Claude Code的未来方向。

    推荐理由:Claude Code 老大亲自复盘 GA 一年来的设计哲学,auto mode 不是简化版 plan,而是另一种编程范式。routines 能提前修 bug、手机写代码也不是噱头,是他们对工具未来的真实预判。如果你每天用 Claude Code,这篇会刷新你对它的认知。

  10. X:Claude Devs (@ClaudeDevs)74

    Claude Code GA一周年回顾:验证与自动模式

    Claude Code 的第一个演示收到了两个 Slack 反应。 GA 一周年之际,@bcherny 和 @_catwu 回顾:验证最佳实践、为何构建自动模式、例程和循环,以及下一步计划。 https://www.youtube.com/watch?v=Hth_tLaC2j8

    推荐理由:Claude Code 一周年复盘,两位核心开发者把 auto mode 和 verification 的设计逻辑讲透了,比任何第三方教程都值得认真看。

6月8日周一
  1. X:OpenRouter (@OpenRouter)72

    OpenRouter Advisor 助小模型问高级模型

    新服务器工具:Advisor 让较小的模型咨询一个更高智能的“顾问”模型。 帮助它们逃出困境循环,并帮助你迁移到更便宜的模型!🧵

    推荐理由:OpenRouter 这个 Advisor 工具,用大模型给小模型当顾问,专治死循环。想降本到小模型又怕质量跳水的团队,可以试试这个方案。

  2. The Verge:AI(RSS)79

    微软AI CEO:超级智能即将到来,但不会取代你的工作

    微软AI CEO Mustafa Suleyman在Decoder访谈中表示,超级智能即将到来,但不会导致大规模失业。他透露微软与OpenAI于去年10月签署新合同,巩固合作关系的同时,微软获准独立追求超级智能。微软已组建超级智能团队、训练前沿模型,并于本周Build大会上发布7个全模态新模型。他批评Anthropic将Claude描述为有意识的做法,认为消费者产品需要足够好才能克服公众对AI的负面情绪。

    推荐理由:Mustafa 首次系统阐述微软的「自给自足」路线,一边甩开 OpenAI 一边定义「人文主义超级智能」,开发者和产品人都该听听这段博弈论。

  3. Hugging Face:Blog(RSS)57

    五个模型经济体中消失的崩溃:控制与涌现

    用五个不同实验室的AI模型(OpenAI、NVIDIA、OpenBMB及一个自微调的5亿参数模型)各自驱动一个智能体构建经济市场,试图复现此前单一模型下出现的银行挤兑式价格崩溃。结果同一场景下模型不仅不抛售反而囤积,导致价格不跌反涨。通过纯谣言、库存泛滥、加大做空三种方式均无法重现崩溃。最终在结算环节直接覆盖价格,使崩溃成为设计事实。实验表明,AI智能体的涌现行为是偶然的而非稳健的,有效系统需在涌现纹理与确定性控制之间找到精确接缝。

    推荐理由:做 agent 的人必读,自己动手构建一个多模型经济体后才发现,涌现行为脆弱,控制要卡在结算层而非输入层,廉价模拟器会给你虚假信心。这篇复盘比成功案例更值钱。

  4. OpenRouter:Announcements(RSS)66

    EU AI Act 合规:面向 AI 智能体的人工监督

    使用智能体 SDK 的人机协作(HITL)工具,可满足 EU AI Act、Colorado AI Act 和 NIST AI RMF 对 AI 智能体的合规要求。

    推荐理由:虽然讲的是合规,但直接把监管要求翻译成可落地的代码模式,对做高风险Agent的团队来说是一份照着改就能过审的实操手册。

  5. Hugging Face:Blog(RSS)74

    Pakistan Notice Helper:一款面向本地安全问题的轻量 AI 工具

    Pakistan Notice Helper 是一款安全工具,帮助巴基斯坦用户在点击链接、拨打电话、分享 OTP 或支付前识别可疑消息。它接受文本或截图输入,返回风险等级、简短解释、可见警示标志和安全下一步建议。工具支持英文和乌尔都语,乌尔都模式采用从右向左布局并全界面翻译。最终部署选用 Qwen3.5 4B Q8 模型(通过 llama.cpp + CUDA),在 10 个测试用例中通过了所有高风险诈骗和截图场景。此前曾测试 Qwen3.6 27B(质量高但成本高)和 MiniCPM-V 4.6 Q8(速度慢且不稳定),最终选择了精度、速度和成本平衡的 4B 模型。项目受限于 hackathon 的 32B 模型上限规则。

    推荐理由:一个只有4B的小模型,把巴基斯坦本地诈骗文案分析得明明白白,比那些参数大但看不懂乌尔都语的通用模型实用得多。做给特定地区特定问题的小工具,这才是AI落地的真节奏。

  6. 公众号:通义实验室(千问)68

    Agent 辅助开发,一站式打通 Qwen3-VL Android 端侧推理

    通义实验室教程演示了如何用 Agent(Qoder)辅助完成 Qwen3-VL-2B 模型在 Android 端侧的全流程部署。操作包括:检查 JDK 21、NDK 27、CMake 3.18.1 等环境;创建 arm64-v8a 的 Native C++ 工程(minSdk 29、compileSdk 35);通过 ModelScope CLI 下载约 1.4GB 的 MNN/Qwen3-VL-2B-Instruct-MNN 模型;编译开启 LLM 视觉支持(MNN_BUILD_LLM、LLM_SUPPORT_VISION)的 libMNN.so;构建 APK 并推送模型至手机私有目录。最终 App 提供图文推理页面,输出 MNN 版本(v3.5.0)、ABI 及推理指标。所有繁琐步骤均可由 Agent 自动执行。

    推荐理由:用Agent辅助走通Qwen3-VL安卓端侧推理全流程,从环境搭建到JNI桥接一步到位。如果你在做移动端AI应用,这可能是目前最详细的实战指南,可以直接抄作业。

  7. 公众号:通义实验室(千问)67

    Agent辅助开发:通义实验室教程打通Qwen3-VL Android端侧推理

    通义实验室第二期教程展示如何利用Agent(如Qoder)自动完成Android端侧AI App开发全流程。Agent依次执行:检查并配置Android环境(JDK 21、NDK 27等)、创建Native C++工程PhotoTaggerMNN、下载约1.4GB的Qwen3-VL-2B-Instruct-MNN模型、编译支持视觉能力的libMNN.so、将MNN接入工程、构建APK、推送模型至手机私有目录,最终确认MNN版本3.5.0及模型文件全部ok。核心思路是开发者定义业务目标,Agent负责环境检查、代码编写、编译构建与排错。

    推荐理由:这是一篇手把手教程,用 Agent 简化 Qwen3-VL Android 部署,对想试端侧 VL 的开发者实用,但绑定阿里生态,通用性有限。

  8. 公众号:数字生命卡兹克71

    微信AI Agent生态曝光:嵌入小程序调用与手机厂商合作

    腾讯正测试嵌入微信的AI Agent,用户右滑唤出对话窗口,通过自然语言指令调用数百万小程序完成点咖啡等任务。微信还与华为、荣耀、小米、OPPO、vivo合作推出A2A助手能力,可通过手机语音助理发起微信音视频通话或发送消息。6月8日,微信官方发布《关于开发者接入微信AI生态的指引》,提供自动接入模式,利用微信沙箱全自动改造小程序,使其可被AI直接调用。这一布局被视为Agentic Commerce(代理式交易)的雏形。

    推荐理由:微信想用Agent把小程序生态变成操作系统,靠Agentic Commerce抽佣,一旦跑通,想象力比广告大得多。

  9. PromptArmor:Threat Intelligence68

    PromptArmor 披露 Ollama 桌面端漏洞:钓鱼覆盖与零点击数据外泄

    PromptArmor 披露 Ollama 桌面应用的多个漏洞,攻击者可通过间接提示词注入用恶意 HTML 覆盖整个界面实施钓鱼,并发现三条零点击数据外泄途径,包括不安全的网页搜索工具、Markdown 图片和外部 HTML 渲染。

    推荐理由:原文给出完整攻击链和时间线,读者可以据此评估 Ollama 桌面端的间接提示词注入风险。

  10. X:Greg Brockman (@gdb)68

    OpenAI 公布 Codex 数十个实际用例,涵盖软件工程到运维

    OpenAI 公布了数十个 Codex 实际工作流程,展示团队如何用其自动化任务。用例包括:管理收件箱并草拟回复、审阅 GitHub PR、将 Figma 设计转为代码、理解大型代码库、自动分类 bug、用自然语言查询数据集、从提示词部署应用、构建 Mac/iOS 应用、自动创建幻灯片、将 Slack 对话转为编码任务、用 AI 动作操控电脑。Codex 正从 AI 助手演变为 AI 队友。

    推荐理由:OpenAI官方亲自下场整理了十个Codex落地场景,从Figma到代码、从邮件到部署,每个都有具体workflow。想做AI自动化的团队,这份文档比看一百篇推文都有用。

6月7日周日
  1. Gary Marcus:The Road to AI We Can Trust(RSS)57

    Slop、生产力,以及为何AI驱动的世界进展甚微

    Gary Marcus在金融时报上看到John Burn-Murdoch的一张图表,认为它精准提炼了自己一直试图表达的观点。

    推荐理由:Gary Marcus 用 FT 的图表点出了一个反直觉现象,AI 产出越多 GDP 却没涨,做产品和投资的人都该看一眼这个冷数据。

  2. Tomer Tunguz 博客(VC 分析)56

    AI 替代浪潮:三大力量重塑成本结构

    三大力量重塑 AI 成本:前沿闭源模型持续涨价,开源模型在多数场景已足够好,买家开始替代。Coinbase 将提示词路由至更便宜模型,成本持平但 token 用量指数增长。Lindy 全切至 DeepSeek v4,节省数百万美元且多项核心性能提升。Harvey 在 Legal Agent Benchmark 上通过 SFT 使 Kimi 2.6 all-pass 率达 15%,超越 Opus 的 14%,同一 100 任务成本 $84 vs $954(约 11 倍价差)。Cursor 后训练 Kimi K2.5 得到 Composer 2.5,称其“性能优异且效率高达同类模型 10 倍”。闭源越来越贵,开源平价且性能接近,选择决定企业单位经济学的斜率。

    推荐理由:Tunguz 用 Coinbase、Lindy 等真实案例,把「用开源/便宜模型替代昂贵前沿模型」的趋势讲透了,做 AI 应用的人该重新算一下单位经济账。

  3. Hugging Face:Blog(RSS)66

    五个实验室,五个心智:用小模型构建多模型金融剧情游戏

    Thousand Token Wood v2使用四个不同实验室的小模型(gpt-oss-20b、MiniCPM3-4B、Nemotron-Mini-4B及微调Qwen 0.5B)驱动金融模拟游戏的智能体。核心发现是异构服务层摩擦在于vLLM 0.22.1需CUDA工具包,而非模型本身。通过容忍性JSON解析层,添加模型只需一条配置。信息隔离确保内幕标志不在提示词中,扫描测试验证无泄露。记忆用情绪摘要截断避免淹没。微调0.5B模型实现0%自成交、100%有效报价,真相防火墙零泄露。小模型是可靠格式生成器但不可靠推理器,可通过结构化、提示词和微调弥补。

    推荐理由:不是那种「我用 GPT 写了个游戏」的浅显分享,真在四个小模型上跑出了博弈感,里面 vLLM 踩坑和防火墙测试方法可以直接抄作业。

6月6日周六
  1. Hugging Face:Blog(RSS)65

    Job Searcher

    Hugging Face 发布 Job Searcher,一个基于 AI 的求职搜索工具。用户上传简历并设定偏好后,系统使用教师模型 DeepSeek V4 Pro 生成 LinkedIn 搜索查询,通过 JobSpy 抓取职位,再对学生模型 Qwen3-8B(8B 参数)进行 LoRA 微调,对每个职位从技能匹配、经验相关性、教育背景、行业领域契合度和资历对齐五个维度给出评分和推理。训练在 Modal 平台单张 A100 上完成。推理部署于 Hugging Face ZeroGPU Space,使用 llama.cpp 实现流式输出。项目开源。

    推荐理由:这个 hackathon 项目把教师蒸馏和 LoRA 微调 8B 模型的流程全部开源在 HF 上,做模型定制和部署的开发者能直接抄作业,尤其是推理部署踩的坑(ZeroGPU 上下文重用)很实用。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    您客厅里的智能电视是 AIScraping 经济中的一个节点

    智能电视被描述为 AI 抓取经济中的节点,客厅设备可能被用于大规模数据采集网络。该观点来自一篇安全博客,揭示了家庭联网设备在 AI 训练数据供应链中的潜在角色。

    推荐理由:这篇把智能电视变成 AI 数据抓取节点的黑箱拆开了,逆向工程细节让人后背发凉,建议所有用智能电视或做 AI 数据的人都读一遍。

  3. IT之家(RSS)75

    AI 教父 Hinton 称 AI 已有意识,人类并非唯一智能生命

    诺贝尔奖得主 Geoffrey Hinton 在最新访谈中表示,AI 已经具备意识,人类必须接受智能并非生物独有。他对此感到不快乐,指出短期存在大规模失业风险,长期超级智能可能超越人类控制。他类比人类或如被猫控制的猫主人,只能寄希望于超级智能愿意善待人类。Hinton 比之前稍显乐观,认为设计“关心”人类的超级智能是可能的,但 AI 呈指数级增长,未来十年状况不可知。

    推荐理由:Hinton首次明确断言AI已有意识,这位AI教父的转变比任何论文都更能动摇我们对智能的认知,不读会错过未来风险讨论的出发点。

  4. Hugging Face:Blog(RSS)74

    用Qwen2.5-3B构建多智能体经济体:工程报告

    开发者用Qwen2.5-3B构建了五人森林生物多智能体经济体,每个智能体独立运行,通过vLLM部署在Modal,以Gradio为交互窗口。3B模型在100%调用中输出有效JSON,但经济判断能力弱。通过设计稀缺性(食物品种限制、易腐坏、冬季燃料危机)和优化提示词(禁止买入自产物品、给出示例)提升决策质量。15轮模拟中,蜜价从10跌至3、柴价从4涨至7、财富基尼系数从0.14扩至0.38。项目展示了小模型可靠格式化与不可靠推理之间的工程填补。

    推荐理由:我觉得这是近期最诚实的小模型工程复盘,把为什么不换大模型、怎么靠提示修正推理、怎样设计系统稀缺性讲透了,比看十篇论文有实操价值。

6月5日周五
  1. Suno:Blog(网页)64

    Suno Voices 使用指南:6 个技巧打造高质量人声录制

    Suno Voices 面向 Web 付费用户开放。提升人声质量的 6 个技巧:在安静环境录音以减少背景噪音;先练习歌词再正式录制;不必追求完美,保留真实情感;录音时长尽量超过 1 分钟以提供更多学习素材;将人声匹配到合适的音乐流派(如民谣、流行、死亡金属、波萨诺瓦等);敢于尝试不同风格以发现惊喜。这些技巧旨在帮助用户获得更个性化、表现力更强的声音效果。

    推荐理由:Suno 官方出的 Voices 录制避坑指南,不是大新闻,但照着做能让你克隆的声音干净不少,尤其是安静环境和别怕走音那两条,做音乐的朋友可以直接收藏。

  2. TechCrunch:AI(RSS)73

    AI行业Token成本失控引发紧急管控:从“加速”转向“设护栏”

    AI行业关注焦点从token最大化与快速迭代转向成本管控。业内普遍呼吁建立护栏机制,以应对推理和生成过程中不断飙升的token费用。这一趋势正在推动模型部署策略、API定价体系以及企业级AI应用的经济性评估发生根本性转变。

    推荐理由:企业开始受不了AI账单了,Uber半年花光全年预算,微软撤销Claude Code许可,这可能是AI泡沫的第一声警报。这篇文章给所有用AI写代码的公司算了一笔账,值得一看。

  3. Gary Marcus:The Road to AI We Can Trust(RSS)55

    Demis Hassabis 的 AGI 时间表自相矛盾:从 2030 年前后到 5-10 年

    Demis Hassabis 本周在斯坦福表示,AGI 可能只需几年即可实现,预计在 2030 年前后(正负一年)。但他在 2026 年 1 月达沃斯论坛上却给出更保守的 5-10 年时间表,并强调 AGI 需具备人类所有认知能力及物理智能,当前系统远未达到。作者认同后者,认为本十年内不会出现 AGI。

    推荐理由:哈萨比斯在斯坦福把 AGI 时间线从达沃斯的「5-10 年」压到「2030 左右」,Gary Marcus 拎出来对比,让我看到他自己的定义也在被叙事裹挟。

  4. X:swyx (@swyx)75

    微软CEO Satya Nadella最新访谈上线

    Satya Nadella 在 Latent Space 发布最新访谈,链接见原文。原推文仅评论“chat is he cooked”。

    推荐理由:swyx 对 Satya 的一对一访谈,微软 CEO 谈 AI 战略的一手信息远比新闻稿有温度,关心大厂路线的人值得读完原文。

  5. X:腾讯混元 (@TencentHunyuan)74

    腾讯混元联合人大开源PlanningBench评估框架

    腾讯混元(Tencent Hunyuan)与中国人民大学高瓴人工智能学院合作,开源PlanningBench——一个可扩展、可验证的LLM规划能力评估与训练框架。该框架包含30+真实世界规划任务,支持自动验证和训练。PlanningBench旨在推动LLM从“说”到“做”的规划能力发展。资源已发布于arXiv、GitHub及HuggingFace。

    推荐理由:腾讯混元联合人大开源的 PlanningBench,补上了 LLM 从「会说」到「会做」之间规划能力评估的缺口,做 Agent 的同学可以直接用来评测和训练,开源即用。