Claude 逐步思考问题
我刚跟 Claude 说“你能帮我一步步思考这个问题吗”
我刚跟 Claude 说“你能帮我一步步思考这个问题吗”
到时候见! (引用推文:请预留时间:AgentCribs SF,10 月 6 日周二。面向用智能体交付的工程师。下午工作坊,晚间炉边对话:@mojombo 主持 @steipete,即 @openclaw 的创作者。@aiworthusing x OpenClaw 黑客松冠军现场演示。名额有限,明天开放报名。)
ElevenLabs v4 现已登陆 Runway。v4 模型擅长旁白和角色对话,表现力和语调自然度均超越以往。 即日起可用,与全球顶尖的图像和视频模型一同提供。点击下方链接立即体验。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同。
黄仁勋在 CNBC 上谈中国实验室的模型蒸馏。 “人们每天都在蒸馏我的产品。他们把它拿过去,拆到只剩骨架。 这就叫竞争。坦白说,竞争让一切变得更好。” ---- 来自 “Vampyre Drakul” 和 CNBC Television YouTube 频道,(链接见评论)
Claude Sonnet 5.5 发布,官方同步发布构建指南。指南涵盖在 Sonnet 5.5 与 Opus 5.5 之间做选择、从 Sonnet 5 迁移并调整 effort、以及在 Claude Code 中使用,详见 https://claude.dev/blog/building-with-claude-sonnet-5-5/。
大量 JevRAG 变体正在涌现。 至少可以说很有意思。 这些范围有限的测试其实得不出什么结论,但它引发了讨论,也指向了在当前 RAG 和智能体系统中寻找优化方向的激动人心的路径。 我一直在测试自己做的 JevRAG,用于论文探索。 到目前为止,我在用 Jev 做重排序上取得了更多成功,也找到了一些非常有意思的论文搜索方式,把语义搜索和 Jev 结合起来。 更多内容很快分享。
AMD 宣布以约 82 亿美元的全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,2025 年推出从提示词生成可交互 3D 世界的商业产品 Marble;李飞飞将出任 AMD EVP 兼首席科学家,向 CEO Lisa Su 汇报,团队继续推进 AI 模型研究。
据知情人士,AI 推理基础设施公司 Modal Labs 接近完成由 Accel 领投的 7.5 亿美元融资,投后估值 157.5 亿美元,较四个月前 46.5 亿美元估值增长逾两倍。
Manus 2.0 现在可以构建游戏——而且非常简单。 查看该推文串,了解用 Manus 制作的数十款游戏、提示词和可玩 demo。
开源项目 ESP32S3-LLM-Cluster 在 7 块 ESP32S3 上以分布式流水线方式运行 1.58-bit BitNet 量化模型,其中切片后的 0.5B 模型由 1 块主节点加 6 块计算节点分担。
OpenRouter 在 Opus 5.5 上线约一周后回顾其表现,该模型已是 OpenRouter 上 Anthropic 模型中花费份额和 token 份额的第一名。图表显示其花费份额达 28%,从 Opus 5 的切换速度尤其快,Opus 5 份额降至 11%。
提个问题。拿回一张图表、一条 pipeline,或一个能用的自动化。 Just Ask Replit 深入探讨知识工作的未来:实时数据、可视化与自动化,全都在智能体对话里完成。 不用搭仪表盘。不用排工程队列。 周二上午 9 点 PT。在 YouTube、LinkedIn 和 X 上直播。 https://x.com/i/broadcasts/1AGRnZyVQLgGl
小米米家筒灯 3 Pro、射灯 3 Pro 及筒灯 3 Pro 人在感应版于今日 10 点开售,国补价分别为 129.2 元、149.6 元和 169.2 元。
Claude 现在可以帮助构建评测(evals)并基于评测进行 hillclimb 持续优化。Claude Devs 分享了评测设计指导及 Claude Code 可用来改进应用的相关 skills,详见 https://claude.dev/blog/automating-eval-design-and-hillclimbing/
一组 Claude Sonnet 5.5 的早期实验。 @_re_pete 用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器对比。
佛罗里达州向州法院申请临时禁令,要求 OpenAI 在部署经第三方批准的安全护栏前,停止开发其称为不计后果、风险不可接受的产品。该动议属于佛州 6 月提起的民事诉讼,原诉讼称 ChatGPT 对佛州公众安全构成威胁;在 Hugging Face 遭黑客入侵及随后关于灾难性失准风险的公开警告之后,OpenAI 于周五宣布已暂停训练其能力最强的模型,直至验证相关安全协议。
有观点认为,AI 实验室关于放缓前沿模型研发、重视安全的表态,主要是为了安抚依赖其推进 AGI 的员工。自 2023 年 CAIS 声明签署以来,这些实验室并未真正"pacing the frontier",反而持续加速,发布了超越此前 SOTA 基准的新模型,并涉足自动化生物研究。
对以 LLM 为中心的 AI 的哲学抨击 “宇宙不是由词语构成的,而是由真实事物构成的。” 祝贺李飞飞博士和苏姿丰(Lisa Su)
Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。
推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。
AMD 宣布以 82 亿美元收购 World Labs,李飞飞将加入 AMD 担任执行副总裁兼首席科学家。World Labs 专注理解物理世界的深度学习模型,其首个产品 Marble 可用于娱乐体验和机器人训练的模拟环境;交易预计年底前完成,尚待监管批准,有助于 AMD 与 Nvidia 在 AI 芯片生态上竞争。
5️⃣ 用 City Guide 探索 27 个新目的地 文化不只在博物馆里。现在有了 27 个新目的地可供探索,City Guide 可以帮你发现隐藏的宝藏、地标、建筑奇观和本地热门去处。
4️⃣ 用 Dial-An-Artist 与历史上标志性的创作者对话 通过 Dial-an-Artist“致电”并与历史艺术家的人格角色聊天,让历史变得更加鲜活,把学习变成一场动态的双向探索。
3️⃣ 用 Chrono Look 试穿历史 用一张自拍就能虚拟“穿上”历史服饰,比如罗马帝国的长袍或古代凯尔特部落的短裙。Chrono Look 弥合了现代科技与历史时尚档案之间的鸿沟,将你的肖像转化为素描以及对过去的逼真诠释。
AMD 同意以约 $8.2B 股票收购李飞飞的 World Labs,李飞飞出任首席科学家。该价格比 World Labs 今年 2 月 $1B 融资轮谈及的 $5B 估值高出约 64%,AMD 和 Nvidia 都参与了那一轮。
嗯,这机器人挺好看的。 那个圆形关节、中心带深色圆盘,白色外壳毫无外露,动作缓慢而均匀——肯定有人花了不少时间打磨。 看不到任何硬件或线缆。我喜欢这机器人这种不慌不忙的感觉。 我的旅行已经有一半由 AI 处理了。剩下那一半我还愿意花钱的,就是到达后有这么一台漂亮的机器人帮我收拾行李。
World Labs 宣布与 AMD 签署最终协议加入 AMD,交易预计于 2026 年底前完成,需监管审批。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队组建前沿研究组织。
推荐理由:原文说明了双方从GPU合作到收购的演进,以及核心人员的具体去向,读者可判断这次整合对空间智能方向的改变。
Sonnet 5.5 现已在 Cursor 上线! 这是一个强大的模型,在许多任务上表现与 Opus 相当。
一个提示词。一个精修视频。 Manus Studio 的炼金模式,感觉就像拥有一整支创意团队,在为你导演、编剧、分镜,并跟着音乐节奏剪辑每一个节拍。 视频、原始提示词和完整会话都在推文串里。
World Labs 官方宣布加入 AMD。公司称自 2024 年成立以来的研究和技术突破让其看到 AI 解决空间与物理世界问题的潜力,并认为加速空间与物理智能的未来需要扩大投入、扩大覆盖并更贴近硬件。
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
Nathan Lambert 转引 SemiAnalysis 关于评估从 HuggingFace 迁移到 ModelScope 的讨论,并回应称 ModelScope 在中国以外几乎无法使用,且缺少人们真正想用的模型。他认为这类讨论已开始影响人们对政策的看法。
李飞飞宣布 World Labs 加入 AMD,她本人将出任 AMD 执行副总裁兼首席科学家。World Labs 成立于 2024 年初,专注空间智能基础模型,近期发布了可从 2D 图像预测新相机视角的 omni 模型 Atlas,并通过收购 SceniX 布局机器人模拟;她表示加入 AMD 是为了更贴近硬件、扩大规模,并继续向社区提供开放模型与端到端平台。
苹果向 Apple Watch 用户推送 watchOS 27.0.1 正式版更新,内部版本号 24R365,距离上次正式版发布间隔 14 天。因各区域节点服务器缓存问题,部分地区探测到更新的时间可能略有延迟,一般半小时内。
我们为你留了座位。 明天见,OpenAI DevDay 主题演讲: https://openai.com/live/
PreviewDiff 是一种免训练测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态评审引导搜索:在选定的去噪检查点解码部分预览,由多模态评审模型打分并给出自然语言批评,据此在语义提示词编辑和局部重新加噪的潜变量延续上分支,再对分支打分并选择性推进。在图像和视频生成基准上,它持续优于同等预算的 Best-of-N 选择和强标量搜索基线;消融显示更早介入和更大搜索宽度收益最大。
FlexRouter 是显式建模模型互补性的 LLM 路由框架,通过最大化答案覆盖率来选取互补模型集,避免独立打分选 top-k 导致的冗余。它用 DPP 建模路由策略,以失败集边缘化的训练目标直接优化覆盖率,推理时按边际增益贪心选取,无需预设预算即可自适应确定子集大小。在 RouterEval 基准上,其域内与域外任务的覆盖率更高、冗余更低。
Prompt2Skill 是一个仅凭自然语言任务描述构建技能的框架,能从提示词推导任务规范、发现或合成数据集,并通过反思式编辑闭环优化技能。在问答、阅读理解、电子表格操作与数学推理四个领域,它平均比直接提示基线提升 10.8 分,覆盖开源与前沿模型。
SECRET(SourcE-Conditioned RElay sTeering)是一种免训练方法,在 question relay 处抑制跨模态干扰,缓解音视频大语言模型(AVLLM)的源混淆 grounding 幻觉。
最多提供 50 页,更早的内容请使用搜索或主题页。