Manus 2.0 集成 H3 Max 视频模型
Manus 团队重磅发布。 很高兴看到 H3 Max——我们后训练的视频模型——集成进 Manus 2.0。
Manus 团队重磅发布。 很高兴看到 H3 Max——我们后训练的视频模型——集成进 Manus 2.0。
全速前进 💨 (引用推文 @amasad:Replit Drift)
自己创业时,你最不需要的就是再多一件事要操心。把精力放在最需要你关注的事情上:你的创造力。剩下的交给我们。 @SRNA_LI 用 Cohere 赋能自己,也赋能她的事业。
特朗普在 Truth Social 宣布成立"超级智能部队"(SIF),负责协调联邦政府与消费者、公益团体、宗教组织、关键基础设施运营方及 AI 公司的对接,直接向总统和幕僚长 Susie Wiles 汇报。
Elvis Saravia 回应 Karpathy 关于理解 LLM 输出的帖子,称类似做法自己已实践一年多,并分享他正在搭建的通用人机协作界面。其当前方案将高级智能体连接到类 Notion 的灵活页面,支持嵌入工件、文本、视频和可视化讲解,智能体按任务输出这类工件而非默认文本回复,他通过评论和建议直接协作,覆盖代码审查、笔记、写作、研究和原型设计等场景。
今天粉丝突破 30 万! 2024 年开始发推时从没想过会有这一天。(我以为得有 Andrej Karpathy 那样的名气才能涨这么多粉) 回头看,这一路特别有意思: - 分享了 nanoGPT & llm.c 运行、还有 Muon 这样的副项目 - 给我之前的创业公司带来了很多用户 - 在这里线下认识了很多了不起的人 我基本上就是尽量每天稳定发 1 条推,想到什么发什么。 X 是 AI 和科技最好的地方。 会继续唠下去!
Anthropic 开始通过其 Anthropic Interviewer 邀请更多用户参与一场 15 分钟的语音访谈。 > “兴奋、担忧,还是介于两者之间?我们想听听 AI 如何融入你的生活,以及你对未来的期望。” 之后,用户可决定是否将访谈内容公开。 这似乎是一种有趣的方式,确保人们有机会表达对 AI 的看法。看起来很快会扩展到更广泛的受众。
GitHarness 框架把每个需求及其对应工作像 Git 提交一样存储,在用户修改需求时从最近有效版本分支、只重做变更部分。作者称其在全部 30 个测试设置中优于简单续跑,其中 1 个编码任务设置 token 用量减少 73.6% 且得分更高。论文指出用户很少一次给出完整规格,多数智能体会携带过时工作或全部重做,建议对接受反馈的智能体内置版本管理。
产品设计师 Mete 撰文分析 Meta 的 Muse 为何登顶美国 App Store,认为其核心组件在 Codex、Claude Code 等产品中已存在一年以上,Meta 的胜出在于把单一主聊天界面作为心智模型、抽象掉模型选择器等复杂选项。
关于招聘你的第一位 @Grok @Bot 员工的实用指南。 这真的就像雇了一个超棒的帮手,它会了解你的需求,而且几乎每天都在变聪明!
Grok 4.7 在 AA Cyber Index 上排名第一
Rohan Paul 总结个人智能体记忆使用的研究结论:更多记忆笔记超过一定限度反而让智能体违反规则,计数或追踪类需求应改用代码。
因性骚扰调查于 9 月 25 日被迫辞职的新泽西州前副州长 Dale Caldwell 在 NJ PBS 采访中称,他把调查报告"喂"给多个 AI 平台,AI 共 59 次被问及"你会得出什么结论",没有任何一个 AI 认定存在性骚扰。AI 聊天机器人以迎合用户著称,常说出用户想听的话。
Bernard Marr 为 Uniquely Wired Magazine 第二卷撰写导言,指出当前生成式 AI、智能体 AI、量子计算、沉浸式界面与先进传感器网络正相互加速,不同于蒸汽、电力、计算各自相隔五十到一百年的单线革命。
本周顶级 AI 论文(9月28日 - 10月4日): - JAZ - CASD - Agensh - Jev-Mem - AutoGym - Taste-Bench - Context Language Models 继续阅读了解更多:
Meta 及合作者提出 Context Language Models(CLMs),把实时上下文当作模型可自由编辑的文件,无需训练即可零样本使用。在 BrowseComp-Plus 上比 SOTA 上下文管理策略准确率高 11.4%、FLOPs 少 21.5%;12 小时 EdgeBench 上分数高 5%、FLOPs 少 59%。
是的 (注:主推文仅为 "Yes",属于纯感叹/回应,信息量极低。引用推文 @VulcanBench 称 "Grok 4.7 writes great code.",即 Grok 4.7 编程能力出色。主推文是对该评价的肯定回应。)
试试 Grok @Bot
Ethan Mollick 用一条提示词让 Fable 5.1 单次生成粗野主义城市建造器,成品可在线访问,并附上可玩的链接。他表示效果相当好,并拿来与一年多前 GPT-5 在类似提示下生成程序化粗野主义建筑创建器的结果作对比,称 GPT-5 当时很聪明且能直接替你完成任务。
机器人格斗公司 REK 在旧金山举办的人形机器人笼斗赛收到加州州立体育委员会(CSAC)的停止侵权禁令,被要求停止举办、宣传或赞助此类未经审批的格斗赛事,未取得许可组织此类活动属轻罪。
在 StarSkirmish 赛事中,OpenAI 的 GPT-6 Astra 与 Claude Opus 5.5 表现相当,但都打不过人类制作的机器人 Stardust。
特朗普在 Truth Social 宣布成立 Super Intelligence Force,负责协调联邦政府确保美国在超级智能领域领先。据《华尔街日报》报道,国家情报总监 Jay Clayton 将担任主席,FTC 主席 Andrew Ferguson 等三人为副主席,任务组需在 120 天内提交关于 AI 风险与机遇的报告,章程强调应对 SI 威胁同时防止过度监管。
作者自制 BinRange 项目,用一个固定 UWB 锚点和六个电池标签,结合 Home Assistant 的收垃圾日程,判断垃圾桶是否真的拿出去。先用 Makerfabs ESP32-WROVER/DW3000 开发板验证:10.1 米间距平均读数约 10.09 米,标准差 3 厘米;天线朝向从平放改为直立使成功率从 37% 升到 100%。
Grok
Tripo P2.0 生成干净、可直接用于动画的角色,采用为运动打造的四边形拓扑。 不再有变形或拉伸。 生成 -> 绑定 -> 动画。 更少手动工作,更干净的结果。
微软正推行名为“仿生”(Biomimicry)的计划,重新规划旗下 20 多个数据中心周边土地,陆续恢复原先湿地生态并种植本土植物,后续美国境内所有新建项目都将采用这一方式。
有 15 年以上终端使用经验的开发者表示,AI 智能体已让他完全放弃终端,转向更适合与智能体协作的新界面。他认为终端假设人类直接通过文件、命令和进程操作计算机,而智能体只需表达意图即可操作机器。他仍庆幸在 AI 时代前学过计算机系统,理解抽象底层让人成为更好的系统思考者,这也是 AI 时代的一种护城河。
Strata 免费开源(MIT 许可),让 Qwen3.8-Flash-Next (125B) 可在 12 GB 以上显存的普通游戏 PC 上运行,RTX 4090 上可达约 100 token/s 生成速度,模型约 70 GB 下载、需 32 GB 以上内存和约 80 GB 磁盘。
获取插件 → https://app.pixverse.ai/cli/marketing
推出 pixverse ad variants,一款面向你的 AI 智能体的全新 PixVerse 插件。 从你已有的一支广告开始,你的智能体就能把它变成营销活动所需的任意多个版本。 → 替换出镜人物、服装、产品或背景 → 保持构图、镜头运动、节奏和灯光不变 → 为每个市场、季节和受众产出新变体
乐山大佛文物保护(景区)管委会回应媒体四川观察称,网传文保工人给大佛"掏耳朵"的视频系AI生成的不实信息,大佛耳鼻内并无杂物需清理,凌云山片区目前没有猴子。管委会数字化信息中心副主任陈芮介绍,2026年以来乐山大佛总计开展5次保养维护,第5次于9月20日至25日进行,内容包括岩体表面微损伤修复、微生物清理、表层植被清除等,与视频内容无关。
可灵 Kling 4.0 制作的短片《The Beat》在社交平台曝光量突破 500 万,官方发布幕后解析。影片开场为 30 秒连续长镜头,依托 Kling 4.0 原生 30 秒生成能力实现;Omni Reference 单任务支持最多 15 个多模态参考,Multi-Keyframe 支持最多 10 个关键帧,并采用 10-bit HDR 输出与升级立体声音频。
美国在忙着做 Frontier Models 中国在忙着做 Open Models,并努力成为 Frontier 欧洲在忙着做 Sovereign Models,谓之"主权" AI
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),用逐步收缩的编辑预算和严格 critic 审查,抑制语言模型反复改写智能体 harness 时对测试任务的记忆。
DeepSeek Harness 组成员崔添翼回应 v0.2.1-alpha.1 版本加入 Claude Code Mods 兼容层,称其属于 alpha 版本中的实验性功能,目的是验证 Claude Code Mods 提供的扩展能力是否大致是 DSH 一切皆插件架构能力的一个子集,目前还无法让所有 Claude Code Mods 无缝运行,技术上未来有可能做到。
pi pod 是一个围绕 pi 编码代理构建的自托管沙箱环境,可在隔离沙箱中运行 pi,并提供精心挑选的最小化工具集。项目作者称其使用体验与现有 pi harness 无异,自托管可保证数据所有权与隐私,适合希望将整个智能体环境放在自有数据中心的团队,托管服务即将推出。
NVIDIA 发布 Mid-Harness 论文,提出在模型与 harness 之间采样并验证候选动作再执行的测试时计算方法。TerminalBench-Lite 上,GPT-5.6 Sol 验证器从 8 个采样动作中选择时,Pass@1 从 50.0% 升至 68.0%;弱验证器下增加采样几乎无收益。
Google 提出 VeriHarness,将同一基座模型变为智能体验证器,专门处理 rollout 间的一致与分歧:分歧时查工作区证据裁决,一致时反向挑战找被遗漏的需求。在五个长时程基准上取得最优选择分数,配合证据修订在 Gemini 3.5 Flash 上提升 6.2 分、Claude Opus 4.8 上提升 6.4 分,并开源约 26,000 条 rollout。
Meshy 与 @OpenAI 共同赞助 G-STAR 2026 的 Unity AI Game Jam。 50 名开发者。24 小时。 创意用 OpenAI,3D 用 Meshy,在 @unity 中构建。 11 月 18–19 日 · BEXCO,釜山 详情:https://on.unitysquare.co.kr/4xRg3D8
宝可梦火红的四天王 + 冠军,一次通关——决策由 Perplexity 的 Decisions API 驱动。 实际运行数据: 592 ms API 响应中位数 987 ms p95——96.4% 的响应在一秒以内 $0.028 预估推理成本,137 次实时 API 调用