Anthropic 与 SpaceX 签署最高 845 亿美元算力协议,可提前 90 天通知解除
Anthropic 与 SpaceX 签署算力协议,据路透社查阅的 IPO 申报文件,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU。
推荐理由:原文基于 SEC 申报文件给出合同金额、月费与解约条款等具体细节,读者可了解 Anthropic 算力采购的实际安排。
Anthropic 与 SpaceX 签署算力协议,据路透社查阅的 IPO 申报文件,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU。
推荐理由:原文基于 SEC 申报文件给出合同金额、月费与解约条款等具体细节,读者可了解 Anthropic 算力采购的实际安排。
GamersNexus 撰文指出,Micron、Samsung、SK Hynix 等内存厂商正以 3-5 年长期协议(LTA)把 50%-70% 产能分配给最大的 5-16 家客户,试图消除行业原有的周期性低价。
推荐理由:原文整理了各内存厂商 LTA 产能分配数字和一年价格涨幅,读者可以据此理解消费市场涨价的结构性原因。
RSA 在旧金山 The AI Conference 上发布智能体身份安全平台 RSA Agent ID,面向金融、政府、医疗等受监管行业,包含 Discover、Secure、Govern 三个模块,可独立部署或整合于 RSA Unified Identity Platform。
查拉图斯特拉如是说
OpenAI 将在数天内上线数百万个 dot,覆盖庞大且多元的社区,处理各类任务。用户使用 2-3 天、教会它更多个人偏好后即可感到明显提升,它能快速学习并独立承担颇具野心的任务。团队正观察用户如何使用主 dot,之后再开放创建整支 dot 团队的能力。
在 DevDay 能和大家面对面交流真是太棒了。现场氛围绝佳,看到大家一整天都在构建各种东西,非常有趣。
百度地图 V22 正式发布,带来车道级导航 4.0、SR 导航 2.0 和全域护航系统三大导航能力升级。车道级导航 4.0 延伸至小区、园区内部道路并打通超百万停车场,SR 导航 2.0 将引导延伸至停车场并引入 AI 生成式渲染,全域护航系统支持 30 多种安全提醒、秒级感知重大异常。新版本同步升级 AI 搜索、AI 出游、AI 路线、AI 此刻、AI 副驾与 AI 互动等服务。
Tibo 回应称收到的 community note 是错的,澄清 primary dot 包含在套餐内并可 24/7 运行。dot 直接执行的工作不消耗用量,只有让它创建 codex task 时才按常规计费;未来提升速度和带宽将是付费功能,但基础功能始终包含在套餐中。
OpenAI CEO 奥尔特曼在 DevDay 后表示,只有能对模型安全作出站得住脚的承诺后才会考虑上市,目前没有确定时间节点。他担心上市后资本市场压力会妨碍安全优先的节奏,认为当下正处在向超高能力模型过渡、迎来全新安全要求的阶段,此时上市不明智;但也称若上市拖延太久对世界并非好事。此前 Anthropic 已于 6 月递交上市申请,马斯克旗下 xAI 所在的 SpaceX 同月完成上市。
Manus 现已支持 OpenRouter。在 Manus Flex 中添加你的 key,即可用你选择的模型驱动你的智能体。
OpenAI CEO 奥尔特曼在旧金山 DevDay 大会上宣布推出新 AI 智能体产品 Dots,并称 AI 给世界带来的影响会超过工业革命。他认为 token 是糟糕的衡量指标,但客户希望付费有据可依,OpenAI 尚未找到更好办法。Dots 会替他处理通知和待办事项,让他不再那么依赖手机;他还主张 AI 安全保障必须领先于能力发展,走中间路线。
BestBlogs 09-30 早报汇总多条 AI 动态:OpenAI 2026 开发者大会发布 dots 常驻智能体、GPT-6.1 Sol 及 Decisions API 等;Manus 更新 2.0 并推出全天候个人智能体 Cue;Claude Sonnet 5.5 发布,API 单价不变但任务成本更低。
OpenAI DevDay 2026 发布常驻智能体 Dots、协作空间 ChatGPT Space、基于 GPT-6 Luna 的 Decisions API 及 Codex 云端环境。
你构建了它,现在展示并分享它。 通过可分享的个人资料页,你可以将你的 Sites 和插件汇集到一处,让他人找到并复用它们。团队成员也能发现你分享的技能——这些技能仅保留在你的工作区内。 面向 Free、Go、Plus、Pro 和 Business 用户开放。即将逐步推送到 ChatGPT Enterprise、Edu 和 Healthcare 方案。
livenerf 是一个 append-only 基准项目,目标是检测 Claude Opus 5.5 在 2026-09-22 发布后性能是否随时间漂移。
欢迎参加 #SFTechWeek 期间的 Tripothon Demo Day! 来看看开发者们用 3D、世界构建和交互体验创造了什么。🧩🦋🌍
OpenAI CEO Sam Altman 在 DevDay 主题演讲后的记者问答中表示,OpenAI 在能对模型安全作出有把握的承诺之前不会上市,目前没有明确时间表。
美国民主党联邦众议员罗·康纳准备提出《Human Control Over AI Act(人类控制 AI 法案)》,在联邦政府建立防护规则并获监管机构批准前,禁止 AI 模型递归式自我改进或自主修改自身核心目标、遏制机制和关停控制。
想法太多,时间太少
Elon Musk 和 Jensen Huang 在白宫正式会晤后表示,他们与特朗普总统及其他多位 AI 领军企业高管共同签署了白宫超级智能协议(White House Accord on Super Intelligence)。作者转发引用了 @GavinSBaker 在 America.gov 发布活动后台、超级智能主题圆桌前的现场照片,并注明完整视频可在 YouTube 频道 DRM News 观看,链接见评论。
Grok 4.7 在 AA 网络安全指数排名第一
Anthropic 保密版 IPO 招股书显示,去年 47% 的客户销售收入经由亚马逊和谷歌的云渠道完成,公司寻求约 2 万亿美元估值。2025 年营收暴涨 12 倍接近 46 亿美元,营业亏损突破 80 亿美元;截至 2026 年初长期采购承诺总额超过 4,170 亿美元,对应 3.5 吉瓦专用算力,招股书同时提示客户与渠道集中带来的利益冲突风险。
Mark Zuckerberg 转发白宫活动并称,美国各大实验室负责人已承诺实施稳健的内部控制和多层审计与审查,让公众更有信心各实验室构建的技术会按预期运行。其引用的 David Sacks 推文称该活动签署了《白宫超智能协议》;协议文件列明四层控制:监控模型训练与部署中的能力和对齐、设立内部团队保障控制运行、引入独立外部审计、设立董事会独立委员会监督。
Window Lab,用 Krea Agent 创建的应用。 只需上传你的视频,调整运动控制,即可获得你想要的效果。 在下方试试 👇
推出 Manus Flex。 将你自己的 API key 带入 Manus。 在 Manus 的智能体框架、工具和执行环境中使用受支持的提供商。 在此查看博客: https://manus.im/blog/introducing-manus-flex
研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上,该方法持续提升超长视频时序定位准确率,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著提升。
一项受控实证研究对比了 TypeSafe AI 称为"System One Model"的 Jev 与推荐专用模型及 pointwise、listwise Qwen 重排序器在多个 Amazon Reviews 领域和候选集规模下的推荐重排序表现。结果显示 Jev 在保持较强推荐效果的同时,延迟增长比 pointwise Qwen 重排序器更为平缓,但服务延迟仍显著高于推荐专用模型。
SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并加入轻量 head,使每个保留的 token 前缀都能单独重建这些特征。201M 的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的各噪声水平上为解码器提供更高语义对齐。
AutoDataBench 是一个隔离数据因素、专门评估 LLM 数据智能的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,并在工具使用、检索和知识注入场景下评测前沿模型迭代改进训练数据的能力。该平台还通过对比训练前预测与实际结果,检验 LLM 是否真正理解数据干预的效果,而非仅靠试错。复用 AutoDataBench 轨迹进行中期训练可提升下游编码性能。
偏好蒸馏中,用更小的冻结模型生成拒绝样本,比学生模型自生成样本训练效果更强,且推理算力更低。研究在 7B 到 72B 学生模型上验证了这一点,覆盖代码生成与数学推理任务,序列级知识蒸馏前后均成立。作者还给出 DPO 的有限时域效用上界,并据此提出混合不同规模拒绝样本、打乱 token、优先选择参考策略下低概率候选三种改进手段。
研究者提出 Box^2-Bench,在固定模型与任务的前提下改变工作流可靠性,以衡量语言模型能否在受益于可靠指导的同时覆盖不可靠指导,即"跳出框框"的能力。测试显示前沿模型虽能从可靠指导中获益,但在指导具有误导性或变得不可靠时仍很脆弱。团队用坏工作流训练两个开放权重模型,发现反事实监督微调可提升鲁棒性,而基于结果的强化学习能提高对有用工作流的使用,该行为还可迁移到同行纠错和受损记忆的鲁棒性上。
小型自回归 Transformer 仅用受限参数区间采样的轨迹训练,就能在训练分布之外的参数上闭环复现倍周期分岔、混沌动力学与吸引子结构。在 logistic 映射上,模型重现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。因果干预显示,控制参数信息经注意力机制进入状态预测,并塑造闭环动力学。
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 将物理过程拆解为原子断言、以召回率和精确率评估描述质量。在 Wan 与 Cosmos 骨干上,该方法在四个物理视频基准上持续提升物理合理性;基于开源 Cosmos3-Nano 的增强模型超过领先的闭源 Veo 3.1。
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
UniEvo-VL 提出一种无需外部教师模型的多模态自进化训练方案,让同一模型分别以学生和教师身份、基于不同上下文进行在线自蒸馏,在自身采样轨迹上最小化去噪扩散分布差异。
Factory 宣布 Automations 全面开放,企业客户已在组织内部署。用户用自然语言描述重复工作流,选择 Schedule、Slack、GitHub 或 webhook 等触发方式,Droid 按设定的模型和运行机器执行到预期结果,支持 BYOK 或 Factory Router,可运行在本地、自有机器或 Droid Computer。
推荐理由:原文给出 Automations 的触发方式、模型与机器可配置细节和企业使用数据,读者可据此评估如何把重复工程工作交给 Droid。
研究发现,d'Ascoli 等人(2025)的脑电转文本方法在完全不含脑信息的合成信号上仍达 22.0% 平衡准确率,接近真实脑数据的 22.3%,原因是按词起始切分的重叠窗口隐含泄露了词时长信息。作者改为独立处理每个窗口,使同一词多次神经响应的预测聚合与预训练 LLM 语言先验都明显更有效,SimpleB2T 在感知语音基准上每词五次观测的词错误率为 36.6%。
论文研究野生 AI 生成网页文本对语言模型预训练的影响,发现 FineWeb 过滤后 2026 年 6 月网页数据中 27.5% 的 token 被 Pangram 标为 AI 生成,8 月升至 31.1%。
SpatialCORE 是一个后训练框架,将模型对生成式定位的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将定位优化与最终答案正确性绑定。该框架在多个 benchmark 上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
Fireworks 在 GLM 5.2 上做同一 RL 任务实验,训练端与 rollout 引擎概率计算不一致时 KL 约 0.013、每批约 45% 样本被丢弃,reward 在约第 20 步从 0.9 崩到 0.2 以下;对齐后 KL 为 0、reward 全程稳定。