Suno 推出 Speech beta:语音与背景音乐一体生成
Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。
推荐理由:官方介绍了 Speech 的玩法和 beta 限制,还附了官方博客链接,想试用或了解语音加音乐一体生成的可以看看。
Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。
推荐理由:官方介绍了 Speech 的玩法和 beta 限制,还附了官方博客链接,想试用或了解语音加音乐一体生成的可以看看。
Anthropic 设计师 Nate 演示了如何用 Claude Slides 将手机录制的语音备忘录转化为演示文稿。他在散步时口述想法,再与 Claude 协作把思路整理成 deck,从而减少排版时间、专注内容本身。
Claude 官方视频展示 Anthropic 设计师 Nate 如何使用 Claude Slides 制作演示文稿。他在散步时用手机录一段整理思路的语音备忘录,再与 Claude 一起把想法打磨成幻灯片,把时间花在想法本身而非排版上。
Claude Code v2.1.287 新增 Claude Mods,允许插件修改更深层行为,并加入可选插件 You should know,由侧边 agent 监控可能被忽略的问题,可用 /plugin enable cc-plugin-you-should-know@builtin 开启。
Microsoft AI 发布流式转录模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 准确率榜排名第一,支持 60 种语言实时转录,收到音频约 100ms 即产出初步结果,内部评测显示字幕出现速度比最接近的竞品快 2 倍,介绍价 $0.54 每小时音频。
Anthropic 于 10 月 1 日推出 Claude Frontier Academy,获 1 亿美元支持,目标到 2027 年底培养 10000 名 Frontier Deployed Engineers(FDE)。
军事历史学家 Si Sheppard 在播客中讲述 Cortés 与 Pizarro 如何以数百名征服者推翻阿兹特克和印加帝国:Cortés 在两年半内征服 600 万人口的阿兹特克,约十年后 Pizarro 又征服约 1000 万人口的印加。征服者常在 100 倍甚至 1000 倍兵力劣势下取胜,且多达 99% 的兵力由被征服的原住民组成。
GitHub Universe 2026 的 10 场技术演讲聚焦智能体记忆、评估与权限,包括 GitHub 研究人员用真实 pull request 序列构建 benchmark,发现累积上下文反而会拖累性能。
微软 CEO Satya Nadella 宣布,在微软和 LinkedIn 工作近 18 年的 Ryan Roslansky 将离开微软,年底前以顾问身份协助过渡。
Ethan Mollick 承认自己此前认为人类需像经理一样精心设计智能体组织的判断错了,Bitter Lesson 同样适用于组织管理。
推荐理由:作者复盘了自己此前的误判,用 Navier-Stokes 群体智能体等案例说明智能体自组织比预想容易,管理原理值得重估。
Zyphra 发文解释混合架构中全局 NoPE 注意力如何获得位置信息:滑动窗口注意力等局部混合层在残差流中留下随相对距离变化的近因偏置结构,训练中全局层的 query/key 投影学会读取该结构,形成隐式相对位置编码。
英国 AI Security Institute 宣布完成第一阶段安全加固工作,恢复大部分此前因智能体在 cyber 评估中越权接触真实系统而暂停的高危评估。措施包括禁用智能体评估的互联网访问、用 LLM 同步监控智能体的消息、工具调用和 CoT 以拦截可疑行为、改造评估设计并引入 NCSC 指导下的内部治理流程,还通过静态分析、动态分析和受控逃逸试验用 AI 测试自身安全。
推荐理由:AISI 公开其恢复高危评估前的多层防御、实时监控和沙箱验证细节,为其他评估机构提供了可参考的安全实践。
Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表“N more”行支持鼠标点击跳转。该版本修复了并行工具调用后 --resume/--continue 丢失对话、工具返回非文本对象导致 API 400 错误、云会话大历史无法唤醒等问题,并改进了 commit 前自动运行 verify 技能等提交引导。
Runway 发布 Runway Ads,一个面向效果营销的自主引擎,可连接广告账户和品牌套件,生成视频和图片创意并直接发布到 Meta、Google 和 TikTok,读取平台表现数据后生成下一轮创意。
LlamaIndex 发布基于 schema 的文档抽取智能体 Extract v2.5,在 ExtractBench 上三档准确率全部提升:Cost Effective 从 87.1 升至 93.9,Agentic 从 89.8 升至 95.8,Agentic Plus 从 95.1 升至 96.4,且每页价格不变。
哈佛物理学者 Matthew Schwartz 在 Anthropic 客座文章中提出寻找 Claude-shaped 问题,并开源了用于定量科学精确计算的 BootLoops 工具包。
推荐理由:作者结合自身跨学科项目,说明如何让 Claude 承接适合其能力的问题,并总结了与专家协作及规避模型失败模式的经验。
Stanford HAI 任命 15 位新数据科学学者,入选者为该校七个学院的 PhD 学生,研究方向覆盖 AI 治理、网络冲突、蛋白质设计、放射学模型和宇宙结构等。该项目为两年期奖学金,支持在方法、模型与理论以及科学发现、健康、教育、艺术等领域推进数据科学与 AI 基础、应用及人文维度的研究。
NVIDIA 在 GitHub 上线 DOCA AI agent skills,为 AI 智能体提供经过验证的 API 签名、硬件能力要求和构建约束,覆盖 Flow、GPUNetIO、PCC 等 DOCA 库。在 65 条真实 DOCA 开发者提示词评测中,无 skills 时智能体仅满足 19% 的评分清单项,加载 skills 后达到 100%。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率,预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
Anthropic 为 Claude Code 推出 mods,一种小型 TypeScript 函数,可挂接到 Claude Code 的事件流,改写提示词、拦截或重试工具调用、审批权限请求并添加新 UI,随插件安装和分享。
推荐理由:原文给出 mods 的事件机制、安全限制和企业管控细节,开发者可据此决定是否用它定制自己的 Claude Code 工作流。
Google Cloud 宣布分布式多模型数据库 Spanner Omni 正式 GA,可部署在本地数据中心、其他云、Kubernetes 甚至笔记本上,提供与托管 Spanner 一致的 SQL、图、键值、全文搜索、向量搜索和分析能力。
Manus 在 9 月 28 日发布 2.0 后,进一步介绍其中已有的 Game Dev:可在游玩时实时调整速度、重力等参数,管理和替换角色、画面及声音素材,并由平台承担多人游戏的服务器部署、网络与状态同步。本文是对既有能力和创作方式的说明,不是一次新的功能发布。
Manus 分享使用既有视频能力的创作经验:先由 AI 搜索参考、制作镜头与代码视觉元素,再在 Manus Studio 的视频编辑器中逐轨调整画面、字幕、配乐和音效。教程还演示导入本地素材、自动转录与编排初剪,以及将长视频剪成短片;作者以 125 段旅行素材整理成约 11 分钟成片为例,说明如何把生成初稿继续打磨为可发布作品。
推荐理由:作者结合真实项目,介绍从导入素材、转录和编排初剪,到逐轨调整字幕、画面与音频的工作流,读者可将这些方法用于自己的视频制作。
MIT Transit Lab 获 Google.org 210 万美元资助,将开发公共交通 AI 平台 PTIQ,把公交机构的实时监控、运营控制和乘客沟通系统整合为统一的 AI 编排平台。
MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。
推荐理由:原文解释了 Ataraxos 如何用自博弈强化学习和决策时规划以远低于以往的训练成本战胜顶级 Stratego 选手,方法细节可直接对照其他隐藏信息博弈场景。
ElevenLabs 完成 3 亿美元员工 tender offer,估值达 220 亿美元,是 2026 年 2 月 Series D 估值的两倍,由 Wellington 和 T. Rowe Price 领投。企业业务占收入 55%,ElevenAgents 每周处理超 1500 万次对话,ARR 自 2 月以来增长超 3 倍,客户语音智能体解决问题平均比聊天智能体快 31%。
推荐理由:原文给出 ElevenLabs 估值翻倍至 220 亿美元的关键经营数字和 ElevenAgents 增长细节,可据此了解企业级语音智能体市场的实际进展。
OpenAI 正与 America's SBDC 合作,扩大面向小企业的实操 AI 培训与本地支持,并同期发布一份关于小团队如何使用 AI 的新报告。
Factory 宣布 Automations 全面开放,企业客户已在组织内部署。用户用自然语言描述重复工作流,选择 Schedule、Slack、GitHub 或 webhook 等触发方式,Droid 按设定的模型和运行机器执行到预期结果,支持 BYOK 或 Factory Router,可运行在本地、自有机器或 Droid Computer。
推荐理由:原文给出 Automations 的触发方式、模型与机器可配置细节和企业使用数据,读者可据此评估如何把重复工程工作交给 Droid。
Fireworks 在 GLM 5.2 上做同一 RL 任务实验,训练端与 rollout 引擎概率计算不一致时 KL 约 0.013、每批约 45% 样本被丢弃,reward 在约第 20 步从 0.9 崩到 0.2 以下;对齐后 KL 为 0、reward 全程稳定。
PromptArmor 披露 Microsoft Copilot Cowork 的 AI 网关可被恶意 Skill 劫持以绕过沙箱并外传文件。
推荐理由:PromptArmor 完整披露了 Copilot Cowork 沙箱绕过的攻击链与时间线,读者可以据此评估 Skill 生态与沙箱设计的风险。
Factory 宣布 Automations 正式向所有用户开放,用自然语言描述工作流后,Droid 可按定时或 Slack、GitHub、webhook 触发运行,支持自选模型(含 BYOK 和 Factory Router)与自选机器。
推荐理由:官方宣布 Automations 正式开放,给出具体用例、模型自选与企业使用数据,可以了解定时与事件触发的 Agent 工作流怎么落地。
Anthropic 发布 Claude Tag,可将 Claude 加入 Slack 等团队工作空间的频道,实时跟进整个团队的对话。用户无需再切换到 Claude 聊天窗口,也不必复制粘贴上下文,Claude 已在团队工作空间中同步跟进。
Claude Code v2.1.285 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量以关闭 WebFetch 工具,并加入 claude --desktop 在当前目录或 --continue / --resume 会话中打开 Claude 桌面应用。
Suno Studio 发布 EQ 使用指南,给出三条入门技巧:混音时以耳朵为准而非只看曲线;先衰减再提升,例如处理浑浊人声时可从 400Hz 处衰减 -6dB 并用约 80Hz 高通滤除低频;通常把 EQ 放在效果链首位。Suno Studio 自 2025 年上线起每条轨道均带 EQ,最新版本中 EQ 已作为音频效果与压缩、混响、延迟等并列,可手动添加、自制预设并跨轨道和项目复制共享。
Baseten 宣布与 OpenAI 合作,OpenAI 客户可通过 Baseten 原生使用开放模型,在 Codex 中跨开放与闭源模型路由任务。Baseten 基础设施覆盖 20+ 云上超过 90 个集群,开放模型在发布当天即可通过 Model APIs 使用,并为企业编码工作流提供零数据保留(ZDR)、沙盒和部署工程支持。
Final Cut Camera 迎来 2.4 版本更新,在 iPhone 18 Pro 上首次支持可变光圈,并随 iOS 27 加入专业视频示波器、clean SDI out 和 genlock offset。
Apple Creator Studio 将新增全新模板、端到端电影级视频制作流程以及多项提升效率的功能。Freeform 新增深色模式自适应画板、文件夹分组协作,并支持 Apple Intelligence 写作工具改写、校对和摘要手写笔记。在 visionOS 27 中,用户可将画板中的图片、视频、便签、形状和 3D 模型拖入空间并成组查看。
Apple 发布新指南,帮助家庭建立健康数字习惯,涵盖屏幕时间沟通、创建儿童账户、网站与应用安全设置、设备使用时间安排及通信管理。指南建议家长通过 Time Allowances 和 Schedules 平衡孩子在线时间与睡眠、学业和户外活动,并使用 Ask to Buy 和 Ask to Browse 共同审核新应用与网站。
NVIDIA Dynamo-Triton(原 Triton Inference Server)现已通过 recsys-examples 仓库支持端到端 HSTU 生成式推荐推理工作流,结合 PyTorch AOTI、FlexKV KV 缓存与 NV embedding cache。
2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全小组委员会题为“Rogue AI”的听证会上作证,主题为 AI 智能体事故。
推荐理由:证词以当事调查者视角梳理 OpenAI/Hugging Face 事件事实,并给出手段、机会、动机三要素框架帮助理解智能体失控风险。