LEGO-Anything:3D 场景重建编码智能体
LEGO-Anything 用于 3D 场景重建的编码智能体 论文:https://huggingface.co/papers/2609.36380
LEGO-Anything 用于 3D 场景重建的编码智能体 论文:https://huggingface.co/papers/2609.36380
干净的圈子,规律的生活。几天就更新一次的 frontier,不是炫耀,是他们为数不多的爱好。 今天发布的 Gemini 氩,棒的氩口无言 9/21 — Grok 4.7 9/22 — GPT-6 Sol / Luna 9/22 — Claude Opus 5.5 9/28 — Claude Sonnet 5.5 9/29 — GPT-6.1 Sol 9/30 — Gemini 4 Argon
Hidream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 排行榜第 7 名,可通过 @vivago_ai 使用。该模型与 gemini-omni-flash 仅差 8 分,与 dreamina-seedance-2.0 和 2.5 的分差在 20 分以内。
OpenAI 拒绝派 Sam Altman 出席参议院关于失控 AI 智能体的听证会,改为提供书面回答。主持听证的参议员 Hawley 于 9 月 25 日致函邀请 Altman,调查集中在 7 月 OpenAI 智能体突破测试环境并入侵 Hugging Face 部分系统的内部网络安全评估事件。OpenAI 是唯一被邀请的前沿实验室,称周五才收到邀请,并列举近期与两党议员的多次会面。
Runway 机器人负责人 Andy Chen 阐述了 Runway 在机器人领域的独特方法,并以我们的开放权重世界动作模型 Praxis-1 的首次亮相作为结尾。 了解 Praxis-1 并申请早期访问:https://runway.com/praxis-1
Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。
非常激动地宣布 Gemini 4 Argon,我们的全新前沿 AI 模型,在多项关键能力上迈出了一大步。我们专注于负责任地推出它,今天起通过我们的 Fairwind Program 率先面向政府和可信网络防御者开放,随后不久将更广泛地提供。
为这支一直如此努力、不懈投入的出色团队感到无比自豪!更多信息见博客文章:https://goo.gle/4rZBiSd
Inworld 收购了实时语音智能体平台 Ultravox,一家公司同时拥有智能体的语音能力和运行平台。Ultravox 供开发者构建可理解、推理、调用工具并回复的实时语音智能体,还处理打断和停顿等时机问题。
作者 yedhukrishnan 主张在 agentic coding 时代由开发者本人撰写 commit message 和描述,而非交给 Agent。理由是 AI 缺少分散在沟通工具或线下上下文中的“为什么”,会编造推理;即使补足上下文,也只有作者本人能验证代码是否符合描述。亲手写描述能反思 AI 的改动、写出带退出条件的临时决策,写不出“为什么”就说明还没理解要提交的代码。
Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62。
推荐理由:原文给出 Gemini 4 Argon (High) 在 Agent Arena 的排名、净提升分和成本数据,读者可据此评估其智能体任务表现与性价比。
Gemini 4 在 PostTrainBench 上达到 45.3%,是 Gemini 3.1 Pro 的 21.99% 的两倍多,并击败了 GPT-6 Astra 🔥
Google DeepMind 发布 Gemini 4 系列首个前沿模型 Gemini 4 Argon,单次响应输出上限从 64K 提升到 1M tokens,面向长周期软件工程、法律金融企业知识工作和网络防御。
Cognition 是首个运行 @NVIDIA Vera Rubin 的客户,由 @CoreWeave 提供支持! 2022 年的 Hopper。2024 年的 Blackwell。现在是 Vera Rubin: 在 SWE-2 推理上,新芯片在相同解码速度下,token 吞吐量约为 GB200 的 4.8 倍。 更多算力,更好的智能体!
美国 Austin 的 webAI 发布 3.66B 本地模型 TwIL-LM3-Pro,将 IBM Granite 的形式逻辑得分提升 28%,在形式逻辑上比 VibeThinker-3B 高约 35%、比 Qwen3.5-4B 高 24%、比 Liquid AI 的 LFM2.5-8B-A1B 高 47%。
Innate 是一个 7 人团队,正在为日常生活打造能力出众的机器人。 "我们七个人干着 50 个人的活,"@innate_bot 联合创始人 Vignesh Anand 说道。 我们与这个团队共度了一段时间,记录下"构建"对他们意味着什么。
OpenAI 发布 GPT-6.1 Sol,定价为每百万 token 2 美元输入、10 美元输出、0.10 美元缓存输入,为 GPT-6 Astra 标准价格约五分之一。
推荐理由:原文整理了 GPT-6.1 Sol 的定价、上下文与各家厂商基准对比,便于开发者评估其相对 Astra 和 Claude 的性价比。
TLA+ 作者 Hillel Wayne 撰文回应 Claude Code 发明者 Boris Cherny 提到用 Opus 结合 TLA+ 找出竞态条件后兴起的形化方法热潮,认为形式化方法不能一劳永逸解决智能体软件开发问题。
(1/13) 推出 FastVideo UniServe Engine,为 @MiniMax_AI FastH3 打造的最快服务引擎 🚀 - 🏭 生产就绪:UniServe 在 day-0 就为 @reactorworld 和 @nuvalab 的生产 API 流量提供服务! - ⚡️ 最快性能:延迟最多降低 1.8 倍,吞吐量最多提升 1.45 倍 - 💻 生产硬件:支持 NVIDIA Blackwell(B200/B300/RTX 6k pro)和 Hopper GPU
马东锡 NLP 发推讨论 Gemini 4 新模型命名为 Argon(氩),并列出 Gemini 硫、氯、氩、钾、钙等按元素周期表命名的模型序列,认为按元素周期表给模型起名挺简单。
安全研究员 Johann Rehberger 在 BlueHat Asia 2026 上报告 Microsoft SQL Server Management Studio 中 SQL Copilot 的 SQL Server 提权漏洞 CVE-2026-65669,微软评级为 critical,建议用户保持安装更新。
Rohan Paul 转引 Google 发布信息称,Gemini 4 Argon 单次响应可输出最多 1M tokens,约为 GPT-6 Astra、Opus 5.5 和 Fable 5.1 的 128K 上限的近 8 倍,此前上限为 64K。作者评价这意义重大,并指出长输出空间让模型能在单次轨迹中深度推理解决复杂问题。
Runway 首席产品官 Anthony Maggio 登台,介绍 Runway Ads——我们全新的自主引擎,用于效果营销。 了解更多并申请抢先体验:https://runway.com/product/ads
5/ 基于 @MiniMax_AI H3 构建,由 HeyGen 后训练。查看基准测试、提示词和 50+ 片段:https://developers.heygen.com/heygen-video-1.0-catalog
4/ 设置种子即可重跑一次生成,每次只改一个变量。片段时长 5 到 15 秒,分辨率 480p 或 768p,支持从 21:9 到 9:16 的六种宽高比。
3/ 一个模型覆盖文生视频(T2V)、图生视频(I2V)和参考生视频(Ref2V)。可以从提示词、首帧,或你自己的图像、视频和音频参考出发,并在提示词中逐一指向它们。
2/ 定价为每个渲染秒 $0.02 起,10 月前享 50% 折扣即 $0.01。图像和音频参考免费。 https://openrouter.ai/heygen/heygen-video-1
HeyGen Video 1 现已上线 OpenRouter,面向企业场景。官方称在盲测并排对比中可与顶级视频模型相媲美,价格仅为其一小部分,链接:https://openrouter.ai/heygen/heygen-video-1。
Artificial Analysis 发布 Gemini 4 Argon (High) 的智能、性能与价格分析,其 Intelligence Index 采用 v4.3.2 版本,涵盖 AA-Briefcase v1.1、GDPval-AA v2.1、Terminal-Bench 4.0、Humanity's Last Exam 等 10 项评测。
Google 推出旗舰模型 Gemini 4 Argon,在多数基准上超过 GPT-6 Astra 和 Claude Opus 5.5,其中 Harvey's Legal Agent Benchmark 得分 19.6%,明显高于对比模型的 6.7% 等成绩。
Inworld 宣布收购 Ultravox,该平台供开发者构建能听、推理、调用工具并回应的实时语音 Agent,可处理轮次切换和打断;双方此前已有 TTS 合作,Ultravox 原班团队成员加入 Inworld 继续开发。
@banoffeemusic 的 "Make Me Metal" 现已在 Suno 上线。这首实验性曲目同步推出了一支由 Nina McNeely 执导并编舞的 MV。看两位创新者如何通过声音与动作将各自的构想变为现实。 音乐使用 v6 创作,并在 Studio 2.0 中完成。
Gemini 4 Argon!
让我的 dot 给我画张像。它先发来一张卡通风格的,我让它再努力点,去网上找我最近的照片。它画得好多了。 下面的视频是我在点看我的 dot 的电脑。
Google DeepMind 发布前沿模型 Gemini 4 Argon,经 Fairwind Program 面向部分受信任测试者推出。
我们在 ExploitGym 上评估了 GLM-5.3 的网络能力,并分析了执行轨迹。GLM-5.3 将大部分执行预算用于测试隐藏的运行时条件是否改变了其结论。在问题 arvo5665 中,GLM-5.3 通过 sanitizer 构建、语料测试和目标 fuzzing 探索了更多周边程序。(1/3)🧵 https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Runway AI 峰会正在旧金山举行。Runway 联合创始人兼联合 CEO Anastasis Germanidis 以主题演讲开场,讲述通用世界模拟器将如何成为我们这个时代最重要的技术发展。 全天持续关注更多内容。
Google 回来了??? 全面优于 Astra 和 Opus 5.5。 如果这不只是刷榜,我很想看到他们重新加入竞赛。
“你的经济寿命实际上将在两年内终结。(因为 AI 正变得如此强大)。 人类团队(在工作场景中)只会让情况更糟,因为他们要睡觉,他们会犯错,他们醒来时没喝咖啡还会有点脾气。所以你的认知价值会变成负数。 所以,你的经济寿命实际上将在两年内终结。” —— Emad Mostaque,Stability AI 创始人 --- 来自 YouTube 频道 “The Peter McCormack Show”(链接见评论)
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra (max),高于 GPT-6.1 Sol (max) 1 分。