跳到正文

全部动态

今日 3 条
10月2日周五
  1. X:Odyssey (@odysseyml)31

    Odyssey 推出 PROWL-2 递归学习框架

    今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现共同提升。 智能体暴露想象中存在的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。

  2. The Decoder43

    Ideogram 称新模型 Ideogram 4.5 可局部编辑图像而不影响其余部分

    Ideogram 称新模型 Ideogram 4.5 只修改用户指定区域,其余部分保持不变,主打产品摄影、室内设计、照片修复和图内文字编辑。该模型提供 0.8 至 22 美分四档单图价格,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线。合作方包括 Picsart、Runway、Pika 和 Leonardo AI,Ideogram 还表示将很快推出开放权重版本。

  3. X:Arena (@arena)71

    Claude Sonnet 5.5 (xHigh) 以 1786 分登 Code Arena: WebDev 第 3 名

    Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分。

    推荐理由:原文给出 Claude Sonnet 5.5 xHigh 的具体榜单分数与分项排名,读者可以据此比较它与 GPT-6 Astra 的性价比位置。

  4. X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)64

    Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming

    Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,Mustafa Suleyman 称其为全球最准确的实时转写模型,比 ElevenLabs 快 55%、便宜 60%。引用的 Artificial Analysis 数据显示,该模型以 2.5% WER、语音结束后 0.13 秒出稿在 AA-WER Streaming 38 个模型中排名第一,超过此前第一的 Grok Voice Transcribe 2.0(2.7%、0.49s),流式定价为每小时音频 $0.54,非流式为 $0.10 每小时。

10月1日周四
  1. X:Viggle AI (@ViggleAI)36

    Viggle Turbo v0.3 发布

    ✨ Viggle Turbo v0.3 来了! 全新的 9-step 模式带来更干净的画面、更精细的细节,以及更好的小字渲染。 现在在 ComfyUI 中更易使用——提供 LoRA 或单文件 int8/fp8/GGUF 模型。

  2. X:Epoch AI (@EpochAIResearch)38

    Epoch AI 模型 ECI 对比工具

    在我们的探索器中对比各模型的 ECI:https://epoch.ai/eci?view=graph&tab=scatter&eciPreset=software

  3. X:OpenRouter (@OpenRouter)42

    OpenRouter 上线 Pareto 26.10 预览版

    1/ 来自 @theunbiasedco 的 Pareto 26.10 Preview 现已在 OpenRouter 上线,输入 $0.80/M、输出 $3.20/M,而当前 Pareto 为 $2.50/$7.50。 一款面向研究、编程和智能体工作流的多模态复合模型,具备 1M 上下文、文本和图像输入,以及工具调用能力。

  4. IT之家(RSS)65

    谷歌逐步推出 Gemini 4 Argon 旗舰模型,内部对编码实战表现存在质疑

    据彭博社报道,谷歌开始向小批网络安全合作伙伴逐步推出旗舰模型 Gemini 4 Argon,后续将优先面向付费订阅用户扩大开放。谷歌称该模型在多项基准测试中取得靠前成绩,安全测试成绩超过 OpenAI 的 Astra;但知情人士称其部分代码任务表现不佳、不擅前端设计,谷歌否认这一说法,DeepMind 负责人卡武库奥卢表示对性能感到鼓舞。

  5. X:Artificial Analysis (@ArtificialAnlys)66

    Artificial Analysis:GPT-6.1 Sol 的 Cost per Task 较 GPT-6 Sol 低约 30%

    Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半。

    推荐理由:原文拆解了 GPT-6.1 Sol 成本下降的具体构成,读者可以据此对比不同代际模型的实际任务开销。

  6. X:Arena (@arena)47

    Gemini 4 Argon 与前沿模型对比

    来自 @GoogleDeepMind 的 Gemini 4 Argon 刚刚在一系列生成任务中与顶级前沿模型正面交锋。 每任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,来看 @petergostev 对 Gemini 4 Argon 对比表现的第一印象。 https://www.youtube.com/watch?v=h5EL5zThKaI

  7. X:Runway (@runwayml)40

    Runway 发布开放权重世界动作模型 Praxis-1

    Runway 机器人负责人 Andy Chen 阐述了 Runway 在机器人领域的独特方法,并以我们的开放权重世界动作模型 Praxis-1 的首次亮相作为结尾。 了解 Praxis-1 并申请早期访问:https://runway.com/praxis-1

  8. X:Demis Hassabis (@demishassabis)39

    Gemini 4 Argon 前沿模型发布

    非常激动地宣布 Gemini 4 Argon,我们的全新前沿 AI 模型,在多项关键能力上迈出了一大步。我们专注于负责任地推出它,今天起通过我们的 Fairwind Program 率先面向政府和可信网络防御者开放,随后不久将更广泛地提供。

  9. X:Arena (@arena)79

    Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,净提升 +7.92%

    Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62。

    推荐理由:原文给出 Gemini 4 Argon (High) 在 Agent Arena 的排名、净提升分和成本数据,读者可据此评估其智能体任务表现与性价比。

  10. X:Rohan Paul (@rohanpaul_ai)43

    webAI 3.66B 小模型 TwIL-LM3-Pro 登顶形式逻辑

    美国 Austin 的 webAI 发布 3.66B 本地模型 TwIL-LM3-Pro,将 IBM Granite 的形式逻辑得分提升 28%,在形式逻辑上比 VibeThinker-3B 高约 35%、比 Qwen3.5-4B 高 24%、比 Liquid AI 的 LFM2.5-8B-A1B 高 47%。

  11. X:Rohan Paul (@rohanpaul_ai)65

    Google Gemini 4 Argon 单次输出上限提升至 1M tokens

    Rohan Paul 转引 Google 发布信息称,Gemini 4 Argon 单次响应可输出最多 1M tokens,约为 GPT-6 Astra、Opus 5.5 和 Fable 5.1 的 128K 上限的近 8 倍,此前上限为 64K。作者评价这意义重大,并指出长输出空间让模型能在单次轨迹中深度推理解决复杂问题。

  12. Hacker News:AI 热帖39

    Gemini 4 Argon (High) 智能、性能与价格分析

    Artificial Analysis 发布 Gemini 4 Argon (High) 的智能、性能与价格分析,其 Intelligence Index 采用 v4.3.2 版本,涵盖 AA-Briefcase v1.1、GDPval-AA v2.1、Terminal-Bench 4.0、Humanity's Last Exam 等 10 项评测。

  13. X:ARC Prize (@arcprize)62

    OpenAI GPT-6.1 Sol 在 ARC-AGI (Verified) 上的评测成绩

    ARC Prize 公布 OpenAI GPT-6.1 Sol 在 ARC-AGI (Verified) 上的成绩:ARC-AGI-3 为 52.7%(标准 harness,$7.6K),provider adapter harness 下 96.4%($4.4K);ARC-AGI-2 为 94.2%($0.25/task);ARC-AGI-1 为 98.5%($0.06/task)。其在 v3 上的 96.4% 接近 GPT-6 Astra 的 99.9%,但成本低 77%。

  14. X:ARC Prize (@arcprize)38

    GPT-6.1 Sol 在 ARC-AGI-3 高推理更省成本

    GPT-6.1 Sol 在 ARC-AGI-3 上以更高推理等级做出更优决策,完成关卡所需动作更少,从而降低总推理成本。以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。