Odyssey 推出 PROWL-2 递归学习框架
今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现共同提升。 智能体暴露想象中存在的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。
今天我们推出 PROWL-2,智能体及其世界模型通过递归学习实现共同提升。 智能体暴露想象中存在的错误,修复这些错误又能促成进一步的学习。 我们相信,这种开放式学习是迈向超级智能的关键一步。
Ideogram 称新模型 Ideogram 4.5 只修改用户指定区域,其余部分保持不变,主打产品摄影、室内设计、照片修复和图内文字编辑。该模型提供 0.8 至 22 美分四档单图价格,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线。合作方包括 Picsart、Runway、Pika 和 Leonardo AI,Ideogram 还表示将很快推出开放权重版本。
Cloudflare 发布两款决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,并以 Apache 2.0 许可证在 Hugging Face 完全开源。
Cohere 发布 Embed 5 嵌入模型家族,分 Pro 和 Fast 两档,均支持文本、图像及图文融合输入、100+ 语言和 128K token 上下文,两档共享同一向量空间,可用 Pro 建索引、Fast 查询。
Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分。
推荐理由:原文给出 Claude Sonnet 5.5 xHigh 的具体榜单分数与分项排名,读者可以据此比较它与 GPT-6 Astra 的性价比位置。
Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,Mustafa Suleyman 称其为全球最准确的实时转写模型,比 ElevenLabs 快 55%、便宜 60%。引用的 Artificial Analysis 数据显示,该模型以 2.5% WER、语音结束后 0.13 秒出稿在 AA-WER Streaming 38 个模型中排名第一,超过此前第一的 Grok Voice Transcribe 2.0(2.7%、0.49s),流式定价为每小时音频 $0.54,非流式为 $0.10 每小时。
Microsoft AI 发布流式语音转写模型 MAI-Transcribe-2-Streaming,在 AA-WER Streaming 评测的 38 个模型中以 2.5% WER、语音结束后 0.13 秒返回最终转写,登顶 Final Transcript 和 First Partial Transcript 准确率。
Microsoft AI 发布流式转录模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 准确率榜排名第一,支持 60 种语言实时转录,收到音频约 100ms 即产出初步结果,内部评测显示字幕出现速度比最接近的竞品快 2 倍,介绍价 $0.54 每小时音频。
✨ Viggle Turbo v0.3 来了! 全新的 9-step 模式带来更干净的画面、更精细的细节,以及更好的小字渲染。 现在在 ComfyUI 中更易使用——提供 LoRA 或单文件 int8/fp8/GGUF 模型。
在我们的探索器中对比各模型的 ECI:https://epoch.ai/eci?view=graph&tab=scatter&eciPreset=software
Epoch AI 发布的 Epoch Capabilities Index(ECI)榜单中,Claude Opus 5.5 以 167 分登顶,略高于 GPT-6 Astra。Claude Sonnet 5.5 大致追平 Claude Fable 5.1(165 分)。
1/ 来自 @theunbiasedco 的 Pareto 26.10 Preview 现已在 OpenRouter 上线,输入 $0.80/M、输出 $3.20/M,而当前 Pareto 为 $2.50/$7.50。 一款面向研究、编程和智能体工作流的多模态复合模型,具备 1M 上下文、文本和图像输入,以及工具调用能力。
开源项目 OpenDLSS 用 Vulkan 重新实现了 NVIDIA DLSS 5 的神经渲染网络,与原版 DLSS-NR build 310.8.0 比特级一致,75 个 block 边界的中间结果逐字节匹配。
NVIDIA 发布 Kumo Tabular 表格基础模型系列,用于分类和回归,以标注行为上下文、单次前向传播预测新行,无需训练、调参或特征工程。
DeepSeek 开源六个 Huawei Ascend 项目,矩阵内核速度达到芯片峰值的 99.8%。
Perplexity Research 与 turbopuffer 发布上下文嵌入模型 pplx-embed-v2-context-9b-preview,权重以 MIT 许可托管在 Hugging Face,可自托管部署,尚未上线 Perplexity API。
Artificial Analysis 发布对 GPT-6.1 Sol 的评测,称其推进了 OpenAI 模型的成本效率前沿。max effort 下每 Intelligence Index 任务成本 $0.72,不到 GPT-6 Astra($3.26)的四分之一,比 GPT-6 Sol($1.04)低 31%、比 GPT-5.6 Sol($1.99)低 64%。
据彭博社报道,谷歌开始向小批网络安全合作伙伴逐步推出旗舰模型 Gemini 4 Argon,后续将优先面向付费订阅用户扩大开放。谷歌称该模型在多项基准测试中取得靠前成绩,安全测试成绩超过 OpenAI 的 Astra;但知情人士称其部分代码任务表现不佳、不擅前端设计,谷歌否认这一说法,DeepMind 负责人卡武库奥卢表示对性能感到鼓舞。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,在 Artificial Analysis 智能指数得分 24,报告总参数 35B、激活 3B,价格降至每 1M 输入/输出 token $0.10/$0.40,但因每任务消耗约 88k 输出 token,单任务成本约为 GPT-6 Luna (max) 的 5 倍。
Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半。
推荐理由:原文拆解了 GPT-6.1 Sol 成本下降的具体构成,读者可以据此对比不同代际模型的实际任务开销。
来自 @GoogleDeepMind 的 Gemini 4 Argon 刚刚在一系列生成任务中与顶级前沿模型正面交锋。 每任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,来看 @petergostev 对 Gemini 4 Argon 对比表现的第一印象。 https://www.youtube.com/watch?v=h5EL5zThKaI
谷歌于 9 月 30 日发布 Gemini 4 Argon,称其为迄今最先进的 AI 模型,主打长流程软件工程、企业知识工作和网络安全防御,单次输出上限约 100 万 tokens。
Hidream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 排行榜第 7 名,可通过 @vivago_ai 使用。该模型与 gemini-omni-flash 仅差 8 分,与 dreamina-seedance-2.0 和 2.5 的分差在 20 分以内。
Runway 机器人负责人 Andy Chen 阐述了 Runway 在机器人领域的独特方法,并以我们的开放权重世界动作模型 Praxis-1 的首次亮相作为结尾。 了解 Praxis-1 并申请早期访问:https://runway.com/praxis-1
Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。
非常激动地宣布 Gemini 4 Argon,我们的全新前沿 AI 模型,在多项关键能力上迈出了一大步。我们专注于负责任地推出它,今天起通过我们的 Fairwind Program 率先面向政府和可信网络防御者开放,随后不久将更广泛地提供。
Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62。
推荐理由:原文给出 Gemini 4 Argon (High) 在 Agent Arena 的排名、净提升分和成本数据,读者可据此评估其智能体任务表现与性价比。
Gemini 4 在 PostTrainBench 上达到 45.3%,是 Gemini 3.1 Pro 的 21.99% 的两倍多,并击败了 GPT-6 Astra 🔥
Google DeepMind 发布 Gemini 4 系列首个前沿模型 Gemini 4 Argon,单次响应输出上限从 64K 提升到 1M tokens,面向长周期软件工程、法律金融企业知识工作和网络防御。
美国 Austin 的 webAI 发布 3.66B 本地模型 TwIL-LM3-Pro,将 IBM Granite 的形式逻辑得分提升 28%,在形式逻辑上比 VibeThinker-3B 高约 35%、比 Qwen3.5-4B 高 24%、比 Liquid AI 的 LFM2.5-8B-A1B 高 47%。
OpenAI 发布 GPT-6.1 Sol,定价为每百万 token 2 美元输入、10 美元输出、0.10 美元缓存输入,为 GPT-6 Astra 标准价格约五分之一。
推荐理由:原文整理了 GPT-6.1 Sol 的定价、上下文与各家厂商基准对比,便于开发者评估其相对 Astra 和 Claude 的性价比。
Rohan Paul 转引 Google 发布信息称,Gemini 4 Argon 单次响应可输出最多 1M tokens,约为 GPT-6 Astra、Opus 5.5 和 Fable 5.1 的 128K 上限的近 8 倍,此前上限为 64K。作者评价这意义重大,并指出长输出空间让模型能在单次轨迹中深度推理解决复杂问题。
Artificial Analysis 发布 Gemini 4 Argon (High) 的智能、性能与价格分析,其 Intelligence Index 采用 v4.3.2 版本,涵盖 AA-Briefcase v1.1、GDPval-AA v2.1、Terminal-Bench 4.0、Humanity's Last Exam 等 10 项评测。
Google 推出旗舰模型 Gemini 4 Argon,在多数基准上超过 GPT-6 Astra 和 Claude Opus 5.5,其中 Harvey's Legal Agent Benchmark 得分 19.6%,明显高于对比模型的 6.7% 等成绩。
Gemini 4 Argon!
Google DeepMind 发布前沿模型 Gemini 4 Argon,经 Fairwind Program 面向部分受信任测试者推出。
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra (max),高于 GPT-6.1 Sol (max) 1 分。
ARC Prize 公布 OpenAI GPT-6.1 Sol 的完整测试结果,排行榜地址为 arcprize.org/leaderboard。推文同时给出公开结果复现仓库 arc-agi-benchmarking、测试政策页面及结果详情链接。
ARC Prize 公布 OpenAI GPT-6.1 Sol 在 ARC-AGI (Verified) 上的成绩:ARC-AGI-3 为 52.7%(标准 harness,$7.6K),provider adapter harness 下 96.4%($4.4K);ARC-AGI-2 为 94.2%($0.25/task);ARC-AGI-1 为 98.5%($0.06/task)。其在 v3 上的 96.4% 接近 GPT-6 Astra 的 99.9%,但成本低 77%。
GPT-6.1 Sol 在 ARC-AGI-3 上以更高推理等级做出更优决策,完成关卡所需动作更少,从而降低总推理成本。以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。