Cantina 开源 apex-flash-1:321.3B 安全研究模型在 60 项漏洞任务中解出 40 项
Cantina Security 联合 Yeta Labs 发布开源权重模型 apex-flash-1,基于 GLM-5.3-Flash 用 GRPO 微调,321.3B 总参数、18B 激活参数,MIT 许可。
Cantina Security 联合 Yeta Labs 发布开源权重模型 apex-flash-1,基于 GLM-5.3-Flash 用 GRPO 微调,321.3B 总参数、18B 激活参数,MIT 许可。
MarkTechPost 汇总对比 30 天内发布的四款前沿模型:Claude Fable 5.1(9 月 1 日)、GPT-6 Astra(9 月 3 日)、GPT-6.1 Sol(9 月 29 日)和 Gemini 4 Argon(9 月 30 日)。
Grok 4.7 在 AA Cyber Index 上排名第一
Aleph Alpha 于德国统一日发布开放权重模型 Kolibri,为 78B 总参数、约 3B 激活的德英双语 MoE Transformer,支持最长 1M token 上下文,权重以 Apache 2.0 许可上传 Hugging Face。
Aleph Alpha 于 2026 年 10 月 3 日发布开放权重模型 Kolibri,为面向德语和英语的 MoE 模型,总参数 781 亿、每 token 激活约 34.6 亿,权重以 Apache 2.0 发布在 Hugging Face。
亚马逊 Strands Agents 团队推出 Strands Decider 2B 决策模型,已在 GitHub 开源、权重上线 Hugging Face,可在本地 CPU / GPU 运行。
Artificial Analysis 评测显示,Ideogram 4.5 在 AA-Image-Editing v2.0 榜单首秀排名第 23,是 Ideogram 首个上榜的模型,在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 上升。
一座快闪城市,每栋建筑都是画在平面画布上的折纸,Sonnet 5.5。
Ideogram 4.5 首次进入 Artificial Analysis 的 AA-Image-Editing v2.0 榜单,排名第 23,Text to Image 排名第 34,比 Ideogram 4.0 的第 40 有所上升。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 在 Agent Arena 排名第 5(+11.23%),中位任务成本 $0.56,并重塑了 Pareto 前沿。
推荐理由:官方榜单数据给出了 GPT-6.1 Sol (Max) 的排名与成本对比,读者可以据此评估它在智能体任务上的性价比位置。
你可能已经注意到,我们 Embed 5 的基准测试看起来有点不一样 👀 Embed 5 是首个采用 RCP-nDCG@10 评测的模型系列,这是我们最新的方法论,改进了对真实场景检索质量的评估。
Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。
推荐理由:原文基于 Arena 榜单数据指出 Claude Sonnet 5.5 得分高但成本更高、未进 Pareto 前沿,读者可以据此比较成本与性能的取舍。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首秀排名 #3,净提升 +12.5%,比 Claude Sonnet 5 (High) 高 8.1 个百分点,并在 Chat 类别以 +15.6% 排名 #1。
Black Forest Labs 发布 FLUX 3 Image,是 FLUX 3 多模态模型中负责图像生成与编辑的部分,可用边界框在 0 到 1000 的画布网格上控制每个元素的位置,也支持直接用提示词生成。
Arena 发布本周榜单更新:GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 第 3 并以 $8/MToken 加入 Pareto 前沿,随后被 Sonnet 5.5 挤至第 4 并跌出前沿。
Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。
Black Forest Labs 发布 Flux 3 家族的图像模型 Flux 3 Image,支持多步编辑且不改动画面其余部分,覆盖文生图、图生图、文字渲染和写实生成。
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。
推荐理由:原文给出训练数据构成、过滤方法与速度成本对比,读者可据此判断开源科学报告模型的具体做法是否可迁移。
AWS Strands Labs 开源决策模型 Strands Decider 2B(1.9B 参数),不生成文本,只在选项、yes/no 概率或量表评分中给出带置信度的答案。
小米 MiMo V2.6 Pro 进入 Arena 的 Agent 榜单第 19 名,输出价格为每百万 tokens $0.87,低于排在其前的 18 个模型。其单任务中位成本 $0.10,并列 top 19 中最低,与排第 15 的 DeepSeek V4.1 Flash (Max) 持平。
Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef,包含 Clef 与 Clef-flash 两款。两者分别基于 Qwen3.8-27B 和 Qwen3.5-9B,在 Jev 决策指数(Decision Index 0.2.1)评测中 Clef 处于领先地位,且完全兼容 Jev-API。
可灵AI公众号发布超级创作者、奥美资深创意总监盛健松对 Kling 4.0 内测版的实测。Kling 4.0 已开启内测,将于10月正式发布,支持最长30秒原生视频生成、主体与场景资产调用、声音延续、动作迁移,并提升复杂运镜稳定性、长提示词理解和跨镜头一致性。
Cloudflare Workers AI 团队发布首批自训模型 Clef(27B,基于 Qwen3.8-27B)和 Clef-flash(9B,基于 Qwen3.5-9B),二者为决策模型,针对类型化问题返回各选项概率而非自由文本,以 Apache 2.0 开源并兼容 TypeSafe AI 的 Jev System One API。
Artificial Analysis 发布 Coding Agent Index 榜单,Claude Sonnet 5.5 (max) 在 Claude Code 以 68 分居首,但每任务成本最高达 $14.19。
推荐理由:原文对比了三个新模型在 Coding Agent Index 的成绩和每任务成本,读者可据此权衡性能与价格的组合。
Black Forest Labs 宣布发布新图像模型 FLUX 3 Image,主打精确编辑并支持 4K。用户已可在 Tools Playground 试用新功能,开放权重计划在未来几周内放出。
微软于 10 月 1 日发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言和自动语言检测,可在讲话进行时持续输出文字。
Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以开源权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的开源权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。
推荐理由:原文给出了自主评测的榜单排名、参数与授权细节,可与同类开源图像模型直接比较。
"今天,我们发布两个由 Cloudflare 训练的决策模型,Clef 和 Clef-flash" https://blog.cloudflare.com/clef-decision-models/ 从没见过一个想法传播得如此之快。
Tavus 发布首个 Human Interaction Model(HIM)Griffin,称其为首个通过视频图灵测试的模型。48% 与其实时视频对话的人误以为对方是真人,此前系统通过率低于 3%,并位列 NVIDIA 全双工 AI 视频基准第一。作者 Rohan Paul 转引 Tavus 官方发布并补充演示视频中的表现。
ARC Prize 2026:ARC-AGI-3 里程碑 #2 获奖者 恭喜三位获奖者开源了他们的高分 ARC-AGI-3 解决方案: 1. Daniel Franzen - 27.9%,$25K 2. Lord Han Solo - 23.8%,$7.5K 3. Lohit Siriki - 22.5%,$5K 了解更多关于每个提交方案的信息:
Grok 4.7 已在网页端可用。截图显示 Expert 模式提示“Thinks hard Grok 4.7”,界面还提供 Auto、Fast、Build、Heavy 等模式选项。
一个有趣的结果:Fable 5.1 得分 44.6%,高于 Fable 5 的 37.3%,同时平均少用 33 分钟。这里的进步也意味着从每小时的自主工作中获得更多产出。 大多数智能体运行 8–10 小时,却取得显著不同的分数。下一个有趣的问题是,每多运行一小时,每个智能体能获得多少提升!
Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。
推荐理由:Arena 官方给出 MiMo-V2.6 两款模型在真实智能体会话中的排名、净提升和成本数据,可据此比较其实际表现与性价比。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,属于 Human Interaction Model(HIM)。与 Griffin 实时对话的受访者中 48% 认为它是真人,此前系统通过率低于 3%,并在 NVIDIA 的全双工 AI 视频基准上排名第一。fal 转发该发布并祝贺 Tavus 团队。
webAI 发布开源模型 TwIL-LM3-Pro,仅 3.6B 参数,可在普通电脑本地量化运行,BIG-Bench Hard 得分 95.4,远超 Qwen3-8B 的 63.7。其训练配方为:在形式逻辑上微调、将权重合并回基座模型,再用程序化验证器做 RL,逻辑分数提升的同时通用推理保持稳定。该模型在 SVAMP 上得 95%、MuSR 上得 64.1%,均为所比较小模型中的最高分。
Grok 4.7 正在 Grok 网页版和移动应用中推出,成为所有模式下的基础模型,包括 Fast、Expert、Build 和 Heavy。作者提到明天的每日 AI 简报预计会因此变得更好。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的 Human Interaction Model,48% 与其实时对话的人以为对方是真人,此前系统通过率低于 3%。作者获早期访问体验,称该视频到视频模型可边看边听、打断和被打断并反应房间内发生的事;在 NVIDIA Video Full-Duplex Benchmark 上生成得分 3.83/5,真人为 3.92。
MICROSOFT 🔥:MAI-Transcribe-2-Streaming、MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 模型即将登陆 MAI Playground 和 API! > "MAI-Transcribe 和 MAI-Voice 模型:准确、快速、低成本,在音频理解与生成方面名列前茅,助你构建最佳的对话式语音智能体。" MAI Playground 还新增了 "Chatter" 演示语音体验。 测试时间 👀
Tavus 发布 Griffin,称其为首个通过视频图灵测试的人类交互模型(HIM),48% 与之实时对话的人认为它是真人,此前系统通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上得 3.83 分(真人为 3.92),次优系统为 2.80 分;它将听、想、说和面部动画整合在单一系统中,可在对话者仍在说话时读取表情、语气并实时反应。