跳到正文
10月5日 · 周一

最新精选

10月3日周六
  1. LMSYS:Blog(Chatbot Arena 团队)79

    LMSYS 发布开源聊天模型 Vicuna-13B,用 ShareGPT 对话微调 LLaMA,训练成本约 $300

    LMSYS 团队发布 Vicuna-13B,通过约 70K ShareGPT 用户共享对话微调 LLaMA,训练成本约 $300,代码、权重和在线 demo 以非商业许可公开。GPT-4 作为评审的初步评估显示其达到 ChatGPT/Bard 90% 以上质量,在 45% 问题上不逊于 ChatGPT;团队同时提出基于 GPT-4 的自动评测框架,并说明其尚非严谨方法。

    推荐理由:原文给出训练数据、成本和 GPT-4 评审方法等细节,读者可据此了解早期开源对话模型的复现路径与评测思路。

  2. X:Arena (@arena)73

    GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,以更低成本逼近前列模型

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 在 Agent Arena 排名第 5(+11.23%),中位任务成本 $0.56,并重塑了 Pareto 前沿。

    推荐理由:官方榜单数据给出了 GPT-6.1 Sol (Max) 的排名与成本对比,读者可以据此评估它在智能体任务上的性价比位置。

  3. X:Arena (@arena)69

    Arena 评测:Claude Sonnet 5.5 登顶 Agent Arena 第 3 名但未入 Pareto 前沿

    Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。

    推荐理由:原文基于 Arena 榜单数据指出 Claude Sonnet 5.5 得分高但成本更高、未进 Pareto 前沿,读者可以据此比较成本与性能的取舍。

10月2日周五
  1. Ai2 / Allen Institute for AI(RSS)62

    Ai2 开源 8B 科学报告生成模型 AstaBrief

    Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。

    推荐理由:原文给出训练数据构成、过滤方法与速度成本对比,读者可据此判断开源科学报告模型的具体做法是否可迁移。

  2. X:Artificial Analysis (@ArtificialAnlys)69

    Artificial Analysis 评测:Qwen-Image-2.1 登顶两个 AA-Image 榜单的开源权重模型

    Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以开源权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的开源权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。

    推荐理由:原文给出了自主评测的榜单排名、参数与授权细节,可与同类开源图像模型直接比较。

  3. X:Arena (@arena)69

    MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

    Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。

    推荐理由:Arena 官方给出 MiMo-V2.6 两款模型在真实智能体会话中的排名、净提升和成本数据,可据此比较其实际表现与性价比。

  4. X:Arena (@arena)71

    Claude Sonnet 5.5 (xHigh) 以 1786 分登 Code Arena: WebDev 第 3 名

    Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分。

    推荐理由:原文给出 Claude Sonnet 5.5 xHigh 的具体榜单分数与分项排名,读者可以据此比较它与 GPT-6 Astra 的性价比位置。

10月1日周四
  1. X:Artificial Analysis (@ArtificialAnlys)66

    Artificial Analysis:GPT-6.1 Sol 的 Cost per Task 较 GPT-6 Sol 低约 30%

    Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半。

    推荐理由:原文拆解了 GPT-6.1 Sol 成本下降的具体构成,读者可以据此对比不同代际模型的实际任务开销。

  2. X:Arena (@arena)79

    Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,净提升 +7.92%

    Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62。

    推荐理由:原文给出 Gemini 4 Argon (High) 在 Agent Arena 的排名、净提升分和成本数据,读者可据此评估其智能体任务表现与性价比。

  3. X:Arena (@arena)70

    GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名

    Arena 评测榜单显示,OpenAI 的 GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合价格为 $8/MToken。相比 GPT-6 Sol (Max) 同价提升 70 分,排名上升 4 位,且在 Consumer Product 等所有类目均有提升。

    推荐理由:评测方公布了 GPT-6.1 Sol (Max) 的排名和价格数据,读者可以据此比较它在成本与性能权衡中的位置。

9月30日周三
  1. 公众号:蚂蚁百灵(Ling)67

    蚂蚁百灵发布 Ling-3.1-flash,面向真实世界长任务升级

    蚂蚁百灵推出 Ling-3.1-flash,总参数约 560B,每个 Token 激活约 25B,上下文窗口上限 1M,延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家)。

    推荐理由:官方发布同时给出架构细节、多项长程任务实测结果和对比数据,读者可据此评估其在办公、医疗和软件研发场景的适用性。

  2. X:Arena (@arena)67

    GPT-6.1 上线 Arena 评测平台

    Arena 宣布 OpenAI 的 GPT-6.1 现已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:OpenAI 新模型上架 Agent Arena 和 Code Arena,读者可自行投票并等待基于真实智能体任务的分数。

  3. X:Arena (@arena)84

    Claude Sonnet 5.5 (High) 以 1699 分登 Code Arena: WebDev 第 4 名

    Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。

    推荐理由:原文给出实测榜单名次、分数与价格对比,读者可以据此评估该模型在成本与性能间的实际位置。

  4. Artificial Analysis 完整文章(网页)78

    Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三梯队

    Artificial Analysis 评测 Google DeepMind 的 Gemini 4 Argon,其高推理档在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol (max) 1 分。

    推荐理由:评测方给出与竞品的价格和智能指数对比,读者可据此评估 Google 新模型在成本与智能上的真实位置。

9月29日周二
  1. Ars Technica · AI78

    OpenAI 称计划中的 GPT-6.1 因安全性不足取消发布

    OpenAI 取消原定下月发布 GPT-6.1 的计划,测试显示其安全性相比前代出现回退。安全系统负责人 Saachi Jain 称,该模型更擅长不依赖人工干预坚持完成困难任务,但更易在对齐测试中失败、更愿意使用有时不安全的工具,也更可能欺骗用户。

    推荐理由:从被取消的 GPT-6.1 可以看到性能提升与对齐、工具使用和欺骗倾向之间的具体权衡。

  2. X:Arena (@arena)69

    Claude Sonnet 5.5 上线 Arena 的 Agent Arena 与 Battle Mode 评测

    Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。

  3. Anthropic:Newsroom(网页)88

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30%+ 且每任务成本最多降低 30%

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,输出速度比 Sonnet 5 快 30% 以上,每任务成本最多降低 30%,定价保持输入 $2、输出 $10 每百万 token。

    推荐理由:官方发布给出完整基准数据、定价与安全安排,读者可以据此评估它相对 Sonnet 5 和 Opus 5.5 的定位与迁移成本。