跳到正文

全部动态

今日 3 条
今天10月5日周一
10月3日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)64

    Aleph Alpha 发布开放权重德英双语 MoE 模型 Kolibri

    Aleph Alpha 于德国统一日发布开放权重模型 Kolibri,为 78B 总参数、约 3B 激活的德英双语 MoE Transformer,支持最长 1M token 上下文,权重以 Apache 2.0 许可上传 Hugging Face。

  2. X:Cohere(@cohere)34

    Cohere Embed 5 采用新评测方法

    你可能已经注意到,我们 Embed 5 的基准测试看起来有点不一样 👀 Embed 5 是首个采用 RCP-nDCG@10 评测的模型系列,这是我们最新的方法论,改进了对真实场景检索质量的评估。

  3. X:Arena (@arena)69

    Arena 评测:Claude Sonnet 5.5 登顶 Agent Arena 第 3 名但未入 Pareto 前沿

    Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。

    推荐理由:原文基于 Arena 榜单数据指出 Claude Sonnet 5.5 得分高但成本更高、未进 Pareto 前沿,读者可以据此比较成本与性能的取舍。

10月2日周五
  1. TechCrunch · AI59

    Google 发布 Gemini 4 Argon,称其为迄今最强模型

    Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。

  2. Ai2 / Allen Institute for AI(RSS)62

    Ai2 开源 8B 科学报告生成模型 AstaBrief

    Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。

    推荐理由:原文给出训练数据构成、过滤方法与速度成本对比,读者可据此判断开源科学报告模型的具体做法是否可迁移。

  3. 公众号:可灵AI(快手·视频)55

    可灵超级创作者实测 Kling 4.0:30秒打戏、运镜稳定性与一致性表现

    可灵AI公众号发布超级创作者、奥美资深创意总监盛健松对 Kling 4.0 内测版的实测。Kling 4.0 已开启内测,将于10月正式发布,支持最长30秒原生视频生成、主体与场景资产调用、声音延续、动作迁移,并提升复杂运镜稳定性、长提示词理解和跨镜头一致性。

  4. X:Artificial Analysis (@ArtificialAnlys)69

    Artificial Analysis 评测:Qwen-Image-2.1 登顶两个 AA-Image 榜单的开源权重模型

    Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以开源权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的开源权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。

    推荐理由:原文给出了自主评测的榜单排名、参数与授权细节,可与同类开源图像模型直接比较。

  5. X:Peter Steinberger (@steipete)40

    Cloudflare 发布 Clef 决策模型

    "今天,我们发布两个由 Cloudflare 训练的决策模型,Clef 和 Clef-flash" https://blog.cloudflare.com/clef-decision-models/ 从没见过一个想法传播得如此之快。

  6. X:Rohan Paul (@rohanpaul_ai)62

    Tavus 发布 Human Interaction Model Griffin,48% 真人误认其为人类

    Tavus 发布首个 Human Interaction Model(HIM)Griffin,称其为首个通过视频图灵测试的模型。48% 与其实时视频对话的人误以为对方是真人,此前系统通过率低于 3%,并位列 NVIDIA 全双工 AI 视频基准第一。作者 Rohan Paul 转引 Tavus 官方发布并补充演示视频中的表现。

  7. X:ARC Prize (@arcprize)45

    ARC-AGI-3 里程碑2获奖者公布

    ARC Prize 2026:ARC-AGI-3 里程碑 #2 获奖者 恭喜三位获奖者开源了他们的高分 ARC-AGI-3 解决方案: 1. Daniel Franzen - 27.9%,$25K 2. Lord Han Solo - 23.8%,$7.5K 3. Lohit Siriki - 22.5%,$5K 了解更多关于每个提交方案的信息:

  8. X:Rohan Paul (@rohanpaul_ai)51

    Grok 4.7 上线网页端

    Grok 4.7 已在网页端可用。截图显示 Expert 模式提示“Thinks hard Grok 4.7”,界面还提供 Auto、Fast、Build、Heavy 等模式选项。

  9. X:Karina Nguyen(@karinanguyen)30

    Fable 5.1 登顶 PostTrainBench

    一个有趣的结果:Fable 5.1 得分 44.6%,高于 Fable 5 的 37.3%,同时平均少用 33 分钟。这里的进步也意味着从每小时的自主工作中获得更多产出。 大多数智能体运行 8–10 小时,却取得显著不同的分数。下一个有趣的问题是,每多运行一小时,每个智能体能获得多少提升!

  10. X:Arena (@arena)69

    MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

    Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。

    推荐理由:Arena 官方给出 MiMo-V2.6 两款模型在真实智能体会话中的排名、净提升和成本数据,可据此比较其实际表现与性价比。

  11. X:fal (@fal)54

    Tavus 发布视频图灵测试模型 Griffin

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,属于 Human Interaction Model(HIM)。与 Griffin 实时对话的受访者中 48% 认为它是真人,此前系统通过率低于 3%,并在 NVIDIA 的全双工 AI 视频基准上排名第一。fal 转发该发布并祝贺 Tavus 团队。

  12. X:Elvis Saravia (@omarsar0, DAIR.AI)47

    webAI 开源 3.6B 模型 TwIL-LM3-Pro,BIG-Bench Hard 得分 95.4

    webAI 发布开源模型 TwIL-LM3-Pro,仅 3.6B 参数,可在普通电脑本地量化运行,BIG-Bench Hard 得分 95.4,远超 Qwen3-8B 的 63.7。其训练配方为:在形式逻辑上微调、将权重合并回基座模型,再用程序化验证器做 RL,逻辑分数提升的同时通用推理保持稳定。该模型在 SVAMP 上得 95%、MuSR 上得 64.1%,均为所比较小模型中的最高分。

  13. X:Testing Catalog (@testingcatalog)53

    Grok 4.7 开始在 Grok 网页版和移动应用上线

    Grok 4.7 正在 Grok 网页版和移动应用中推出,成为所有模式下的基础模型,包括 Fast、Expert、Build 和 Heavy。作者提到明天的每日 AI 简报预计会因此变得更好。

  14. X:Elvis Saravia (@omarsar0, DAIR.AI)56

    Tavus 发布 Griffin 视频对话模型,称其首个通过视频图灵测试

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的 Human Interaction Model,48% 与其实时对话的人以为对方是真人,此前系统通过率低于 3%。作者获早期访问体验,称该视频到视频模型可边看边听、打断和被打断并反应房间内发生的事;在 NVIDIA Video Full-Duplex Benchmark 上生成得分 3.83/5,真人为 3.92。

  15. X:Testing Catalog (@testingcatalog)48

    微软MAI语音转录与语音模型上新

    MICROSOFT 🔥:MAI-Transcribe-2-Streaming、MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 模型即将登陆 MAI Playground 和 API! > "MAI-Transcribe 和 MAI-Voice 模型:准确、快速、低成本,在音频理解与生成方面名列前茅,助你构建最佳的对话式语音智能体。" MAI Playground 还新增了 "Chatter" 演示语音体验。 测试时间 👀

  16. X:Rohan Paul (@rohanpaul_ai)64

    Tavus 发布 Griffin,48% 的人将其误认为真人

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的人类交互模型(HIM),48% 与之实时对话的人认为它是真人,此前系统通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上得 3.83 分(真人为 3.92),次优系统为 2.80 分;它将听、想、说和面部动画整合在单一系统中,可在对话者仍在说话时读取表情、语气并实时反应。