跳到正文

全部动态

今日 0 条
1月24日周五
1月20日周一
  1. 公众号:DeepSeek(深度求索)64

    DeepSeek-R1 发布,性能对标 OpenAI o1 正式版

    DeepSeek-R1 发布,性能对标 OpenAI o1 正式版。模型遵循 MIT License 开放 API,训练技术同步公开。

    推荐理由:虽已是旧闻,但 DeepSeek-R1 作为首个开源对齐 o1 的模型,其训练技术至今仍有参考价值,做推理方向的值得回溯。

12月26日周四
  1. 公众号:DeepSeek(深度求索)67

    DeepSeek-V3 正式发布

    深度求索正式发布 DeepSeek-V3 模型,性能比肩世界顶尖模型,速度跃升,价格更新。

    推荐理由:DeepSeek-V3 是 2024 年底国产模型的一次真正跃迁,首次亮剑就逼近闭源顶尖,开源权重更是直接改变了开发者生态。时隔一年半回头看,它仍是理解 DeepSeek 路径的起点。

12月19日周四
  1. Answer.AI 官方研发博客(RSS)82

    Answer.AI 发布 ModernBERT:替代 BERT 的新一代编码器模型

    Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列旨在取代 BERT 的 SOTA 编码器模型。该模型将 LLM 的最新架构改进(如 Flash Attention、RoPE)应用于编码器,支持 8192 token 上下文长度(远超传统 BERT 的 512),并在速度和下游任务性能上全面超越旧一代模型。提供 base (149M) 和 large (395M) 两种参数规模,已集成至 Hugging Face Transformers v4.48.0,可直接作为 BERT 类模型的即插即用替代品,适用于 RAG、分类及代码检索等场景。

    推荐理由:这是六年来首个真正意义上对 BERT 架构的重大升级,解决了长上下文限制并提升了效率,对依赖编码器的 RAG 和搜索系统开发者具有直接的生产力价值。

11月29日周五
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-1:首个全球分布式训练的 10B 参数模型

    Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。

    推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。

11月20日周三
9月30日周一
  1. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布首批 Liquid Foundation Models:LFM-1B/3B/40B

    Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。

    推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。

9月6日周五
  1. 公众号:DeepSeek(深度求索)61

    DeepSeek-V2.5:融合通用与代码能力的全新开源模型

    DeepSeek-V2.5 保留原有 Chat 模型的通用对话能力和 Coder 模型的代码处理能力,并更好地对齐人类偏好。

    推荐理由:DeepSeek首次将通用对话与代码能力合一的开源模型,当时直接拉低了多任务成本,今天看仍是模型混合能力演变的早期标杆。

7月3日周三
  1. 通义 QwenAudio:原创语音项目62

    FunAudioLLM 发布 Fun-CosyVoice 3.0 开源语音合成模型

    通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。

    推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。

4月16日周二
  1. Zyphra Research(网页)61

    Zyphra 发布 7B 混合架构基础模型 Zamba

    Zyphra 发布 7B 基础模型 Zamba,采用 Mamba 块加每 6 层共享权重的全局注意力层的混合架构。

    推荐理由:官方原文给出架构设计、训练规模和开放 checkpoints 细节,读者可以据此评估 Mamba 混合架构在本地部署上的取舍。