跳到正文

全部动态

今日 0 条
4月23日周四
  1. xAI:News(网页)75

    Grok Voice Think Fast 1.0:xAI发布旗舰语音模型,专为复杂工作流设计

    xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种工具处理硬件故障排查、换货等高风险任务。

    推荐理由:xAI 的语音代理不再只是实验,Starlink 实测 20% 销售转化率说明它已经能扛真实业务,语音模型进入可用阶段,做客服和销售自动化的团队该试一下。

  2. Simon Willison 博客71

    Qwen3.6-27B:27B 稠密模型实现旗舰级编程能力

    Qwen 发布 Qwen3.6-27B 开源模型,这款 27B 参数的稠密模型在编码基准测试中超越了上一代 397B 总参数/17B 激活参数的 MoE 旗舰模型 Qwen3.5-397B-A17B。模型体积从 807GB 大幅缩减至 55.6GB,16.8GB 的量化版本即可在本地运行,生成速度约 25 tokens/s。实测显示其能生成复杂的 SVG 图形代码,展现出旗舰级的编程能力。

    推荐理由:通义千问 3.6 27B 用 55GB 瘦身换来了超 397B MoE 的编码能力,Simon 亲手跑出的 SVG 效果惊艳,2026 年最值得本地部署的开源小模型。

  3. 公众号:小米 MiMo79

    Xiaomi MiMo-V2.5 系列大模型开启公测

    Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。

    推荐理由:在自主完成编译器构建和视频编辑器开发的长程任务演示中,展示了结构化的逐层搭建和自我修正能力,其效率对比数据有助于判断复杂Agent任务的成本边界。

  4. 字节 Seed:Research Feed(网页内嵌数据)61

    字节 Seed 发布 Seed3D 2.0,几何与 PBR 材质生成达 SOTA

    字节 Seed 正式发布 3D 生成大模型 Seed3D 2.0,在几何生成、纹理材质生成两项核心指标对比中均取得 SOTA 结果。模型采用 Coarse-to-Fine 两阶段 DiT 提升几何精度,统一 PBR 生成架构并引入 MoE 与 VLM 先验,还支持部件级生成、关节化建模与场景组合,输出可兼容 Isaac Sim 等仿真引擎;技术报告已公开,API 已上线火山引擎。

    推荐理由:官方博客给出两阶段 DiT、统一 PBR 等架构细节与人类盲评结果,读者可了解 3D 生成走向生产可用的具体路径。

4月21日周二
  1. Moonshot AI:Kimi Blog81

    Kimi K2.6:推动开源编程发展

    Kimi发布K2.6版本,专注提升开源编程能力。新版本在代码生成与理解方面实现优化,发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局,通过改进编程辅助功能,为开源社区提供更高效的代码编写支持。

    推荐理由:Kimi K2.6 把长程编程和 Agent Swarm 能力带到了开源模型里,那几个 12 小时自主优化、13 小时重构旧代码库的工程案例比基准表更有说服力,做 Agent 的可以认真看看。

4月20日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)74

    Qwen 3.6-Max-Preview:更智能、更精准,仍在不断进化

    阿里通义千问团队发布Qwen 3.6-Max-Preview预览版大模型,主打更智能的推理能力与更精准的输出表现,目前仍处于快速迭代阶段。该版本在Hacker News社区获得121个赞,用户可通过官方博客了解详情并体验最新功能。作为Max系列的最新预览版本,模型在保持高性能的同时持续优化,具体技术细节和基准测试成绩尚未完全公布。

    推荐理由:通义千问新旗舰模型预览,agentic coding 多个 bench 冲到第一,虽然还不是正式版,但已经能通过 Studio 试用了,对做 coding agent 的团队是个实在信号。

  2. 蚂蚁 inclusionAI:GitHub 新仓库69

    DR-Venus:基于开放数据的边缘级深度研究智能体

    DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。

    推荐理由:4B 参数、仅用 1 万条公开数据就能在多个 deep research benchmark 上碾压 8B 对手,蚂蚁 inclusionAI 这次证明了小模型做 Agent 的关键不在参数量而在数据管线,做端侧 Agent 的团队值得拆一下它的 SFT+RL 流程。

4月17日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库56

    inclusionAI发布LLaDA2.0-Uni模型

    LLaDA2.0-Uni是一个统一的多模态模型,具备对世界的理解与生成能力。该模型通过整合视觉、语言等多模态信息,实现了跨模态的语义理解和内容生成。其架构支持从图像理解到文本生成、跨模态检索等复杂任务,标志着多模态人工智能向更通用、统一的方向演进。

    推荐理由:蚂蚁 inclusionAI 推出 LLaDA2.0-Uni,主打理解与生成统一架构,但距发布已过两周且信息极少,建议等官方技术报告出来再决定是否跟进。

  2. HuggingFace Daily Papers(社区热门论文)81

    Qwen3.5-Omni技术报告

    阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。

    推荐理由:Qwen3.5-Omni把语音、视频、文本全模态做到一个模型里,且在215项音频任务上超越Gemini 3.1 Pro,这是国内团队在全模态模型上的里程碑,做交互产品的值得关注。

4月16日周四
  1. Anthropic:Newsroom(网页)79

    Claude Opus 4.7 正式发布

    Claude Opus 4.7 全面上线,在高级软件工程任务上实现重大飞跃,93项编码基准测试解决率较 Opus 4.6 提升 13%,并首次解决四项前代无法完成的难题。新版本支持更高分辨率图像识别,在研究代理基准测试中总分达 0.715,长上下文性能表现最为稳定。模型定价维持每百万输入 token 5 美元、输出 25 美元不变。出于安全考量,其网络攻击能力较 Claude Mythos Preview 有所削弱,并配备自动拦截高风险网络安全请求的防护机制,合法安全研究人员可通过 Cyber Verification Program 申请使用权限。

    推荐理由:Opus 4.7 不是最炫的模型,但多家真实用户反馈指出它在复杂工程任务上的可靠性提升是实打实的,尤其长链自主执行和指令遵循,对开发 Agent 的团队是一次直接的生产力升级。

  2. Hacker News 热门(buzzing.cc 中文翻译)84

    Qwen3.6-35B-A3B:具有能动编码能力的模型,现已向所有人开放

    阿里巴巴通义千问团队发布Qwen3.6-35B-A3B代码模型,总参数350亿、激活参数30亿,具备能动编码(Agentic Coding)能力,可自主规划并执行复杂编程任务。该模型采用MoE架构平衡性能与成本,现已完全开源并向公众免费开放。

    推荐理由:Qwen 这台 3B 活跃参数的 MoE 在 coding agent 上追平 27B 密集模型,效率惊人,对端侧部署和低成本 agent 应用是实打实的利好。

  3. 公众号:通义实验室(千问)62

    Qwen3.6-35B-A3B 开源!

    通义千问开源 Qwen3.6-35B-A3B,一款总参数 350 亿、推理仅激活 30 亿参数的稀疏 MoE 模型。其在 SWE-bench、Terminal-Bench 等编程基准上显著超越前代,并超越 270 亿参数的稠密模型;原生多模态,在 RefCOCO 上得分 92.0。

    推荐理由:千问又推轻量 MoE 模型,35B 总参激活仅 3B,小团队能跑,但正文就一句宣传语,缺技术细节,先观望。

4月15日周三
  1. Google Blog:AI(RSS)70

    Gemini 3.1 Flash TTS:下一代表现力AI语音技术

    Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

    推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

  2. HuggingFace Daily Papers(社区热门论文)71

    Seedance 2.0:推进面向复杂世界的视频生成

    Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。

    推荐理由:Seedance 2.0 把音视频联合生成真正推到了可用级别,支持多片段、多图片、多音频参考输入,对做视频的创作者是直接的生产力提升。

  3. Midjourney:Updates(RSS)72

    V8.1 Alpha 发布

    V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。

    推荐理由:Midjourney V8.1 把 HD 模式提速 3 倍且变成默认,对设计师意味着每次出图成本骤降,探索速度接近 draft。加上图像提示回归,实用性跨了一大步。

  4. 字节 Seed:Research Papers(网页内嵌数据)66

    字节 Seed 发布 Seedance 2.0 音视频联合生成模型

    字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。

    推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。

4月8日周三
  1. 公众号:智谱(GLM)62

    GLM-5.1开源:一个独立工作8小时的模型

    智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。

    推荐理由:智谱把 GLM-5.1 开源,并且主打 8 小时独立工作,这个定位切中了 agent 场景下长任务执行的痛点,想做自动化流程的可以跑起来试试。

  2. X:唐杰(@jietang)69

    GLM 5.1 发布,聚焦长时任务与记忆反思

    GLM 5.1 即将到来 https://huggingface.co/zai-org/GLM-5.1 编码是基石,长时任务(LHT)是本次的新特性。 更专注于:1. 记忆 2. 进化/持续学习 3. 自我判断/反思。

    推荐理由:智谱 GLM 5.1 把长程任务记忆和自进化作为新能力,这比单纯编码提升更值得关注,做 agent 的团队可以认真评估它在持续任务上的表现。

  3. Meta AI:Research Blog(网页)80

    Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

    Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线并开放部分用户的私有 API 预览。

    推荐理由:官方发布给出基准成绩与三条扩展轴的技术细节,读者可以了解其相对 Llama 4 Maverick 的效率变化和安全评估结论。

  4. Tomer Tunguz 博客(VC 分析)61

    Mythos 横空出世

    Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局——拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义,工程预算也将从开发转向深度加固。

    推荐理由:Claude Mythos 的漏洞发现能力是意外的副产物,这让安全变成了准入壁垒,没有访问权的公司软件将默认多孔。

4月7日周二
  1. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布软件工程智能体模型 SWE-1.6,上线 Windsurf

    Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。

    推荐理由:官方说明了用长度惩罚等训练手段改善模型 UX 的具体做法和效果,对关注智能体行为质量的人有可参考的细节。

4月2日周四
3月30日周一
  1. Inception Labs:Blog(网页)61

    Inception Labs 发布扩散模型 Mercury Edit 2,专注代码 next-edit 预测

    Inception Labs 发布 Mercury Edit 2,一个专为 next-edit 预测构建的扩散 LLM(dLLM),基于近期编辑和代码库上下文预测下一步修改,并行生成 token 以降低延迟。

    推荐理由:官方给出了 KTO 偏好对齐带来的接受率和展示率变化及定价,可帮助开发者评估扩散模型做 next-edit 的实际收益。

3月26日周四
  1. Cohere Labs:官方研究博客65

    Cohere 发布开源语音识别模型 Cohere Transcribe,登顶 HuggingFace Open ASR Leaderboard

    Cohere 发布开源 ASR 模型 Cohere Transcribe,基于 Conformer 编码器-解码器架构,参数量 2B,支持英语、法语、中文、日语、阿拉伯语等 14 种语言,采用 Apache 2.0 许可证。

    推荐理由:原文给出了模型规格、WER 数据和推理吞吐表现,读者可以据此评估它在语音识别工作流中的实际可用性。

3月25日周三
  1. ARC Prize:官方博客72

    ARC Prize 发布交互式基准 ARC-AGI-3,ARC Prize 2026 设超 200 万美元奖金

    ARC Prize 官方发布 ARC-AGI-3,包含数百个由人类游戏设计师手工制作的回合制交互环境,无指令、无规则、无既定目标,要求智能体自行探索并跨关卡迁移所学。人类得分 100%,前沿 AI 得分 0.51%。ARC Prize 2026 同步开启,奖金超 200 万美元,设 ARC-AGI-3 竞赛与 ARC-AGI-2 大奖两个开源竞赛,并发布技术论文。

    推荐理由:官方公布交互式基准的构成、人类与前沿 AI 的分数差距及两个竞赛的奖金安排,可据此了解智能体评测方向。

3月18日周三
  1. MiniMax:Blog(网页)61

    MiniMax M2.7:自我进化的早期回声

    M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了“分析-修改-评估”的自主迭代优化循环,在内部评估中提升了性能。

    推荐理由:MiniMax M2.7 让模型参与自身进化,在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平,Agent Teams 设计也值得看,但整体仍是追赶者姿态。

3月1日周日
  1. Cognition 模型 / Devin 博客(网页)60

    Cognition 发布 SWE-1.6 早期预览并分享 RL 训练研究进展

    Cognition 发布 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,达到 51.7%,速度同为 950 tok/s,并向小部分用户开放早期访问。

    推荐理由:官方给出 SWE-1.6 预览版成绩与 RL 训练细节,并提出基准之外的 Model UX 问题,对做智能体训练的人有参考价值。

2月28日周六
  1. FireRedTeam:原创语音与多模态项目60

    FireRedTeam 发布 FireRed-OCR-2B 结构化文档解析模型,OmniDocBench v1.5 得分 92.94

    FireRedTeam 发布 FireRed-OCR-2B 权重,基于 Qwen3-VL-2B-Instruct,在 OmniDocBench v1.5 上取得 92.94 的总成绩,高于 DeepSeek-OCR 2 的 91.09、PaddleOCR-VL 的 92.86 等模型。

    推荐理由:原文给出了 OmniDocBench v1.5 具体分数、对比模型和三阶段训练方法,读者可以据此判断这个 2B 文档解析模型的实际位置。

2月24日周二
  1. Inception Labs:Blog(网页)68

    Inception Labs 发布扩散推理模型 Mercury 2

    Inception Labs 发布 Mercury 2,称其为最快的推理语言模型,基于扩散并行细化而非自回归逐 token 解码,生成速度较此前提升超 5 倍。

    推荐理由:原文给出扩散架构带来的具体速度、价格和上下文参数,读者可据此评估实时推理场景的可行性。

  2. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布早期检查点 LFM2-24B-A2B,24B 总参数仅 2.3B 激活

    Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。

    推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。

2月20日周五
  1. X:Noam Shazeer(@NoamShazeer)78

    Gemini 3.1 Pro 发布,核心智能升级

    上周我们升级了 Gemini 3 Deep Think。今天,我们正式推出实现这些突破的核心智能:Gemini 3.1 Pro。一个明显更智能、能力更强的基线,应对你最艰巨的挑战。现已可用:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro

    推荐理由:Noam Shazeer 宣布 Gemini 3.1 Pro,作为 Deep Think 突破背后的核心基座升级,全行业该关注的信号。

2月12日周四
  1. FireRedTeam:原创语音与多模态项目61

    FireRedTeam 开源 FireRedASR2S 一体化语音识别系统,含 ASR、VAD、LID 和标点四个模块

    FireRedTeam 发布开源工业级一体化语音识别系统 FireRedASR2S,集成 FireRedASR2(支持中文普通话、20+ 方言口音、英文、中英混说及歌声转写)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块,均开源权重与推理代码。

    推荐理由:官方开源的一体化语音识别系统,给出与 Doubao-ASR、Silero-VAD 等的对比数字和完整推理代码,便于直接部署验证。

  2. MiniMax:Blog(网页)67

    MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造

    MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。

    推荐理由:MiniMax M2.5 把 SWE-bench 拉到 80.2%,成本只有 Claude Opus 4.6 的十分之一,速度还翻倍,对做 agent 的团队来说是个高性价比选择。

2月11日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库65

    inclusionAI发布新一代即时大模型Ling-2.5-1T

    inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。

    推荐理由:蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。

  2. 蚂蚁 inclusionAI:GitHub 新仓库78

    inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

    inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。

    推荐理由:蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

  3. FireRedTeam:原创语音与多模态项目65

    小红书团队开源 FireRed-Image-Edit 图像编辑模型并发布 REDEdit-Bench

    小红书智能创作团队开源 FireRed-Image-Edit 图像编辑模型,权重采用 Apache 2.0 协议,并在 ImgEdit、GEdit 和自建 REDEdit-Bench 上取得开源模型中的最高分,如 ImgEdit_O 4.56。

    推荐理由:小红书团队开源图像编辑模型,README 给出完整基准对比表、训练与部署方案,读者可自行核对开源 SOTA 的成色。

2月2日周一
  1. ElevenLabs:Blog(网页)65

    Eleven v3 语音模型正式全量开放,符号与数字朗读错误率下降 68%

    ElevenLabs 宣布其最先进的 Text to Speech 模型 Eleven v3 结束 Alpha 阶段,正式面向所有平台开放。新版本在测试中 72% 的场景被用户认为比 Alpha 更稳定;针对数字、符号和专业记号的处理,内部基准覆盖 8 种语言 27 个类别,错误率从 15.3% 降至 4.9%,整体减少 68%,改进集中在体育比分、货币、化学式等依赖上下文判断符号含义的场景。

    推荐理由:原文给出具体的错误率下降数字和示例对比,读者可以据此评估 Eleven v3 正式版在数字和符号朗读上的实际改进。

2月1日周日
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)62

    MOVA 发布:32B MoE 端到端同步视频-音频生成模型全栈开源

    OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。

    推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。

1月27日周二
  1. 公众号:月之暗面(Kimi)61

    Kimi 发布并开源 K2.5 模型,带来全新视觉理解、代码和 Agent 集群能力

    Kimi 发布并开源迄今最智能、最全能的 K2.5 模型,原生多模态架构支持视觉与文本输入、思考与非思考模式,在 Agent、代码、图像、视频及通用智能任务上取得开源 state-of-the-art 表现。

    推荐理由:Kimi K2.5把视觉理解和Agent集群能力打包开源,国内模型里比较早做这个组合的,虽然参数规模争议不小,但对想搭多模态Agent的团队是个可用的起点。

1月20日周二
  1. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布 LFM2.5-1.2B-Thinking,1.2B 参数端侧推理模型内存低于 1GB

    Liquid AI 发布可在手机上完全离线运行的推理模型 LFM2.5-1.2B-Thinking,内存占用约 900 MB,已上线 Hugging Face、LEAP 和 Playground。

    推荐理由:官方公布了小参数量思考模型的端侧内存、速度数据和训练配方,读者可以据此评估边缘推理方案的选型。