百川智能开源医疗大模型Baichuan-M3
我们已正式开源新一代医疗大语言模型 Baichuan-M3,其在 HealthBench 上获得 65.1 分,并在 HealthBench Hard 上以 44.4 分夺冠。该模型在医疗领域全面超越 GPT-5.2。
推荐理由:医疗大模型在 HealthBench 上超越 GPT-5.2 是个真料,开源后医疗开发者可以直接调优,但别急着相信所有宣传数字,等实测再下结论。
我们已正式开源新一代医疗大语言模型 Baichuan-M3,其在 HealthBench 上获得 65.1 分,并在 HealthBench Hard 上以 44.4 分夺冠。该模型在医疗领域全面超越 GPT-5.2。
推荐理由:医疗大模型在 HealthBench 上超越 GPT-5.2 是个真料,开源后医疗开发者可以直接调优,但别急着相信所有宣传数字,等实测再下结论。
Liquid AI 发布 LFM2.5-1.2B 模型家族,将预训练从 10T 扩展到 28T tokens 并加入强化学习后训练,覆盖 Base、Instruct、日语、视觉语言和音频语言五个变体。
推荐理由:官方发布给出了完整基准数据和推理速度对比,读者可以据此评估 1B 级端侧模型在指令遵循和部署上的实际水位。
通义实验室发布 Fun-ASR 端到端语音识别模型系列并开源。Fun-ASR-Nano-2512 参数量 800M,基于数千万小时语音训练,支持中英日三语、7 种汉语方言和 26 种地方口音;Fun-ASR-MLT-Nano-2512 同为 800M,基于数十万小时训练,支持 31 种语言。
推荐理由:原文给出两个识别模型的训练规模、语言覆盖和开源基准对比,还附部署与推理路径,读者可据此评估在中文和方言场景的可用性。
DeepSeek 发布正式版 DeepSeek-V3.2 和长思考增强版 V3.2-Speciale,网页端、App 和 API 均已更新。
推荐理由:V3.2将思考融入工具调用,在Agent评测中达到开源最高水平,泛化性提升可能改变复杂工具调用应用的模型选型。
DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。
推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。
推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。
xAI 发布 Grok 4.1,现已向 grok.com、X 和 iOS、Android 应用的全部用户开放,在 Auto 模式立即推出,也可在模型选择器中显式选择。
推荐理由:原文给出了盲测 Elo、EQ-Bench3 和幻觉率等多维度评测结果,读者可以据此判断 Grok 4.1 相比前代的具体提升。
ElevenLabs 发布实时语音转文字模型 Scribe v2 Realtime,延迟低于 150 ms,在 30 种常用欧洲和亚洲语言上达到 93.5% 准确率,并支持约 90 种语言。
推荐理由:官方公布了延迟、准确率等具体指标和主要功能,读者可据此评估其是否适合语音智能体等实时场景。
Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。
推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。
MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的“不可能三角”,为构建更普及的AI智能体应用提供基础,体现了其“智能平权”的愿景。
推荐理由:MiniMax M2 把 Agent 模型的价格打到了 Claude 的 8%,速度还翻倍,开源权重直接可用,做 Agent 的开发者值得上手试试。
Cognition 发布 SWE-grep 和 SWE-grep-mini 模型,专注高度并行的代码上下文检索,检索能力匹敌前沿编码模型但耗时低一个数量级。模型每轮最多发起 8 个并行工具调用、限制 4 轮,通过多轮强化学习训练,奖励为文件与行范围检索的加权 F1;由 SWE-grep 蒸馏并继续 RL 得到 SWE-grep-mini。
推荐理由:原文给出检索质量分数与推理速度对比数字,并说明多轮 RL 训练方法,读者可评估这种专用检索模型能否迁移到自己的编码工作流。
Microsoft AI 发布首个完全在内部开发的图像生成模型 MAI-Image-1,在 LMArena 文生图榜单上首次亮相即进入前十。模型擅长生成写实图像,如光影(反弹光、反射)和风景,兼顾速度与质量,便于用户快速迭代后再迁移到其他工具精修。
推荐理由:微软首次全自研图像生成模型上线 Bing Image Creator 和 Copilot,主打生成速度与写实光影,创作者可以据此尝试更快迭代。
Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS 2025接收。
推荐理由:蚂蚁把自回归视频生成的训练成本砍到 Cosmos 的 0.2% 还能赢,这个效率信号比分数本身更值得关注,做视频生成的团队该认真看看它的课程学习和渐进分辨率策略。
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,扩展了 LFM2 家族。
推荐理由:官方给出了 VoiceBench、ASR 词错率和低于 100ms 的延迟数据,读者可以据此评估 1.5B 参数模型在端侧实时语音场景的可用性。
DeepSeek 发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention(DSA)稀疏注意力机制,在几乎不影响输出效果的前提下大幅提升长文本训练和推理效率,公开评测表现与 V3.1-Terminus 基本持平。
推荐理由:稀疏注意力在几乎不影响效果的前提下大幅降低长文本成本,API 降价 50% 让依赖长上下文的应用获得了更现实的部署条件。
inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。
推荐理由:蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。
Liquid AI 发布 Liquid Nanos 系列,包含 350M 至 2.6B 参数的任务专用 LFM2 模型,可完全在手机、笔记本和嵌入式设备上运行。
推荐理由:原文给出各款小模型的参数量、任务定位和评测对比,读者可判断端侧专用模型能否替代云端大模型。
DeepSeek-V3.1 已更新至 DeepSeek-V3.1-Terminus 版本,在保持原有能力基础上,缓解了中英文混杂、偶发异常字符等问题,并优化了 Code Agent 与 Search Agent 的表现。官方 App、网页端、小程序与 DeepSeek API 均已同步更新,开源版本已发布至 Hugging Face。
推荐理由:V3.1-Terminus 重点改进了语言混杂和 Agent 表现,开源权重与 API 已同步,适合评估多语言应用和工具调用的稳定性提升。
xAI 发布 Grok 4 Fast,主打高性价比推理,实现与 Grok 4 相当的基准表现,同时平均少用 40% 思考 token,达到同等前沿基准性能的价格降低 98%。
推荐理由:官方给出了与 Grok 4 等模型的基准对比、token 效率提升和 API 定价,读者可据此评估其成本与性能取舍。
FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。
推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。
Microsoft AI(MAI)发布语音生成模型 MAI-Voice-1,单张 GPU 可在一秒内生成一分钟音频,已用于 Copilot Daily 和 Podcasts。
推荐理由:官方公布两款自研模型的技术细节与试用入口,可据此了解其训练规模和落地进展。
DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。
推荐理由:混合推理架构统一思考与非思考模式,Agent基准提升具体,API兼容Anthropic格式直接降低Claude Code接入门槛。
DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。
推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。
Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。
推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。
今天我们推出了 Baichuan-M2,一款医疗增强的推理模型,它在 #HealthBench 基准测试上超越了包括 gpt-oss-120b 在内的所有开源模型。在此试用:https://huggingface.co/baichuan-inc/Baichuan-M2-32B #AIHealth
推荐理由:百川 M2 是首个明确主打医疗推理的 32B 模型,在 HealthBench 上压过 GPT-OSS,做医疗 AI 应用的可以直接上 HuggingFace 拉下来跑,垂类专精可能比通用巨兽更接地气。
OpenRouter 上线 OpenAI 的 GPT-5,称其支持 400,000 token 上下文窗口和最高 128,000 输出 token,思考模式下幻觉较 o3 减少约 80%。
推荐理由:给出 GPT-5 三档变体定价与 SWE-Bench Verified 得分,可对照 Claude Sonnet-4 等模型横向比较。
OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。
推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。
[Lmgame Bench] 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-oss-20b → 第13名
推荐理由:OpenAI 终于开源了,这是 GPT-2 之后第一次放开权重,120B 和 20B 两个尺寸直接对标 Llama 和 Qwen 的开源生态。虽然游戏 benchmark 排名不算惊艳,但信号本身比分数重要得多,所有基于开源模型做产品的团队都得重新评估选型。
FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为“稀疏蒸馏”的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。
推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。
上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。
推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。
Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。
推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。
OpenRouter 公布新隐身模型 Cypher Alpha。页面正文目前仅包含 newsletter 订阅说明,未披露模型规模、上下文长度或开放时间等任何参数与可用性信息。
OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。
推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。
🚀 DeepSeek-R1-0528 现已发布! 🔹 基准测试性能提升 🔹 前端能力增强 🔹 减少幻觉现象 🔹 支持 JSON 输出与函数调用 ✅ 立即试用:https://chat.deepseek.com/ 🔌 API 使用方式不变 — 文档在此:https://api-docs.deepseek.com/guides/reasoning_model 🔗 开源权重:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528
推荐理由:DeepSeek-R1 的常规迭代,幻觉降低和 JSON 输出是实用改进,但距离代际跃迁还差得远。开源权重直接可用,做推理链产品的团队值得花半小时跑一下。
DeepSeek 发布 R1 模型小版本升级 DeepSeek-R1-0528,在数学、编程与通用逻辑等基准测评中取得当前国内所有模型中首屈一指的成绩,整体表现接近 o3 与 Gemini-2.5-Pro。
推荐理由:后训练投入增加带来的推理提升幅度,为开源社区提供了可蒸馏的高质量思维链,小模型也能接近大模型表现。
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。
推荐理由:原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。
Prime Intellect 发布 INTELLECT-2,称其为首个 32B 参数模型的全球无许可去中心化强化学习训练,任何人可贡献异构算力。
推荐理由:官方完整公开了异步 RL 去中心化训练的框架、验证机制与数据过滤细节,读者可以照此评估和复用整套开源组件。
DeepSeek 发布小版本升级 DeepSeek-V3-0324,在数学、代码类评测集上得分超过 GPT-4.5,并增强了前端代码生成、中文写作与联网搜索能力。模型参数约 660B,开源版本上下文长度为 128K,网页端、App 和 API 提供 64K 上下文。权重已开源,采用 MIT License,允许蒸馏训练其他模型。
推荐理由:推理能力提升至超越 GPT-4.5 的同时保持 MIT 开源许可,让低成本部署强推理模型的门槛进一步降低。
DeepSeek-V3 新版已发布,关闭深度思考模式即可体验,模型权重同步开源。
推荐理由:DeepSeek-V3 发布时是开源模型的有力竞争者,但这条一年多前的旧闻如今毫无新意,对关注 AI 动态的你来说,可以直接跳过。
Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。
推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。