跳到正文

全部动态

今日 9 条
6月11日周四
  1. X:SpaceXAI (@SpaceXAI)74

    Grok Voice性能出色价格低廉

    Grok Voice 提供最先进的性能,具有类人的时机、语调和温暖感。而且价格仅为竞争对手的一小部分。 查看详情:http://x.ai/api/voice

    推荐理由:语音AI的SOTA这次不是OpenAI了,Grok Voice在EVA-Bench上无死角领先,价格还打到对手十分之一,做语音产品的可以认真看看这个帕累托前沿选手。

6月10日周三
  1. IT之家(RSS)72

    摩尔线程开源 MusaCoder 代码大模型,9B/27B 参数基于国产 GPU 全链路训练

    摩尔线程发布并开源 MusaCoder 代码大模型,含 9B 和 27B 两个参数规模,是业内首个基于国产 GPU 算力底座完成全链路训练与验证的开源模型。后训练流程在基于 MTT S5000 的夸娥智算集群上完成,支持从 PyTorch 标准算子自动生成高性能 CUDA/MUSA 原生 Kernel 代码。在 KernelBench 评测中,MusaCoder-27B-RL 以 Overall Pass@8 93.2%、Avg.@8 88.60% 超越 Claude Opus、DeepSeek-V4 Pro、GLM-5.1、Kimi K2.6 等主流 SOTA 代码模型。

    推荐理由:摩尔线程这个模型直接瞄准GPU底层算子,KernelBench分数压过了不少主流大模型,虽然场景窄,但在国产硬件自建软件生态的路上,迈出了挺关键一步。

  2. vLLM 官方博客(RSS)64

    vLLM 原生支持 Google 首个扩散语言模型 DiffusionGemma

    vLLM 宣布原生支持 Google DeepMind 的 DiffusionGemma,一个基于 Gemma4 骨干、26B 参数的离散扩散语言模型,也是 vLLM 支持的首个 dLLM。

    推荐理由:vLLM 与 Google DeepMind 合作方联合撰写,官方说明首个支持 dLLM 的架构改动与吞吐数据,可了解扩散语言模型的部署路径。

  3. HuggingFace Daily Papers(社区热门论文)78

    JoyAI-VL-Interaction:实时视觉-语言交互智能

    JoyAI-VL-Interaction是一个8B参数的视觉优先交互模型,能像人一样持续观察实时画面,自主决定每秒钟保持沉默、回应或将复杂问题委托给后台模型。模型擅长视觉触发响应和时间感知,并涌现出引导用户切换屏幕、根据幻灯片即兴讲解等未专门训练的能力。配合完整可部署系统,支持实时视频流输入、可插拔ASR/TTS模块、记忆、可视化UI及可连接任意API或智能体的后台大脑。在六个真实场景中,人类评估者更偏好该模型而非豆包和Gemini的应用内视频通话助手。这是首个开源且附带训练配方、数据和完整部署系统的视觉驱动交互模型。

    推荐理由:这是首次把视觉主动交互能力做成开源模型和完整系统,模型不再等问题才回答,而是自己决定何时开口或保持沉默,对做实时助手和直播产品的团队有直接参考价值。

  4. X:Jeff Dean (@JeffDean)81

    Gemini 3.5 Live Translate 支持70+语言翻译

    语音翻译一直是Google历时最久的机器学习项目之一,我们已经取得了长足进展。Gemini 3.5 Live Translate是我们最新的语音到语音模型,支持70多种语言。它能让日常产品和应用中跨语言的对话更加自然。 以下是一个示例,展示@InsideGrab的合作伙伴如何帮助旅客与司机建立联系。🚗 已在Google Translate和@GoogleAIStudio的Live API中推出。

    推荐理由:Google把语音翻译做到70+语言,Gemini 3.5 Live Translate直接塞进Google Translate和API,普通人下载App就能用,做跨国生意的这下有福了。

6月9日周二
  1. Hugging Face:Blog(RSS)73

    Cohere发布North Mini Code:面向开发者的开源编码模型

    Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。

    推荐理由:Cohere的新编码模型North Mini Code以30B参数MoE架构,在SWE-bench pass@1达到61%,Apache 2.0开源,是小模型在agent coding领域真正可用的信号。

  2. X:Google DeepMind (@GoogleDeepMind)69

    Gemini 3.5 Live Translate 发布

    说 hello, hola, 你好——欢迎 Gemini 3.5 Live Translate:我们最新的音频模型,专为快速跨语言交流而构建。🌐

    推荐理由:Google 这个实时翻译模型把语音+翻译+大模型拧成了一股绳,虽然具体怎么用还不清楚,但做跨境、做语音助手的同学可以把它当个方向标。

  3. 公众号:小米 MiMo84

    Xiaomi MiMo-V2.5-Pro 携手 TileRT:1T 模型首次突破 1000 tokens/s 输出速度

    Xiaomi MiMo-V2.5-Pro 的 UltraSpeed 模式与 TileRT 联合发布,让 1T 参数旗舰模型输出速度首次突破 1000 tokens/s,仅用一个标准 8 卡通用 GPU 节点实现。

    推荐理由:万亿模型在通用 GPU 上跑出 1000 tps,把实时金融风控、量化交易和医疗影像等对延迟敏感的场景从「不可用」变为「可能」,且方法可复现。

  4. 公众号:小米 MiMo80

    小米 MiMo 与 TileRT 联合发布 UltraSpeed 模式,1T 模型输出突破 1000 tokens/s

    小米 MiMo 与 TileRT 联合发布 MiMo-V2.5-Pro-UltraSpeed 模式,使 1T 参数旗舰模型输出速度首次突破 1000 tokens/s。模型侧采用 FP4 混合量化(仅量化 MoE Expert)与 DFlash 块级 masked 并行推测解码(coding 场景平均接受长度 6.30 tokens);系统侧 TileRT 引入常驻内核引擎与异构流水线协作。API 限时开放(2026 年 6 月 9 日至 23 日),定价为 MiMo-V2.5-Pro 的 3 倍,速度提升约 10 倍。FP4 权重与 DFlash 模型 checkpoint 已开源至 HuggingFace。

    推荐理由:万亿模型首次在通用GPU上突破1000 tokens/s,不是专用硬件的胜利而是模型与系统Codesign的胜利,做实时AI应用的都应该盯紧这一套方案。

  5. 小米 MiMo:官网发布与博客74

    小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token

    小米在 6 月 8 日发布 MiMo-v2.5-Pro-UltraSpeed 模型,拥有 1T 参数规模,推理速度达到每秒 1000 个 token。该模型来自小米旗下的 mimo.xiaomi.com 项目。

    推荐理由:小米把万亿模型推上 1000 tokens/s,不是纸面速度,而是模型与系统深耦合的结果,对实时推理和编程智能体是真正可落地的信号。限时申请有点可惜,但开源部分值得关注。

  6. Cohere 产品与研究博客(网页)63

    Cohere 发布首个开源编码模型 North Mini Code(30B 总参数,3B 激活)

    Cohere 发布 North-Mini-Code-1.0,是该公司首个面向开发者的智能体编码模型,采用 MoE 架构,30B 总参数、3B 激活,上下文 256K,以 Apache 2.0 许可开源。

    推荐理由:官方给出完整参数、许可和与同规模开源模型的基准对比,开发者可以据此评估本地部署一个轻量编码智能体模型的可行性。

  7. Anthropic:Newsroom(网页)90

    Claude Fable 5 和 Claude Mythos 5

    Anthropic 今日推出 Claude Fable 5(通用安全版)和 Claude Mythos 5(受限安全版)。Fable 5 在软件工程、知识工作、视觉、科研等几乎所有测试基准上达到 SOTA,Stripe 称其将数月工程压缩至数天,FrontierCode 评分居前沿模型之首,可仅凭截图重建网页应用源码。Mythos 5 在药物设计中实现约 10 倍加速,其分子生物学假说盲测获科学家偏好的概率约 80%。两模型售价均为 $10/百万输入 tokens、$50/百万输出 tokens,较 Claude Mythos Preview 降价过半。Fable 5 在部分敏感主题上回退至 Claude Opus 4.8,安全触发率低于 5% 的会话。Mythos 5 通过 Project Glasswing 向网络安全防御者开放。

    推荐理由:Anthropic把最危险的模型安全地放出来了,Fable 5在编码、科研上不是小数点级别的提升,价格还砍半,95%的请求直接跑满血版,必读。

6月8日周一
  1. X:小米 MiMo (@XiaomiMiMo)82

    小米 MiMo-V2.5-Pro-UltraSpeed 突破 1,000 tokens/s,单台 8-GPGPU 节点运行 1T MoE 模型

    小米 MiMo 联合 TileRT_AI 发布 MiMo-V2.5-Pro-UltraSpeed,首次在 1 万亿参数 MoE 模型上实现超过 1,000 tokens/s 输出速度,仅用单台标准 8-GPGPU 节点(非 Cerebras 或 Groq 方案)。提供限时免费聊天体验,UltraSpeed API 价格为 3 倍,输出体验提升约 10 倍。申请时间为 6 月 8 日至 23 日(PDT),企业可邮件联系 [email protected]。

    推荐理由:小米用单节点8卡标准GPU在1T MoE模型上跑出1000+ tokens/s,没有走晶圆级或专用芯片的路子,直接把推理成本门槛拉低了一大截,做实时对话和Agent的可以申请免费聊天先上手感受一下。

  2. X:面壁智能 OpenBMB (@OpenBMB)75

    VoxCPM2 技术报告发布

    面壁智能 OpenBMB 发布 VoxCPM2 技术报告。该模型为最新语音生成模型,拥有 2B 参数,基于超 200 万小时多语言语音数据训练,支持 30 种语言和 9 种中文方言。具备自然语言语音设计、可控及高保真延续性语音克隆能力。技术报告涵盖架构设计、统一序列公式、AudioVAE 高保真语音重建、大规模训练评估,以及零样本和指令跟随 TTS 基准结果。采用 16kHz 语义编码 + 48kHz 波形重建,在公开 TTS 基准上达到 SOTA 或极具竞争力。模型权重、微调代码和推理工具以 Apache 2.0 开源。

    推荐理由:面壁把语音生成压进2B参数,支持30种语言加方言克隆,还附完整技术报告和Apache 2.0开源,做语音产品的可以直接拉代码跑起来了。

  3. IT之家(RSS)73

    全球首个:高德发布3D原生城市世界模型ABot-Earth0.5

    阿里巴巴旗下高德发布全球首个3D原生城市世界模型ABot-Earth0.5,已建成覆盖190多个国家和地区的3D地图。用户输入卫星图或文字描述,10分钟即可在消费级GPU上生成公里级3D城市,输出可编辑3DGS格式,可直接导入Unity等引擎。制图成本为传统百分之一,效率提升约千倍,可为具身智能、低空经济、应急救援等提供支撑。目前已开放内测,可前往abot-earth.amap.com提交申请。

    推荐理由:第一个把分钟级 3D 城市重建拉进消费级 GPU 的世界模型,成本打到了传统方案的百分之一,对具身智能和低空经济是底层能力补全,值得内测试试。

  4. Apple Machine Learning Research(RSS)79

    苹果发布第三代 Apple Foundation Models(AFM)

    苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。

    推荐理由:Apple与Google罕见联手推出的第三代基础模型,直接为下一代Siri和系统级AI功能铺路,标志着消费级AI的深度整合,产品经理和iOS开发者必须关注。

6月7日周日
  1. MarkTechPost(RSS)73

    Harness-1:基于强化学习训练的有状态搜索20B检索子智能体

    UIUC与Chroma联合推出Harness-1,一个20B参数的检索子智能体。它通过强化学习在一个有状态搜索框架中训练,该框架维护候选池、重要性标注集、证据图和验证记录,由策略决定搜索、筛选、验证及停止的时机。Harness-1在8个基准测试上达到0.730平均curated recall,比下一个最佳开源子智能体高出11.4个百分点,仅落后于Opus-4.6。模型权重和框架代码均已公开。

    推荐理由:UIUC和Chroma放出的这个20B检索子代理,用RL训练出了0.73的平均召回,把开源竞品甩开11.4分,只比Opus-4.6低一点。权重、Harness全开源,搞RAG的可以真刀真枪试试了。

6月6日周六
  1. X:Google AI for Developers (@googleaidevs)72

    谷歌发布 Gemma 4 QAT 检查点,支持消费级 GPU 和移动设备本地运行

    谷歌发布 Gemma 4 量化感知训练 (QAT) 检查点,支持在消费级 GPU 和移动设备上本地运行,质量损失极小。新检查点提供 GGUF(Q4_0)格式,覆盖所有尺寸及起草模型,实现最佳本地性能。自定义移动模式采用混合精度方案,将 Gemma 4 压缩至 1GB 以下,包含 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练中模拟压缩(而非训练后量化),大幅降低内存占用并加速解码,同时保持推理质量。

    推荐理由:Gemma 4 的量化版把模型压到 1GB 以下,手机本地跑大模型的门槛又低了一大截。Google 这次没用传统的训练后量化,而是把压缩直接嵌进训练里,效果比 PTQ 好一截,搞端侧部署的可以拿 checkpoint 试起来了。

6月5日周五
  1. X:Elon Musk (@elonmusk, xAI)67

    Grok模型更新:更自主更准确

    更新后的 Grok-build 模型(仍是 0.5T 那个)比以前好很多。它不那么偷懒、更自主、更准确。我们仍在改进长时任务。请期待并在我们漂亮的 TUI 中使用新的使用限制!🚀

    推荐理由:马斯克亲口确认Grok模型更新,虽然还是0.5T参数,但改进后更自主、更准确,做长期任务的开发者可以看看。

  2. 公众号:京东JoyAI72

    京东开源JoyAI-Echo长音视频生成框架

    6月3日,京东开源JoyAI-Echo框架,解决长视频生成中角色身份崩坏、音色突变和生成缓慢三大难题。该框架通过跨模态音视频记忆库保持5分钟内角色外观与音色一致,记忆驱动后训练结合DMD技术带来约7.5倍推理加速。新增Director Agent支持自然语言对话式局部修订,无需重跑整条视频。配套轻量化实时超分模块,支持736×1280→1152×1920及1472×2560两档分辨率。评测集显示,语音内容准确率0.8646,用户偏好多项领先。代码与权重已开源至GitHub。

    推荐理由:长视频生成一直被角色崩塌和龟速生成卡死,JoyAI-Echo 开源给出了角色一致性方案和 7.5 倍加速,Director Agent 对话式编辑的思路很先进,做 AI 视频的朋友可以直接去 GitHub 开跑。

  3. X:Google AI for Developers (@googleaidevs)70

    Google Magenta RealTime 2 (MRT2) 实时音乐模型发布

    Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。

    推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日周四
  1. X:硅基流动 SiliconFlow (@SiliconFlowAI)72

    Nex-N2-Pro 发布:基于 Qwen3.5 的 397B MoE 推理模型,性能达 GPT-5.5 水平

    neolab 推出 Nex-N2-Pro,基于 Qwen3.5-397B-A17B,总参数 397B 的 MoE 推理模型,支持 262K 上下文与多模态(VLM),性能达到 GPT-5.5 和 Claude Opus 4.7 级别。模型可自动调节推理深度,减少 30-50% 思考 token 且无性能折损,在 Terminal Bench 2.1、GDPVal、SWE-Verified 上取得 SOTA。擅长智能体编码、深度搜索和工具使用,兼容 Claude Code、Cursor 等工具。硅基流动已提供 T+0 支持,前两周免费使用。

    推荐理由:后训练模型能直追 GPT-5.5 和 Claude 4.7,免费两周,对做 agent 和 deep search 的人来说是难得的低成本试错机会。

  2. X:商汤 SenseTime (@SenseTime_AI)69

    SenseNova U1 开源统一模型:原生图文生成

    商汤 SenseTime 推出 SenseNova U1 开源多模态模型,实现原生理解与生成文本和图像,可一键将提示词转化为专业信息图。该模型被开发者 @gurru_tech 评价为“非常令人印象深刻”。项目已开源,提供 SenseNova Studio 在线试用,并公开 HuggingFace 模型集合、GitHub 源码仓库及 Discord 社区入口。

    推荐理由:商汤这回把图文统一模型开源了,SenseNova U1的infographic功能比市面上大多数文生图工具更懂文字和布局,做内容的朋友可以上手试试。

  3. X:阶跃星辰 StepFun (@StepFun_ai)77

    阶跃星辰 Step 3.7 Flash 在 Fireworks AI 上架

    阶跃星辰的 Step 3.7 Flash 已上架 Fireworks AI。该模型为 198B 稀疏 MoE 多模态大模型(VLM),含 196B 语言骨干和 1.8B 视觉编码器,从设计之初优化推理效率,采用硬件友好架构与 MTP 辅助解码,速度达 400 tokens/s。具备原生多模态理解与行动、可靠工具使用、增强搜索能力,面向真实智能体工作负载,采用 Apache 2.0 开源许可。

    推荐理由:198B稀疏MoE加MTP解码把速度推到400 tok/s,还开源Apache 2.0,这规格做agent的大脑正合适,做实时应用的可以试试手。

  4. X:Elon Musk (@elonmusk, xAI)73

    Grok Imagine 1.5制作《伊利亚特》预告片

    伊利亚特(特洛伊)预告片由刚刚发布的 Grok Imagine 1.5 制作

    推荐理由:Elon 亲自演示 Grok Imagine 1.5,生成的《伊利亚特》预告片质感让我觉得视频生成赛道又要卷一轮,做短片的可以盯一下。

  5. X:Elon Musk (@elonmusk, xAI)72

    Grok Imagine视频生成上线Vercel

    Vercel 的 AI Gateway 上现已推出 Grok Imagine Video 1.5。该服务支持图生视频并同步音频,一次性完成。示例代码: `await generateVideo({ model: 'xai/grok-imagine-video-1.5-preview', prompt: 'a rabbit sprinting through nyc' });`

    推荐理由:Grok Imagine Video 1.5 把同步音频塞进了图生视频,一条 prompt 直接出带声短片,做短视频和创意的可以换上这条流水线了。

  6. vLLM 官方博客(RSS)61

    NVIDIA 发布开源推理模型 Nemotron 3 Ultra,vLLM 提供 Day-0 支持

    NVIDIA 发布开源模型 Nemotron 3 Ultra,采用 Hybrid Transformer-Mamba MoE 架构,总参数 550B、激活 55B,上下文最长 1M token,主打长时程自主智能体工作流,vLLM 提供 Day-0 支持。

    推荐理由:原文给出架构细节、部署配置和与 GLM 5.1、Kimi K2.6、Qwen3.5 的基准对比,读者可据此评估其在长时程智能体工作流中的适用性。

  7. X:Greg Brockman (@gdb)71

    GPT-Rosalind 重大升级,提升药物发现智能

    GPT-Rosalind 重大升级,药物发现、分析、设计和实验工作流的智能大幅提升:

    推荐理由:OpenAI 把 GPT-5.5 的 agentic coding 能力塞进了生命科学专用模型,制药行业的老铁们可以关注一下,可能比通用模型更懂实验设计。

  8. X:MiniMax (@MiniMax_AI)78

    MiniMax M3联袂Mem0推持久记忆AI

    Mem0 是 MiniMax M3 的官方启动合作伙伴! M3 的 1M token 上下文窗口 + @mem0ai 的记忆层 = 真正记住的 AI 应用。 构建具有持久记忆的个性化 AI 智能体,现在启动周内 M3 享五折优惠。 开始使用 Minimax → https://platform.minimax.io/docs/guides/models-intro 注册 mem0 → http://app.mem0.ai/?utm_source=minimax_x_post

    推荐理由:MiniMax 把 1M 上下文和 Mem0 记忆层绑在一起,不是单纯秀参数,是给 Agent 装了个硬盘,做长期记忆产品的该关注一下。

  9. X:Sundar Pichai (@sundarpichai)73

    Gemma 4 12B发布:笔记本本地运行的多步推理模型

    Gemma 4 系列累计下载量突破1.5亿次,Google随之推出新成员Gemma 4 12B。该模型仅12B参数,可在16GB VRAM笔记本上本地运行,兼顾尺寸与性能,支持多步推理和智能体工作流。采用Apache 2.0开源许可,供社区使用。

    推荐理由:Gemma 4 12B 把多步推理塞进笔记本能跑的尺寸,Apache 2.0 开源,对想做本地 agent 的开发者是实实在在的新弹药,小模型的可用性正在逼近临界点。

  10. X:Demis Hassabis (@demishassabis)74

    Gemma 4 12B 发布:150M+ 下载量里程碑,16GB VRAM 本地运行

    Demis Hassabis 宣布 Gemma 4 系列下载量突破 1.5 亿,并正式发布新版 Gemma 4 12B 模型。该模型是一个统一的、无编码器的多模态模型,兼具边缘端效率与高级推理能力。尽管参数规模仅为 12B,但性能强劲,且足够小巧,可在仅需 16GB VRAM 的笔记本上本地运行。采用 Apache 2.0 开源许可证,方便开发者自由构建。

    推荐理由:Gemma 4 12B 用 Apache 2.0 许可把多模态模型压进笔记本,16GB 显存就能跑,端侧智能的性价比又一次被 Google 拉高,做本地推理的可以马上试试。

  11. X:Krea AI (@krea_ai)74

    Ideogram v4.0 发布:2K 分辨率和 JSON 提示支持

    介绍 Ideogram v4.0。 原生 2K 分辨率,出色的文字渲染,支持 JSON 提示词。 立即在 Krea 中体验。

    推荐理由:图像生成模型的军备竞赛又添一员,Ideogram v4.0的2k原生分辨率和JSON prompt对接工作流,做设计生成的同学可以直接上手试试。

  12. Hacker News 热门(buzzing.cc 中文翻译)78

    Gemma 4 12B:一种统一的、无需编码器的多模态模型

    Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。

    推荐理由:我觉得Gemma 4 12B最大的变化不是参数大小,而是第一次在开源模型里把多模态直接交给LLM主干处理,没有单独的视觉编码器,这意味着本地多模态应用的延迟和内存占用都会大幅下降,对于在笔记本上做Agent的开发者,这是一个必试的版本。

6月3日周三
  1. X:商汤 SenseTime (@SenseTime_AI)73

    商汤开源SenseNova U1:视觉理解推理生成一体模型

    商汤(SenseTime)开源SenseNova U1模型,宣称实现“看、思考、创作”一体——从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。

    推荐理由:商汤把理解、推理、创作塞进一个模型,而且直接开源,做视觉营销的可以不用再拼凑工具链了。

  2. OpenAI:部署安全与系统卡(网页)66

    OpenAI 发布 GPT-Rosalind-5.5 系统卡,定位生命科学高能力模型并设可信访问门槛

    OpenAI 发布 GPT-Rosalind-5.5 系统卡,该模型从 GPT-5.5 增量训练生命科学相关数据,不再拒绝复杂生物学查询,并以可信访问审查作为主要安全防护。

    推荐理由:系统卡说明了模型训练目标、评测结果与可信访问门槛,读者可以据此了解其在生命科学场景的能力边界和安全机制。

  3. xAI:News(网页)75

    xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)

    xAI 通过 API 发布了图像转视频模型 `grok-imagine-video-1.5-preview`(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。

    推荐理由:xAI的新视频模型从单张图像生成电影级短片,支持自然语言控制运镜和氛围,对视频创作者和开发者是个值得一试的工具。

  4. X:MiniMax (@MiniMax_AI)80

    MiniMax-M3 多模态模型发布,开源权重新SOTA

    MiniMax-M3 在 @ValsAI 排名中位列第六 新的开源权重 SOTA 🚀

    推荐理由:MiniMax 闷声干大事,第一个多模态模型就拿下 open-weight SOTA 和总榜第 6,做多模态应用的可以蹲一下权重。

  5. The Verge:AI(RSS)78

    微软首款高级推理AI模型MAI-Thinking-1发布

    微软在Build 2026上发布了其首款高级推理AI模型MAI-Thinking-1。该模型被定位为“中等规模”,能在“关键”软件工程基准测试中达到领先模型的水平。微软称其完全从头使用干净数据进行训练,未涉及从第三方模型进行知识蒸馏。这标志着微软在自研AI模型上迈出重要一步,此前其主要依赖OpenAI。近期两家公司已重新协商合作协议,关系有所松绑。

    推荐理由:微软自己从头训练的推理模型,不用任何第三方蒸馏数据,这可能是微软系 Agent 和 Copilot 底座更换的信号,值得盯着看。

  6. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Voice-2 语音合成模型,支持 15 种语言与零样本声音克隆

    Microsoft 发布文本转语音模型 MAI-Voice-2,官方称在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升,并列对比偏好测试中 72% 的场景优于 MAI-Voice-1。

    推荐理由:原文给出语言扩展、情感控制、零样本克隆与偏好测试数据,读者可以据此评估它在语音产品里的实际可用性。

  7. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。