Moonshot 发布 Kimi K3,Modal 首日以 460 tokens/s 上线
Moonshot 发布 2.8 万亿参数多模态模型 Kimi K3,具备 1M token 上下文窗口和原生视觉能力,Modal 在发布当天以 460 tokens/s 提供推理。
Moonshot 发布 2.8 万亿参数多模态模型 Kimi K3,具备 1M token 上下文窗口和原生视觉能力,Modal 在发布当天以 460 tokens/s 提供推理。
Thinking Machines 发布通用多模态模型 Inkling,可输入文本、图像和音频并输出文本,Modal 以 Day 0 支持将其作为按 token 计费的 Managed Endpoint 上线。
OpenRouter 为模型页接入 Artificial Analysis 提供的编程、数学、科学与长上下文推理基准分数,并新增 Effective Pricing 标签,按提供商展示含阶梯定价的实际费用。Rankings 页面新增基准散点图与扩展表格,100K–1M token 长上下文请求正在激增。新路由 openrouter/free 可自动为请求选择兼容的全部免费 LLM。
Modal 提出一套面向编码智能体的开发者体验框架,认为人类与智能体同样依赖紧密的反馈循环。框架强调用 CLI、SDK 和 API 提供程序化访问,让错误信息具备可操作性,并以一致、贴近代码的示例作为学习基础。Modal 称这些原则来自服务数千名用户的迭代,其 vLLM 推理示例即体现基础设施与逻辑同处一处。
Modal 产品更新:多节点训练集群进入 beta,加 @clustered 装饰器即可调度多主机上的数十块 GPU,并借 3.2 Tbps Infiniband RDMA 随节点数线性扩展。
OpenRouter 现已支持用 Passkeys 无密码登录,并同步推出多项开发者体验更新。provider 与量化版本新增 slug,便于精确指定 API;模型旁的 Copy 按钮可直接复制含 slug 的 API 调用,文档页也新增了 Copy Page 下拉菜单。由 Mastra 撰写的 TypeScript 智能体编写指南已上线其文档。
OpenRouter 为所有模型上线 :nitro 和 :floor 快捷方式:前者按吞吐量(tokens per second)优先选最快供应商,后者优先选最低价供应商。
OpenRouter 对 finish reasons 进行标准化,内容发布于 OpenRouter Blog。正文未披露涉及的模型、字段细节或生效时间,页面仅说明订阅其邮件简报可获取模型用量数据、产品更新与研究报告,约每周一封,可随时退订。
Modal 宣布所有用户现在都能使用 NVIDIA H100 GPU。按 NVIDIA 基准,H100 对比 A100 最高带来 4 倍训练加速和 30 倍推理加速,单卡 80 GB 显存、每小时 7.65 美元,最多可 8 卡通过 NVLink 互联。在 Modal decorator 中把 GPU 类型设为 “H100” 即可运行,且只按实际用量付费。