Benchmark 领投早期芯片初创公司 Tendrils Compute 新一轮融资
Benchmark 在一场激烈竞争中胜出,领投英国剑桥早期芯片初创公司 Tendrils Compute 的新一轮融资,两轮融资此前均未曝光。知情人士称,该公司已在讨论一轮快速跟进的融资,估值可能超过 10 亿美元。Tendrils 由 Nils Cremer 领导,押注基于 interaction nets 的通用芯片,认为 AI 智能体完成多步推理和工具调用后,CPU 速度可能成为新瓶颈。
Benchmark 在一场激烈竞争中胜出,领投英国剑桥早期芯片初创公司 Tendrils Compute 的新一轮融资,两轮融资此前均未曝光。知情人士称,该公司已在讨论一轮快速跟进的融资,估值可能超过 10 亿美元。Tendrils 由 Nils Cremer 领导,押注基于 interaction nets 的通用芯片,认为 AI 智能体完成多步推理和工具调用后,CPU 速度可能成为新瓶颈。
Modal 宣布其多节点集群 Modal Clusters 正式可用,用户通过 @modal.clustered 装饰器即可创建集群。集群节点间通过 InfiniBand RDMA 通信,速率最高 6.4 Tbps,为 PyTorch 和 NCCL 自动配置,按秒计费。
Neighborhood OPSD(N-OPSD)把局部参数扰动产生的互补参考修正转化为监督,改进数学推理模型的在线策略自蒸馏(OPSD)。在 AIME 2024、AIME 2025 和 HMMT February 2025 上,Qwen3-1.7B、4B、8B 的三基准 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分。
FlexRouter 是显式建模模型互补性的 LLM 路由框架,通过最大化答案覆盖率来选取互补模型集,避免独立打分选 top-k 导致的冗余。它用 DPP 建模路由策略,以失败集边缘化的训练目标直接优化覆盖率,推理时按边际增益贪心选取,无需预设预算即可自适应确定子集大小。在 RouterEval 基准上,其域内与域外任务的覆盖率更高、冗余更低。
Prompt2Skill 是一个仅凭自然语言任务描述构建技能的框架,能从提示词推导任务规范、发现或合成数据集,并通过反思式编辑闭环优化技能。在问答、阅读理解、电子表格操作与数学推理四个领域,它平均比直接提示基线提升 10.8 分,覆盖开源与前沿模型。
SECRET(SourcE-Conditioned RElay sTeering)是一种免训练方法,在 question relay 处抑制跨模态干扰,缓解音视频大语言模型(AVLLM)的源混淆 grounding 幻觉。
过去六个月 GPU 时租价格从 4.40 美元涨到 8.08 美元,而 AI 调用价格仍在下降,文章解释了这两条曲线为何能同时成立。
阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。
OpenRouter 上线 Batch API,把请求打包提交可享受通常为原价 50% 甚至更低的每 token 价格,目前已支持 70 多个模型。官方称两周 beta 期内完成的 230k+ 批次中,完成时间中位数为 7 分钟,90% 在一小时内返回。
Mistral 的 Regional Endpoints 正式可用、Priority Tier 进入公开预览,客户可自选推理在欧洲或美国运行,后者提供承诺服务等级与 SLA。
OpenRouter 上线 OpenAI 的 GPT-5,称其支持 400,000 token 上下文窗口和最高 128,000 输出 token,思考模式下幻觉较 o3 减少约 80%。
推荐理由:给出 GPT-5 三档变体定价与 SWE-Bench Verified 得分,可对照 Claude Sonnet-4 等模型横向比较。
Modal 产品更新:多节点训练集群进入 beta,加 @clustered 装饰器即可调度多主机上的数十块 GPU,并借 3.2 Tbps Infiniband RDMA 随节点数线性扩展。
OpenRouter 发布 Reasoning Tokens 功能,在 Chatroom 和 API 中展示模型的推理步骤,请求时加上 include_reasoning: true,即可从 message 的 reasoning 字段读取推理内容。