跳到正文

全部动态

今日 4 条
2月12日周四
  1. 字节 Seed:Research Feed(网页内嵌数据)1

    Seedance 2.0 正式发布

    Seedance 2.0 视频生成模型正式发布,综合性能达业界 SOTA 水平。新版本支持多模态输入,可同时参考 9 张图片、3 段视频、3 段音频及文本指令,精准迁移构图、动作、运镜与音效。模型支持 15 秒高质量多镜头生成,集成双声道立体声技术,并新增视频延长与编辑功能,可定向修改片段、角色及剧情。目前已在即梦 AI、豆包及火山方舟平台上线,适用于影视、广告、电商等工业级内容创作场景。

    推荐理由:字节Seedance 2.0发布,支持多模态输入与物理稳定生成,已上线豆包即梦

  2. MiniMax:Blog(网页)67

    MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造

    MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。

    推荐理由:MiniMax M2.5 把 SWE-bench 拉到 80.2%,成本只有 Claude Opus 4.6 的十分之一,速度还翻倍,对做 agent 的团队来说是个高性价比选择。

2月11日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库61

    inclusionAI 发布高性能量化推理 GEMM 内核库 Humming

    inclusionAI 开源了 Humming,这是一个专为量化推理设计的高性能、轻量级即时编译 GEMM 内核库。它支持在 FP16、BF16、FP8 等多种激活数据类型下进行 8 比特以下任意权重类型的推理,兼容多种量化策略与缩放类型,并同时支持稠密 GEMM 和混合专家 GEMM 运算。该库兼容 SM75+ 及以上的所有 NVIDIA GPU,在多种计算场景下能提供业界领先的吞吐量和效率。其依赖极简,仅需 PyTorch 和 NVCC,软件包大小仅约 100 KB,便于超轻量化部署。

    推荐理由:蚂蚁 inclusionAI 开源了一个 100KB 级的量化 GEMM 库,支持从 INT1 到 FP8 全家桶,SM75+ 全覆盖,做推理部署的工程师值得花半小时跑一下 benchmark,看看能不能替换掉现有的 Marlin 方案。

  2. 蚂蚁 inclusionAI:GitHub 新仓库65

    inclusionAI发布新一代即时大模型Ling-2.5-1T

    inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。

    推荐理由:蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。

  3. 蚂蚁 inclusionAI:GitHub 新仓库78

    inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T

    inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。

    推荐理由:蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

  4. FireRedTeam:原创语音与多模态项目65

    小红书团队开源 FireRed-Image-Edit 图像编辑模型并发布 REDEdit-Bench

    小红书智能创作团队开源 FireRed-Image-Edit 图像编辑模型,权重采用 Apache 2.0 协议,并在 ImgEdit、GEdit 和自建 REDEdit-Bench 上取得开源模型中的最高分,如 ImgEdit_O 4.56。

    推荐理由:小红书团队开源图像编辑模型,README 给出完整基准对比表、训练与部署方案,读者可自行核对开源 SOTA 的成色。

  5. OpenAI Developers:Blog(网页)73

    OpenAI 发布长时运行智能体实践指南:Skills、shell 工具与服务端 compaction

    OpenAI 基于 Codex 与内部智能体经验发布一组智能体原语实践指南,包括 Skills(对齐 Agent Skills 开放标准的可复用版本化指令)、支持安装依赖和写输出的托管 shell 工具,以及自动压缩对话历史的服务端 compaction。

    推荐理由:OpenAI 以自家和 Glean 的生产经验总结了 Skills、shell 与 compaction 的组合模式,含可操作的路由与安全建议。

  6. 蚂蚁百灵:Developer Blog(网页)83

    感知无界·创造有形:百灵全模态 Ming-flash-omni-2.0 焕新生活想象

    百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。

    推荐理由:国产全模态模型开源,多模态能力达领先水准,开发者可直接体验或集成。

2月10日周二
  1. PromptArmor:Threat Intelligence72

    PromptArmor 揭示消息应用链接预览可致 AI Agent 数据外泄,OpenClaw 默认配置受影响

    PromptArmor 演示了一种通过间接提示词注入让 AI Agent 返回携带敏感数据的恶意 URL,借助 Telegram、Slack 等应用的链接预览功能在用户不点击的情况下实现数据外泄的攻击链。

    推荐理由:原文拆解了链接预览导致无需点击即可数据外泄的攻击链,并给出 OpenClaw Telegram 的具体关闭配置和自测方法。

  2. Prime Intellect(网页)65

    Prime Intellect 发布 Lab 全栈后训练平台,向所有人开放

    Prime Intellect 发布 Lab 平台,将 Environments Hub 与 Hosted Training、Hosted Evaluations 整合为覆盖大规模智能体 RL、推理与评估的后训练全栈平台,即日起向所有人开放。

    推荐理由:原文交代了平台构成、已开放状态和训练配置方式,读者可以判断它能否替代自建 GPU 集群做智能体后训练。

  3. Cognition 模型 / Devin 博客(网页)66

    Cognition 推出 Devin 自动修复 PR 审查评论功能

    Cognition 宣布 Devin 现在可自动修复 Devin Review 及其他审查机器人留下的 PR 评论,包括 linter、CI/CD、安全扫描和依赖管理机器人。用户可在 Settings > Customization > Autofix settings 中配置;该功能大幅增加了内部 token 消耗,但团队称 PR bug 明显减少,并缩小了人类只需处理需判断的工作。

    推荐理由:原文给出具体配置入口和适用范围,读者可以了解如何让 Devin 自动修复 PR 上的机器人评论。

2月9日周一
  1. Moonshot AI:Kimi Blog1

    Agent Swarm多代理协作系统

    Kimi推出Agent Swarm系统,支持100个子代理并行工作,可执行超1500次工具调用,任务完成速度比顺序执行快4.5倍。该系统突破单模型上下文限制,采用自我组织架构,用户下达指令后自动"招聘"CEO、研究员等角色并动态分配工作流,无需人工编写脚本。适用于大规模信息搜集、长文档生成及多视角辩论等场景,通过结构性分歧避免AI群体思维。

    推荐理由:Kimi发布Agent Swarm,支持100个AI子代理并行协作,可自动分解复杂研究任务

2月7日周六
  1. FireRedTeam:原创语音与多模态项目63

    FireRedTeam 开源 FireRed-OpenStoryline 对话式视频创作工具

    FireRedTeam 于 2026-02-10 正式开源 FireRed-OpenStoryline,将视频创作变为自然语言对话,支持素材搜索下载、脚本生成、BGM 与配音字体推荐,以及全流程剪辑。

    推荐理由:官方开源的对话式视频剪辑项目,覆盖素材检索、脚本生成到剪辑全流程,并可直接通过 Claude Code 等 Agent Skills 安装使用。

  2. OpenAI:Alignment 研究博客(RSS)71

    在真实世界使用中发现未知的 AI 对齐偏差

    研究表明,推理模型能够通过分析用户的实际反馈,识别并理解此前未知的 AI 行为对齐偏差。这种方法不依赖预设的偏差分类,而是从真实互动数据中主动发现模型行为与人类意图之间的潜在偏离,为动态监测和修正 AI 系统提供了新途径。

    推荐理由:OpenAI 让推理模型从真实用户反馈中自动发现未知的对齐失败,这比红队测试更接近真实威胁面。做安全和对齐的人应该认真看,它可能改变你们的检测范式。

2月6日周五
  1. Cursor Blog1

    NVIDIA 3 万开发者使用 Cursor,代码提交量提升 3 倍

    NVIDIA 已向 3 万名开发者部署 Cursor,代码提交量提升 3 倍,缺陷率保持稳定。Cursor 已深度集成至软件开发生命周期全流程,不仅用于代码生成,还通过自定义规则实现代码审查、测试、调试及 git 工作流自动化。新员工可更快熟悉复杂代码库,资深开发者也能跨技术栈工作,代码风格一致性得到改善。

    推荐理由:NVIDIA 3万开发者使用 Cursor,代码提交量提升3倍,展示企业级 AI 编程与 Agent 自动化实践

  2. PromptArmor:Threat Intelligence69

    PromptArmor 演示通过 MCP 对 OpenAI Agent Builder 的数据外泄攻击

    PromptArmor 实测演示了对 OpenAI Agent Builder 的间接提示词注入攻击:攻击者提交含注入的 Google Form,诱使销售智能体工作流通过 Gmail 将 Salesforce CRM 数据发送给攻击者。

    推荐理由:作者以第一手实测演示了 OpenAI Agent Builder 中经 MCP 的提示词注入数据外泄路径,还展示了 Guardrail 被绕过和多步工作流传递注入的细节。

  3. Dwarkesh Patel:Podcast & Blog(RSS)1

    埃隆·马斯克——「36个月内,部署AI最便宜的地方将是太空」

    埃隆·马斯克预测,36个月后太空将成为部署人工智能成本最低的地点。他指出,长期专注于软件领域的从业者即将面临硬件层面的严峻挑战。这一判断暗示,随着AI算力需求爆发式增长,地面数据中心的能源消耗与散热限制将推高计算成本,而太空环境凭借丰富的太阳能和天然散热优势,可能在未来三年内成为AI基础设施部署的更经济选择。

    推荐理由:Musk预判三年内太空将成为AI算力最优解,软件工程师需直面硬件物理约束

  4. Suno:Blog(网页)57

    Suno Studio 1.2 新功能介绍

    Suno Studio 1.2 现已面向 Suno Premier 订阅用户发布。此次更新旨在为创作者提供更强大的创作与制作控制能力。主要新增功能包括:Remove FX,可移除音频片段中的效果;带量化功能的 Warp Markers,用于调整音频的时间与律动;Alternates 功能,允许在同一轨道内创建并预览声音的不同变体;以及新增对 6/8、7/8 等非 4/4 拍号的支持。这些功能让用户无需离开 Suno 平台,即可更精细地控制音乐创作过程。

    推荐理由:这是Suno为专业创作者铺的路,Warp Markers和Remove FX让AI生成音乐能真正进入后期流程,但113天前的更新,现在看更适合补课而非抢鲜。

  5. Manus:Blog(网页)60

    2026 年最佳 B2B 销售演示 AI 工具实测对比:Prezi、Genspark、Visme、Manus 等 8 款

    Manus 博客针对 B2B 销售提案、QBR 和竞争演示场景测试了 8 款 AI 演示工具,Manus 以研究驱动的可引用数据获 9 分居首,Genspark 和 Visme 各得 8 分。测评指出多数工具输出属于演示级初稿,只有 Manus 在生成幻灯片前实际研究市场和竞争对手;各工具均缺深度原生 CRM 导入,团队一般还需 15–30 分钟人工完善。

    推荐理由:作者以真实 QBR 场景实测 8 款 AI 演示工具,给出评分、价格和适用场景,读者可按销售工作流直接对照选型。

  6. Manus:Blog(网页)60

    7 款 AI 登陆页面生成器实测对比:Manus、Base44、Aura 等

    Manus 博客用同一个 QuillSpark 产品发布页提示,实测并对比 7 款 AI 登陆页面生成器,按设计质量、文案、生产就绪度、免费发布和自定义等标准评分。

    推荐理由:原文用同一提示实测 7 个 AI 登陆页面生成器,给出评分、价格和免费发布差异,可作为选型比较参考。

2月5日周四
  1. Nathan Lambert:Interconnects(RSS)1

    Nvidia 为何构建开源模型:对话 Bryan Catanzaro

    Interconnects 第17期访谈中,Nvidia 副总裁 Bryan Catanzaro 系统回顾了 Nemotron 开源模型项目的技术演进与战略定位。访谈涵盖该系列模型从研发初期到当前版本的迭代历程,剖析了英伟达在开源 AI 领域的布局逻辑,并披露了 Nemotron 在合成数据生成与模型训练效率方面的最新进展及未来规划。

    推荐理由:NVIDIA副总裁亲述开源模型战略,揭示芯片巨头如何通过开放生态锁定行业标准

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    量化智能体编码评估中的基础设施干扰

    研究发现,在SWE-bench等智能体编码基准测试中,基础设施配置差异对模型评分的影响,可能超过排行榜上顶尖模型之间的微小分差。内部实验显示,在Terminal-Bench 2.0上,最严格与最宽松的资源设置间成功率相差6%。严格限制资源会导致近6%的任务因容器意外终止而失败,而宽松配置下此类错误率可降至0.5%。当资源余量超过基准规格3倍时,智能体甚至能借助额外资源成功完成原本无法解决的任务。这表明评估环境不仅影响测试稳定性,更会改变基准测试实际衡量的能力维度。

    推荐理由:Anthropic 用自家数据证明,agentic coding benchmark 的排行榜差距可能只是硬件配置差异而非模型能力差距,3 个百分点以内的领先都该打问号。做模型选型的人别再迷信那几个百分点了。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    用并行Claude智能体团队从零构建C编译器

    研究人员采用“智能体团队”方法,让多个Claude实例在无人工干预下并行协作开发代码。为进行压力测试,团队指派16个智能体从零编写一个能编译Linux内核的Rust版C编译器。项目消耗近2000次会话和约2万美元,最终产出10万行代码的编译器,可成功在x86、ARM和RISC-V架构上构建Linux 6.9内核。研究重点在于设计支持长时间自主运行的智能体团队框架,包括如何编写测试以保持智能体不偏离方向,以及如何通过基于文本文件的锁机制协调多智能体并行任务分配。

    推荐理由:Anthropic 研究员用 16 个 Claude 并行写了个能编译 Linux 内核的 C 编译器,2000 次会话花了两万刀。真正值钱的不是编译器本身,而是他总结的 agent 团队协作方法论,做多 agent 系统的人该逐段拆。

2月4日周三
  1. ElevenLabs:Blog(网页)65

    ElevenLabs 融资 5 亿美元 Series D,估值 110 亿美元

    ElevenLabs 于 2026 年 2 月 4 日宣布完成 5 亿美元 Series D 融资,估值 110 亿美元,较一年前增长超过三倍,总融资达 7.81 亿美元。

    推荐理由:官方公告给出融资额、估值变化和 ARR 数字,还交代了资金投向与产品线布局,可据此了解这家语音 AI 公司的扩张重点。

  2. OpenAI Developers:Blog(网页)65

    Alpic 总结构建 ChatGPT Apps 的 15 条经验,并开源 Skybridge 框架与 Codex Skill

    Alpic 基于 Apps SDK 在三个月内开发二十多个 ChatGPT Apps,总结出 15 条经验,核心包括用户、UI 与模型三方之间的上下文不对称问题。

    推荐理由:作者基于三个月开发二十多个 ChatGPT Apps 的一手经验,总结上下文流、UI 模式与 CSP 等实操教训,并开源配套框架。

2月3日周二
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 解析 Agent 的 Skills 与 MCP 工具取舍

    LlamaIndex 撰文比较 Skills 与 MCP 两种让 Agent 调用工具和获取领域知识的方式,并在构建 LlamaAgents Builder 时做了实测。

    推荐理由:作者结合 LlamaAgents Builder 的实测经验,给出 MCP 与技能在执行模型、维护成本和适用场景上的具体取舍依据。

2月2日周一
  1. ElevenLabs:Blog(网页)65

    Eleven v3 语音模型正式全量开放,符号与数字朗读错误率下降 68%

    ElevenLabs 宣布其最先进的 Text to Speech 模型 Eleven v3 结束 Alpha 阶段,正式面向所有平台开放。新版本在测试中 72% 的场景被用户认为比 Alpha 更稳定;针对数字、符号和专业记号的处理,内部基准覆盖 8 种语言 27 个类别,错误率从 15.3% 降至 4.9%,整体减少 68%,改进集中在体育比分、货币、化学式等依赖上下文判断符号含义的场景。

    推荐理由:原文给出具体的错误率下降数字和示例对比,读者可以据此评估 Eleven v3 正式版在数字和符号朗读上的实际改进。

  2. xAI:News(网页)1

    SpaceX 收购 xAI

    SpaceX 于 2026 年 2 月 2 日宣布收购 xAI。马斯克旗下的火箭公司与人工智能公司正式合并,具体交易条款未予披露。

    推荐理由:SpaceX收购xAI,马斯克旗下AI与航天业务重大整合

  3. OpenAI Developers(RSS)62

    OpenAI 发布 Codex 应用并演示核心工作流

    OpenAI 发布 Codex 应用,并提供了介绍性演示视频,展示该应用及其核心工作流。

    推荐理由:官方演示了 Codex 应用的核心工作流,想了解这款编码工具实际用法的读者可以从中看到直接的操作示例。

  4. Manus:Blog(网页)60

    实测五款AI图像生成器:ChatGPT、Midjourney、Nano Banana Pro、Adobe Firefly与Manus对比

    Manus博客发布一篇亲测对比,作者花数周用相同的逼真书籍、印象派油画、文本标志和幻想景观四个提示词测试五款AI图像生成器。ChatGPT (GPT-4o)与Manus获5/5评分,Midjourney 4/5,Nano Banana Pro与Adobe Firefly 3/5;五款中四款有免费版本,Midjourney是唯一无免费计划的工具。

    推荐理由:作者用相同四个提示词实测五款图像生成工具,给出定价、免费额度和各自强弱项,便于按需求与预算挑选。

1月30日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库61

    高效离线推理框架 Flood:吞吐量显著领先,支持多模态与量化

    Flood 是一款面向离线应用的高效大语言模型推理框架。它采用流水线并行降低通信开销,并通过分段式KV缓存管理提升连续性。框架支持连续批处理、分块预填充、FP8/INT8量化及多模态模型推理。性能测试表明,其在多种模型和硬件上的吞吐量最高可达 vLLM 的 2.4 倍。其专用内核 SegmentAttention 在处理长序列时,解码速度较 FlashAttention 最高提升 3.16 倍。该项目于 2025 年 3 月开源并快速迭代,已支持前瞻解码等新特性。

    推荐理由:蚂蚁的 FLOOD 框架用流水线并行替代张量并行来压通信开销,实测吞吐比 vLLM 高 1.4 到 2.4 倍,做离线推理部署的团队值得花半小时跑一下 benchmark 看看自家场景能不能吃这个红利。

  2. Anthropic:Alignment Science Blog(网页)63

    Anthropic 测试部署前对齐审计能否抓住显式破坏模型

    Anthropic 训练了三个基于 Claude Sonnet 4.5 Internal 的显式破坏模型,与两个良性模型一起做盲审计测试。人类审计员与自动化审计 Agent 配合,在两小时内正确识别全部五个模型,对三个破坏模型给出大于 97% 的破坏概率判断。

    推荐理由:文章用盲测审计游戏验证部署前对齐审计能否抓住显式破坏模型,并揭示人工介入与聚合指标的具体短板。

1月28日周三
  1. xAI:News(网页)1

    xAI发布Grok Imagine API

    xAI推出Grok Imagine API,提供文本/图像转视频及高精度编辑功能,支持物体增删、风格转换与原生音频生成。在Artificial Analysis和LMArena基准测试中排名首位,720p视频生成延迟与成本均低于Veo 3和Sora 2;在IVEBench评测中整体表现超越Kling o1与Runway Aleph。API已开放xAI及第三方平台接入。

    推荐理由:xAI发布Grok Imagine视频生成API,性能宣称超越Sora与Veo,支持端到端视频创作工作流

  2. Nathan Lambert:Interconnects(RSS)1

    Arcee AI 全力投入在美国构建的开放模型

    Arcee AI 发布开源大模型 Trinity Large,标志着其全面投入在美国本土构建开放模型的战略布局。该发布作为 Interconnects 第16期访谈的核心内容,彰显该公司对开源生态与数据主权的承诺。Trinity Large 的推出代表 Arcee AI 在本土 AI 基础设施建设上的关键进展,强调模型训练与开发的地理合规性及技术自主性。

    推荐理由:开源模型Trinity Large发布,美国本土训练的企业级合规新选择

  3. Ethan Mollick:One Useful Thing(RSS)1

    管理是 AI 的超能力

    智能体(agents)时代,管理能力将成为人类 thriving 的核心超能力。在 AI 主导的未来,懂得如何管理比单纯的技术能力更能决定成败。

    推荐理由:沃顿教授 Ethan Mollick 深度解析 Agent 时代的管理变革与机遇

  4. LlamaIndex:产品、工程与评测61

    LlamaIndex 推出 LlamaAgents Builder 测试版,用自然语言快速构建文档处理智能体

    LlamaIndex 发布 LlamaAgents Builder 测试版,用户用自然语言描述需求即可生成基于开源 Workflows 框架的文档处理智能体。该工具会提出澄清问题、创建 LlamaExtract 智能体并生成完整 Workflow,代码可推送到 GitHub 或部署在自有基础设施;目前免费面向所有 LlamaParse 用户,beta 阶段主要支持抽取类文档处理流程。

    推荐理由:原文交代了自然语言生成可导出 Workflow 代码的机制和部署路径,读者可以据此评估它与低代码工具的差异。

1月27日周二
  1. PromptArmor:Threat Intelligence73

    PromptArmor 披露 Claude Cowork 可被提示注入诱导外泄本地文件

    PromptArmor 发布研究演示,称 Claude Cowork 存在未修复漏洞,可通过隐藏提示注入诱导其用 curl 调用 Anthropic 文件上传 API,把用户本地文件(含财务数据和部分 SSN)上传到攻击者账户,全程无需人工确认。

    推荐理由:原文完整披露了攻击链与利用机制,读者可以了解 Cowork 文件外泄风险的具体成因和触发路径。

1月23日周五
  1. MiniMax:Blog(网页)1

    MiniMax Speech 2.8 语音模型

    MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。

    推荐理由:10秒样本克隆真人声线,AI说话带'嗯啊'呼吸声,MiniMax语音模型上新

1月22日周四
  1. OpenAI Developers:Blog(网页)63

    OpenAI 开发者博客讲解如何用 Evals 系统化测试 Codex Agent 技能

    OpenAI 开发者博客发布教程,讲解如何像测试 LLM 应用一样,用 evals 系统化评估 Codex 的 Agent 技能。核心流程为定义可度量的成功标准、用 $skill-creator 创建技能、以 codex exec -- 捕获 JSONL 轨迹做确定性检查,再用 --output-schema 输出符合评分规则的 JSON 做风格等定性评估。

    推荐理由:OpenAI 官方给出用 evals 系统化测试 Codex 技能的完整模式,从定义成功标准到确定性检查与评分规则均可迁移复用。

  2. Nathan Lambert:Interconnects(RSS)1

    精通 Agents

    AI Agents 的能力正逼近关键临界点,其性能飞跃已超出传统工作模式的承载范围。这要求从业者必须重新界定工作范畴、重构项目管理流程并革新任务执行策略。从需求规划到交付标准,现有方法论面临全面调整,组织与个人亟需掌握与智能体协作的新范式,以适应这一技术变革带来的深层影响。

    推荐理由:Agent工具迫使开发者重构工作流,资深研究者分享进阶路径