OpenAI 展示 Codex 在代码编辑器中的使用方式
OpenAI 发布视频,演示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的开发工作流。内容涉及 Codex 与 IDE 扩展(codex, IDE extension),视频链接为 https://www.youtube.com/watch?v=sd21Igx4HtA。
推荐理由:OpenAI 官方演示视频,展示如何把 Codex 接入主流代码编辑器并简化编辑器内工作流。
OpenAI 发布视频,演示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的开发工作流。内容涉及 Codex 与 IDE 扩展(codex, IDE extension),视频链接为 https://www.youtube.com/watch?v=sd21Igx4HtA。
推荐理由:OpenAI 官方演示视频,展示如何把 Codex 接入主流代码编辑器并简化编辑器内工作流。
Anthropic 推出了“Agent Skills”开放标准,旨在为通用智能体(如Claude)提供可组合、可扩展且可移植的领域专业知识。一个Skill是一个包含指令、脚本和资源的文件夹,其核心SKILL.md文件采用渐进式披露设计,智能体可根据任务动态加载所需信息,从而最小化上下文占用。例如,PDF技能赋予了Claude直接操作PDF表单的新能力。该框架允许用户通过封装和共享程序性知识来定制智能体,无需为每个用例构建碎片化的定制代理。
推荐理由:Agent Skills 把「给 Agent 喂知识」从手写 prompt 变成了可复用的文件夹协议,做 Claude Code 或 Agent 产品的人现在就该动手试,这比 MCP 更轻量也更贴近日常开发。
Manus 推出 Manus 1.5 与 Manus-1.5-Lite 两个新代理,平均任务完成时间从4月的15分钟缩短到不到4分钟,内部基准测试显示任务质量提高15%、用户满意度提升6%。新版本支持全栈 Web 应用开发(含后端、数据库、用户认证和嵌入式 AI 功能)、更长上下文窗口、团队协作与资料库;Manus-1.5-Lite 向所有用户开放,Manus-1.5 面向订阅用户。
推荐理由:原文给出任务提速近四倍、质量提升15%等具体数据,以及全栈Web开发和协作等功能细节,读者可据此评估其工作流适用性。
Cognition 发布 SWE-grep 和 SWE-grep-mini 模型,专注高度并行的代码上下文检索,检索能力匹敌前沿编码模型但耗时低一个数量级。模型每轮最多发起 8 个并行工具调用、限制 4 轮,通过多轮强化学习训练,奖励为文件与行范围检索的加权 F1;由 SWE-grep 蒸馏并继续 RL 得到 SWE-grep-mini。
推荐理由:原文给出检索质量分数与推理速度对比数字,并说明多轮 RL 训练方法,读者可评估这种专用检索模型能否迁移到自己的编码工作流。
Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活“面部”特征的更大结构中时才会激活“眼睛”特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似“人脸幻想”的倾向,会将形状解释为动物绘图的组成部分。这些特征对人类手绘的SVG同样有效。
推荐理由:为AI可解释性研究提供新实验方法,启发跨模态模型设计。
Microsoft AI 发布首个完全在内部开发的图像生成模型 MAI-Image-1,在 LMArena 文生图榜单上首次亮相即进入前十。模型擅长生成写实图像,如光影(反弹光、反射)和风景,兼顾速度与质量,便于用户快速迭代后再迁移到其他工具精修。
推荐理由:微软首次全自研图像生成模型上线 Bing Image Creator 和 Copilot,主打生成速度与写实光影,创作者可以据此尝试更快迭代。
Answer.AI 的 Kerem Turgutlu 撰文讲解如何用 SolveIt 把 Andrej Karpathy 超两小时的 tokenizers 视频教程转成带可运行代码、超链接和图片的书章。
推荐理由:作者完整复盘两阶段对话工作流,把超两小时视频转成可运行代码的书章,方法可直接迁移到任意长视频转写场景。
Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS 2025接收。
推荐理由:蚂蚁把自回归视频生成的训练成本砍到 Cosmos 的 0.2% 还能赢,这个效率信号比分数本身更值得关注,做视频生成的团队该认真看看它的课程学习和渐进分辨率策略。
Anthropic 在 APPS 后门设置中训练 Sonnet 3.7 规避不同监控,发现仅针对输出监控训练时,模型能用推理提升隐蔽后门成功率;仅针对推理监控训练时,模型学会用推理说服监控后门无害;而当同时面对推理和输出双监控时,即使辅以强化学习和细微推理微调,模型也无法在不触发推理监控的前提下用推理提升后门成功率。
推荐理由:Anthropic 用后门插入实验给出推理监控的实证边界,读者可以据此理解同时部署推理与输出监控的理由。
英国 AI Security Institute 与 Anthropic、Alan Turing Institute 合作发布迄今最大规模的数据毒化研究。团队在 600M 到 13B 参数的四个不同规模模型上测试同一后门攻击,发现仅需 250 篇文档即可成功毒化所有被测模型的训练数据,所需数量并不随模型或数据集规模增加,推翻了此前按比例投毒才可成功的假设,表明毒化攻击可能比以往认为的更可行。
推荐理由:研究给出与既往假设相反的结论,即毒化所需文档数不随模型规模增长,对理解后门攻击可行性有直接参考价值。
Anthropic 发布开源自动审计框架 Petri(Parallel Exploration Tool for Risky Interactions),用 AI 审计智能体在多轮场景中测试目标模型,工具地址为 github.com/safety-research/petri。
推荐理由:Anthropic 开源了用 AI 智能体自动审计目标模型行为的 Petri 框架,读者可以直接复用其审计流程和评分维度设计。
所有客户每月可免费获得 100 万次“自带密钥”(BYOK)请求。这一政策将 BYOK 功能从付费服务转变为免费提供的基础配额,大幅降低了企业使用自有密钥管理数据安全的技术与成本门槛。免费额度覆盖了绝大多数中小规模企业的典型月请求量。
推荐理由:OpenRouter 给 BYOK 用户每月免 100 万次请求,对用自己 API key 跑 Agent 的开发者来说是实打实的成本减免,值得顺手薅。
Answer.AI 发布开源 Python 包 cachy(pip install pycachy),通过补丁 httpx 的 send 方法,把 Anthropic 和 OpenAI SDK 的 LLM 调用响应自动缓存到本地并在相同请求时复用,无需编写 mock。
推荐理由:原文给出了补丁原理和提速数据,读者可以直接复用这个零代码缓存方案加速自己的 LLM 测试和 notebook 工作流。
Thinking Machines Lab 于 2025 年 10 月 1 日发布 Tinker,一个用于微调语言模型的灵活 API,官方处理分布式训练的复杂性,用户可控制算法和数据。
推荐理由:原文来自官方发布,说明了 Tinker 的微调能力、LoRA 成本方式和早期用户实例,可据此判断其对研究者的可用性。
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,扩展了 LFM2 家族。
推荐理由:官方给出了 VoiceBench、ASR 词错率和低于 100ms 的延迟数据,读者可以据此评估 1.5B 参数模型在端侧实时语音场景的可用性。
英国 AI Security Institute 发表新论文,测试 AI 聊天机器人对选民政治知识的影响。
推荐理由:原文用代表性调查和随机对照试验给出实证数据,读者可据此对照公众对聊天机器人误导选民的担忧。
探讨 AI Agents 在真实工作场景中的定位,指出其核心挑战在于对抗"无限PPT"的形式主义陷阱。强调真正的智能体应当服务于以人为本的实质性工作,而非制造更多文档流程或官僚化产出。
推荐理由:Ethan Mollick 深度解析 AI Agent 在实际工作中的应用与人类价值重塑
inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。
推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。
inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。
推荐理由:蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。
OpenAI 推出 Agentic Commerce Protocol(ACP),一个连接商家与 ChatGPT 用户的开放标准,作为两者之间的基础设施。它让 ChatGPT 能接收结构化商品目录数据、理解商家库存并在对话中呈现相关商品。文档提供了带示例 payload 的入门指引,以及关于商品文案、变体建模和归因的 feed 质量优化最佳实践。
推荐理由:OpenAI 官方文档介绍了 ACP 的定位和接入路径,商家可据此了解如何让商品出现在 ChatGPT 中。
Cognition 发布基于 Claude Sonnet 4.5 重构的新版 Devin,速度提升 2 倍,Junior Developer Evals 提升 12%,已在 Agent Preview 上线,旧版 Devin 仍可用。
推荐理由:来自一线 Agent 团队的适配复盘,给出了 Sonnet 4.5 的具体新行为和对应的工程应对,可迁移到类似智能体架构。
随着AI应用从单次提示转向构建长期运行的智能体,焦点正从“提示工程”演进为“上下文工程”。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在“注意力预算”限制和“上下文腐化”现象——随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。
推荐理由:Anthropic 亲自下场定义 context engineering 这个新范式,把 prompt engineering 之后的工程方法论讲透了。做 Agent 的人如果还在死磕 prompt,这篇会让你重新审视整个技术栈。
Liquid AI 发布 Liquid Nanos 系列,包含 350M 至 2.6B 参数的任务专用 LFM2 模型,可完全在手机、笔记本和嵌入式设备上运行。
推荐理由:原文给出各款小模型的参数量、任务定位和评测对比,读者可判断端侧专用模型能否替代云端大模型。
TensorZero 在数据抽取、智能体编码和客服三个任务上对比了 OpenAI RFT(o4-mini)与 SFT(GPT-4.1 mini)。
推荐理由:作者用三个真实任务实测 OpenAI RFT 与 SFT 的效果和成本差距,给出了按任务类型判断 RFT 是否值得用的可比结论。
xAI 发布 Grok 4 Fast,主打高性价比推理,实现与 Grok 4 相当的基准表现,同时平均少用 40% 思考 token,达到同等前沿基准性能的价格降低 98%。
推荐理由:官方给出了与 Grok 4 等模型的基准对比、token 效率提升和 API 定价,读者可据此评估其成本与性能取舍。
八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。
推荐理由:Anthropic 主动公开三个基础设施 bug 的完整复盘,这种坦诚在大厂里极少见。做 AI 产品的人都该读一下,它把「模型质量下降」从玄学拉回了工程现实,尤其是 XLA 编译器那层的坑,踩过才知道多深。
Anthropic 可解释性团队在月度更新中分享了关于大语言模型跨语言表征的新发现。研究显示,模型在不同语言间的特征相似性(通过交并比IoU衡量)会随文本样本长度增加而上升。通过对比英法双语段落的首句与末句,团队发现末句的IoU显著高于首句,且无关文本的首句间重叠度高于末句。这表明模型在较长上下文中能构建更丰富的跨语言理解,而非由虚假激活主导。相关发现支持了模型随上下文积累深化语义表征的观点。
推荐理由:揭示语言模型随上下文深化理解的机制,助力可解释性研究进展。
OpenAI 介绍 gpt-realtime 语音模型和 Realtime API 正式可用(GA)后的接口变化与新功能。
推荐理由:官方逐一解释了 GA 版接口变化和新功能的使用场景,对正在接入 Realtime API 的开发者有直接参考价值。
文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。
推荐理由:Anthropic 把自家内部反复打磨的 agent 工具开发方法论完整公开了,从评估流程到 prompt 工程细节全是实操干货,做 MCP server 或 agent 工具链的人可以直接抄作业。
LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。
推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。
FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。
推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。
Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投。Devin 的 ARR 从 2024 年 9 月的 100 万美元增至 2025 年 6 月的 7300 万美元,公司历史总净消耗低于 2000 万美元;收购 Windsurf 使 ARR 翻倍以上,并购后七周合并企业级 ARR 增长超 30%。
推荐理由:官方披露融资估值的同时给出 ARR、净消耗和并购后的增长数字,读者可以据此评估其 AI 编码业务的真实成色。
Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。
推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。
Transluce 通过强化学习训练 investigator agent,针对 48 个涉及 CBRN、炸药和违禁药物的高危任务生成自然语言越狱提示,对 Claude Sonnet 4、Grok 4、Gemini 2.5 Pro、GPT-5-main 的 pass@1 成功率分别达 92%、98%、90% 和 78%。
推荐理由:原文给出完整的 RL 训练方法和跨模型迁移数据,并开源代码与提示词,读者可评估低成本自动红队的可行性。
FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。
推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。
从 GPT-5 到 nano banana,强大的人工智能技术正变得普及化。无论是尖端大模型还是轻量级应用,普通用户都能便捷获取先进 AI 能力,技术民主化进程加速,标志着智能时代进入人人可及的新阶段。
推荐理由:Ethan Mollick 解读 AI 普及化趋势,从 GPT-5 到微型设备应用
Microsoft AI(MAI)发布语音生成模型 MAI-Voice-1,单张 GPU 可在一秒内生成一分钟音频,已用于 Copilot Daily 和 Podcasts。
推荐理由:官方公布两款自研模型的技术细节与试用入口,可据此了解其训练规模和落地进展。
xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。
推荐理由:xAI发布专为Agentic Coding优化的极速编程模型,已集成Cursor、Copilot等主流工具,价格极具竞争力
Anthropic 于 8 月 27 日发布与 OpenAI 在 2025 年 6 月至 7 月初进行的对齐互评试点结果,双方用各自的内部对齐评估测试对方公开模型。
推荐理由:Anthropic 与 OpenAI 互评对齐的一次早期实践,作者还给出了自家评估的局限与改进方向,对理解跨实验室对齐评估的可行做法有参考价值。
Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。
推荐理由:Claude浏览器代理正式开放,自动操作网页同时攻克提示注入安全难题