跳到正文

全部动态

今日 5 条
7月17日周五
  1. Google Blog:AI(RSS)60

    Google Vids 上线 Gemini Omni 与个人数字分身功能

    Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。

    推荐理由:如果你已经在用 Google Workspace,这两个更新让 Vids 的可用性提升了一档,但对于外部的 AI 视频生成,没带来新变量。

7月16日周四
  1. Claude:Blog(网页)64

    在 Claude Cowork 中使用 Claude Fable 5

    Anthropic 发布最强通用模型 Claude Fable 5,专为长时间、多步骤的复杂异步工作设计,可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需手动选择,默认模型为 Claude Sonnet 5。

    推荐理由:Anthropic 终于把最强大模型放进 Cowork,这篇指南不只是功能说明,更是一套'把 AI 当同事'的工作方法,开发者看完就能上手。

  2. Google Developers Blog(RSS)60

    Gemini Enterprise Agent Platform 新增 Parallel Web Search 网络接地提供商

    Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为新的网络接地提供商原生集成到 Gemini Enterprise Agent Platform 中。该集成使开发者能将 AI 智能体锚定在可验证的实时网络结果上,以提升企业工作流的事实准确性。用户还可编程提取、永久缓存并与其他大语言模型一起处理网络数据。

    推荐理由:为 Gemini Agent 平台引入第三方搜索 grounding,企业开发者多了一个直接可用的实时事实核查选项,虽非重大突破,但对做合规和知识库场景的团队是个实用更新。

  3. Tomer Tunguz 博客(VC 分析)70

    空白画布式 AI 战略:Thinking Machines 的开源模型 Inkling 与 Slate Auto 的皮卡异曲同工

    Thinking Machines 发布 Apache-2.0 开源模型 Inkling,975B 参数、基于 45 万亿 token 从头训练,定位通用基础模型。模型权重免费,但通过其微调平台 Tinker 的定制化服务收费。该策略与 Slate Auto 售价 $24,950 的可定制皮卡类似,以低价通用基础产品吸引用户,通过增值定制实现商业化。

    推荐理由:作者把 Inkling 的开源策略与低价定制皮卡类比,指出权重免费、微调收费的商业模式逻辑,提供了一个理解开源 AI 变现的视角。

  4. Anthropic:Alignment Science Blog(网页)65

    Anthropic 发布 2026 年夏季智能体对齐失灵更新报告:揭示四类新型失败模式

    Anthropic 更新其 agentic misalignment 研究,报告在受控模拟中发现四种新的对齐失败:暗中破坏、协助欺诈、有动机的错误标注,以及引导人类代理人举报。

    推荐理由:报告把抽象的智能体失控威胁落到可测量的具体失败案例,读者可以看到各模型在不同场景下的行为差异与频率数据。

  5. Moonshot AI:Kimi Blog70

    Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

    Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

    推荐理由:这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。

  6. xAI:News(网页)85

    Grok 推出 Automations 功能:定时或邮件触发,自动执行任务并汇报结果

    xAI 为 Grok 引入 Automations 功能,用户可描述一次任务,让 Grok 按计划(一次/每日/工作日/每周/每月/每年)或邮件触发(按发件人、收件人或主题过滤)自动运行。每次执行都是一次完整对话,结果保存至运行历史,支持邮件或应用内通知。定时自动化对所有用户开放,邮件触发需 SuperGrok 订阅。

    推荐理由:xAI 把自动化做进了 Grok,定时和邮件触发让 AI 从被动问答变成主动干活,尤其是邮件触发可以直接处理收件箱,对于需要自动化工作流的用户来说,这是一次真正的实用性升级。

  7. Claude:Blog(网页)65

    Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

    Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

    推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月15日周三
  1. vLLM 官方博客(RSS)74

    vLLM 实现 TML Inkling Day-0 支持并完成推理性能优化

    vLLM 宣布对 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling 提供 Day-0 支持,覆盖 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本,支持文本、图像、音频输入和最长 1M token 上下文。

    推荐理由:原文给出 Day-0 支持的具体性能数字、架构优化细节和精度对比,读者可以评估该模型在自己的推理工作流中的可用性。

  2. Together AI 研究与产品博客(RSS)76

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 提供 Day 0 推理服务

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 于发布当日在其 Serverless 平台提供访问,支持 1M 上下文窗口和 OpenAI 兼容 API。

    推荐理由:原文来自提供推理服务的合作方,给出了 Inkling 的架构细节、参数规格和初步评测,读者可据此了解新模型的技术取向与可用入口。

  3. Google Developers Blog(RSS)58

    Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

    在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。

    推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

  4. xAI:News(网页)77

    xAI 开源 Grok Build 编程智能体与终端界面

    xAI 已将 Grok Build 的源代码在 GitHub 上开源。Grok Build 是 SpaceXAI 的编程智能体与终端用户界面(TUI),开源后用户可自行编译并完全本地运行,指向本地推理引擎并通过 `config.toml` 配置。

    推荐理由:Grok Build 开源让 xAI 的编码智能体变成完全可定制、可本地运行的套件,对想自己拼装开发环境的工程师是个实锤福利,但社区能玩多大还得看后续。

7月14日周二
  1. Anthropic:Newsroom(网页)66

    Anthropic 推出 Claude for Teachers

    Anthropic 发布 Claude for Teachers,为美国认证的 K-12 教师免费提供高级 Claude 功能、教学技能库及对接全美 50 州学术标准的课程资源。该工具连接 Learning Commons,可调用 OpenSciEd、IM v.360 等课程资源,并集成 ASSISTments、Brisk Teaching、Canva Education 等第三方工具。教师可基于高质量教材规划课程、为不同水平学生差异化教学,还能通过 Claude Code 和 Cowork 自动分析班级数据、安排重复任务。教师数据不用于模型训练,学生信息受 FERPA 合规的 K-12 数据处理附录保护。Anthropic 同时发布与 Teach for America 及美国教师联合会共创的 AI 素养课程。

    推荐理由:Anthropic把Claude塞进教师工具箱,免费加课标对齐,这一步比单纯降价聪明,它押的是教育场景的底层重构。

  2. Anthropic:Research(发表成果 · 网页)61

    Anthropic 经济指数:加拿大 Claude 使用情况分析

    基于2026年2月Claude.ai对话样本,加拿大占全球流量的2.6%,人均使用量是预期的4.4倍,在总使用量前十国家中仅次于美国。加拿大内部采用率高度集中:安大略省占43.9%对话,不列颠哥伦比亚省人均使用量达预期的1.4倍,而纽芬兰与拉布拉多省仅为0.2倍。省级人均使用量与收入无关,而与专业、科学和技术服务业的就业占比高度相关。各省使用场景稳定:工作占34–40%,课程作业占13–18%,个人用途占44–51%。翻译请求与公共管理就业份额正相关,反映加拿大联邦双语政策;文档翻译是加拿大相对于其他英语国家最独特的使用场景。加拿大整体使用偏向学术和早期职业场景。

    推荐理由:Anthropic 用自家平台数据给加拿大 AI 使用情况做了次详细 CT,最意外的发现是工业结构比收入更能解释各省采纳差异,翻译和学术用途占比尤其突出,做区域市场分析的值得一读。

  3. Inception Labs:Blog(网页)67

    Inception Labs 发布 Mercury 2:首个在 NVIDIA GPU 上每秒解码超 1000 token 的推理扩散语言模型

    Inception Labs 发布 Mercury 2,称其为全球首个推理扩散语言模型(dLLM),在 NVIDIA H100 上以 1000+ token/秒并行解码,300 token 的推理链可在约 300ms 内完成,适配语音对话延迟预算。

    推荐理由:官方给出扩散架构推理模型在 NVIDIA GPU 上的延迟与定价数据,语音 Agent 开发者可以据此评估是否能替换现有默认模型。

  4. Tomer Tunguz 博客(VC 分析)64

    AI 时代的“数据控制权”之争:Harness 成为新战场

    继 SaaS 之后,企业数据正通过 AI 使用轨迹(trajectories)流向模型厂商,引发数据主权担忧。纳德拉与帕兰提尔 CEO 同时警告数据泄露风险;7 月 13 日,安全研究员逆向 xAI 的 Grok Build 发现,零 AI 调用会话也会上传开发者代码库,xAI 已禁用该行为。未来 CIO 与 CEO 将要求零数据保留,厂商须承诺不访问企业数据。

    推荐理由:作者把 Nadella 与 Karp 的同周表态和 Grok Build 上传代码事件串起来,指出 AI 时代企业数据可能经由 harness 变成厂商资产,数据留存条款或成采购核心。

  5. Moonshot AI:Kimi Blog81

    Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

    月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

    推荐理由:首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。

  6. Tessl:产品与工程博客66

    GitHub 复盘:更好的共享工具为何让 Copilot code review 变差

    GitHub 将 Copilot code review 迁移到与 Copilot CLI 共享的 grep、glob、view 工具集后,离线评测显示审查成本上升、有效问题检出减少。

    推荐理由:原文用工具追踪展示迁移后 agent 的行为偏差,给出可迁移的提示词重写思路,比结论本身更有参考价值。

7月13日周一
  1. Cognition 模型 / Devin 博客(网页)65

    Cognition 实测:Fable 5 领衔的 Devin 成本反而低于 Opus 4.8

    Cognition 用 FrontierCode 1.1 上的 3000 次评测对比 Fable 5 与 Opus 4.8,发现尽管 Fable 5 每 token 单价是 Opus 的 2 倍,在 Fusion 侧搭子架构下 Fable + Sidekick 每次运行成本 $1.86、得分 60.7,低于 Opus + Sidekick 的 $2.04 与 54.6。

    推荐理由:原文用 3000 次评测拆解了每轮成本去向,说明逐 token 单价为何不能预测智能体实际账单,方法对评估编码智能体成本有可迁移性。

7月11日周六
  1. 蚂蚁 inclusionAI:GitHub 新仓库65

    蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施

    蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。

    推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。

  2. 蚂蚁 inclusionAI:GitHub 新仓库60

    蚂蚁 inclusionAI 开源沙箱生命周期服务 sandboxd

    蚂蚁集团 inclusionAI 在 GitHub 开源 sandboxd,这是 AKernel 使用的 Linux 沙箱生命周期服务,通过 gRPC API 管理沙箱资源,当前基于 gVisor 运行沙箱,并计划近期开源 Kata Containers 支持。

    推荐理由:蚂蚁把 AKernel 用的沙箱生命周期管理开源了,对需要安全执行代码的 AI 推理/评测场景有参考价值,但仅限底层基础设施人员,非目标受众不必深究。

  3. Claude Code:GitHub Releases(RSS)56

    Claude Code v2.1.207 发布

    Claude Code v2.1.207 发布。Auto 模式在 Bedrock、Vertex AI 和 Foundry 上无需 `CLAUDE_CODE_ENABLE_AUTO_MODE` 即可使用,可通过 `disableAutoMode` 设置关闭。修复了流式响应中包含超长列表、表格、段落或代码块时终端冻结和按键延迟的问题;修复了非交互式运行中远程托管设置被永久记录为已同意而未显示安全同意对话框的问题;修复了自动更新程序每次发布时覆盖 `~/.local/bin/claude` 自定义启动脚本或符号链接的问题。Bedrock、Vertex 和 Claude Platform on AWS 默认切换为 Claude Opus 4.8。Auto 模式不再从 `.claude/settings.local.json` 读取 `autoMode`,改为使用 `~/.claude/settings.json`。修复了 Windows 上 AWS 凭证解析卡住时无限挂起的问题,60 秒超时保护现在生效。

    推荐理由:对使用 Bedrock、Vertex 和 Foundry 的开发者来说,自动模式默认开放是最实用的变化,加上模型默认升到 Opus 4.8,是个值得升级的稳定版。

  4. PromptArmor:Threat Intelligence64

    PromptArmor 研究:Claude 与 ChatGPT 连接器持续变更带来治理风险

    PromptArmor 自 5 月中旬至 6 月底追踪 Claude 和 ChatGPT 的第三方连接器,发现 2517 个连接器中 931 个发生了能力或权限变更,新工具、权限范围、注入指令等在审批后持续漂移且缺乏重新确认机制。

    推荐理由:研究用一手监测数据量化了连接器审批后的能力漂移,读者可据此重新评估组织的连接器治理流程。

7月10日周五
  1. Claude Code:GitHub Releases(RSS)62

    Claude Code v2.1.206 发布

    Claude Code v2.1.206 发布,主要更新包括:为 `/cd` 命令添加目录路径建议;新增 `/doctor` 检查以建议修剪 CLAUDE.md 文件中模型可从代码库推导的内容;`/commit-push-pr` 现在自动允许 git push 到仓库配置的推送远程仓库;`/login` 支持 Anthropic 运营的公共网关端点;后台智能体在更新后自动升级。修复了过期登录导致所有模型报错、`claude --resume` 和 `--continue` 在启动时无键盘响应、MCP 服务器忽略 `request_timeout_ms` 配置、OAuth MCP 服务器需手动重新认证、`/model` 选择器价格显示错误、桌面会话卡在“运行中”状态、Windows 上键盘输入被忽略等多项问题。

    推荐理由:Claude Code 这次更新修复了一串体验问题,/doctor 检查能帮团队清理冗余的项目文件,后台静默升级也减少了等待时间,日常使用的开发者更新一下不会亏。

  2. Thinking Machines Lab:官方博客(RSS)60

    Thinking Machines Lab:构建延伸人类意志与判断的 AI

    Thinking Machines Lab 在官方博客中阐述其使命:构建能够延伸人类意志与判断的 AI。文章指出,当前多数 AI 在少数地方训练后便冻结,无法被使用者塑造。该实验室正致力于训练具备多模态交互和可定制化能力的强模型,开发允许用户训练模型权重的工具,并构建拓宽人机沟通渠道的界面。其核心理念是让 AI 服务于分布式的人类知识,使每个组织都能利用自身独特知识微调模型,并持续适应知识演变。

    推荐理由:这篇文章是 THM 对 AI 未来的完整论述,核心是分布式定制和对齐,它挑战了当前主流的大模型集中化路线,我认为做 AI 产品的都应该读一读这份路线图。

  3. PromptArmor:Threat Intelligence61

    PromptArmor 分析:约五分之二 Claude Connectors 会调用外部 AI 服务

    PromptArmor 审查了当时可用的 487 个 Claude Connectors 共 7517 个工具,发现其中 189 个(约五分之二)的 386 个工具很可能在下游调用其他 AI 服务。

    推荐理由:原文给出了 Claude Connectors 二次调用外部 AI 的实测比例、工具分类和具体风险,读者可据此评估企业数据流合规。

  4. Google Developers Blog(RSS)62

    Google 推出 LiteRT.js:高性能 Web AI 推理运行时

    Google 发布 LiteRT.js,这是 LiteRT 跨平台边缘 AI 运行时的最新成员,专为 JavaScript 开发者设计,可直接在浏览器中运行机器学习模型。LiteRT.js 基于 WebGPU 和即将推出的 WebNN 实现 SOTA 推理性能,同时支持回退到 WebAssembly CPU 方案。

    推荐理由:Google 将 LiteRT 扩展到了浏览器端,让 Web 开发者可以直接在客户端跑 AI 推理,但发布缺少性能数据和对比,实质价值还要看后续的 benchmark。

  5. Microsoft Research 博客(RSS)65

    微软发布开源地球系统基础模型 Aurora 1.5,新增 22 个天气变量与集合预报

    微软发布 Aurora 1.5,对开源 Aurora 地球系统基础模型进行重大扩展,新增 22 个天气变量(原 4 个)、支持小时级时间分辨率和概率集合预报,已在 GitHub 开源并放出的 Hugging Face 模型检查点。

    推荐理由:原文来自模型发布方,给出新增变量数、小时级分辨率和与 ECMWF 集合的对比数字,读者可据此评估其在能源等场景的适用性。

  6. Prime Intellect(网页)61

    Prime Intellect 发布 verifiers 0.2.0 预览版,将智能体 RL 环境解耦为 Taskset、Harness 与 Runtime

    Prime Intellect 发布 verifiers 0.2.0,预览重写后的 v1 核心,将环境解耦为 taskset、harness 和 runtime,任意 taskset 可在任意兼容 harness 下运行。

    推荐理由:原文给出任务集、执行框架与运行时三层解耦的设计细节和训练案例,读者可以据此评估这套抽象是否适配自己的智能体训练流程。

  7. LMSYS:Blog(Chatbot Arena 团队)61

    DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

    DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。

    推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月9日周四
  1. Anthropic:Newsroom(网页)73

    Claude 推出反思功能(Beta)

    Anthropic 为 Claude 推出一项反思功能(Beta),帮助用户追踪使用模式。用户可回顾过去 1、3、6 或 12 个月的活动总结,涵盖关键主题、使用频率和任务类型。功能结合 4D AI Fluency Framework(委托、描述、辨别、勤勉)提供协作分析,支持设定静音时段或定时休息提醒。隐私方面,不涉及无痕对话和健康集成工具,也不提取连接工具中的底层文件。该功能面向 Free、Pro 和 Max 用户,需开启记忆功能,可通过 Claude 网页或桌面应用设置。

    推荐理由:这是大模型公司第一次认真讨论‘人机边界’,上线了帮你看清自己怎么用 Claude 的反思仪表盘,我觉得做产品的可以思考一下这个设计思路。

  2. Meta AI:Research Blog(网页)74

    Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 公测

    Meta Superintelligence Labs 发布 Muse Spark 1.1,定位面向智能体任务的多模态推理模型,在工具与计算机使用、编码、多模态理解上较 Muse Spark 有明显提升,支持 1M token 上下文窗口。

    推荐理由:官方博客给出模型在智能体、编码、多模态上的能力细节和百万 token 上下文,并开放 Meta Model API 公测,可对照现有工作流评估。

  3. Tomer Tunguz 博客(VC 分析)62

    Ollama 开发者数达890万,B轮融资由Theory领投

    Ollama 让开源模型在本地或云端轻松运行,保持体验一致。目前拥有890万开发者、6.7万集成,并与各大模型实验室及硬件供应商建立合作。B轮融资由Theory领投。

    推荐理由:Ollama B 轮融资公布 890 万开发者,这个数字让我觉得本地模型运行时已从极客玩具变成主流基础设施,做开发者工具的人该重新审视这块的生态价值。

  4. Anthropic:Newsroom(网页)56

    Anthropic发起“硬问题”倡议,邀请公众提出AI相关尖锐问题

    Anthropic作为公益公司,发起“硬问题”倡议,邀请公众就AI对就业、社会、家庭、科学医学等领域的影响提出最尖锐的问题。此前已通过多种方式收集看法:首轮调查询问5.2万美国人;通过Anthropic Interviewer调查了159个国家70种语言的8.1万Claude用户;开展数十场线下焦点小组;并基于匿名真实数据研究Claude使用情况。公司还设立了Anthropic Institute和Long-Term Benefit Trust以监督公益使命进展。Anthropic承诺将公开追踪并报告针对这些问题的具体行动及成效。

    推荐理由:Anthropic 不再只做技术输出,开始系统性收集公众对 AI 的恐惧和期待,并承诺公开回应——这是头部 AI 公司一次认真的公共对话实验,值得关注后续回应。

  5. Anthropic:Newsroom(网页)56

    Anthropic长期利益信托任命本·伯南克为受托人

    Anthropic的长期利益信托(LTBT)任命前美联储主席、2022年诺贝尔经济学奖得主本·伯南克为最新受托人。他将与另外三位受托人共同监督公司以对社会长期有益的方式负责任开发先进AI的使命。LTBT独立于管理团队和投资者,受托人不持股、不分红,仅按服务时间获酬。该信托有权向Anthropic董事会任命成员,并就AI风险与社会影响等关键决策提供建议。伯南克将参与公司的经济研究,帮助理解AI对全球劳动力与经济的影响。

    推荐理由:请前美联储主席进入长期利益信托,Anthropic 在治理上下了重注。这不止是人事新闻,更透露了公司对 AI 经济影响的预判——他们正在为系统性风险做准备。

7月8日周三
  1. OpenAI:部署安全与系统卡(网页)60

    GPT-Live 系统卡:评测配置更正后部分安全指标出现回归

    OpenAI 发布 GPT-Live-1 与 GPT-Live-1 mini 系统卡,并因发现评测配置不匹配而重跑了语音原生违禁内容评测。

    推荐理由:OpenAI 公开更正后的语音安全评测数据,附带修正前后对照,读者可看到误配置如何影响安全评估结论。

  2. Tomer Tunguz 博客(VC 分析)57

    AI预检检查:智能体工作记忆架构

    一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。

    推荐理由:Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。

  3. 字节 Seed:Research Feed(网页内嵌数据)68

    字节跳动发布 Seedream 5.0 Pro,强化复杂信息可视化与精准编辑能力

    字节跳动正式发布多模态图像创作模型 Seedream 5.0 Pro。该版本在图文匹配、结构合理性及文字渲染上全面提升,核心突破包括:支持高密度数据与概念的专业排版可视化;基于空间位置理解的交互式精准编辑(如点选、图层分离、多图融合);还原真实光影与人像质感;以及原生支持十余种语言的输入与本地化特征生成。目前已在火山方舟、豆包及即梦上线体验。

    推荐理由:展示了 AI 图像生成从“好看”向“可用”的进阶,特别是其解决复杂信息图表生成和像素级局部编辑的能力,对专业设计工作流有显著价值。