跳到正文

全部动态

今日 4 条
3月6日周五
  1. Manus:Blog(网页)60

    Manus 实测 8 个 AI 作品集构建工具,评选 2026 年最佳免费选项

    Manus 博客用同一严格提示测试 8 个 AI 作品集构建工具,从设计质量、AI 智能化程度、发布能力和转化重点评估。Manus 和 Replit 均获 9/10 并列第一,Aura、Figma、Webflow 得 8 分,Lovable、Wix 得 7 分,Jimdo 得 6 分。

    推荐理由:作者用同一严格提示实测 8 个工具并给出评分和价格表,读者可按预算和设计风格直接对号入座选型。

  2. Manus:Blog(网页)65

    Manus 评测 7 个 AI 应用构建工具:同一提示下的并排对比

    Manus 博客用同一段 Solace Studio 健康工作室应用的提示,测试 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个 AI 移动应用构建平台,按提示遵循度、速度、移动体验和易用性评估。

    推荐理由:文章用同一提示并排实测七个平台,指出多数工具只生成前端、后端逻辑才是真正差距,可作为选型参考。

  3. Manus:Blog(网页)64

    Manus 内容作者实测 Google Veo 3:唇同步惊艳但整体表现参差

    Manus 内容作者用四个提示实测 Google Veo 3,发现对话唇同步质量达到纪录片级,但产品一致性、动作场景和电影测试均出现明显问题。测试中为完成四个视频从 Google AI Plus($7.99/月)两次升级到 Google AI Pro($19.99/月),结论是 Veo 3 在对话类内容上表现突出,但尚不是演示所暗示的可靠全能视频生成器,剪辑最长 8 秒且受每日生成限制。

    推荐理由:作者用四个提示实测 Veo 3 并给出各档订阅价格与真实短板,读者可据此判断它适不适合自己的使用场景。

3月5日周四
  1. 英国 AI Security Institute:Blog(网页)63

    AISI 与 Irregular 发现加大推理预算可显著提升 AI 网络任务成功率

    AISI 与 Irregular 联合研究发现,近期前沿模型能有效利用远超常规评测设置的推理预算:AISI 用 50M token 上限、Irregular 用 1000 turns,均观察到成功率随预算扩大持续上升,约 8% 的 AISI 任务只有在预算从 10M 提到 50M token 时才被解决。

    推荐理由:AISI 与 Irregular 用更大推理预算实测发现常规评测低估模型网络攻击能力上限,并给出按 cost per success 选预算的方法。

  2. Google Blog:AI(RSS)1

    在 AI Mode 中使用 Canvas 完成任务、实现创意,就在 Search 中

    Google Search 的 AI Mode 已向美国所有用户开放 Canvas 功能,新增文档起草和交互式工具构建能力,用户可直接在搜索页面完成创作。

    推荐理由:Google Search AI Mode 全面开放 Canvas 功能,支持文档起草与交互式工具构建

3月4日周三
  1. Google Blog:AI(RSS)1

    在 Project Genie 中创建新世界的 4 个技巧

    Google DeepMind 分享 Project Genie 使用指南,提供 4 个提示词写作技巧,帮助用户通过自然语言描述生成可交互的虚拟世界。

    推荐理由:Google DeepMind分享Project Genie提示词技巧,教你用AI生成可交互3D世界

3月3日周二
  1. Apple:Newsroom(RSS)71

    Apple 推出搭载 M5 芯片的全新 MacBook Air

    Apple 发布了搭载 M5 芯片的全新 MacBook Air,为这款全球最受欢迎的笔记本电脑带来卓越性能和扩展的 AI 能力。新款 MacBook Air 在性能上实现显著提升,并增强了人工智能相关功能,进一步巩固其在轻薄本市场的领先地位。

    推荐理由:Apple M5芯片强化端侧AI能力,开发者需关注硬件对AI部署的影响。

  2. PromptArmor:Threat Intelligence70

    PromptArmor 披露 GitHub Copilot CLI 可被提示注入诱导下载执行恶意软件

    PromptArmor 发现 GitHub Copilot CLI 可通过 README 中的间接提示注入,利用内置只读命令列表中的 env 包裹 curl 和 sh,绕过命令校验与外部 URL 审批,在 macOS 上无人工批准地下载并执行恶意软件。

    推荐理由:作者实测演示了绕过 Copilot CLI 人工审批的具体命令链,并披露 GitHub 已确认但暂不修复,读者可据此评估自身使用风险。

  3. LlamaIndex:产品、工程与评测61

    LlamaIndex:不止是 RAG 框架,转向智能体文档处理

    LlamaIndex 官方宣布公司使命收窄为构建智能体文档处理基础设施(OCR、抽取与工作流),不再定位为单纯的 RAG 框架。

    推荐理由:官方复盘了通用 LLM 框架价值下降的原因,并说明转向文档基础设施的动机和产品布局,读者可借此理解框架类公司的转型逻辑。

3月2日周一
  1. Cursor Blog1

    PlanetScale 借助 Bugbot 保障生产环境可靠性

    PlanetScale 引入 Bugbot 作为 AI 代码审查代理,应对 AI 代码生成普及后审查环节成为瓶颈的问题。Bugbot 能发现人类难以察觉的深层逻辑缺陷,如状态同步间隙和异步控制器交互问题,而非仅检查语法错误。目前 80% 的 Bugbot 评论在合并前被工程师处理,每月审查超 2000 个 PR,节省相当于两名全职工程师的审查工作量,显著降低生产环境宕机风险。

    推荐理由:Cursor Bugbot 企业落地数据:Agent 审查解决 80% 问题,揭示 AI 编程时代代码审查成新瓶颈

  2. Answer.AI 官方研发博客(RSS)63

    Answer.AI 分析:OpenAI 与战争部合同能否冻结自主武器相关法律

    Answer.AI 的 Jeremy Howard 与 Luke Versweyveld 撰文分析 OpenAI 与战争部合同中“all lawful purposes”条款的含义,指出 OpenAI 方面称该条款指“签约时适用的法律”,但合同语言未包含冻结条款。

    推荐理由:文章援引美国合同法判例逐条分析 OpenAI 与国防部合同的用语,说明为何签约时的法律未必能冻结未来的立法变化。

3月1日周日
  1. Cognition 模型 / Devin 博客(网页)60

    Cognition 发布 SWE-1.6 早期预览并分享 RL 训练研究进展

    Cognition 发布 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,达到 51.7%,速度同为 950 tok/s,并向小部分用户开放早期访问。

    推荐理由:官方给出 SWE-1.6 预览版成绩与 RL 训练细节,并提出基准之外的 Model UX 问题,对做智能体训练的人有参考价值。

2月28日周六
  1. FireRedTeam:原创语音与多模态项目60

    FireRedTeam 发布 FireRed-OCR-2B 结构化文档解析模型,OmniDocBench v1.5 得分 92.94

    FireRedTeam 发布 FireRed-OCR-2B 权重,基于 Qwen3-VL-2B-Instruct,在 OmniDocBench v1.5 上取得 92.94 的总成绩,高于 DeepSeek-OCR 2 的 91.09、PaddleOCR-VL 的 92.86 等模型。

    推荐理由:原文给出了 OmniDocBench v1.5 具体分数、对比模型和三阶段训练方法,读者可以据此判断这个 2B 文档解析模型的实际位置。

  2. 蚂蚁百灵:Developer Blog(网页)80

    拒绝“AI 味”:我们用 6 个文学维度,重新审视了模型的创意写作边界

    本文通过叙事工艺、语言艺术等六个文学维度,评估百灵模型Ling-2.5-1T的创意写作能力。测试显示,该模型能驾驭莎士比亚十四行诗、七言绝句等多种体裁,并通过感官描写实现“展现而非告知”的文学技法,在微观叙事和语言质感上接近人类水平。然而,模型仍存在依赖高频文学意象、处理否定指令时语义代偿等局限。该框架为创作者提供了激发AI写作潜力的具体方法。

    推荐理由:提供实用文学维度框架和 Prompt 技巧,助你驾驭 AI 创意写作。

2月27日周五
  1. Cursor Blog1

    AI 软件开发的第三个时代

    AI 编程进入第三时代:从 Tab 补全到同步 Agent,再到可独立运行数小时的云 Agent。Cursor 内部数据显示,Agent 用户已反超 Tab 用户 2 倍,35% 的 PR 由云 Agent 自主创建。开发者角色从逐行编码转向构建"软件工厂"——定义问题、配置工具并审查产物。Cursor 昨日正式发布 cloud agents,支持并行任务与独立 VM 运行。

    推荐理由:Cursor 定义 AI 编程第三时代:云端 Agent 已占其内部 35% PR,用户量反超 Tab 两倍

  2. Cognition 模型 / Devin 博客(网页)67

    Cognition 如何用 Devin 开发 Devin

    Cognition 发文介绍其从创立起就用 Devin 构建 Devin,上周合并了 659 个 Devin PR,高于 2025 年最好一周的 154 个。文章覆盖全接口使用(web、Slack、Linear、CLI、API)及 Ask Devin 代码问答、Devin Review 自动代码审查、每日设计系统审计、!

    推荐理由:Cognition 以当事方身份披露用 Devin 开发 Devin 的完整工作流,上周合并 659 个 Devin PR,读者可对照自身团队借鉴具体用法。

  3. Anthropic:Newsroom(网页)1

    就战争部长 Pete Hegseth 评论的声明

    美国战争部长 Pete Hegseth 宣布将 Anthropic 列为供应链风险,因其拒绝将 Claude 用于大规模国内监控和完全自主武器。Anthropic 认为当前 AI 模型不足以支持自主武器,且大规模监控违反基本权利,称将在法庭挑战这一史无前例的指定。声明澄清,该指定不影响个人和商业客户使用 Claude;国防部承包商仅在执行军方合同时受限,其他用途不受影响。

    推荐理由:Anthropic回应美政府供应链风险指控,坚持反对自主武器与大规模监控立场

2月26日周四
  1. OpenAI Developers:Blog(网页)66

    Codex 接入 Figma MCP server,支持设计与代码双向转换

    OpenAI 宣布 Codex 现可通过 Figma MCP server 生成和读取 Figma 设计文件。

    推荐理由:原文给出从设计到代码、再从代码回画布的双向流程和具体工具名,读者可以照此判断是否接入自己的工作流。

  2. 蚂蚁百灵:Developer Blog(网页)86

    Ling 2.5 Lightning Attention+MLA 混合线性架构改造实践

    为提升超长上下文下的计算效率,Ling 2.5架构将Ling 2.0的GQA改造为1:7的Lightning Attention与MLA混合线性注意力。此举旨在利用Lightning Attention提升长序列吞吐,并通过MLA极致压缩KV Cache。为确保改造后性能无损,团队设计了精细的平滑迁移训练策略,包括权重转换、QK Norm融合与Partial RoPE改造等多阶段加训。Scaling Law实验确定了1:7为最优混合比例,最终使万亿参数模型实现了更低的计算成本与更高的长文本推理效率。

    推荐理由:为大模型长上下文优化提供可落地的工程实践参考。

  3. Anthropic:Newsroom(网页)1

    Anthropic CEO就国防部谈判发表声明

    Anthropic CEO Dario Amodei声明,尽管Claude已广泛用于美军情报分析、网络作战等任务,且公司曾主动切断数亿美元收入阻止中国关联企业使用,但拒绝两项用途:大规模国内监控和完全自主武器。Amodei认为前者威胁民主价值,后者技术不可靠且缺乏监督。国防部威胁将其标记为"供应链风险"并强制移除安全措施。Anthropic坚持原则,但表示如被移除将确保平稳过渡,希望继续服务国防。

    推荐理由:Anthropic CEO声明宁可退出军方合作,也不开放自主武器与大规模监控权限

2月25日周三
  1. OpenAI Developers(RSS)73

    OpenAI 发布 gpt-5.3-codex 提示词指南

    OpenAI 发布 Codex 模型提示词指南,API 上的 Codex 调优模型为 gpt-5.3-codex,推荐用 medium 推理力度平衡智能与速度,复杂任务可用 high 或 xhigh。

    推荐理由:官方为 gpt-5.3-codex 给出完整提示词与工具迁移指南,覆盖并行调用、compaction 和 phase 参数等可落地的集成细节。

  2. Nathan Lambert:Interconnects(RSS)1

    蒸馏对中国 LLM 到底有多重要?

    针对 Anthropic 关于"蒸馏攻击"的最新论述,分析模型蒸馏技术对中国大语言模型的实际影响。探讨通过蒸馏 GPT、Claude 等模型来训练中国 LLM 的效果与争议,评估该方法在提升模型性能与降低训练成本方面的作用,以及可能引发的知识产权与安全问题。

    推荐理由:技术权威视角拆解'蒸馏攻击',厘清中国大模型能力来源争议

  3. Anthropic:Newsroom(网页)1

    Anthropic 收购 Vercept 以推进 Claude 的 computer use 能力

    Anthropic 收购 Vercept,后者专注 AI 感知与交互,将停止外部产品并加入 Anthropic。Claude Sonnet 4.6 在 OSWorld 基准测试中准确率已从 2024 年底的 15% 提升至 72.5%,可接近人类水平处理复杂表格和跨标签页网页表单。

    推荐理由:Anthropic 收购 Vercept 团队,Claude 的 Computer Use 能力将获大幅提升。

2月24日周二
  1. Inception Labs:Blog(网页)68

    Inception Labs 发布扩散推理模型 Mercury 2

    Inception Labs 发布 Mercury 2,称其为最快的推理语言模型,基于扩散并行细化而非自回归逐 token 解码,生成速度较此前提升超 5 倍。

    推荐理由:原文给出扩散架构带来的具体速度、价格和上下文参数,读者可据此评估实时推理场景的可行性。

  2. METR:Research(网页)67

    METR 承认后续 AI 开发者效率实验受选择效应影响,宣布修改实验设计

    METR 宣布更改其开发者生产力实验设计,认为 2025 年 8 月启动的新一轮实验数据不能可靠反映 AI 工具对开发效率的影响。

    推荐理由:原文解释了新一轮 AI 开发者效率实验为何出现选择偏差并导致结果不可靠,还列出后续多种替代测量方案,方法层面的教训可以迁移到类似研究。

  3. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布早期检查点 LFM2-24B-A2B,24B 总参数仅 2.3B 激活

    Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。

    推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。

  4. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 Devin 2.2,支持桌面端测试与自动修复

    Cognition 发布 Devin 2.2,智能体现在可用 computer use 在自己的 Linux 桌面上端到端测试网页和桌面应用,并在开 PR 前自查代码、自动修复问题,完成后回传屏幕录制供用户审阅。

    推荐理由:官方公告给出自主测试、自动修复和启动提速等具体能力变化,读者可以据此评估对现有开发流程的影响。

2月23日周一
  1. OpenAI Developers:Blog(网页)67

    OpenAI 工程师实测 GPT-5.3-Codex 连续运行约25小时从零构建设计工具

    OpenAI 开发者博客记录一次长时程实验:用 GPT-5.3-Codex 在空白仓库上以 Extra High 推理从零构建设计工具, uninterrupted 运行约25小时、消耗约13M token、生成约30k行代码。

    推荐理由:作者用一次25小时的实测复盘,给出长时程 Codex 任务的文件栈和验证方法,可迁移到自己跑长任务。

  2. Together AI 研究与产品博客(RSS)63

    Together AI 发布 SF Streets 基准,揭示语音模型街名转写错误率达 39% 并用跨语言风格迁移降低 60% 错误

    Together AI 发布 SF Streets 与 US Streets 两项基准,测试 15 个先进 ASR 模型在街名转写上的表现,发现平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。

    推荐理由:原文用自建基准量化了 ASR 在街名转写上的短板,并给出可复用的合成数据改进方法,对语音部署有直接参考价值。

2月18日周三
  1. Ethan Mollick:One Useful Thing(RSS)1

    Agentic 时代 AI 选择指南

    Agentic 时代 AI 不再只是聊天机器人,而是能自主执行任务的智能体。面对 Claude、GPT、LLaMA 等模型,需根据代理能力、任务类型和生态集成重新评估选择策略。

    推荐理由:AI 大咖 Ethan Mollick 撰写 Agent 时代实用选型指南

  2. Answer.AI 官方研发博客(RSS)66

    Answer.AI 揭示未授权工具调用问题:Claude 等模型可调用未授予的工具且 API 不拦截

    Answer.AI 的 Piotr Czapla 发现 Claude 4.5 在 solveit 对话中幻觉出一个未授予的工具 add_msg 并成功执行,API 未拦截,且在 Gemini 和 Grok 上也复现了类似行为。

    推荐理由:作者以可复现的实验展示 API 层不校验工具名带来的安全缺口,并给出客户端侧的简单修复思路。

  3. Nathan Lambert:Interconnects(RSS)1

    开源模型的永无止境的追赶

    开源模型与闭源巨头(如 GPT、Claude)之间的能力差距持续存在,形成永无止境的追赶态势。文章探讨了知识蒸馏技术对缩小差距的作用,分析了开源与闭源模型在创新时间尺度上的差异,以及开源模型如何通过专业化模型在特定领域寻找获胜路径。同时指出当前开源生态在基础研究和资源投入上的缺失环节,并评估了这种追赶模式的可持续性。

    推荐理由:开源与闭源鸿沟难越,但蒸馏与专业化或是破局关键

2月17日周二
  1. PromptArmor:Threat Intelligence71

    PromptArmor 发布 OpenAI Codex 恶意 config.toml 风险 PSA,OpenAI 判定为按设计工作

    PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。

    推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。

  2. 英国 AI Security Institute:Blog(网页)75

    英国 AI Security Institute 发布 Boundary Point Jailbreaking 黑盒越狱攻击方法

    英国 AI Security Institute 红队发布 Boundary Point Jailbreaking(BPJ),一种在纯黑盒设置下自动生成通用越狱前缀的攻击方法。

    推荐理由:原文由攻击方法开发者本人披露关键结果与成本数字,读者可据此了解黑盒越狱攻击的演进方向和防御启示。

  3. METR:Notes(网页)63

    METR 用 5305 份 Claude Code transcript 估算 AI 编码时间节省为约 1.5x 至 13x 的软上界

    METR 基于 2026 年 1 月 7 名技术人员的 5305 份 Claude Code transcript,用 LLM judge 估算无 AI 完成同样任务所需时间,得出时间节省倍数约 1.5x 至 13x。作者认为该数值因任务替代、任务选择、员工专业化和 judge 验证有限(仅 34 个人工标注)而高估真实提升,只是软上界;并发 agent 数更高的员工时间节省倍数更高。

    推荐理由:作者用 5305 份 Claude Code transcript 估算时间节省倍数,并说明它为何只是真实生产力提升的软上界,方法细节可直接借鉴。

2月14日周六
  1. 字节 Seed:Research Feed(网页内嵌数据)1

    Seed2.0 正式发布

    Seed2.0系列正式发布,推出Pro、Lite、Mini三款通用Agent模型及专用Code模型,针对复杂多模态任务与长链路Agent场景优化。模型在视觉理解、数学推理与长上下文处理方面达SOTA水平,SuperGPQA分数超越GPT-5.2,并在ICPC、IMO、CMO测试中获金牌。支持科学研究级任务,token成本较顶尖模型降低约一个数量级。目前已上线豆包App、TRAE及火山引擎API。

    推荐理由:字节 Seed2.0 正式发布,Agent 与多模态能力全面升级,已接入豆包和 TRAE

2月13日周五
  1. 字节 Seed:Research Feed(网页内嵌数据)1

    "思考"更深,生成更准|Seedream 5.0 Lite 发布

    字节跳动发布 Seedream 5.0 Lite 图像生成模型,采用多模态统一架构,跨模态理解与推理能力显著提升,Elo 评分超越前代 4.5 版本。模型首次引入实时检索增强能力,可联网获取最新知识,突破训练数据时间限制。内置丰富世界知识库,在信息可视化、视觉推理、复杂多主体生成等场景表现突出,能根据模糊指令精准修图,支持风格迁移与多步逻辑推理。目前已上线即梦 AI、火山方舟体验中心及豆包内测。

    推荐理由:字节发布 Seedream 5.0 Lite,支持实时检索与深度推理的图像生成模型。

  2. Manus:Blog(网页)60

    Manus 评测2026年9款AI代码审查工具并给出选型对照

    Manus 博客在相同PR包(含授权反转、中间件边界等安全回归场景)上实测 Qodo、Graphite、GitLab Duo、Greptile、Devlo、CodeRabbit、Codacy、Atlassian Rovo 和 Manus 共9款AI代码审查工具,并给出标准化对比表与按需选型指南。

    推荐理由:同一组高风险PR上实测9款工具,读者可按安全审查深度与工作流集成需求快速对照选型。

2月12日周四
  1. FireRedTeam:原创语音与多模态项目61

    FireRedTeam 开源 FireRedASR2S 一体化语音识别系统,含 ASR、VAD、LID 和标点四个模块

    FireRedTeam 发布开源工业级一体化语音识别系统 FireRedASR2S,集成 FireRedASR2(支持中文普通话、20+ 方言口音、英文、中英混说及歌声转写)、FireRedVAD、FireRedLID 和 FireRedPunc 四个模块,均开源权重与推理代码。

    推荐理由:官方开源的一体化语音识别系统,给出与 Doubao-ASR、Silero-VAD 等的对比数字和完整推理代码,便于直接部署验证。