ARC Prize 实测 OpenAI o3 在 ARC-AGI-Pub 取得突破性高分
ARC Prize 官方测试报告显示,OpenAI o3 在 ARC-AGI-1 Semi-Private 评测中以 $10k 算力上限取得 75.7%,高算力(172 倍)配置达 87.5%,Public Eval 高算力为 82.8%、低算力为 91.5%。
推荐理由:ARC Prize 官方第一手测试数据,给出 o3 在 ARC-AGI 各算力档位的得分、成本和机制解读。
ARC Prize 官方测试报告显示,OpenAI o3 在 ARC-AGI-1 Semi-Private 评测中以 $10k 算力上限取得 75.7%,高算力(172 倍)配置达 87.5%,Public Eval 高算力为 82.8%、低算力为 91.5%。
推荐理由:ARC Prize 官方第一手测试数据,给出 o3 在 ARC-AGI 各算力档位的得分、成本和机制解读。
Anthropic基于实践经验指出,成功的LLM智能体往往采用简单、可组合的模式,而非复杂框架。文章区分了工作流(预定义路径编排)与智能体(LLM动态自主决策),建议开发者优先采用最简单方案,仅在必要时增加复杂性。许多核心模式直接调用LLM API仅需几行代码即可实现。文中介绍了增强型LLM、提示链等基础构建模块,强调应为特定用例定制检索、工具等增强功能,并推荐通过Model Context Protocol集成第三方工具生态。
推荐理由:Anthropic 官方把过去一年踩过的坑浓缩成一篇 Agent 架构指南,核心观点是「别上框架,先用最简单的模式」。做 Agent 产品的开发者,这篇比任何第三方教程都值得当 checklist 用。
ARC Prize 团队于 2024 年 10 月 24 日举办线上活动,说明为何单靠深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路线。
推荐理由:Chollet 和 Knoop 系统论述 LLM 局限于记忆技能、需结合程序合成才能胜出 ARC-AGI 的技术路径,为理解智能与抽象层次提供了可迁移的分析框架。
传统RAG系统在编码时易丢失上下文,导致检索失败。新方法“上下文检索”通过“上下文嵌入”和“上下文BM25”两项子技术,在检索前为文本块添加解释性上下文,能将检索失败次数减少49%,结合重排序后降幅可达67%,显著提升了下游任务性能。对于小于20万token的小型知识库,可直接将其完整内容放入提示词,结合Claude的提示词缓存功能,能降低超过2倍的延迟和高达90%的成本。对于大型知识库,上下文检索则提供了可扩展的解决方案。
推荐理由:Anthropic 把 RAG 检索失败率砍了 67%,方法不复杂但数据扎实,做知识库的开发者可以直接抄 cookbook 上手,是那种读完当天就能改进生产环境的实用帖。
ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。
推荐理由:ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。
Cognition 公布在 Devin 中测试 o1-mini 和 o1-preview 数周的早期结果:在内部基准 cognition-golden 上,Devin-Base 从 GPT-4o 的 25.9% 提升到 o1-mini 的 34.6%、o1-preview 的 51.8%,生产版 Devin 达 74.2%。
推荐理由:Cognition 作为 Devin 开发方给出 o1 系列的实测对比数据,并完整披露其内部基准 cognition-golden 的评测方法。
ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。
推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。
Neo4j 客座教程讲解如何在 LlamaIndex 中自定义属性图谱索引,用 SchemaLLMPathExtractor 做模式引导抽取、用文本嵌入加编辑距离做实体去重,并实现先识别查询实体再分别执行 VectorContextRetriever 的自定义检索器。示例使用 250 篇新闻文章和 Neo4j 图存储,最后用自定义检索器完成问答回流,代码托管在 GitHub。
推荐理由:原文给出图谱构建、实体去重和自定义检索的完整可复现代码,读者可以迁移到自己的 GraphRAG 项目。
LlamaIndex 发布 Mozilla 客座教程,讲解用 llamafile 在笔记本上本地运行 LLM,并以 TinyLlama-1.1B 作为 LLM 与嵌入后端,结合 Wikipedia 页面与私有文档构建完全本地运行的 RAG 研究助手。
推荐理由:教程给出从下载运行 llamafile 到用 LlamaIndex 搭建本地 RAG 研究助手的完整代码路径,可迁移到其他主题。
Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。
推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。
LlamaIndex 博客介绍 Agentic RAG 架构:将最多 100 篇文档拆分后,为每篇文档创建具备嵌入搜索与摘要能力的文档 Agent,再由顶层 meta-agent 通过工具检索和 CoT 回答用户问题,并用 Rerank 端点对文档按相关性排序。
推荐理由:原文拆解了多文档 Agent 与顶层 meta-agent 的编排结构,并给出可运行的 Colab 示例,读者可据此理解 Agentic RAG 的扩展方式。
LlamaIndex 发布分步教程,教读者用 LlamaIndex、Qdrant 和 Render 构建并部署一个监听 Slack 对话、存储事实并回答问题的 Slackbot。
推荐理由:LlamaIndex 官方教程从零搭建一个能监听 Slack 消息、用向量索引存储记忆并用 Qdrant 持久化的机器人,步骤完整可复现。
LlamaIndex 发布教程,讲解如何用 Ollama 在本地运行 Mixtral 8x7b 并结合 LlamaIndex 使用。Mixtral 是 Mistral AI 发布的八专家混合模型,各含 7B 参数,博客称其在多项基准上匹敌或超过 GPT-3.5 和 Llama2 70b。
推荐理由:原文提供从安装到建 API 的完整本地 Mixtral 流程,含代码和硬件要求,读者可以直接照做搭建本地 RAG。
LlamaIndex 介绍如何在 RAG 中使用 LongLLMLingua,通过问题感知的粗粒度重排、细粒度提示词压缩和子序列恢复来增强 LLM 对关键信息的感知。
推荐理由:原文拆解了 LongLLMLingua 的粗细粒度压缩与重排细节,并给出在 LlamaIndex 中作为 NodePostprocessor 的用法,可迁移到自己的 RAG 成本优化。
LlamaIndex 用其 Retrieval Evaluation 模块,以 Hit Rate 和 MRR 两项指标评测多种 Embedding 模型(OpenAI、Cohere、Voyage、Jina、bge-large、Google PaLM 等)搭配不同 Reranker 的检索效果。
推荐理由:原文提供了可复现的评测脚本和各嵌入与重排模型组合的 Hit Rate 与 MRR 数据,读者可以照此在自己的数据上选型。
LlamaIndex 发布教程,介绍 LayoutPDFReader 如何结合层级布局信息解析 PDF,实现章节识别、段落合并、表格与列表处理等内容感知分块。文章给出接入 llmsherpa API 和构建 LlamaIndex 向量查询引擎的示例代码,并说明该工具仅支持带文本层的 PDF,暂不支持 OCR。
推荐理由:文章解释了 PDF 解析难点并给出 LayoutPDFReader 的层级解析与智能分块方法,含可直接复用的代码。
LlamaIndex 演示如何用 Response Evaluation 模块评测 RAG 系统的最佳 chunk size,以 Uber 2021 10K 文件为数据。
推荐理由:原文给出可复现的评测流程和具体数据,读者可以据此在自己的 RAG 场景中测试并选定合适的 chunk size。
LlamaIndex 发布端到端指南,教你在无标注的非结构化语料上用 LLM 生成合成问题对来微调开源嵌入模型 BAAI/bge-small-en。
推荐理由:原文提供了完整的无标注数据微调嵌入模型方法和评测结果,读者可以直接复用笔记本改进自己的 RAG 检索。
LlamaIndex 发布教程,展示如何用 text-to-SQL 数据集微调 Llama 2 并接入 LlamaIndex 对任意 SQL 数据库做结构化分析。
推荐理由:原文给出了微调 Llama 2 做 text-to-SQL 的完整技术栈和前后对比示例,可帮助读者评估微调对结构化分析场景的实际收益。
LlamaIndex 工程师在发布 LlamaHub Tools(含 Gmail、Google Calendar、Wolfram Alpha 等 15 个工具)后,总结编写 LLM Agent 工具的技巧。
推荐理由:作者结合 LlamaHub Tools 的开发实践,总结出输入容错、错误自恢复、日期函数等可直接套用的 Agent 工具编写方法。
LlamaIndex 在博客中展示新查询引擎 SQLAutoVectorQueryEngine,可同时利用 SQL 数据库和向量数据库回答同时涉及结构化与非结构化数据的自然语言查询。
推荐理由:原文给出 SQLAutoVectorQueryEngine 的工作流程、示例代码和实验结果,读者可以照着复现结构化与非结构化数据的组合查询。
ARC 作为第三方评估方与 Anthropic、OpenAI 等实验室合作,在受控环境中测试前沿模型自主获取资源、逃避人工监督的危险能力。结论是被测的 Claude 和 GPT-4 版本均未能产出可信的完整自主复制计划,执行中易出错、有幻觉、难以在多副本间分派任务,但能部分完成浏览网页、雇佣人类代办、制定长期计划等子任务。
推荐理由:ARC 公布了危险能力评测的动机、方法与结论,读者可以了解模型自主复制能力的评估方式。
监督学习任务的性能依赖于高质量标注数据,但获取大量标注样本成本高昂。主动学习是一种在标注预算有限、但允许投入部分人工标注资源的条件下,应对标注数据不足的范式。其核心思路是智能地选择最具信息量的样本进行标注,以在有限预算内最大化模型性能的提升。该方法旨在解决当面临标注数据受限时,如何通过策略性采样来高效利用标注资源的问题。
推荐理由:这是 Lilian Weng 数据不足系列的第二篇,把主动学习的核心采样策略和实际权衡讲得很清楚,做数据标注和 ML 工程的同学值得复习一遍。
进化策略是一种在目标函数解析形式未知或无法直接计算梯度时,用于优化模型参数的黑箱优化算法。它作为随机梯度下降的替代方案,适用于多种优化场景。文章介绍了模拟退火、爬山法、Nelder-Mead方法等经典进化策略,并探讨了该方法在深度强化学习中的应用。通过评估目标函数值而非依赖梯度信息,进化策略为复杂优化问题提供了有效路径。
推荐理由:这篇五年前的进化策略入门,至今仍是理解黑箱优化的最佳起点,Lilian Weng的笔法清晰,做RL的朋友可以当字典翻。
该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。
推荐理由:这篇是当年策略梯度方法的“圣经”级综述,现在看虽然有些过时,但想理解PPO、SAC的来龙去脉还得从这儿啃起。