跳到正文

全部动态

今日 2 条
8月25日周五
  1. LlamaIndex:产品、工程与评测74

    LlamaIndex 教程:用合成数据微调嵌入模型提升 RAG 检索性能

    LlamaIndex 发布端到端指南,教你在无标注的非结构化语料上用 LLM 生成合成问题对来微调开源嵌入模型 BAAI/bge-small-en。

    推荐理由:原文提供了完整的无标注数据微调嵌入模型方法和评测结果,读者可以直接复用笔记本改进自己的 RAG 检索。

8月17日周四
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 教程:如何微调 Llama 2 用于 Text-to-SQL 应用

    LlamaIndex 发布教程,展示如何用 text-to-SQL 数据集微调 Llama 2 并接入 LlamaIndex 对任意 SQL 数据库做结构化分析。

    推荐理由:原文给出了微调 Llama 2 做 text-to-SQL 的完整技术栈和前后对比示例,可帮助读者评估微调对结构化分析场景的实际收益。

7月17日周一
  1. LlamaIndex:产品、工程与评测61

    LlamaIndex 工程师分享构建 LLM Agent 工具的实用技巧

    LlamaIndex 工程师在发布 LlamaHub Tools(含 Gmail、Google Calendar、Wolfram Alpha 等 15 个工具)后,总结编写 LLM Agent 工具的技巧。

    推荐理由:作者结合 LlamaHub Tools 的开发实践,总结出输入容错、错误自恢复、日期函数等可直接套用的 Agent 工具编写方法。

7月12日周三
  1. LlamaIndex:产品、工程与评测70

    LlamaIndex 发布 Data Agents 与 LlamaHub 工具仓库

    LlamaIndex 发布 Data Agents,LLM 驱动的知识工作者可对非结构化、半结构化和结构化数据执行读取与写入任务。

    推荐理由:发布方亲自讲解 Data Agents 的推理循环与工具抽象设计,并给出可直接复用的代码示例,适合想在自己的数据上搭建智能体的开发者参考。

5月28日周日
  1. LlamaIndex:产品、工程与评测61

    LlamaIndex 推出 SQLAutoVectorQueryEngine,结合 Text-to-SQL 与语义搜索完成 RAG 查询

    LlamaIndex 在博客中展示新查询引擎 SQLAutoVectorQueryEngine,可同时利用 SQL 数据库和向量数据库回答同时涉及结构化与非结构化数据的自然语言查询。

    推荐理由:原文给出 SQLAutoVectorQueryEngine 的工作流程、示例代码和实验结果,读者可以照着复现结构化与非结构化数据的组合查询。

5月12日周五
  1. LlamaIndex:产品、工程与评测65

    LlamaIndex 实测 Anthropic Claude 100K 上下文窗口处理 SEC 10-K 文件的表现

    LlamaIndex 在 UBER 2019-2022 年 SEC 10-K 文件上测试 Anthropic 新推出的 100K token 上下文窗口。由于单份 10-K 约 160k token 仍超出窗口,作者用 list index 切成约 100k token 大块并测试响应合成策略。

    推荐理由:作者用 UBER 10-K 实测 Claude 100K 上下文的延迟、成本与回答质量,并给出 tree_summarize 优于 create-and-refine 的可复用结论。

3月17日周五
  1. METR:Research(网页)70

    ARC 发布 Claude 与 GPT-4 危险能力评测进展

    ARC 作为第三方评估方与 Anthropic、OpenAI 等实验室合作,在受控环境中测试前沿模型自主获取资源、逃避人工监督的危险能力。结论是被测的 Claude 和 GPT-4 版本均未能产出可信的完整自主复制计划,执行中易出错、有幻觉、难以在多副本间分派任务,但能部分完成浏览网页、雇佣人类代办、制定长期计划等子任务。

    推荐理由:ARC 公布了危险能力评测的动机、方法与结论,读者可以了解模型自主复制能力的评估方式。

3月16日周四
  1. Anthropic:Transformer Circuits(可解释性研究)73

    Transformer残差流中的特权基向量

    研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。

    推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。

2月20日周日
  1. Lilian Weng:Lil'Log(RSS)57

    数据不足情况下的学习第二部分:主动学习

    监督学习任务的性能依赖于高质量标注数据,但获取大量标注样本成本高昂。主动学习是一种在标注预算有限、但允许投入部分人工标注资源的条件下,应对标注数据不足的范式。其核心思路是智能地选择最具信息量的样本进行标注,以在有限预算内最大化模型性能的提升。该方法旨在解决当面临标注数据受限时,如何通过策略性采样来高效利用标注资源的问题。

    推荐理由:这是 Lilian Weng 数据不足系列的第二篇,把主动学习的核心采样策略和实际权衡讲得很清楚,做数据标注和 ML 工程的同学值得复习一遍。

6月15日周二
  1. Anthropic:Transformer Circuits(可解释性研究)76

    Transformer电路逆向工程练习题集

    本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。

    推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。

9月5日周四
  1. Lilian Weng:Lil'Log(RSS)57

    进化策略

    进化策略是一种在目标函数解析形式未知或无法直接计算梯度时,用于优化模型参数的黑箱优化算法。它作为随机梯度下降的替代方案,适用于多种优化场景。文章介绍了模拟退火、爬山法、Nelder-Mead方法等经典进化策略,并探讨了该方法在深度强化学习中的应用。通过评估目标函数值而非依赖梯度信息,进化策略为复杂优化问题提供了有效路径。

    推荐理由:这篇五年前的进化策略入门,至今仍是理解黑箱优化的最佳起点,Lilian Weng的笔法清晰,做RL的朋友可以当字典翻。

4月8日周日
  1. Lilian Weng:Lil'Log(RSS)55

    策略梯度算法

    该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。

    推荐理由:这篇是当年策略梯度方法的“圣经”级综述,现在看虽然有些过时,但想理解PPO、SAC的来龙去脉还得从这儿啃起。