跳到正文

全部动态

今日 0 条
10月23日周四
  1. X:Dan Hendrycks (@hendrycks)78

    Dan Hendrycks 分享 LLM 价值观调查:多数模型存在种族与性别偏见,Grok 4 Fast 相对平等

    CAIS 负责人 Dan Hendrycks 引用第三方博客对主流大模型进行“效用工程”测试,发现 GPT-4o、Claude Sonnet 4.5 等模型在评估不同群体生命价值时存在显著偏差:多数模型认为白人价值低于其他族裔,男性价值低于女性,且极度贬低 ICE 特工。测试显示模型分为四个道德集群,其中仅 Grok 4 Fast 表现出近似平等的价值观,Hendrycks 呼吁 xAI 解释其实现方式。

    推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。

10月13日周一
  1. Answer.AI 官方研发博客(RSS)60

    Kerem Turgutlu 用 SolveIt 将 Karpathy 的 tokenizer 视频教程做成书章

    Answer.AI 的 Kerem Turgutlu 撰文讲解如何用 SolveIt 把 Andrej Karpathy 超两小时的 tokenizers 视频教程转成带可运行代码、超链接和图片的书章。

    推荐理由:作者完整复盘两阶段对话工作流,把超两小时视频转成可运行代码的书章,方法可直接迁移到任意长视频转写场景。

9月29日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    为AI智能体实施有效的上下文工程

    随着AI应用从单次提示转向构建长期运行的智能体,焦点正从“提示工程”演进为“上下文工程”。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在“注意力预算”限制和“上下文腐化”现象——随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。

    推荐理由:Anthropic 亲自下场定义 context engineering 这个新范式,把 prompt engineering 之后的工程方法论讲透了。做 Agent 的人如果还在死磕 prompt,这篇会让你重新审视整个技术栈。

9月25日周四
9月17日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    近期三次基础设施故障的事后分析

    八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。

    推荐理由:Anthropic 主动公开三个基础设施 bug 的完整复盘,这种坦诚在大厂里极少见。做 AI 产品的人都该读一下,它把「模型质量下降」从玄学拉回了工程现实,尤其是 XLA 编译器那层的坑,踩过才知道多深。

9月11日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体编写高效工具——与智能体协作

    文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。

    推荐理由:Anthropic 把自家内部反复打磨的 agent 工具开发方法论完整公开了,从评估流程到 prompt 工程细节全是实操干货,做 MCP server 或 agent 工具链的人可以直接抄作业。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)60

    破解LLM推理中的非确定性

    LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。

    推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。

8月15日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/UI-Venus

    UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。

    推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

8月7日周四
  1. OpenAI Developers(RSS)64

    如何用 LM Studio 在本地运行 gpt-oss

    OpenAI 发布 Cookbook 教程,讲解如何在本地硬件上用 LM Studio 运行 gpt-oss。LM Studio 是一款在本地硬件运行大语言模型的桌面应用,教程将引导用户完成本地运行 gpt-oss 的步骤。

    推荐理由:OpenAI 官方 Cookbook 给出在本地硬件用 LM Studio 运行 gpt-oss 的完整步骤,可作为离线部署的操作参考。

8月5日周二
  1. OpenAI Developers(RSS)60

    OpenAI Cookbook 教程:用 Hugging Face Transformers 微调 gpt-oss

    OpenAI 开发者 Cookbook 发布教程,讲解如何结合 gpt-oss 与 Hugging Face Transformers 进行微调。文章由 Edward Beeching、Quentin Gallouédec 和 Lewis Tunstall 撰写,并从大型推理模型(如 OpenAI o3)通过生成思维链提升准确性的背景切入。

    推荐理由:官方 Cookbook 教程给出用 Hugging Face Transformers 微调 gpt-oss 的具体路径,适合需要本地定制推理模型的开发者参考。

  2. OpenAI Developers(RSS)79

    如何用 Ollama 在本地运行 gpt-oss

    OpenAI 开发者发布教程,讲解如何用 Ollama 在本地硬件上部署 gpt-oss-20b 或 gpt-oss-120b 并选择合适的推理设置。

    推荐理由:来自 OpenAI 开发者官方的实操指南,读者可按步骤在自己硬件上用 Ollama 跑通 gpt-oss 两个规格模型。

7月18日周五
  1. Manus:Blog(网页)68

    Manus 团队分享构建 AI 智能体的上下文工程经验教训

    Manus 团队成员 Yichao 'Peak' Ji 撰文分享构建 Manus 智能体的上下文工程经验,核心原则包括围绕 KV-cache 命中率设计、用 logits 遮蔽而非移除工具、把文件系统当作终极上下文、通过复述待办列表操控注意力,以及保留错误和避免少样本陷阱。

    推荐理由:Manus 团队复盘构建智能体的上下文工程经验,KV缓存、工具遮蔽和文件记忆等做法可直接迁移到读者的 Agent 项目。

7月14日周一
  1. OpenRouter:Announcements(RSS)56

    OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2

    OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。

    推荐理由:一篇将 OpenRouter 模型接入 Cursor 的实操指南,虽然已过时三百多天,但对想免配置用 Kimi K2 的 Cursor 用户仍有参考价值。

7月1日周二
  1. Factory 研究 / 产品(RSS)70

    Factory 提出 Agent Native Development:用自主智能体开发软件的方法论

    Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。

    推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。

6月13日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    我们如何构建多智能体研究系统

    Claude的多智能体研究系统采用协调器-工作者架构,一个主导智能体分析用户查询并制定策略,并行调用多个专用子智能体协同工作。内部评估显示,以Claude Opus 4为主导、Claude Sonnet 4为子智能体的系统,在研究任务上比单智能体Claude Opus 4性能提升90.2%。该系统擅长处理需要同时探索多个独立方向的广度优先查询,通过分配独立上下文窗口实现并行推理扩容。但多智能体系统消耗的token量约为普通聊天的15倍,适用于任务价值足以支撑性能提升的场景,在需要高度并行化、大信息量或多工具调用的任务中表现卓越。

    推荐理由:Anthropic 把 Research 背后的多智能体架构、prompt 工程和踩坑经验全抖出来了,做 Agent 的同行可以直接抄作业,尤其是『token 用量解释 80% 性能方差』这个结论,选型逻辑要变。

6月12日周四
  1. Cognition 模型 / Devin 博客(网页)71

    Cognition 撰文反对构建多智能体系统,提出上下文工程两条原则

    Cognition 发文《Don't Build Multi-Agents》,提出上下文工程两条原则:共享完整 agent 轨迹的上下文,以及行动携带隐含决策、冲突决策导致糟糕结果。

    推荐理由:Cognition 以自身 agent 构建经验提炼上下文工程两条原则,并解释为何多智能体架构在 2025 年仍然脆弱。

6月5日周四
  1. ARC Prize:官方博客67

    ARC Prize 实测各大 AI 推理系统,ARC-AGI 上没有明显赢家

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,ARC-AGI-2 上则全数近乎失败,最高仅 Claude Opus 4 的 8.6%。文章指出测试时计算扩展方法堆叠可提升准确率但效率大幅下降,ARC-AGI-2 上的一致性差说明前沿系统存在共同局限,AGI 仍需新想法。

    推荐理由:官方实测给出了各推理系统在 ARC 上的准确率与成本双轴数据,读者可据此按自身需求选型而非追单一赢家。

  2. TensorZero:实验与工程博客72

    TensorZero 逆向 Cursor 的 LLM 客户端并公开其系统提示词

    TensorZero 团队将自家的开源框架作为自托管代理接入 Cursor,经 Ngrok 和 Nginx 绕过 Cursor 服务器与 CORS 限制后,成功观察并控制其全部 LLM 调用。

    推荐理由:作者实测把自托管代理接进 Cursor,读者可以照着复现并查看其真实提示词与模型调用。

5月13日周二
  1. LlamaIndex:产品、工程与评测60

    LlamaIndex 为 Agent 推出改进的长短期 Memory 组件

    LlamaIndex 发布改进的 Memory 组件,为 Agent 提供短长期记忆能力。基础形式将聊天记录按 token 上限存入 SQL 数据库(默认内存 SQLite)。

    推荐理由:官方介绍了新版 Memory 组件的设计与用法,开发者可以对照三类长期记忆块判断是否迁移自己的 Agent 工作流。

4月24日周四
  1. Anthropic:Alignment Science Blog(网页)63

    Anthropic 提出对齐 Bumpers 策略,主张用多层防护捕捉并修正早期 AGI 失准

    Anthropic 对齐科学博客提出名为 Bumpers 的对齐策略:即使无法彻底解决对齐问题,也可通过多层相互独立的防护来捕捉和修正失准模型。核心流程包括微调、并行审计、发现警告信号后回溯重训,以及部署后监控等次级防线,方法涵盖机制可解释性审计、红队测试、Clio 式批量监控和分阶段发布等。

    推荐理由:文章提出以多层独立防护快速迭代修正对齐失败的策略,并说明其假设、局限与相关研究议程。

4月22日周二
  1. ARC Prize:官方博客70

    ARC Prize 实测 o3 与 o4-mini 在 ARC-AGI 上的表现

    ARC Prize Foundation 首次公布 OpenAI o3 与 o4-mini 在 ARC-AGI 上的公开测试结果。o3-low 在 ARC-AGI-1 Semi Private Eval 得分 41%,o3-medium 达 53%,两者在 ARC-AGI-2 上均未超过 3%;o4-mini-low 在 ARC-AGI-1 得 21%。

    推荐理由:ARC Prize 公布了自家基准上 o3 与 o4-mini 的完整实测数据和高推理档的失真问题,读者可借此校准对推理档位选择的预期。

4月18日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude Code:智能体编码最佳实践指南

    Claude Code 提供了一套完整的智能体编程工具与框架。其核心遵循“先探索、再计划、后编码”的工作流,并通过配置 CLAUDE.md 文件、管理权限和连接 MCP 服务器来优化环境。最佳实践强调为 Claude 提供工作验证方法、积极管理上下文、使用子代理进行调查,以及利用检查点回退来处理复杂任务。文档还详细介绍了在 VS Code、JetBrains IDE、Slack 及 CI/CD 中的集成使用,并提供了避免常见失败模式的实用建议。

    推荐理由:Anthropic 官方出的 Claude Code 最佳实践,不是泛泛而谈的入门指南,而是从 CLAUDE.md 配置到 subagent 编排的完整工程手册,用 Claude Code 做日常开发的人直接照抄就能少踩一半坑。

3月26日周三
  1. OpenAI Developers(RSS)79

    OpenAI 演示如何使用 4o 模型生成图像

    OpenAI 发布介绍视频,演示如何使用 4o 模型创建图像。视频展示了 4o 的图像生成功能的基本用法。

    推荐理由:官方演示如何用 4o 模型生成图像,想上手该功能的开发者可以直接参照操作。

3月20日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)71

    “思考”工具:让Claude在复杂工具使用场景中停下来思考

    Anthropic为Claude引入了“思考”工具,允许其在生成最终响应前插入一个专门的思考步骤,以处理多步骤工具调用链、分析外部信息并遵循复杂策略。该工具与更早发布的“扩展思考”功能不同,更侧重于在响应生成过程中对新信息进行针对性推理。在τ-Bench基准测试中,该工具显著提升了Claude在客户服务场景的表现。文章建议在需要复杂工具调用、长链分析或高成本序列决策的场景中使用它,并提供了标准的工具实现格式。

    推荐理由:Anthropic 官方给出的 think tool 实操指南,附带 τ-Bench 和 SWE-bench 的真实数据,做 Agent 或 tool use 的开发者可以直接抄 prompt 模板,比自己瞎试强太多。

2月13日周四
  1. Cognition 模型 / Devin 博客(网页)64

    Linktree 复盘用 Devin 一个月写约 300 个 PR 的实践经验

    Linktree 团队分享使用 Cognition 的 AI 智能体 Devin 一个月的成果:Devin 完成约 300 个 PR,其中约 100 个已合并,主要是修复客户报告的 bug、实现小功能和原型验证。

    推荐理由:Linktree 官方复盘 Devin 落地细节,给出任务筛选标准、多 Devin 协作和 API 用法等可直接迁移的经验。

1月29日周三
  1. ARC Prize:官方博客72

    ARC Prize 分析 DeepSeek R1-Zero 与 R1 在 ARC-AGI-1 上的结果

    ARC Prize 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得分 14% 和 15.8%,与 o1(低算力 20.5%)相当,而 o3-preview 低算力达 75.7%。

    推荐理由:作者基于 ARC-AGI-1 实测数据比较 R1-Zero 与 o1/o3,提出纯 RL 训练可绕过人类标注瓶颈和推理经济学两个分析角度。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)78

    Answer.AI 实测 Devin:20 项任务仅 3 次成功,自主编程能力存疑

    Answer.AI 团队对 AI 软件工程师 Devin 进行了为期一个月的深度测试。尽管早期在 API 集成等简单任务中表现尚可,但在扩展至新项目创建、研究及代码修改等 20 项真实任务时,结果令人失望:仅 3 项成功,14 项失败,且无法预测成败规律。Devin 常陷入技术死胡同、生成过度复杂的“面条代码”,或在面对不可行任务时产生幻觉并浪费大量时间。文章指出其实际表现远低于宣传预期,难以替代人类开发者。

    推荐理由:来自知名 AI 评测机构的详实一手数据,揭示了明星产品 Devin 在真实工作流中的局限性,为评估当前自主编程 Agent 的实际成熟度提供了重要参考。

1月6日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录

    升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。

    推荐理由:Anthropic 把自家 SWE-bench agent 的 prompt、工具设计和踩坑经验全公开了,做 coding agent 的人可以直接抄作业,比看十篇二手解读都管用。

12月20日周五
  1. ARC Prize:官方博客83

    ARC Prize 实测 OpenAI o3 在 ARC-AGI-Pub 取得突破性高分

    ARC Prize 官方测试报告显示,OpenAI o3 在 ARC-AGI-1 Semi-Private 评测中以 $10k 算力上限取得 75.7%,高算力(172 倍)配置达 87.5%,Public Eval 高算力为 82.8%、低算力为 91.5%。

    推荐理由:ARC Prize 官方第一手测试数据,给出 o3 在 ARC-AGI 各算力档位的得分、成本和机制解读。

12月19日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)80

    构建高效智能体:从简单模式开始

    Anthropic基于实践经验指出,成功的LLM智能体往往采用简单、可组合的模式,而非复杂框架。文章区分了工作流(预定义路径编排)与智能体(LLM动态自主决策),建议开发者优先采用最简单方案,仅在必要时增加复杂性。许多核心模式直接调用LLM API仅需几行代码即可实现。文中介绍了增强型LLM、提示链等基础构建模块,强调应为特定用例定制检索、工具等增强功能,并推荐通过Model Context Protocol集成第三方工具生态。

    推荐理由:Anthropic 官方把过去一年踩过的坑浓缩成一篇 Agent 架构指南,核心观点是「别上框架,先用最简单的模式」。做 Agent 产品的开发者,这篇比任何第三方教程都值得当 checklist 用。

10月28日周一
  1. ARC Prize:官方博客60

    Mike Knoop 与 François Chollet 阐述结合深度学习与程序合成攻克 ARC-AGI 的技术路径

    ARC Prize 团队于 2024 年 10 月 24 日举办线上活动,说明为何单靠深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路线。

    推荐理由:Chollet 和 Knoop 系统论述 LLM 局限于记忆技能、需结合程序合成才能胜出 ARC-AGI 的技术路径,为理解智能与抽象层次提供了可迁移的分析框架。

9月19日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    引入上下文检索:大幅提升RAG系统准确性的新方法

    传统RAG系统在编码时易丢失上下文,导致检索失败。新方法“上下文检索”通过“上下文嵌入”和“上下文BM25”两项子技术,在检索前为文本块添加解释性上下文,能将检索失败次数减少49%,结合重排序后降幅可达67%,显著提升了下游任务性能。对于小于20万token的小型知识库,可直接将其完整内容放入提示词,结合Claude的提示词缓存功能,能降低超过2倍的延迟和高达90%的成本。对于大型知识库,上下文检索则提供了可扩展的解决方案。

    推荐理由:Anthropic 把 RAG 检索失败率砍了 67%,方法不复杂但数据扎实,做知识库的开发者可以直接抄 cookbook 上手,是那种读完当天就能改进生产环境的实用帖。

9月13日周五
  1. ARC Prize:官方博客71

    ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

    ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。

    推荐理由:ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。

9月12日周四
  1. Cognition 模型 / Devin 博客(网页)60

    Cognition 评测 OpenAI o1 系列在 Devin 编码智能体上的表现并公开评测方法

    Cognition 公布在 Devin 中测试 o1-mini 和 o1-preview 数周的早期结果:在内部基准 cognition-golden 上,Devin-Base 从 GPT-4o 的 25.9% 提升到 o1-mini 的 34.6%、o1-preview 的 51.8%,生产版 Devin 达 74.2%。

    推荐理由:Cognition 作为 Devin 开发方给出 o1 系列的实测对比数据,并完整披露其内部基准 cognition-golden 的评测方法。

6月12日周三
  1. ARC Prize:官方博客62

    ARC Prize 发布 Day 1 复盘并回应算力与奖金争议

    ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。

    推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。

6月11日周二
  1. LlamaIndex:产品、工程与评测60

    LlamaIndex 教程:自定义属性图谱索引以提升 GraphRAG 准确率

    Neo4j 客座教程讲解如何在 LlamaIndex 中自定义属性图谱索引,用 SchemaLLMPathExtractor 做模式引导抽取、用文本嵌入加编辑距离做实体去重,并实现先识别查询实体再分别执行 VectorContextRetriever 的自定义检索器。示例使用 250 篇新闻文章和 Neo4j 图存储,最后用自定义检索器完成问答回流,代码托管在 GitHub。

    推荐理由:原文给出图谱构建、实体去重和自定义检索的完整可复现代码,读者可以迁移到自己的 GraphRAG 项目。

5月14日周二
  1. LlamaIndex:产品、工程与评测62

    用 LlamaIndex 和 llamafile 搭建本地私有研究助手

    LlamaIndex 发布 Mozilla 客座教程,讲解用 llamafile 在笔记本上本地运行 LLM,并以 TinyLlama-1.1B 作为 LLM 与嵌入后端,结合 Wikipedia 页面与私有文档构建完全本地运行的 RAG 研究助手。

    推荐理由:教程给出从下载运行 llamafile 到用 LlamaIndex 搭建本地 RAG 研究助手的完整代码路径,可迁移到其他主题。

5月12日周日
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

1月30日周二
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 讲解 Agentic RAG:用多文档 Agent 构建可扩展的 RAG 架构

    LlamaIndex 博客介绍 Agentic RAG 架构:将最多 100 篇文档拆分后,为每篇文档创建具备嵌入搜索与摘要能力的文档 Agent,再由顶层 meta-agent 通过工具检索和 CoT 回答用户问题,并用 Rerank 端点对文档按相关性排序。

    推荐理由:原文拆解了多文档 Agent 与顶层 meta-agent 的编排结构,并给出可运行的 Colab 示例,读者可据此理解 Agentic RAG 的扩展方式。

1月25日周四
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 教程:用 LlamaIndex、Qdrant 和 Render 构建可学习的 Slack 机器人

    LlamaIndex 发布分步教程,教读者用 LlamaIndex、Qdrant 和 Render 构建并部署一个监听 Slack 对话、存储事实并回答问题的 Slackbot。

    推荐理由:LlamaIndex 官方教程从零搭建一个能监听 Slack 消息、用向量索引存储记忆并用 Qdrant 持久化的机器人,步骤完整可复现。