跳到正文
SL Blog 技术探索 · 工程实践 · AI 时代思考

🔍 RAG 系列

检索增强生成(RAG)从原理到落地:核心架构、源码导读、Embedding 评测,以及完整的评测体系与实验。

AI 工程 · 9 篇

  1. 01
  2. RAG 系列(一):核心原理与完整链路

    面向第一次接触RAG的读者。本篇先建立“它为什么存在、每个名词是什么意思、数据到底怎样流动”的整体概念,不要求你预先了解向量数据库或大模型框架。

  3. 02
  4. RAG 系列(二):源码导读与动手实验

    本篇把第一篇的名词映射到真实代码。阅读目标不是背Python,而是能够沿数据流解释:“这一行接收什么、产生什么、为什么下一步需要它”。

  5. 03
  6. RAG 系列(三):Embedding 检索评测与 Benchmark

    本篇回答一个工程问题:两个Embedding模型都能运行,怎样判断谁更适合当前真实知识库?重点评测Retriever,不把LLM的语言风格和随机性混进实验。

  7. 04
  8. RAG 系列(四):为什么 RAG 必须建立完整评测体系

    本篇先不讲指标公式,也不急着打开代码。我们先回答一个更根本的问题:一个RAG系统已经能返回答案,为什么还要花力气建立评测体系?

  9. 05
  10. RAG 系列(五):可信评测数据与检索指标

    本篇解决两个问题:怎样保证评测试卷可信,以及Hit、Recall、Precision、MRR、nDCG、Pairwise和置信区间分别验证什么场景。

  11. 06
  12. RAG 系列(六):无答案判断与 Context 评测

    Retriever总会返回“最相似”的内容,但最相似不等于足以回答。本篇先建立无答案决策,再检查TopK进入LLM之前是否丢失、重复或污染了证据。

  13. 07
  14. RAG 系列(七):回答质量、幻觉与引用评测

    检索命中只是“模型有机会答对”。本篇继续验证最终回答是否覆盖标准事实、是否只使用Context、是否回应问题,以及引用是否真正支持结论。

  15. 08
  16. RAG 系列(八):系统约束与 RAG 发布门槛

    检索和回答质量再高,也不能抵消一次权限泄漏、旧版本误召回或不可接受的长尾延迟。本篇把这些不能被平均分掩盖的问题纳入统一Gate。

  17. 09
  18. RAG 系列(九):从代码到完整评测实验

    前五篇建立了指标和设计。本篇把它们映射到真实代码、命令和产物,并用`stage2-20260824-final`解释一次完整实验应该怎样复现、审计和转化为优化任务。