返回 RAG 工程实战目录

名词术语表

按类别查询 RAG 工程术语

附录 · 参考材料 | 服务于全生命周期各篇(01~11)| 按类别速查,解释保持一句话,详见对应篇目

一、基础概念

术语全称/英文解释详见
RAGRetrieval-Augmented Generation检索增强生成:先检索资料再交给大模型作答01
LLMLarge Language Model大语言模型,如 Qwen、DeepSeek、GPT01
Token模型处理文本的最小单位,约等于 0.5~1.5 个汉字,计费与上下文长度都按它算01
幻觉Hallucination模型生成无依据或与事实冲突的内容;RAG 提供证据,但仍需忠实度校验与拒答策略01
知识截止Knowledge Cutoff模型训练数据的时间边界,之后的事它不知道01
微调Fine-tuning用自有数据继续训练模型;管"怎么答",与 RAG(管"答什么")互补01
私有化部署On-Premise系统部署在自有或受控环境;是否数据不出域还取决于模型、Embedding、日志和外部连接配置02
Prompt提示词给模型的输入指令与上下文;RAG 中=指令+检索切片+问题06
Temperature控制采样随机性的参数之一;低值通常更稳定,但不能保证事实正确,具体范围按模型与评测结果确定06

二、模型与向量化

术语全称/英文解释详见
Embedding嵌入/向量化把文本映射成高维数字向量,语义相近则向量相近01/05
向量维度Dimension向量的数字个数,如 bge-large 为 1024 维;建库后不可中途更换模型05
余弦相似度Cosine Similarity衡量两个向量方向是否接近,1 最相似;检索打分的标准算法05
L2 归一化Normalize把向量长度缩放为 1,之后内积=余弦相似度,计算更快05
Cross-Encoder交叉编码器把问题和切片拼在一起整体打分的精排模型,准但慢(Rerank 的原理)06
BGE / M3E常用开源中文 Embedding 模型系列,可私有化部署02
TEIText Embeddings InferenceHuggingFace 出的 Embedding 推理服务,批量编码高性能04
vLLM面向 LLM 服务的推理引擎之一,是否采用应结合模型兼容性、吞吐、延迟和运维要求评估04/10
Ollama本地一键跑开源模型的工具,开发测试环境常用04
KV CacheLLM 推理时的显存缓存,并发越多占用越大,是显存规划关键10

三、入库流水线

术语全称/英文解释详见
解析Parsing从 PDF/Word 等格式中提取结构化文本(正文、表格、标题层级)05
OCROptical Character Recognition光学字符识别:扫描件/图片 → 文本05
版面分析Layout Analysis识别页面元素(正文/表格/页眉页脚/水印),决定哪些留哪些扔05
文本层Text LayerPDF 内嵌的可复制文字;无文本层或过少才走 OCR05/07
切片Chunking把长文档切成适合检索的片段,是检索质量的第一决定因素05
chunk_size单个切片的目标长度,应按文档结构、模型 token 口径和评测结果选择05
overlap重叠相邻切片重复的内容,可降低边界截断风险,也可能制造重复召回,需要实验确定05
递归分割Recursive Splitting按 段落→句子→字符 逐级降级切分,尽量保住语义完整05/07
语义切片Semantic Chunking用向量相似度找语义突变点来断句,比固定长度更聪明05
父子切片Parent-Child Chunk小切片用于检索(准),命中后取其父切片喂给模型(上下文全)05
元数据Metadata / Payload随切片存储的文档名、页码、部门、密级等信息,支撑引用展示与权限过滤05/03
幂等Idempotency同一操作重复执行结果不变;用"doc_id:chunk_index"做向量 ID 实现重复入库即覆盖03/07
内容哈希SHA256文件内容的指纹,用于判重复上传07
魔数校验Magic Number读文件头字节判断真实格式,防止改扩展名伪装(.exe 改 .pdf)07
索引Indexing向量+原文+元数据写入向量数据库,建立可检索结构05

四、检索与生成

术语全称/英文解释详见
查询改写Query Rewrite把口语化提问改成检索友好的规范表述06
多查询扩展Multi-QueryLLM 生成多个角度的查询分别检索再合并,提升召回06
HyDEHypothetical Document Embeddings先让 LLM 编一个假设性答案,拿它去检索(答案比问题更像原文)06
混合检索Hybrid Search向量检索(语义)+ BM25(关键词)两路并发再融合05/06
BM25经典关键词相关性打分算法,精确命中术语/文号/人名06
倒排索引Inverted Index"词 → 包含它的文档"的索引结构,ES/BM25 的底层06
RRFReciprocal Rank Fusion多路检索结果融合公式:score=Σ 1/(k+rank),k 常取 6006/07
重排Rerank用 Cross-Encoder 对粗排候选精排,把最相关的顶到前面06
粗排/精排粗排=向量库快速捞出 top20~50;精排=Rerank 选出 top3~8 进 Prompt06
top_k检索返回的前 K 条结果数;K 大召回高但噪声与 token 成本也高06
拒答Refusal检索无结果或相关度过低时回答"未找到相关内容",禁止硬编06
引用溯源Citation答案标注资料来源(文档名+页码),可信度的关键06
SSEServer-Sent Events服务器单向推送协议,实现打字机式流式输出06/07
兜底/降级Fallback上游异常时的保底策略,如 LLM 超时则返回纯检索结果06
Prompt 注入Prompt Injection用话术诱导模型无视规则("忽略之前的指令…"),安全测试必测08

五、测试与评测

术语全称/英文解释详见
评测集Golden QA Set人工整理的"问题+标准答案+标准切片"集合,效果回归的考卷09
golden_chunks评测集中某问题应该命中的标准切片,用于计算检索指标09
Recall@K召回率前 K 条检索结果命中了多少标准切片,检索质量核心指标09
Precision@K精确率前 K 条里有多少是相关的09
MRRMean Reciprocal Rank标准切片排得越靠前分越高,衡量排序质量09
NDCG@K带位置衰减的排序质量指标,方案对比常用09
Hit Rate命中率有没有命中(二值),最直观的底线指标09
忠实度Faithfulness答案是否严格基于检索资料、无编造,幻觉的量化指标09
幻觉率Hallucination Rate答案中编造内容的比例,越低越好09
Ragas开源 RAG 自动化评测框架,用 LLM 给忠实度/相关性打分09
基线Baseline首次评测建立的指标基准,后续所有变更与它对比09
回归评测Regression Eval任何链路变更(切片/Prompt/模型)后重跑评测集,不低于基线才放行09/10
准入/准出Entry/Exit Criteria测试开始与结束的判定标准(如 P0 用例 100% 通过)08
用例八要素用例编号、模块、标题、优先级、前置条件、测试数据、操作步骤、预期结果08
坏例回流Bad Case Loop线上差评问答 → 归因 → 修复 → 加入评测集 → 回归 的闭环11

六、存储与中间件

术语全称/英文解释详见
向量数据库Vector Database专为向量相似度检索设计的数据库01/05
Milvus开源分布式向量库,大规模生产主流选择02
Qdrant轻量开源向量库,单容器即可跑,中小规模推荐02/04
PGVectorPostgreSQL 的向量检索插件,已有 PG 的团队低成本选择02
FAISSFacebook 开源的向量检索算法库(库非服务),适合实验02
MinIO开源对象存储(兼容 S3 协议),存文档原件,是全量重建的底气04/10
ESElasticsearch分布式搜索引擎,提供 BM25 关键词检索,混合检索的关键词路06
Redis内存数据库,本系列中做任务队列与缓存03/04
MySQL关系型数据库,存文档/任务/切片等元数据03
ORMObject-Relational Mapping代码对象与数据库表的映射框架(如 SQLAlchemy)07
DDLData Definition Language建表语句,03 篇含全套表结构03
CeleryPython 分布式任务队列,入库流水线的异步执行框架03/07
消息队列MQ异步解耦组件(Kafka/RabbitMQ),文档接收分发的通道05

七、部署与运维

术语全称/英文解释详见
Docker / Compose容器化部署;Compose 用一个 YAML 编排多容器04/10
K8sKubernetes容器编排系统,可提供调度、自愈和扩缩容;是否需要取决于规模与运维能力10
HPAHorizontal Pod AutoscalerK8s 水平自动扩缩容,按 CPU 等指标自动加减副本10
Nginx反向代理网关:HTTPS、限流、负载均衡;SSE 必须关缓冲10
CI/CDContinuous Integration/Delivery持续集成/交付流水线:lint→测试→构建→部署10
评测卡点Eval GateRAG 特有 CI 阶段:链路变更必须过评测集回归才能上线10
ConfigMap / SecretK8s 的配置与密钥管理对象;密钥不进代码、不进镜像、不打日志10
Prometheus / Grafana监控指标采集与可视化大盘的标准组合10/11
健康检查Health Check定期探测服务存活,失败自动重启/摘除流量10
灰度发布Canary Release新版本先给小部分用户(10%→50%→100%),有问题影响可控10
蓝绿部署Blue-Green新旧两套环境并存,验证通过后切流量,回滚极快10/11
回滚Rollback出问题时恢复上一已验证版本;所需时间由部署方式、数据变更和演练结果决定10
P9595th Percentile95% 的请求都快于该值,比平均值更能反映体验08/10
RPORecovery Point Objective数据可容忍的最大丢失时间窗口(如 binlog 实时=RPO≤5min)10

八、框架与工具速查

术语解释详见
LangChain组件最全的 LLM 应用编排框架,代码级灵活02/04
LlamaIndex专注数据索引与检索的 RAG 框架02
RAGFlow / Dify / MaxKB / FastGPT开源成品知识库平台,开箱即用适合私有化快速落地02
FastAPIPython 高性能 Web 框架,本系列应用层选型07
PaddleOCR百度开源 OCR,中文识别强、可私有化02/04
Tesseract老牌开源 OCR,中文效果一般02
PyMuPDF / pdfplumberPDF 解析库;前者快、后者表格抽取好04/05
Unstructured / Tika通用多格式解析框架,一套 API 吃几十种格式05
pytestPython 测试框架,配 coverage 统计覆盖率07
Trivy容器镜像漏洞扫描,高危阻断进 CI10

说明 使用说明

  • 遇到陌生名词先查本表,按"详见"列跳到对应文章展开
  • 各篇新增术语时,随手补充到本表对应分类,保持同步