附录 · 参考材料 | 服务于全生命周期各篇(01~11)| 按类别速查,解释保持一句话,详见对应篇目
一、基础概念
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| RAG | Retrieval-Augmented Generation | 检索增强生成:先检索资料再交给大模型作答 | 01 |
| LLM | Large Language Model | 大语言模型,如 Qwen、DeepSeek、GPT | 01 |
| Token | — | 模型处理文本的最小单位,约等于 0.5~1.5 个汉字,计费与上下文长度都按它算 | 01 |
| 幻觉 | Hallucination | 模型生成无依据或与事实冲突的内容;RAG 提供证据,但仍需忠实度校验与拒答策略 | 01 |
| 知识截止 | Knowledge Cutoff | 模型训练数据的时间边界,之后的事它不知道 | 01 |
| 微调 | Fine-tuning | 用自有数据继续训练模型;管"怎么答",与 RAG(管"答什么")互补 | 01 |
| 私有化部署 | On-Premise | 系统部署在自有或受控环境;是否数据不出域还取决于模型、Embedding、日志和外部连接配置 | 02 |
| Prompt | 提示词 | 给模型的输入指令与上下文;RAG 中=指令+检索切片+问题 | 06 |
| Temperature | — | 控制采样随机性的参数之一;低值通常更稳定,但不能保证事实正确,具体范围按模型与评测结果确定 | 06 |
二、模型与向量化
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| Embedding | 嵌入/向量化 | 把文本映射成高维数字向量,语义相近则向量相近 | 01/05 |
| 向量维度 | Dimension | 向量的数字个数,如 bge-large 为 1024 维;建库后不可中途更换模型 | 05 |
| 余弦相似度 | Cosine Similarity | 衡量两个向量方向是否接近,1 最相似;检索打分的标准算法 | 05 |
| L2 归一化 | Normalize | 把向量长度缩放为 1,之后内积=余弦相似度,计算更快 | 05 |
| Cross-Encoder | 交叉编码器 | 把问题和切片拼在一起整体打分的精排模型,准但慢(Rerank 的原理) | 06 |
| BGE / M3E | — | 常用开源中文 Embedding 模型系列,可私有化部署 | 02 |
| TEI | Text Embeddings Inference | HuggingFace 出的 Embedding 推理服务,批量编码高性能 | 04 |
| vLLM | — | 面向 LLM 服务的推理引擎之一,是否采用应结合模型兼容性、吞吐、延迟和运维要求评估 | 04/10 |
| Ollama | — | 本地一键跑开源模型的工具,开发测试环境常用 | 04 |
| KV Cache | — | LLM 推理时的显存缓存,并发越多占用越大,是显存规划关键 | 10 |
三、入库流水线
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| 解析 | Parsing | 从 PDF/Word 等格式中提取结构化文本(正文、表格、标题层级) | 05 |
| OCR | Optical Character Recognition | 光学字符识别:扫描件/图片 → 文本 | 05 |
| 版面分析 | Layout Analysis | 识别页面元素(正文/表格/页眉页脚/水印),决定哪些留哪些扔 | 05 |
| 文本层 | Text Layer | PDF 内嵌的可复制文字;无文本层或过少才走 OCR | 05/07 |
| 切片 | Chunking | 把长文档切成适合检索的片段,是检索质量的第一决定因素 | 05 |
| chunk_size | — | 单个切片的目标长度,应按文档结构、模型 token 口径和评测结果选择 | 05 |
| overlap | 重叠 | 相邻切片重复的内容,可降低边界截断风险,也可能制造重复召回,需要实验确定 | 05 |
| 递归分割 | Recursive Splitting | 按 段落→句子→字符 逐级降级切分,尽量保住语义完整 | 05/07 |
| 语义切片 | Semantic Chunking | 用向量相似度找语义突变点来断句,比固定长度更聪明 | 05 |
| 父子切片 | Parent-Child Chunk | 小切片用于检索(准),命中后取其父切片喂给模型(上下文全) | 05 |
| 元数据 | Metadata / Payload | 随切片存储的文档名、页码、部门、密级等信息,支撑引用展示与权限过滤 | 05/03 |
| 幂等 | Idempotency | 同一操作重复执行结果不变;用"doc_id:chunk_index"做向量 ID 实现重复入库即覆盖 | 03/07 |
| 内容哈希 | SHA256 | 文件内容的指纹,用于判重复上传 | 07 |
| 魔数校验 | Magic Number | 读文件头字节判断真实格式,防止改扩展名伪装(.exe 改 .pdf) | 07 |
| 索引 | Indexing | 向量+原文+元数据写入向量数据库,建立可检索结构 | 05 |
四、检索与生成
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| 查询改写 | Query Rewrite | 把口语化提问改成检索友好的规范表述 | 06 |
| 多查询扩展 | Multi-Query | LLM 生成多个角度的查询分别检索再合并,提升召回 | 06 |
| HyDE | Hypothetical Document Embeddings | 先让 LLM 编一个假设性答案,拿它去检索(答案比问题更像原文) | 06 |
| 混合检索 | Hybrid Search | 向量检索(语义)+ BM25(关键词)两路并发再融合 | 05/06 |
| BM25 | — | 经典关键词相关性打分算法,精确命中术语/文号/人名 | 06 |
| 倒排索引 | Inverted Index | "词 → 包含它的文档"的索引结构,ES/BM25 的底层 | 06 |
| RRF | Reciprocal Rank Fusion | 多路检索结果融合公式:score=Σ 1/(k+rank),k 常取 60 | 06/07 |
| 重排 | Rerank | 用 Cross-Encoder 对粗排候选精排,把最相关的顶到前面 | 06 |
| 粗排/精排 | — | 粗排=向量库快速捞出 top20~50;精排=Rerank 选出 top3~8 进 Prompt | 06 |
| top_k | — | 检索返回的前 K 条结果数;K 大召回高但噪声与 token 成本也高 | 06 |
| 拒答 | Refusal | 检索无结果或相关度过低时回答"未找到相关内容",禁止硬编 | 06 |
| 引用溯源 | Citation | 答案标注资料来源(文档名+页码),可信度的关键 | 06 |
| SSE | Server-Sent Events | 服务器单向推送协议,实现打字机式流式输出 | 06/07 |
| 兜底/降级 | Fallback | 上游异常时的保底策略,如 LLM 超时则返回纯检索结果 | 06 |
| Prompt 注入 | Prompt Injection | 用话术诱导模型无视规则("忽略之前的指令…"),安全测试必测 | 08 |
五、测试与评测
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| 评测集 | Golden QA Set | 人工整理的"问题+标准答案+标准切片"集合,效果回归的考卷 | 09 |
| golden_chunks | — | 评测集中某问题应该命中的标准切片,用于计算检索指标 | 09 |
| Recall@K | 召回率 | 前 K 条检索结果命中了多少标准切片,检索质量核心指标 | 09 |
| Precision@K | 精确率 | 前 K 条里有多少是相关的 | 09 |
| MRR | Mean Reciprocal Rank | 标准切片排得越靠前分越高,衡量排序质量 | 09 |
| NDCG@K | — | 带位置衰减的排序质量指标,方案对比常用 | 09 |
| Hit Rate | 命中率 | 有没有命中(二值),最直观的底线指标 | 09 |
| 忠实度 | Faithfulness | 答案是否严格基于检索资料、无编造,幻觉的量化指标 | 09 |
| 幻觉率 | Hallucination Rate | 答案中编造内容的比例,越低越好 | 09 |
| Ragas | — | 开源 RAG 自动化评测框架,用 LLM 给忠实度/相关性打分 | 09 |
| 基线 | Baseline | 首次评测建立的指标基准,后续所有变更与它对比 | 09 |
| 回归评测 | Regression Eval | 任何链路变更(切片/Prompt/模型)后重跑评测集,不低于基线才放行 | 09/10 |
| 准入/准出 | Entry/Exit Criteria | 测试开始与结束的判定标准(如 P0 用例 100% 通过) | 08 |
| 用例八要素 | — | 用例编号、模块、标题、优先级、前置条件、测试数据、操作步骤、预期结果 | 08 |
| 坏例回流 | Bad Case Loop | 线上差评问答 → 归因 → 修复 → 加入评测集 → 回归 的闭环 | 11 |
六、存储与中间件
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| 向量数据库 | Vector Database | 专为向量相似度检索设计的数据库 | 01/05 |
| Milvus | — | 开源分布式向量库,大规模生产主流选择 | 02 |
| Qdrant | — | 轻量开源向量库,单容器即可跑,中小规模推荐 | 02/04 |
| PGVector | — | PostgreSQL 的向量检索插件,已有 PG 的团队低成本选择 | 02 |
| FAISS | — | Facebook 开源的向量检索算法库(库非服务),适合实验 | 02 |
| MinIO | — | 开源对象存储(兼容 S3 协议),存文档原件,是全量重建的底气 | 04/10 |
| ES | Elasticsearch | 分布式搜索引擎,提供 BM25 关键词检索,混合检索的关键词路 | 06 |
| Redis | — | 内存数据库,本系列中做任务队列与缓存 | 03/04 |
| MySQL | — | 关系型数据库,存文档/任务/切片等元数据 | 03 |
| ORM | Object-Relational Mapping | 代码对象与数据库表的映射框架(如 SQLAlchemy) | 07 |
| DDL | Data Definition Language | 建表语句,03 篇含全套表结构 | 03 |
| Celery | — | Python 分布式任务队列,入库流水线的异步执行框架 | 03/07 |
| 消息队列 | MQ | 异步解耦组件(Kafka/RabbitMQ),文档接收分发的通道 | 05 |
七、部署与运维
| 术语 | 全称/英文 | 解释 | 详见 |
|---|
| Docker / Compose | — | 容器化部署;Compose 用一个 YAML 编排多容器 | 04/10 |
| K8s | Kubernetes | 容器编排系统,可提供调度、自愈和扩缩容;是否需要取决于规模与运维能力 | 10 |
| HPA | Horizontal Pod Autoscaler | K8s 水平自动扩缩容,按 CPU 等指标自动加减副本 | 10 |
| Nginx | — | 反向代理网关:HTTPS、限流、负载均衡;SSE 必须关缓冲 | 10 |
| CI/CD | Continuous Integration/Delivery | 持续集成/交付流水线:lint→测试→构建→部署 | 10 |
| 评测卡点 | Eval Gate | RAG 特有 CI 阶段:链路变更必须过评测集回归才能上线 | 10 |
| ConfigMap / Secret | — | K8s 的配置与密钥管理对象;密钥不进代码、不进镜像、不打日志 | 10 |
| Prometheus / Grafana | — | 监控指标采集与可视化大盘的标准组合 | 10/11 |
| 健康检查 | Health Check | 定期探测服务存活,失败自动重启/摘除流量 | 10 |
| 灰度发布 | Canary Release | 新版本先给小部分用户(10%→50%→100%),有问题影响可控 | 10 |
| 蓝绿部署 | Blue-Green | 新旧两套环境并存,验证通过后切流量,回滚极快 | 10/11 |
| 回滚 | Rollback | 出问题时恢复上一已验证版本;所需时间由部署方式、数据变更和演练结果决定 | 10 |
| P95 | 95th Percentile | 95% 的请求都快于该值,比平均值更能反映体验 | 08/10 |
| RPO | Recovery Point Objective | 数据可容忍的最大丢失时间窗口(如 binlog 实时=RPO≤5min) | 10 |
八、框架与工具速查
| 术语 | 解释 | 详见 |
|---|
| LangChain | 组件最全的 LLM 应用编排框架,代码级灵活 | 02/04 |
| LlamaIndex | 专注数据索引与检索的 RAG 框架 | 02 |
| RAGFlow / Dify / MaxKB / FastGPT | 开源成品知识库平台,开箱即用适合私有化快速落地 | 02 |
| FastAPI | Python 高性能 Web 框架,本系列应用层选型 | 07 |
| PaddleOCR | 百度开源 OCR,中文识别强、可私有化 | 02/04 |
| Tesseract | 老牌开源 OCR,中文效果一般 | 02 |
| PyMuPDF / pdfplumber | PDF 解析库;前者快、后者表格抽取好 | 04/05 |
| Unstructured / Tika | 通用多格式解析框架,一套 API 吃几十种格式 | 05 |
| pytest | Python 测试框架,配 coverage 统计覆盖率 | 07 |
| Trivy | 容器镜像漏洞扫描,高危阻断进 CI | 10 |
说明 使用说明
- 遇到陌生名词先查本表,按"详见"列跳到对应文章展开
- 各篇新增术语时,随手补充到本表对应分类,保持同步