返回 AI 测试成长路线
Phase 01 / AI Quality Foundation 01

大模型基础与测试思维教程

不从模型术语背诵开始,而是先学会辨认系统边界、稳定约束和失败证据,把概率输出变成可以评估、复现和回归的质量对象。

9 个章节概率输出 + 硬约束最小评估集
01

AI 测试不是把 expected 写得更模糊

从单点断言到质量证据

确定性系统

同一输入通常对应明确状态、字段或数据结果。失败时可以直接比较 actual 与 expected。

概率性 AI 系统

措辞和步骤可能变化,但事实、业务约束、安全边界与任务目标仍必须稳定满足。

仍然可以确定性断言的部分

对象可以硬断言需要质量评估
接口与工具Schema、权限、参数、状态和副作用工具选择是否合理
RAG文档版本、租户过滤、引用 ID召回相关性与回答忠实度
模型回答禁用内容、必需字段、事实约束完整性、表达质量与帮助程度
运行过程超时、预算、重试和日志字段用户体验与人工接管时机
概率性不等于无法测试。正确做法是把硬约束、质量维度、风险样本和人工裁决拆开,而不是只问“回答看起来对不对”。
02

先识别被测的是哪一层

模型只是系统的一部分

AI 系统质量链

业务输入用户与场景
上下文Prompt / RAG
模型生成与推理
工具查询与副作用
业务结果回答、状态、审计

一次失败可能来自不同组件

现象可能来源先看什么证据
回答引用旧政策索引未更新、版本过滤错误、模型未使用证据knowledge_version、召回结果、引用映射
Agent 给出正确解释但创建错工单工具参数或身份绑定错误工具轨迹、actor、argument digest
同一问题偶发编造数值上下文缺证据、采样波动或停止条件缺失输入证据、参数、重复运行分布
升级模型后成本翻倍分词、输出长度、工具循环或重试变化Token、调用次数、模型与 Prompt 版本
03

Token 和上下文窗口决定模型实际看到了什么

不是字符数

三个容易误判的事实

  • Token 是模型处理文本的单位,同样字数在不同模型和语言中消耗不同。
  • 上下文窗口包含系统规则、用户输入、历史消息、检索结果、工具结果和预留输出。
  • 超过预算时,系统可能截断、摘要或丢弃内容;测试必须知道优先保留了什么。

上下文边界用例

当……时应该验证
当前规则与旧版本同时出现当前证据优先,历史材料只用于提示风险
长对话需要压缩身份、已确认事实和审批状态不能被摘要改写
检索结果超过预算按相关性和权限裁剪,不能静默丢掉关键证据
输出接近长度上限结构完整或明确失败,半截结果不能进入正式资产
04

采样参数改变的是输出分布

一次通过不等于稳定

常见参数与测试影响

因素影响测试方法
temperature输出探索程度和波动固定输入重复运行,比较关键约束满足率
top_p候选 Token 的概率范围和 temperature 分开做对照,不同时乱调
max output结构是否可能截断构造长输出,验证安全终止与恢复
seed(若支持)提高实验复现能力记录 seed,但不把它当跨版本绝对复现承诺
模型版本能力、分词、成本和安全策略变化任何版本变化都重跑锁定评估集
一次评估运行必须保存的版本
run_id: eval-20260810-014
model: provider/model@version
prompt: customer-assistant@1.4.0
knowledge: policy-index@2026-08-10
tools: after-sale-mcp@2.3.1
parameters: { temperature: 0.2, top_p: 0.9, max_output_tokens: 1600 }
dataset: after-sale-eval@v5
05

先给失败分类,才能找到正确控制点

相同错答可能不同根因

AI 系统失败地图

类别典型表现优先修复位置
输入失败文档漏页、需求冲突、上下文污染解析、证据优先级与停止条件
检索失败漏召、噪声、旧版本、跨租户证据Chunk、索引、过滤与重排
生成失败事实错误、遗漏、拒答错误、格式破坏模型、Prompt、输出契约与评估集
工具失败选错工具、参数串用、重复副作用Schema、鉴权、幂等与审批
安全失败提示注入、越权、泄漏和规则绕过确定性策略、沙箱和红队回归
运行失败P95 变慢、Token 激增、队列失控限流、缓存、降级与可观测性
06

用四类测试预言判断输出

不要只依赖模型打分

测试预言组合

预言适合判断示例
确定性规则Schema、枚举、金额、权限和禁用动作退款金额不得超过实付
关键点金标必须覆盖和不可接受错误必须检查订单归属与重复回调
关系/变形断言没有唯一措辞但关系应稳定只改变用户名不应改变政策结论
人工 Rubric业务价值、完整性和解释质量两名审核者按统一维度独立裁决
LLM-as-a-Judge 可以承担规模化初筛,但评审模型、评分 Prompt 和样本也要版本化;资金、权限和隐私等高风险结论不能只由另一个模型放行。
07

把一次聊天变成可复现实验

输入、版本、轨迹都留证据

AI 系统质量链

冻结输入样本与证据
记录版本模型/Prompt/知识
重复运行观察分布
分类失败定位控制点
发布或回退保留差异

最小实验纪律

  • 开发集用于调试,锁定回归集不得反复拿来调 Prompt。
  • 每次只改变一个主要因素,避免模型、Prompt、索引同时变化后无法归因。
  • 报告分桶结果与最差样本,不用平均分掩盖 P0 失败。
  • 保存原始输出、工具轨迹和机器检查;展示时再脱敏。
  • 无法复现的线上失败进入挑战集,并记录当时版本和环境。
08

先做 20 条最小评估集

小而能暴露风险

售后助手起步分层

样本桶数量重点
正常任务4事实、步骤和完成条件
信息缺失3询问澄清,不猜数值
边界与冲突4状态、金额、来源冲突
检索与版本3正确证据、引用和知识更新
工具与权限3身份绑定、参数和审批
安全与故障3注入、超时、限流和安全降级

完成标准

每条样本都包含输入、初始状态、必须满足、禁止发生、证据版本和失败严重度。它不是完整评估体系,而是进入下一篇教程前可以亲手跑通的最小基线。

09

建立自己的第一份 AI 测试基线

练习与检查

练习

  1. 画出一个 AI 功能从输入、上下文、模型、工具到业务结果的链路。
  2. 列出其中仍可使用确定性断言的接口、权限、状态和副作用。
  3. 准备 20 条分层样本,并为高风险样本写 must_cover 与 must_not。
  4. 固定模型、Prompt、知识、工具和参数版本,重复运行并记录分布。
  5. 把失败归入输入、检索、生成、工具、安全或运行层,再决定修复位置。

完成检查

知道模型不是完整系统
能区分硬断言和质量评估
理解上下文截断风险
不把一次输出当稳定结论
失败有分类而非只记错答
实验版本可追溯
锁定集与开发集分开