2026/8/29 5:37:32

AI测试系统CI/CD落地三件套

AI测试系统CI/CD落地三件套 AI测试系统CI/CD落地三件套Checklist 基准集模板 评估指标表以下三份材料均为工程可落地模板可直接裁剪后用于企业内部项目推进与验收。一、AI测试系统接入CI/CD 落地Checklist按「规划→搭建→验证→灰度→上线→治理」全流程拆解每项均对应明确验收标准。阶段检查项是否完成验收标准 / 备注阶段1前期规划与边界定义明确接入CI/CD的AI测试场景范围禁止超范围使用□需书面划定如仅用于UI元素识别、视觉回归初筛、缺陷自动填报不包含核心业务断言明确权责边界AI仅做识别/推荐最终断言权归属□规则模型不输出Pass/Fail最终结论判定权由规则引擎/人工持有完成业务风险分级对应不同门禁策略□核心交易链路仅旁路观测非核心页面可逐步放开弱门禁制定降级与回滚预案□AI服务故障时自动切换为传统测试方案不阻塞主流水线确认数据合规与脱敏方案□截图、日志、HAR中的敏感信息手机号、身份证、密钥完成脱敏处理阶段2工程化架构搭建输入标准化层落地□所有素材截图、日志、HAR统一尺寸、格式、裁剪规则、脱敏规则输出强约束落地□所有模型输出强制JSON Schema校验非法输出自动重试/降级不流入下游模型分层路由落地□实现「传统规则→轻量模型→强模型」三级路由支持按置信度自动升级结果缓存机制落地□基于「输入哈希Prompt版本模型版本」做缓存版本变更自动失效降级熔断机制落地□超时、错误率飙升、整体置信度下降时自动熔断跳过AI测试全链路可追溯落地□每次调用的输入、输出、模型版本、Prompt版本、耗时、置信度全量落库资产版本化管理落地□Prompt、模型参数、基准集全部纳入Git版本控制变更可回滚阶段3基准测试集与评测体系建设核心场景黄金基准集构建完成□覆盖正常、异常、边界、易错、兼容性五类场景每条数据真值标注完成且经过复核□双人标注交叉复核真值格式与模型输出格式完全一致基准集分类维度完整□支持按场景、难度、缺陷类型、页面类型多维度筛选评测离线评测流水线搭建完成□可一键执行全量/分场景评测自动输出指标对比报告Bad Case闭环机制建立□线上发现的错误案例标注后固定回流至基准集阶段4离线验证与调优首轮全量基准集评测完成□输出各场景准确率、误报率、漏报率完整报告核心场景误报率达到灰度阈值□建议阈值≤ 1%输出一致性验证通过□相同输入重复执行≥3次输出一致性 ≥ 99.5%Prompt与模型参数版本冻结□灰度期间不随意变更变更必须重新跑基准集与现有测试框架联调通过□可被Playwright/Pytest/Jenkins正常调用返回格式适配阶段5灰度接入·旁路观测期旁路并行模式上线□AI测试与传统测试并行运行结果仅记录展示不阻断流水线每日差异报告自动产出□自动对比AI结果与真值/人工结果输出误报、漏报清单按周迭代优化机制落地□每周复盘Bad Case优化Prompt/路由同步扩充基准集连续稳定运行达标□连续运行≥2周核心指标持续稳定在阈值内团队同步与培训完成□研发、测试团队知晓AI测试定位、误报处理方式与反馈渠道阶段6灰度接入·弱门禁期弱门禁模式开启□AI通过直接放行AI不通过标记为「待复核」不强制阻断构建高置信度缺陷试点阻断□置信度≥95%的明确缺陷可试点直接阻断需配套快速申诉通道人工复核流程落地□有明确复核入口、SLA与误判标记机制周度复盘机制运行□每周统计阻断准确率、人工复核工作量、研发反馈连续稳定运行达标□连续运行≥4周误报率持续低于阈值研发无大规模负面反馈阶段7正式上线·强门禁与治理成熟场景升级为强门禁□仅对长期验证稳定的场景开放失败直接阻断构建一键降级开关可用□异常情况下可一键关闭AI门禁切回传统模式月度质量复盘机制落地□每月回顾指标变化、Bad Case、成本变化输出质量报告变更门禁生效□模型版本、Prompt变更必须先过基准集评测无劣化方可上线成本核算机制落地□按月统计调用成本优化路由策略控制成本在预算内二、基准测试集设计模板2.1 通用字段规范所有场景通用基准集采用结构化表格管理每条用例对应唯一真值与模型输出格式严格对齐。字段名类型必填说明case_id字符串是唯一用例ID命名规则场景分类_子场景_序号如ui_recognize_form_001scene_category枚举是场景大类UI元素识别 / 视觉回归 / 兼容性 / 缺陷识别 / 日志分析sub_scene字符串是子场景如表单页、列表页、弹窗、报错页、空状态页difficulty枚举是难度等级低 / 中 / 高用于分维度评估input_asset字符串是输入素材文件路径截图、录屏、日志、HAR文件input_context字符串否补充指令/上下文如「识别页面中的登录按钮」expected_outputJSON是真值预期输出格式与模型输出Schema完全一致labeler字符串是标注人label_time日期是标注时间dataset_version字符串是基准集版本号如 v1.2.0remark字符串否备注如易错场景、边界场景说明2.2 分场景预期输出示例场景1UI元素识别基准集expected_output示例{elements:[{type:button,text:立即登录,coordinate:[420,560,580,610],is_visible:true},{type:input,placeholder:请输入手机号,coordinate:[320,420,680,470],is_visible:true}],confidence:1.0}场景2视觉回归缺陷基准集expected_output示例{is_defect:true,defect_type:文案错误,defect_area:[200,300,500,350],defect_description:按钮文案由「确认」变为「确定」,severity:minor,confidence:1.0}场景3兼容性测试基准集expected_output示例{is_compatible_issue:true,issue_type:按钮溢出,device:iPhone 14,issue_description:提交按钮右侧超出屏幕边界,confidence:1.0}2.3 数据集构建与管理规则覆盖比例建议正常场景 40%、异常/缺陷场景 35%、边界/易错场景 15%、兼容性/极端分辨率场景 10%正负样本平衡正负样本比例建议控制在 1:1 ~ 1:2避免单一样本占比过高导致评测失真迭代规则每发现1个线上Bad Case必须标注后补充进基准集每月至少迭代1个小版本版本规则基准集版本与评测报告绑定不同版本间指标不直接对比。三、AI测试能力评估指标表分为准确性、稳定性、性能效率、成本四大维度配套灰度准入与正式上线双阈值。指标大类指标名称计算口径 / 公式适用场景灰度准入阈值正式上线阈值统计周期准确性指标核心整体准确率预测正确样本数 / 总样本数 × 100%全场景≥ 95%≥ 98%每轮评测误报率假阳性率误报样本数 / 全部正常样本数 × 100%视觉回归、缺陷识别≤ 1%≤ 0.5%每日/每轮漏报率假阴性率漏报样本数 / 全部缺陷样本数 × 100%视觉回归、缺陷识别≤ 2%≤ 1%每日/每轮幻觉率输出不存在元素/缺陷的样本数 / 总样本数 × 100%UI识别、缺陷分析≤ 1%≤ 0.3%每轮评测元素坐标准确率坐标IOU≥0.8的元素数 / 总元素数 × 100%UI元素识别≥ 96%≥ 99%每轮评测缺陷召回率正确识别的缺陷数 / 真实缺陷总数 × 100%缺陷自动识别≥ 90%≥ 95%每周稳定性指标可回归性输出一致性率相同输入3次执行结果一致数 / 总用例数 × 100%全场景≥ 99%≥ 99.5%版本变更必测重试成功率首次失败后重试成功数 / 首次失败总数 × 100%全场景≥ 80%≥ 90%每周服务可用率正常响应请求数 / 总请求数 × 100%全场景≥ 99.5%≥ 99.9%每月降级触发率触发降级/熔断的构建数 / 总构建数 × 100%全场景≤ 2%≤ 0.5%每周性能效率指标单请求平均耗时总耗时 / 总请求数全场景≤ 3s≤ 2s每日P95处理耗时95%请求完成耗时全场景≤ 5s≤ 3.5s每日流水线增量耗时接入AI后流水线总耗时 - 接入前耗时CI/CD集成≤ 10%≤ 5%每周批量处理能力单位时间可处理截图数量巡检、兼容性≥ 60张/分钟≥ 100张/分钟压测成本指标单次调用平均成本总费用 / 总调用次数全场景符合预算符合预算每月单构建平均AI成本月度总费用 / 月度总构建数CI/CD集成符合预算符合预算每月缓存命中率命中缓存请求数 / 总请求数 × 100%全场景≥ 30%≥ 50%每月强模型占比调用最强模型次数 / 总调用次数 × 100%分层路由≤ 20%≤ 10%每月核心说明误报率是CI/CD接入的第一约束指标。误报率过高会直接导致研发信任崩塌宁可牺牲部分召回率也要优先把误报率压到极低水平。