
1. 如何让 AI 理解业务需求核心逻辑AI 不会自发“懂业务”本质是语义匹配而非业务认知必须通过「结构化输入 领域锚定 多轮校验」的工程化手段把隐性需求显性化、模糊需求明确化引导AI对齐业务语义。落地方法需求结构化预处理把自然语言大段需求拆解为标准化字段业务目标、角色权限、前置条件、输入输出约束、验收标准、异常处理规则避免散文式模糊描述。领域知识锚定通过RAG注入企业业务术语词典、业务规则库、历史需求范例、行业规范对齐企业内部黑话、默认约定和领域规则解决通用大模型不懂行业语境的问题。歧义前置自检要求AI输出需求理解清单的同时自动识别前后矛盾、概念模糊、约束缺失等显性歧义点输出疑问清单先澄清再推进。Few-shot 范例对齐注入1~2个同业务场景的优秀需求拆解范例对齐输出格式、拆解粒度和业务视角。人工复核闭环核心业务需求必须人工确认理解结果再进入后续环节。能力边界AI仅能对齐显性化需求无法识别行业隐性潜规则、跨部门默认约定复杂业务场景必须人工兜底。2. 如何保障 AI coding 的质量AI 生成脚本 / 代码核心思路全流程三层管控不相信单次生成结果从生成前约束、生成中控制、生成后校验建立完整质量门禁。生成前约束前置规范注入明确输入边界输出目标、技术栈、编码规范、命名规则、异常处理要求、禁止项如禁止硬编码凭证、禁止使用废弃API不能只说“写个登录脚本”。规范上下文注入把团队编码规范、公共函数库、Skill封装规范、最佳实践作为上下文注入避免风格混乱、重复造轮子。生成中多步生成内置自检分步生成先输出结构设计再编写核心逻辑最后补充异常处理与注释避免一步输出的逻辑漏洞。自校验指令要求生成后先自查语法、边界条件、逻辑一致性输出自检结果。高风险场景双模型互校核心逻辑用两个不同模型分别生成交叉比对差异。生成后多层校验强制门禁静态校验语法检查、Lint 扫描、安全漏洞扫描自动拦截低级错误。单元验证自动生成对应单元测试用例执行验证功能正确性。分级人工复核核心逻辑、高风险代码100%人工评审非核心代码抽样复核。资产沉淀通过的代码纳入代码库优秀范例加入 Few-shot 库持续优化生成质量。3. AI 自动化测试的思路核心定义AI 自动化测试 AI 智能编排 原子化 Skill 执行 自动化流水线底座是对传统脚本式自动化的升级把“人工写脚本”变成“AI编排能力、自动生成用例、智能执行分析”。四层核心思路需求层AI 解析自然语言测试需求拆解测试点识别歧义输出结构化测试范围与优先级。用例层AI 自动设计测试场景、生成测试数据、输出标准化用例人工复核校准效率远高于纯人工设计。执行层AI 匹配调用原子化 Skill自动编排执行流程驱动 Playwright、接口测试框架等底层工具执行内置防环、熔断、重试等安全管控避免执行失控。分析层AI 自动读取执行日志、错误栈匹配历史故障库初步定位失败根因生成测试报告自动沉淀 bad case 进入用例库形成质量闭环。和传统自动化的核心区别传统是脚本驱动维护成本高、响应变更慢AI 是能力编排驱动复用率高、上手门槛低、适配变更快。4. AI 应用的测试思路是什么大模型类产品RAG 智能客服、AI 问答助手核心原则分层解耦测试 概率化断言 基准集回归 正负向结合和传统软件测试的核心差异是输出为概率性不能用固定字符串断言质量是相对基线的量化评估而非绝对的“对/错”。五层测试体系底座能力基准测试验证模型本身的基础能力推理、知识、指令遵循、基础安全用 TruthfulQA 等通用基准集先确认模型底座达标避免把模型原生问题当成业务问题。组件层专项测试RAG 核心检索层固定查询集测召回率、精确率、排序质量完全排除生成模型干扰。生成层固定召回上下文测忠实度、幻觉率、指令遵循、虚假引用完全排除检索质量干扰。端到端业务测试模拟真实用户场景测整体业务效果业务正确率、问题解决率、多轮对话一致性、交互流畅度。安全合规专项测试提示词注入、敏感信息泄露、权限越权、行业合规校验是企业级 AI 应用的一票否决红线。性能稳定性测试并发延迟、吞吐量、长对话稳定性、服务降级容错、海量知识库下的检索性能。配套方法用 Golden Set 黄金测试集做版本回归用 LLM-as-Judge 做自动化评测用语义相似度、核心要素命中替代固定字符串断言。5. 什么是 Skill在 AI 测试中 Skill 能解决哪些实际问题定义Skill 是原子化、参数化、可复用、可编排的标准化能力封装是 AI / Agent 可以直接调用的最小执行单元。它不是大模型原生能力是工程层面把重复的操作、逻辑、工具调用封装成的标准“技能包”遵循统一输入输出协议可通过 MCP 等协议被大模型直接调用。核心特征单一职责、参数驱动、标准输出、内置容错、可编排、可复用。AI 测试中解决的6类核心实际问题解决重复开发问题登录、查询、断言、评测等通用操作只封装一次全场景复用避免每个脚本重复编写相同逻辑。降低维护成本一处修改全量生效不用同步修改散落在几百个脚本中的重复代码维护成本降低60%以上。降低上手门槛业务测试人员无需精通代码通过组合 Skill 就能搭建业务测试用例实现低代码自动化。解决AI执行失控Skill 内置防环、重试、熔断、失败留证等安全管控AI 只能调用标准能力不能随意执行操作从机制上避免“AI发疯”。提升编排效率Agent 可直接识别需求匹配组合 Skill 快速生成执行链路不用从零编写脚本用例搭建效率提升3~5倍。标准化集成统一协议的 Skill 可无缝接入不同 Agent、流水线、测试平台避免厂商绑定。测试领域典型 Skill 示例需求解析 Skill、检索指标计算 Skill、忠实度评测 Skill、Playwright 登录 Skill、接口调用 Skill、日志分析 Skill、测试报告生成 Skill。6. RAG 做 AI 测试会存在哪些常见缺陷怎么规避以下是 RAG 应用测试中行业普遍存在的测试误区、缺陷以及对应规避方案常见测试缺陷具体表现规避方案只测端到端不分层定位只看最终回答对不对无法区分问题出在检索还是生成优化无方向严格分层测试检索层、生成层、端到端层分别验证每层独立达标再进入下一层测试集与知识库数据泄露测试问题直接从知识库原文摘抄评测分数虚高上线后效果断崖式下跌测试集独立构建问题做转述、口语化、多跳推理改写禁止用知识库原文直接出题只测正向场景忽略负向边界正常问题都答对一遇到诱导、超纲、敏感问题就失控上线出现合规风险强制覆盖边界拒答、提示注入、错误诱导类负向场景占比不低于30%固定字符串断言误报率极高同一个问题换种表述就判失败大量正常输出被误判为不通过采用语义相似度、核心要素命中、LLM-as-Judge 等概率性断言放弃精确字符串匹配静态一次测试无迭代回归上线前测一次后续知识库更新、Prompt迭代后质量漂移无人监控建立 Golden Set 基准集每次变更都做全量回归设置质量门禁不达标禁止上线只测正确率忽略幻觉与虚假引用回答看起来通顺实则无中生有、编造引用业务风险高增加忠实度、虚假引用率专项指标采用 FactScore 原子事实验证高风险场景强制引用溯源测试环境与生产不一致测试用小数据量、高配环境生产海量数据下性能、召回效果差异大测试环境数据量级、配置参数、索引策略与生产保持同比例性能测试用生产级数据量