面向手工测试人员的提示工程:如何从AI工具获取有用输出
你第一次打开AI助手时,心中满怀期待。你输入"为登录页面编写测试用例",大约三秒后得到了八个测试用例:有效登录、无效密码、空用户名、空密码。这类列表你闭着眼睛都能写出来,却遗漏了对你产品真正重要的每一个场景。
于是你关掉工具,心想:这工具处理基础任务还行,但根本不懂测试。AI被过度贬低了。
这里有一个关键的重构认知:AI并没有辜负你,是你的提示词出了问题。"为登录页面编写测试用例"根本不是一份测试简报,而是一种敷衍。你把一个能力不错的助手几乎空手交出去,它自然只能给出互联网上最平庸的答案。泛泛的提示词只能得到泛泛的回答,而测试人员的提示词才能得到测试人员想要的答案。
从懒散请求到精准请求之间的差距,就是提示词工程。它不是编程,也不是魔法。它是一种技能:告诉AI你究竟需要什么,从而得到值得保留的输出。本指南是一份面向手动测试人员的实用、非技术性教程:为什么模糊的提示词会产生无用的输出、有效提示词的结构、你日常工作中实际任务的改进前后示例,以及为什么这正在成为一项值得写入简历的技能。无需代码,只需用好语言。
简短答案
如何在测试时从AI获得有用的输出,概览如下:
- 赋予角色:告诉AI它应该扮演谁,比如你产品领域的高级QA测试人员。
- 提供只有你才知道的上下文:产品规则、边界情况、已知问题——这些AI无法看到。
- 明确你关心的风险:引导它关注负面和边界情况,而非快乐路径。
- 指定输出格式:表格、Given/When/Then结构,或你的缺陷模板。
- 将其视为对话:修正初稿,而非全盘接受。
本指南的其余部分将逐一拆解这些要点,并提供你今天下午就能直接粘贴使用的提示词。
为什么"为登录页面编写测试用例"得不到有用的东西
AI模型的设计目标是给出最可能的答案。当你的提示词模糊时,最可能的答案就是最通用的答案——所有登录测试的平均值,与你的产品毫无关联。
这就是问题的全部核心。模型不了解你的应用程序。它不知道你的登录在五次尝试后锁定,不知道你支持生物识别登录,不知道存在一个关于会话过期的已知缺陷,也不知道你的用户是那些在信号只有一格的火车上查看银行余额的焦虑人群。它看不到这些。所以当你遗漏这些信息时,AI就会用最平淡的猜测来填补空白。
而你呢,恰恰知道这一切。这些知识就是你带来的全部价值。提示词工程不过是将你脑海中的信息转移到提示词中,让AI有真实的东西可以处理。你得到的输出质量,取决于你输入的质量。
这并非Katalon的一家之言。它已经融入了测试行业的专业标准。2024年,ISTQB推出了独立的专业认证——生成式AI测试认证(CT-GenAI),其教学大纲中专门设有提示词工程章节,与大型语言模型和风险管理并列。当制定软件测试规则的机构创建了一个部分关于如何编写提示词的认证时,这是一个明确的信号:这是一项真实、公认的技能,而非花招。
真正有效的提示词结构
一个好的测试提示词并非为了长而长,而是要做到完整。五个要素能把一句敷衍变成一份简报,你可以用"角色、上下文、任务、焦点、格式"来记忆。
| 要素 | 作用 | 示例 |
|---|---|---|
| 角色 | 告诉AI扮演谁,从而设定深度和语气 | "扮演移动银行应用的高级QA测试人员" |
| 上下文 | 提供只有你才知道的产品事实 | "登录使用邮箱和密码,5次失败后锁定,支持生物识别登录" |
| 任务 | 明确你要完成的一项工作 | "为此屏幕生成测试用例" |
| 焦点 | 引导它关注你关心的风险 | "优先考虑负面和边界情况,尤其是账户锁定和会话过期" |
| 格式 | 定义你想要的输出形式,使其可用 | "返回表格:测试用例、前置条件、步骤、预期结果。目标12-15个用例" |
你不需要每次都包含全部五个要素,但上下文和焦点是区分测试人员提示词与其他人提示词的关键。上下文是AI无法拥有的产品知识,焦点是你对缺陷藏身之处的判断。这些恰恰是普通用户永远不会想到包含的内容,因此,善于编写提示词的测试人员能获得比其他人好得多的输出。
通用与有用:同一请求,两种方式
感受差异最快的方式就是亲眼看到。以下是同一任务,两种提示方式。
| 弱提示词 | 强提示词 |
|---|---|
| "为登录页面编写测试用例。" | "扮演移动银行应用的高级QA测试人员。登录使用邮箱和密码,5次失败后锁定,支持Face ID,空闲10分钟后超时。返回表格:测试用例、前置条件、步骤、预期结果。关注负面和边界情况:账户锁定、会话过期、Face ID失败及回退、用户已在别处登录。目标12-15个用例。" |
| 结果:4行任何人都能写的快乐路径。 | 结果:一套针对生产环境中真正出问题的场景的聚焦测试套件。 |
弱提示词只能得到四行快乐路径。强提示词则能得到一套聚焦于生产环境中真正出问题的场景的测试套件,因为你告诉了它该往哪里看。同样的工具,同样的三秒钟,价值却天差地别。
注意,强提示词中没有任何技术内容。没有代码,没有语法,没有特殊命令。它只是一个测试人员在描述功能和风险,就像你向新加入团队的初级同事做简报一样。如果你能向初级测试人员解释一个功能,你就能写出强提示词。
你日常工作的四个提示词工程示例
理论很好,但你来到这里是为了找一些今天下午就能粘贴到工具里的东西。以下是手动测试人员经常做的四种工作配方。根据你的产品调整括号内的部分。
生成值得保留的测试用例
诀窍是输入需求,然后约束输出方向,使其更注重深度而非数量。
"这里有一个需求:[粘贴用户故事或验收标准]。扮演经验丰富的测试人员。生成覆盖主流程、备选流程和失败路径的测试用例。每个用例给出前置条件、步骤和预期结果。不要包含即使功能有缺陷也能通过的琐碎用例。"
最后一句很重要。它推动AI远离"验证页面加载"这类填充内容,转向真正能捕获缺陷的用例。
让AI找出你可能遗漏的边界情况
将AI用作头脑风暴伙伴,它的唯一任务是拓宽你的思路,而不是编写最终用例。
"针对这个功能:[粘贴描述]。列出10个典型测试计划可能忽略的边界情况和边界条件。考虑空状态、最大长度、特殊字符、网络缓慢或断开、并发用户和时区。对每个情况,添加一行说明为什么它存在风险。"
你可能会保留其中六个,对其余的翻个白眼。这是个好结果。三十秒内得到六个你之前没写下来的边界情况,这是你原本会错过的真实覆盖。
生成负面和不愉快路径场景
AI默认走快乐路径,所以明确要求相反的方向。
针对上述密码重置流程,仅生成负面测试场景。包括无效和畸形输入、过期重置链接、重复使用的重置链接、不匹配的确认字段,以及滥用案例(如一分钟内请求50次重置)。每个场景按Given / When / Then格式编写。
明确指定你想要的类别(如"过期链接"、"重复使用链接"、"滥用案例"),才能获得有深度的场景,而非仅仅是"输入错误密码"的三种变体。
将杂乱的会话笔记转化为清晰的缺陷报告
这是最能赢得他人认可的技巧,因为它消除了你厌恶的琐事。粘贴你的粗略笔记,让AI进行格式化,但需设置一个重要护栏。
"将这段杂乱的会话笔记转化为清晰的缺陷报告:'尝试上传12MB的个人资料照片,加载图标一直转圈,刷新后旧照片也消失了,这种情况发生了两次。' 使用以下格式:标题、环境、复现步骤、预期结果、实际结果、严重程度、备注。如果任何细节缺失或模糊,请将其列在'待确认'项下,而非自行编造。"
这最后一条指令是区分有用草稿与危险草稿的关键。没有它,AI会愉快地编造出你从未观察到的浏览器版本、精确文件类型和复现概率。"不要编造,请向我确认"能保持输出的诚实性,并让你始终掌控事实。
将其视为对话,而非自动售货机
新用户最大的错误是将AI视为自动售货机:输入一次提示,获得一个答案,要么接受要么放弃。真正获得价值的测试人员将其视为对话。
当第一次回复过于泛泛时,不要放弃,也不要默默自行重写。告诉AI哪里不对,让它重新尝试。"这些都是正向路径,给我失败场景。""添加生物识别回退的案例。""那个缺陷标题太模糊,要具体说明数据丢失的情况。"每次修正成本很低,而第二次答案几乎总是远好于第一次,因为你刚刚提供了第一次遗漏的上下文。
优化才是你测试判断力真正发挥作用的地方。AI快速起草;你引导它走向真正有用的方向。这种来回互动是技能所在,也是随着你对优秀测试理解加深而不断提升的部分。
向AI提问进行测试时的常见错误
- 一次性要求所有内容。"测试我的整个应用程序"会让AI无从聚焦,你得到的是浅显零散的答案。每次提示只针对一个功能、一个清晰任务。
- 提供零上下文。如果你不告诉AI你的产品、规则和用户,它就无法考虑这些因素。上下文缺失是导致输出泛泛的首要原因。
- 接受初稿。第一个答案只是起点,而非交付物。如果你原封不动地提交,那不是测试,而是转发。
- 让它编造细节。不加约束的话,AI会编造听起来合理但纯属虚构的步骤、数据、版本和复现概率。始终让它标记未知项而非自行填充,并验证它提供的内容。
- 忘记格式。一大段需要手动重新格式化的文字几乎谈不上节省时间。明确告诉AI你想要的输出格式(表格、Given/When/Then、你的缺陷模板),它就能立即投入使用。
- 忘记你仍是审核者。AI提出方案;你负责批准。一个看似自信、格式良好但存在细微错误的测试用例,比没有测试用例更危险。你的眼睛永远是最后一道关卡,每次都是。
为什么提示工程是技能而非捷径
目前手工测试中存在一种隐忧:如果AI能生成测试用例,那我还剩下什么?提示工程是最清晰的答案之一,因为它翻转了问题。AI不会取代能够出色提问的测试人员,而是放大他们的能力。
再看本指南中每个优秀提示所需的条件:了解哪些风险对你的产品重要;知道缺陷实际藏在哪里;明白什么是有用的测试用例,什么是无关紧要的;能识别泛泛的答案并知道如何推动改进;在编造的细节进入缺陷报告之前就发现它。这些都不是来自AI,全部来自你。提示只是将你的专业知识导入工具的管道,而缺乏测试判断力的人编写提示,只会得到自信、流畅但无用的结果。
这是从"AI存在"到"我在日常工作中使用AI"的桥梁,跨越这座桥梁是一项需要刻意学习的技能,而非性格特质。行业已经认识到这一点:ISTQB围绕在测试中使用生成式AI构建了完整的专家认证CT-GenAI,其中提示工程是核心主题。学会熟练驾驭这些工具的测试人员不会被自动化取代,而是悄然变得比那些输入"为登录页面编写测试用例"后得到垃圾结果就放弃的同事高效两到三倍。
能够蓬勃发展的测试人员,不会是那些回避AI或盲目信任AI的人,而是那些学会向AI提出正确问题的人。
在Katalon AI助手中实践
以上所有内容均与工具无关。相同的原则(角色、上下文、任务、聚焦、格式,并通过对话优化)直接适用于Katalon True Platform的Katalon AI助手,它被设计为对话式而非一次性输出。Katalon已经介绍了AI助手是什么以及它能做什么;本文是教你如何实际与之对话的配套指南。
该助手围绕这些习惯设计的几个方面:
- 在连续对话中工作。你可以在同一线程中优化需求、生成测试用例并收紧它们,这正是本指南主张的迭代方法(自动售货机模式是错误的)。
- 主动询问上下文而非猜测。当测试生成代理需要更多信息才能生成好的测试用例时,助手会先提示你提供缺失的细节,将"提供上下文"规则融入工作流程,而非让你记住。
- 让你始终作为审批者。生成的用例是供你审查、编辑或丢弃的草稿,每个用例都可追溯到其需求。该模型与本指南一致:AI提出,你批准。
平台处理速度和结构。你带来判断力和提示。这种分工正是关键所在。
如果你既编写测试用例也编写测试脚本,相同的提示纪律(角色、上下文、迭代)也适用于代码生成。Katalon为希望AI帮助编写自动化脚本而非测试用例的自动化工程师,提供了另一份更技术性的Katalon Studio StudioAssist提示工程指南。
关键要点
- 模糊的提示得到泛泛的答案,因为AI会用最平均的响应填补空白。输出质量由输入质量决定。
- AI不了解你的产品、风险或用户。提示工程就是将这些知识注入提示的行为。
- 使用角色、上下文、任务、聚焦和格式。上下文和聚焦是让测试人员的提示优于其他人的关键。
- 对于日常任务,向深度约束:要求非平凡的测试用例、被忽视的边缘案例、仅负面场景,以及从粗略笔记生成清晰的缺陷报告。
- 始终告诉AI标记未知项而非编造,并将其视为对话,通过修正和优化而非接受初稿。
- 你仍是审核者。AI提出,你批准,每次都是。
- 出色的提示工程是公认的高价值技能,ISTQB围绕在测试中使用生成式AI构建了CT-GenAI认证,提示工程是其核心。它放大优秀测试人员的能力,而非取代他们。
"AI被过度炒作"与"AI每周为我节省数小时"之间的区别,往往只在于提示词。学会像指导一位敏锐的新同事那样去引导这些工具,它们就能在日常工作中真正发挥作用。Katalon AI助手正是为这种你来我往的协作而设计,而你始终是质量的最终决策者。AI提出建议,你来批准。