PKD / LITE

ISTQB CT-GenAI v1.1: Sổ tay thực chiến cho QA Automation

Sổ tay này diễn giải CT-GenAI v1.1 thành workflow, quality gate và bài tập áp dụng cho QA Automation.

Đây là tài liệu học tập, không thay thế syllabus ISTQB chính thức.

🧭 Mô hình tổng thể

Nền tảng GenAI
  -> Prompt cho test
  -> Use case trong QA
  -> Đánh giá đầu ra
  -> Rủi ro và governance
  -> RAG, agent, LLMOps
  -> Roadmap và PoC đo được

Kết luận nhanh

Lý thuyết AI cơ bản       : ########--  8/10
Prompt Engineering       : ########## 10/10
Ứng dụng vào QA          : ########## 10/10
Automation chuyên sâu    : #######---  7/10
Kiến trúc AI Testing     : ########--  8/10
Code framework cụ thể    : ####------  4/10
Governance cho enterprise: #########-  9/10

Điểm mạnh nhất là kết nối GenAI với toàn bộ test lifecycle. Điểm hạn chế là không dạy sâu một framework cụ thể như Playwright, Selenium, Tosca hoặc cách lập trình một AI agent hoàn chỉnh.

🔄 GenAI trong vòng đời kiểm thử

 Requirement / User Story / Wireframe / Source Code
                         |
                         v
              +---------------------+
              |  GenAI Test Analyst |
              +---------------------+
                 |  phát hiện mơ hồ
                 |  tạo câu hỏi
                 |  đề xuất acceptance criteria
                 v
              +---------------------+
              |  GenAI Test Designer|
              +---------------------+
                 |  test conditions
                 |  test cases / Gherkin
                 |  test data / expected results
                 v
              +---------------------+
              | Automation Assistant|
              +---------------------+
                 |  sinh script
                 |  debug / bảo trì
                 |  tối ưu regression
                 v
              +---------------------+
              | Execution & Analysis|
              +---------------------+
                 |  phân tích log
                 |  gom nhóm lỗi
                 |  báo cáo / insight
                 v
              +---------------------+
              | Human Review Gate   |
              +---------------------+
                         |
             PASS -------+------- REWORK

Nguyên tắc quan trọng:

AI tạo bản nháp + Con người xác minh + Công cụ thực thi = Kết quả đáng tin cậy

Không nên dùng:

AI tạo kết quả ------------------------------> dùng ngay
                      X Không có quality gate

✍️ Prompt engineering thực chiến

Cấu trúc prompt 6 thành phần

+---------+   +---------+   +-------------+
|  ROLE   | + | CONTEXT | + | INSTRUCTION |
+---------+   +---------+   +-------------+
       +-------------+   +-------------+   +---------------+
       | INPUT DATA  | + | CONSTRAINTS | + | OUTPUT FORMAT |
       +-------------+   +-------------+   +---------------+
                              |
                              v
                    +-------------------+
                    |  TESTING OUTPUT   |
                    +-------------------+

Template dùng ngay

ROLE
Bạn là Senior QA Automation Engineer có kinh nghiệm trong [domain].

CONTEXT
Hệ thống đang kiểm thử là [...]. Mục tiêu nghiệp vụ là [...].

INSTRUCTION
Phân tích user story, tìm điểm mơ hồ và tạo test cases.

INPUT DATA
User story, acceptance criteria, business rules, wireframe, API spec...

CONSTRAINTS
Không tự giả định business rule. Đánh dấu thông tin còn thiếu.
Áp dụng Equivalence Partitioning và Boundary Value Analysis.

OUTPUT FORMAT
Xuất bảng gồm: ID, condition, precondition, steps, data,
expected result, priority, requirement mapping.

Ba kỹ thuật prompting trọng tâm

A. Prompt chaining: chia bài toán lớn thành bước nhỏ

User Story
    |
    v
[1. Tìm ambiguity]
    |
    v
[Human review]
    |
    v
[2. Cải thiện Acceptance Criteria]
    |
    v
[Human review]
    |
    v
[3. Sinh Test Conditions]
    |
    v
[4. Sinh Test Cases]
    |
    v
[5. Kiểm tra Coverage]

Phù hợp khi bài toán phức tạp, cần độ chính xác và phải xác minh kết quả trung gian.

B. Few-shot prompting: đưa ví dụ mẫu

Example 1: User Story -> Gherkin chuẩn
Example 2: User Story -> Gherkin chuẩn
Example 3: User Story -> Gherkin chuẩn
                    |
                    v
New User Story -> AI bắt chước cấu trúc mong muốn

Phù hợp với Gherkin, keyword-driven test, báo cáo theo mẫu và quy ước code của framework.

C. Meta prompting: nhờ AI thiết kế prompt

Tester mô tả mục tiêu
        |
        v
AI tạo prompt phiên bản 1
        |
        v
Tester đánh giá đầu ra
        |
        v
AI cải thiện prompt
        |
        v
Prompt chuẩn hóa đưa vào Prompt Library

Phù hợp khi chưa biết cách viết prompt hoặc muốn tạo template dùng lại cho team.

🧪 Use case theo từng hoạt động QA

Requirement analysis

Requirement
    |
    +--> Ambiguous wording?
    +--> Missing business rule?
    +--> Inconsistent condition?
    +--> Not testable?
    +--> Missing negative flow?
    |
    v
Clarification Questions + Improved Acceptance Criteria

Bài thực hành

  1. Chọn một user story thật đã loại bỏ dữ liệu nhạy cảm.
  2. Yêu cầu AI liệt kê giả định, mâu thuẫn và thông tin thiếu.
  3. Yêu cầu AI viết lại acceptance criteria.
  4. BA/SME xác minh thủ công.
  5. So sánh thời gian và số vấn đề phát hiện với cách làm cũ.

Test case generation và coverage

 User Story
     |
     v
 Acceptance Criteria
     |
     v
 Test Conditions
     |
     +--------+--------+---------+
     |        |        |         |
 Positive  Negative  Boundary  Business Rule
     |        |        |         |
     +--------+--------+---------+
              |
              v
          Test Cases
              |
              v
  Requirement-to-Test Coverage Matrix

Quality gate

[ ] Mỗi acceptance criterion có test tương ứng
[ ] Có positive, negative và boundary cases
[ ] Expected result không phải do AI tự bịa
[ ] Test data không chứa dữ liệu nhạy cảm
[ ] Có traceability về requirement
[ ] SME xác nhận business-critical scenarios

Gherkin generation

Business Rule
     |
     v
Given  : trạng thái ban đầu
When   : hành vi chính
Then   : kết quả quan sát được
And    : điều kiện bổ sung
     |
     v
Scenario Outline + Examples

Prompt ngắn

Hãy chuyển acceptance criteria sau thành Gherkin.
Chỉ dùng thông tin được cung cấp.
Dùng Scenario Outline nếu có nhiều bộ dữ liệu.
Đánh dấu [NEED CLARIFICATION] nếu thiếu business rule.

Automation script generation

Test Case / Gherkin
        |
        v
Framework conventions + examples
        |
        v
AI sinh script nháp
        |
        v
Static checks / lint / compile
        |
        v
Execute in test environment
        |
     +--+-------------------+
     |                      |
   PASS                   FAIL
     |                      |
Review maintainability   Logs + AI debug suggestion
     |                      |
     +----------+-----------+
                v
           Human approval

Với Playwright

Nên cấp cho AI:

  • coding conventions;
  • Page Object hoặc fixture mẫu;
  • locator strategy;
  • assertion conventions;
  • retry và timeout policy;
  • quy tắc không hard-code test data;
  • ví dụ script tốt đã được team duyệt.

AI chỉ tạo bản nháp. Script phải được lint, compile, chạy thật và review như code bình thường.

Regression optimization

Code change + Defect history + Risk + Dependencies
                         |
                         v
                  GenAI impact analysis
                         |
        +----------------+----------------+
        |                |                |
    High Risk        Medium Risk       Low Risk
        |                |                |
Run critical pack   Run related pack  Defer / sample
        +----------------+----------------+
                         |
                         v
                Human-approved test scope

Cảnh báo

AI có thể xếp sai mức ưu tiên hoặc bỏ sót dependency. Quyết định cuối cùng cần dựa trên risk analysis và người chịu trách nhiệm kiểm thử.

Test report analysis

Execution results + Logs + Screenshots + Known issues
                         |
                         v
                 Structured prompt chain
                         |
        +----------------+----------------+
        |                |                |
  Cluster failures   Compare known bugs  Detect anomalies
        |                |                |
        +----------------+----------------+
                         |
                         v
             Summary + Risks + Next Actions

Không nên yêu cầu AI kết luận root cause chỉ từ error message. Hãy coi đó là giả thuyết cần kiểm chứng.

📏 Đánh giá chất lượng đầu ra AI

                 +----------------+
                 | AI Test Output |
                 +----------------+
                         |
     +---------+---------+---------+----------+
     |         |         |         |          |
 Accuracy  Precision   Recall   Relevance  Diversity
     |         |         |         |          |
     +---------+---------+---------+----------+
                         |
          Execution Success + Time Saving
                         |
                         v
                 ACCEPT / REFINE / REJECT

Scorecard gợi ý

Tiêu chí Câu hỏi đánh giá
Accuracy Kết quả có đúng requirement và business rule không?
Precision Những test được tạo có thực sự liên quan không?
Recall Có bỏ sót scenario quan trọng không?
Contextual fit Có phù hợp domain, hệ thống và conventions không?
Diversity Có positive, negative, boundary, edge cases không?
Execution success Script sinh ra chạy thành công bao nhiêu?
Time efficiency Có giảm effort so với baseline thủ công không?

Vòng lặp tối ưu prompt

Baseline Prompt
      |
      v
Generate Output
      |
      v
Measure with Scorecard
      |
  +---+-----------------------+
  |                           |
Good                      Not Good
  |                           |
Store in Library       Analyze error pattern
                              |
                      Modify prompt/context
                              |
                              +----> Repeat

Có thể dùng A/B testing giữa hai prompt, nhưng cần cùng input, cùng tiêu chí đánh giá và đủ số lần thử vì mô hình có tính không xác định.

🛡️ Rủi ro và quản trị AI

Hallucination, reasoning error và bias

                   AI OUTPUT RISK
                         |
       +-----------------+-----------------+
       |                 |                 |
 Hallucination      Reasoning Error       Bias
 "bịa dữ kiện"     "sai chuỗi logic"   "lệch phạm vi"
       |                 |                 |
       +-----------------+-----------------+
                         |
                         v
  Cross-check + SME review + Execute + Consistency check

Ví dụ

  • Hallucination: tạo test cho một acceptance criterion không tồn tại.
  • Reasoning error: ưu tiên test case sai do hiểu sai risk/dependency.
  • Bias: chỉ tạo functional happy-path mà thiếu accessibility, security hoặc negative tests.

Data privacy và security

 Sensitive Requirement / Production Data
                 |
                 v
        +--------------------+
        | Data classification|
        +--------------------+
                 |
        Contains sensitive data?
            /             \
          YES              NO
           |                |
 Mask / anonymize      Approved input
           |                |
           +-------+--------+
                   v
          Approved AI environment
                   |
                   v
          Output security review

Checklist enterprise

[ ] Không đưa production credentials vào prompt
[ ] Không đưa PII hoặc dữ liệu khách hàng khi chưa được phép
[ ] Mask/anonymize test data
[ ] Dùng công cụ và môi trường được tổ chức phê duyệt
[ ] Kiểm tra licensing và lưu trữ dữ liệu
[ ] Review code AI sinh ra để tìm lệnh hoặc dependency nguy hiểm
[ ] Lưu trace về input, model/tool, output và người phê duyệt

Shadow AI

Unapproved AI Tool
       |
       +--> Data leakage
       +--> Compliance risk
       +--> Unclear IP/license
       +--> No audit trail
       |
       v
Enterprise AI Strategy + Approved Tools + Training + Governance

🏗️ Kiến trúc LLM-powered testing

Kiến trúc cơ bản

+------------------+
| Tester / QA Lead |
+------------------+
         |
         v
+------------------+
| Front-end / Chat |
+------------------+
         |
         v
+--------------------------------------------------+
|                   BACK END                       |
| Auth | Prompt Builder | Retrieval | Guardrails   |
| Tool Calling | Post-processing | Audit / Metrics |
+--------------------------------------------------+
         |                  |                   |
         v                  v                   v
+---------------+   +---------------+   +---------------+
| LLM / SLM     |   | Vector DB    |   | Test Tools    |
+---------------+   +---------------+   +---------------+
                                            |
                         +------------------+----------------+
                         |                  |                |
                      Jira/Test Mgmt     CI/CD          Automation

RAG workflow

OFFLINE / INDEXING

Requirements -> Clean -> Chunk -> Embedding -> Vector Database
Test Cases   -> Clean -> Chunk -> Embedding -> Vector Database
Defects      -> Clean -> Chunk -> Embedding -> Vector Database

RUNTIME

Tester Query
     |
     v
Query Embedding
     |
     v
Semantic Retrieval
     |
     v
Relevant Chunks + Source Context
     |
     v
LLM generates grounded answer
     |
     v
Citation / Verification / Human Review

RAG phù hợp khi muốn agent trả lời theo requirement, domain knowledge, test repository và tài liệu hiện hành của tổ chức.

Agent workflow

                         GOAL
                          |
                          v
                   +-------------+
                   | Planner     |
                   +-------------+
                          |
           +--------------+--------------+
           |              |              |
           v              v              v
   Requirement Agent  Test Agent   Automation Agent
           |              |              |
           +--------------+--------------+
                          |
                          v
                   Execution Tool
                          |
                          v
                Result Analysis Agent
                          |
                          v
                   HUMAN APPROVAL

Mức tự động hóa nên chọn

Low-risk repetitive task  -> có thể tự động nhiều hơn
Business-critical task    -> semi-autonomous + approval gate
Security/compliance task  -> bắt buộc human oversight

RAG hay fine-tuning?

Need latest enterprise knowledge?
             |
            YES ---> RAG
             |
            NO
             v
Need model behavior/style/domain pattern changed deeply?
             |
            YES ---> Consider Fine-tuning
             |
            NO ---> Prompt + Examples may be enough

Fine-tuning cần dữ liệu chất lượng, chi phí tính toán và quy trình đánh giá. Không nên chọn chỉ vì nghe “nâng cao”.

⚙️ LLMOps cho QA

Use Case
   |
   v
Prompt / Agent Versioning
   |
   v
Evaluation Dataset
   |
   v
Quality + Security Gates
   |
   v
Deployment
   |
   v
Monitoring
   |-- Accuracy / relevance
   |-- Execution success
   |-- Latency / recurring cost
   |-- Data and security incidents
   |
   v
Feedback -> Improve -> New Version

Cần quản lý cả prompt, context, model, test dataset, evaluation result và phiên bản agent, không chỉ quản lý source code.

🗺️ Roadmap áp dụng GenAI cho tổ chức kiểm thử

+------------------+      +----------------------+      +-------------------+
| 1. DISCOVERY     | ---> | 2. INITIATION       | ---> | 3. UTILIZATION    |
+------------------+      +----------------------+      +-------------------+
| Training         |      | Select use cases     |      | Integrate process |
| Approved access  |      | Evaluate tools       |      | Monitor metrics   |
| Experiments      |      | Define governance    |      | Scale & iterate   |
+------------------+      +----------------------+      +-------------------+

Ma trận ưu tiên use case

                          BUSINESS VALUE
                     LOW                HIGH
                +----------------+----------------+
LOW RISK        | Nice to have   | QUICK WIN      |
                +----------------+----------------+
HIGH RISK       | Avoid / defer  | CONTROLLED PoC |
                +----------------+----------------+

Quick wins gợi ý:

  • review requirement và đặt clarification questions;
  • sinh test case draft;
  • chuyển test case sang Gherkin;
  • tóm tắt test execution report;
  • chuẩn hóa defect report;
  • hỗ trợ debug automation script.

🚀 Mini project cho QA Automation Lead

AI-Assisted Regression Copilot

User Story / Acceptance Criteria
               |
               v
       Requirement Analyzer
               |
               v
       Test Case Generator
               |
               v
        Coverage Checker
               |
               v
     Playwright Draft Generator
               |
               v
  Lint -> Compile -> Execute -> Report
               |
               v
          Human Approval

Deliverables

01 prompt library
01 evaluation scorecard
01 requirement-to-test coverage report
01 Playwright proof of concept
01 before/after effort comparison
01 risk and governance checklist
01 knowledge-sharing session

Suggested success measures

Tự đặt baseline trước khi áp dụng, sau đó đo:

  • effort tạo test case;
  • output accuracy sau SME review;
  • requirement coverage;
  • tỷ lệ script chạy thành công ngay lần đầu;
  • số vòng sửa prompt/script;
  • defect-report completeness;
  • mức độ sử dụng của team.

Không đặt mục tiêu phần trăm nếu chưa có baseline đáng tin cậy.

🎯 Gợi ý OKR gắn chứng chỉ với kết quả thật

Objective

Nâng cao năng lực AI-Augmented Testing và áp dụng GenAI vào quy trình QA Automation một cách an toàn, đo lường được.

Key Results

KR1  Hoàn thành lộ trình học và đạt chứng chỉ ISTQB CT-GenAI.

KR2  Xây dựng 01 PoC có workflow:
     Requirement -> Test Case -> Coverage -> Automation Draft.

KR3  Thiết lập baseline và chứng minh cải thiện effort hoặc chất lượng
     trên ít nhất 01 test activity được chọn.

KR4  Xây dựng Prompt Library và Evaluation Scorecard dùng lại cho team.

KR5  Tổ chức 01 buổi knowledge sharing, kèm demo và governance checklist.
Certification only
       |
       X  Giá trị hạn chế

Certification + PoC + Measurement + Sharing
       |
       v
Competency + Business Impact + Reusable Asset

📚 Kế hoạch học theo sprint

Sprint 1: Foundations + Prompt Structure
    |
    +--> LLM, token, context window, multimodal
    +--> 6-part prompt

Sprint 2: Test Analysis + Test Design
    |
    +--> ambiguity analysis
    +--> acceptance criteria
    +--> test case + Gherkin + coverage

Sprint 3: Automation + Reporting
    |
    +--> script generation
    +--> regression analysis
    +--> test report analysis

Sprint 4: Risk + Architecture
    |
    +--> hallucination/privacy/security
    +--> RAG/Agent/Fine-tuning/LLMOps

Sprint 5: Organization Adoption
    |
    +--> strategy, metrics, governance
    +--> complete PoC and exam practice

Mỗi chủ đề học theo vòng lặp:

READ -> DRAW -> PROMPT -> EXECUTE -> REVIEW -> TEACH BACK

✅ Cheat sheet cuối cùng

DO
+ Cung cấp đầy đủ context
+ Chia task phức tạp thành prompt chain
+ Dùng examples cho output cần chuẩn hóa
+ Đánh giá bằng metrics
+ Run generated scripts
+ Có human approval
+ Mask sensitive data
+ Version prompt và agent

DON'T
- Tin output vì nghe hợp lý
- Đưa production data vào công cụ chưa được duyệt
- Dùng một prompt khổng lồ cho mọi việc
- Gọi AI output là root cause khi chưa kiểm chứng
- Đo productivity mà không có baseline
- Tự động hoàn toàn business-critical decisions

Công thức ghi nhớ

       GOOD CONTEXT
            +
     STRUCTURED PROMPT
            +
       RIGHT MODEL
            +
    MEASURABLE EVALUATION
            +
       HUMAN REVIEW
            =
  RESPONSIBLE AI-ASSISTED TESTING

☑️ Checklist sẵn sàng thi và áp dụng

[ ] Giải thích được LLM, token, context window và multimodal
[ ] Viết được prompt theo 6 thành phần
[ ] Phân biệt prompt chaining, few-shot và meta prompting
[ ] Dùng GenAI cho analysis, design, automation và reporting
[ ] Đánh giá output bằng accuracy, recall, relevance và execution success
[ ] Nhận diện hallucination, reasoning error và bias
[ ] Biết kiểm soát privacy, security và shadow AI
[ ] Giải thích được RAG, agent, fine-tuning và LLMOps
[ ] Xây dựng được roadmap adoption cho test team
[ ] Có ít nhất một PoC thực tế và số đo trước/sau

🔗 Tài liệu tham khảo

📚 Kết luận

CT-GenAI hữu ích nhất khi biến đầu ra GenAI thành bản nháp có thể đo, kiểm tra và truy vết trong quy trình test. Hãy bắt đầu từ use case rủi ro thấp, thiết lập baseline, áp dụng quality gate và giữ quyền phê duyệt cho con người; không dùng chứng chỉ hay kết quả sinh tự động như bằng chứng thay thế cho xác minh thực tế.

🧾 Tóm tắt bỏ túi (Take away)

Điểm chính Hành động
Prompt cần đủ ngữ cảnh và ràng buộc Dùng cấu trúc role, context, instruction, input, constraints và output format.
AI chỉ tạo bản nháp Đối chiếu requirement, chạy script và yêu cầu người có thẩm quyền phê duyệt.
Chất lượng phải đo được Lập scorecard, baseline và coverage matrix trước khi kết luận có cải thiện.
Rủi ro cần được kiểm soát Mask dữ liệu nhạy cảm, dùng môi trường được duyệt và lưu trace phê duyệt.
Hãy triển khai từng bước Chọn quick win, làm PoC có giới hạn rồi mở rộng theo số liệu và governance.