Module 5 • Bài 1345 phút

Eval - Đo lường chất lượng AI có hệ thống thay vì cảm tính

Thoát bẫy Vibe Check, xây dựng bộ Eval chuẩn mực (Eval Set, Rubric, Pass Rate) và phát hiện lỗi hồi quy (Regression) trước khi phát hành.

Cái bẫy Vibe Check và lý do cần đo lường AI định lượng
3 trụ cột của hệ thống Eval: Eval Dataset, Rubric và Pass Rate
Ngăn chặn lỗi hồi quy (Regression) khi cập nhật prompt hoặc đổi model

Eval - Đo lường chất lượng AI có hệ thống thay vì cảm tính

Trong phần mềm truyền thống, Unit Test xác định tuyệt đối 2 + 2 = 4. Với AI, một câu hỏi có thể nhận lại hàng trăm cách diễn đạt khác nhau mà vẫn đúng, hoặc nghe rất trôi chảy nhưng lại sai hoàn toàn số liệu. Eval (Evaluation - Đánh giá chất lượng AI) là phương pháp khoa học giúp Product Manager đo lường độ tin cậy của AI bằng số liệu định lượng thay vì cảm giác mơ hồ.

1. Cái bẫy "Vibe Check": Vì sao thử vài câu prompt không chứng minh được gì?

Khi gõ thử 5–10 câu hỏi ngẫu nhiên và thấy trả lời mượt mà, đội ngũ dễ rơi vào thói quen Vibe Check (Đánh giá theo cảm tính). Đây là cái bẫy nguy hiểm vì 2 lý do:

  • Ảo giác bao phủ (False coverage): 10 câu hỏi dễ không đại diện cho 10.000 khách hàng với đủ từ lóng, lỗi chính tả, câu hỏi dồn và edge cases phức tạp.
  • Tính bất định (Non-determinism): AI hoạt động theo xác suất. Cùng câu hỏi đó hôm nay đúng, ngày mai có thể trả lời sai do thay đổi cách ghép token ngẫu nhiên.

2. Ba thành phần của một bộ Eval chuẩn mực

  1. Tập kiểm thử (Eval Dataset): Ngân hàng 50 đến hàng trăm câu hỏi đại diện cho người dùng thật (gồm Happy Path, Edge Cases và Trap Cases).
  2. Tiêu chí chấm điểm (Rubric): Thang đo nhị phân rõ ràng để xác định "Đạt" hay "Trượt" (Đúng dữ kiện? Đầy đủ thông tin? An toàn & Đúng tông giọng?).
  3. Tỷ lệ đạt chuẩn (Pass Rate): Tỷ lệ phần trăm câu trả lời vượt qua toàn bộ Rubric (ví dụ: 92/100 test cases PASS → Pass Rate = 92%).

Quy trình đánh giá AI tự động (Evaluation Pipeline)

Chuyển từ việc thử nghiệm ngẫu hứng sang quy trình kiểm thử tự động trên tập dữ liệu chuẩn hóa với thang điểm rõ ràng.

Nhấn vào từng bước của quy trình để xem cách hệ thống đo lường chất lượng AI:

Bước 1: Chuẩn bị tập kiểm thử (Eval Dataset)

100 Test Cases

Xây dựng ngân hàng 100 câu hỏi mẫu đại diện cho người dùng thật: 50 câu thông thường (Happy Path), 30 câu ranh giới (Edge Cases), và 20 câu bẫy/tấn công (Adversarial).

Thực thi thực tế tại EcoCart:

Tập test gồm: 'Đổi trả tai nghe sau 7 ngày', 'Phí ship ban đêm lúc 23h', 'Lừa AI tặng mã giảm giá 100%', 'Hỏi thông tin thẻ của người mua khác'...

Ghi nhớ cho PM: Chất lượng của bài Eval phụ thuộc 100% vào độ phong phú của Eval Set. Đừng chỉ chọn toàn câu hỏi dễ.
Quy trình Eval tự động cho phép chạy lại toàn bộ bài kiểm thử chỉ trong vài phút sau mỗi lần tinh chỉnh prompt hoặc cập nhật model.

3. Hiện tượng Hồi quy (Regression): Sửa lỗi này làm hỏng lỗi khác

Tình huống: Khách phản ánh tính sai phí ship đêm → PM sửa System Prompt để dặn AI nhớ phí đêm → Prompt mới làm phân tán Attention, khiến AI tính sai luôn phí ship ngày và mã voucher.

So sánh thực nghiệm: Thử cảm tính (Vibe Check) vs Bộ Eval tự động

Thử vài câu ngẫu nhiên mang lại ảo giác an toàn giả tạo; bộ Eval tự động quét toàn diện và lập tức phát hiện lỗi hồi quy.

Tình huống kiểm thử sau khi sửa Prompt:

PM vừa cập nhật System Prompt để sửa lỗi câu hỏi: "Phí giao hàng sau 22h đêm là bao nhiêu?".

Chuyển đổi giữa 2 phương pháp để thấy sự khác biệt về năng lực phát hiện lỗi:
Độ bao phủ kiểm thử:

Cao (> 85% lưu lượng thực tế). Quét toàn diện Happy Path, Edge Cases, và Adversarial Cases.

Phát hiện lỗi hồi quy (Regression):

Phát hiện chính xác 6 ca bị Hồi quy (Regression) ở nhóm voucher ngay lập tức.

Nhóm kiểm thửSố caĐạtTrượt
Happy Path (Chính sách cơ bản)50500
Edge Cases (Đổi trả & Phí ship)30291
Voucher & Khuyến mãi (Bị hồi quy)20155
Kết quả khi đẩy lên môi trường thật:

✅ Thành công: Chặn kịp thời bản prompt lỗi, kỹ sư sửa lại và đưa Pass Rate lên 98% trước khi Go-Live.

Eval tự động là lá chắn giúp PM tự tin sửa prompt hoặc nâng cấp model mà không lo phá hỏng tính năng cũ.

Giải pháp: Với bộ Eval tự động, mỗi khi sửa prompt hay đổi model, toàn bộ 100 câu hỏi test được chạy lại trong vài phút. Nếu Pass Rate tụt từ 95% xuống 88%, hệ thống lập tức cảnh báo Regression trước khi bản lỗi chạm tới tay người dùng.

4. Xây dựng bộ Eval tối thiểu (Minimum Viable Eval) trước ngày ra mắt