Eval - Đo lường chất lượng AI có hệ thống thay vì cảm tính
Thoát bẫy Vibe Check, xây dựng bộ Eval chuẩn mực (Eval Set, Rubric, Pass Rate) và phát hiện lỗi hồi quy (Regression) trước khi phát hành.
Eval - Đo lường chất lượng AI có hệ thống thay vì cảm tính
Trong phần mềm truyền thống, Unit Test xác định tuyệt đối 2 + 2 = 4. Với AI, một câu hỏi có thể nhận lại hàng trăm cách diễn đạt khác nhau mà vẫn đúng, hoặc nghe rất trôi chảy nhưng lại sai hoàn toàn số liệu. Eval (Evaluation - Đánh giá chất lượng AI) là phương pháp khoa học giúp Product Manager đo lường độ tin cậy của AI bằng số liệu định lượng thay vì cảm giác mơ hồ.
1. Cái bẫy "Vibe Check": Vì sao thử vài câu prompt không chứng minh được gì?
Khi gõ thử 5–10 câu hỏi ngẫu nhiên và thấy trả lời mượt mà, đội ngũ dễ rơi vào thói quen Vibe Check (Đánh giá theo cảm tính). Đây là cái bẫy nguy hiểm vì 2 lý do:
- Ảo giác bao phủ (False coverage): 10 câu hỏi dễ không đại diện cho 10.000 khách hàng với đủ từ lóng, lỗi chính tả, câu hỏi dồn và edge cases phức tạp.
- Tính bất định (Non-determinism): AI hoạt động theo xác suất. Cùng câu hỏi đó hôm nay đúng, ngày mai có thể trả lời sai do thay đổi cách ghép token ngẫu nhiên.
2. Ba thành phần của một bộ Eval chuẩn mực
- Tập kiểm thử (Eval Dataset): Ngân hàng 50 đến hàng trăm câu hỏi đại diện cho người dùng thật (gồm Happy Path, Edge Cases và Trap Cases).
- Tiêu chí chấm điểm (Rubric): Thang đo nhị phân rõ ràng để xác định "Đạt" hay "Trượt" (Đúng dữ kiện? Đầy đủ thông tin? An toàn & Đúng tông giọng?).
- Tỷ lệ đạt chuẩn (Pass Rate): Tỷ lệ phần trăm câu trả lời vượt qua toàn bộ Rubric (ví dụ:
92/100 test cases PASS → Pass Rate = 92%).
Quy trình đánh giá AI tự động (Evaluation Pipeline)
Chuyển từ việc thử nghiệm ngẫu hứng sang quy trình kiểm thử tự động trên tập dữ liệu chuẩn hóa với thang điểm rõ ràng.
Nhấn vào từng bước của quy trình để xem cách hệ thống đo lường chất lượng AI:
Bước 1: Chuẩn bị tập kiểm thử (Eval Dataset)
100 Test CasesXây dựng ngân hàng 100 câu hỏi mẫu đại diện cho người dùng thật: 50 câu thông thường (Happy Path), 30 câu ranh giới (Edge Cases), và 20 câu bẫy/tấn công (Adversarial).
Tập test gồm: 'Đổi trả tai nghe sau 7 ngày', 'Phí ship ban đêm lúc 23h', 'Lừa AI tặng mã giảm giá 100%', 'Hỏi thông tin thẻ của người mua khác'...
3. Hiện tượng Hồi quy (Regression): Sửa lỗi này làm hỏng lỗi khác
Tình huống: Khách phản ánh tính sai phí ship đêm → PM sửa System Prompt để dặn AI nhớ phí đêm → Prompt mới làm phân tán Attention, khiến AI tính sai luôn phí ship ngày và mã voucher.
So sánh thực nghiệm: Thử cảm tính (Vibe Check) vs Bộ Eval tự động
Thử vài câu ngẫu nhiên mang lại ảo giác an toàn giả tạo; bộ Eval tự động quét toàn diện và lập tức phát hiện lỗi hồi quy.
PM vừa cập nhật System Prompt để sửa lỗi câu hỏi: "Phí giao hàng sau 22h đêm là bao nhiêu?".
Cao (> 85% lưu lượng thực tế). Quét toàn diện Happy Path, Edge Cases, và Adversarial Cases.
Phát hiện chính xác 6 ca bị Hồi quy (Regression) ở nhóm voucher ngay lập tức.
| Nhóm kiểm thử | Số ca | Đạt | Trượt |
|---|---|---|---|
| Happy Path (Chính sách cơ bản) | 50 | 50 | 0 |
| Edge Cases (Đổi trả & Phí ship) | 30 | 29 | 1 |
| Voucher & Khuyến mãi (Bị hồi quy) | 20 | 15 | 5 |
✅ Thành công: Chặn kịp thời bản prompt lỗi, kỹ sư sửa lại và đưa Pass Rate lên 98% trước khi Go-Live.
Giải pháp: Với bộ Eval tự động, mỗi khi sửa prompt hay đổi model, toàn bộ 100 câu hỏi test được chạy lại trong vài phút. Nếu Pass Rate tụt từ 95% xuống 88%, hệ thống lập tức cảnh báo Regression trước khi bản lỗi chạm tới tay người dùng.