“AI thỉnh thoảng tự bịa chính sách khuyến mãi hoặc số liệu sai nghiêm trọng - làm sao dựng rào chắn ngăn chặn?”
Audit và chặn đứng ảo giác độc hại trước khi đưa AI ra người dùng
AI Agent Skills tương ứng
Rà soát an toàn prompt tự động, kiểm tra các lỗ hổng jailbreak, rò rỉ dữ liệu (PII) và rủi ro tấn công prompt injection.
SafetyGuardrailsSecurity
Kiểm tra và thiết lập các quy tắc bảo vệ dữ liệu tất định ở tầng lưu trữ, ngăn chặn AI truy cập dữ liệu trái phép.
RulesGuardrailsDatabase
Phát hiện và chặn các prompt cố tình jailbreak hoặc injection trước khi chúng chạm tới model chính.
GuardrailsJailbreak DetectionSafety
Khung hành động
- Liệt kê danh sách các thông tin 'tuyệt đối không được sai' (giá cả, cam kết pháp lý, chính sách đổi trả, dữ liệu nhạy cảm).
- Thêm bước tiền xử lý (Input Guardrail): phát hiện và chặn các prompt cố tình lừa AI vi phạm chính sách.
- Thêm bước hậu xử lý (Output Verification): dùng regex hoặc rule engine kiểm tra lại các con số, đường link, mã giảm giá trong câu trả lời.
- Thiết lập cơ chế Fallback rõ ràng: khi độ tự tin thấp hoặc vi phạm guardrail, chuyển hướng sang câu trả lời an toàn hoặc nhân viên hỗ trợ.
- Ghi log 100% các câu trả lời bị guardrail chặn để liên tục bổ sung kịch bản kiểm thử vào bộ Eval.
Trước
"Nhắc trong system prompt: 'hãy luôn trả lời chính xác, không được bịa đặt'."
Sau
"Dựng lớp kiểm tra sau (Post-check): mọi mức giá AI tạo ra phải khớp với bảng giá DB; nếu lệch quá 0%, chặn output và trả về link bảng giá chính thức."