Về Thư viện Skills

AI thỉnh thoảng tự bịa chính sách khuyến mãi hoặc số liệu sai nghiêm trọng - làm sao dựng rào chắn ngăn chặn?

Audit và chặn đứng ảo giác độc hại trước khi đưa AI ra người dùng

AI Agent Skills tương ứng

Rà soát an toàn prompt tự động, kiểm tra các lỗ hổng jailbreak, rò rỉ dữ liệu (PII) và rủi ro tấn công prompt injection.

SafetyGuardrailsSecurity
2026-06-1410.1k

Kiểm tra và thiết lập các quy tắc bảo vệ dữ liệu tất định ở tầng lưu trữ, ngăn chặn AI truy cập dữ liệu trái phép.

RulesGuardrailsDatabase
2026-07-2299.9k

Phát hiện và chặn các prompt cố tình jailbreak hoặc injection trước khi chúng chạm tới model chính.

GuardrailsJailbreak DetectionSafety
2026-06-05697

Khung hành động

  1. Liệt kê danh sách các thông tin 'tuyệt đối không được sai' (giá cả, cam kết pháp lý, chính sách đổi trả, dữ liệu nhạy cảm).
  2. Thêm bước tiền xử lý (Input Guardrail): phát hiện và chặn các prompt cố tình lừa AI vi phạm chính sách.
  3. Thêm bước hậu xử lý (Output Verification): dùng regex hoặc rule engine kiểm tra lại các con số, đường link, mã giảm giá trong câu trả lời.
  4. Thiết lập cơ chế Fallback rõ ràng: khi độ tự tin thấp hoặc vi phạm guardrail, chuyển hướng sang câu trả lời an toàn hoặc nhân viên hỗ trợ.
  5. Ghi log 100% các câu trả lời bị guardrail chặn để liên tục bổ sung kịch bản kiểm thử vào bộ Eval.

Trước

"Nhắc trong system prompt: 'hãy luôn trả lời chính xác, không được bịa đặt'."

Sau

"Dựng lớp kiểm tra sau (Post-check): mọi mức giá AI tạo ra phải khớp với bảng giá DB; nếu lệch quá 0%, chặn output và trả về link bảng giá chính thức."

Học sâu hơn: Bài 09 - AI Agents for PM