SafetyGuardrailsSecurityAI Agent Skill
ai-prompt-engineering-safety-review
Rà soát an toàn prompt tự động, kiểm tra các lỗ hổng jailbreak, rò rỉ dữ liệu (PII) và rủi ro tấn công prompt injection.
Tuỳ chọn cài đặt
Cài đặt vào Claude Code, Cursor, Codex hoặc Antigravity bằng lệnh sau:
$ npx skills add github/awesome-copilot@ai-prompt-engineering-safety-review
Tình huống thực tế ứng dụng Skill này
Audit và chặn đứng ảo giác độc hại trước khi đưa AI ra người dùng
“AI thỉnh thoảng tự bịa chính sách khuyến mãi hoặc số liệu sai nghiêm trọng - làm sao dựng rào chắn ngăn chặn?”
Khung hành động 5 bước
- 1Liệt kê danh sách các thông tin 'tuyệt đối không được sai' (giá cả, cam kết pháp lý, chính sách đổi trả, dữ liệu nhạy cảm).
- 2Thêm bước tiền xử lý (Input Guardrail): phát hiện và chặn các prompt cố tình lừa AI vi phạm chính sách.
- 3Thêm bước hậu xử lý (Output Verification): dùng regex hoặc rule engine kiểm tra lại các con số, đường link, mã giảm giá trong câu trả lời.
- 4Thiết lập cơ chế Fallback rõ ràng: khi độ tự tin thấp hoặc vi phạm guardrail, chuyển hướng sang câu trả lời an toàn hoặc nhân viên hỗ trợ.
- 5Ghi log 100% các câu trả lời bị guardrail chặn để liên tục bổ sung kịch bản kiểm thử vào bộ Eval.
Trước khi dùng Skill
"Nhắc trong system prompt: 'hãy luôn trả lời chính xác, không được bịa đặt'."
Sau khi áp dụng Skill
"Dựng lớp kiểm tra sau (Post-check): mọi mức giá AI tạo ra phải khớp với bảng giá DB; nếu lệch quá 0%, chặn output và trả về link bảng giá chính thức."
Bài học đào sâu trong giáo trình
AI Agents for PM • Bài 9
Nội dung chỉ dẫn SKILL.md
SKILL.md • Read-only preview# AI Prompt Safety Review Skill Audit prompts against OWASP Top 10 for LLMs, verify input sanitization, and enforce strict boundary tokens.