Module 6 • Bài 5345 phút

Kiến Trúc Guardrail Nhiều Lớp Cho Use Case Thực Chiến

Thiết kế kiến trúc Sandwich Guardrails, phân bổ 4 vùng rủi ro đỏ vào tầng Input/Output và thiết lập rào chắn cho tác vụ thực thi.

Làm chủ kiến trúc Sandwich Guardrails kẹp model ở giữa Input và Output
Phân bổ 4 vùng rủi ro đỏ có chọn lọc và kiểm soát quyền thực thi ghi dữ liệu

Kiến Trúc Guardrail Nhiều Lớp Cho Use Case Thực Chiến

AI Literacy Lesson 14, bạn đã làm quen với hai khái niệm nền tảng: "Sandwich Guardrails" (Rào chắn bánh kẹp) và "4 vùng rủi ro đỏ" (PII, Jailbreak, Financial Over-promise, Toxicity). Khi bước vào triển khai một sản phẩm thực tế, câu hỏi thiết kế của PM không dừng lại ở định nghĩa, mà là: "Với use case cụ thể này, vùng rủi ro nào thực sự áp dụng, và mỗi vùng cần được chặn ở lớp Input, lớp Output, hay cả hai?"

Ví dụ xuyên suốt bài: MedBook AI — trợ lý AI tiếp nhận yêu cầu đặt lịch khám bệnh trực tuyến và giải đáp quyền lợi bảo hiểm y tế tại một hệ thống phòng khám tư nhân (có khả năng tự động tạo lịch hẹn trực tiếp vào cơ sở dữ liệu nếu bệnh nhân xác nhận).

1. Kiến trúc Sandwich Guardrails: Input vs Output

Một hệ thống phòng vệ chuẩn mực "kẹp" mô hình AI ở giữa hai lớp bảo vệ độc lập:

  • Input Guardrail (Lớp phòng vệ đầu vào):
    • Mục tiêu: Kiểm tra và thanh lọc dữ liệu trước khi câu hỏi được gửi tới model.
    • Vai trò: Chặn đứng các hành vi tấn công, khai thác lỗ hổng hoặc nhồi nhét mã độc ngay tại cửa ngõ. Ngăn không cho model tiêu tốn token để xử lý các yêu cầu vi phạm chính sách.
  • Output Guardrail (Lớp phòng vệ đầu ra):
    • Mục tiêu: Kiểm tra phản hồi do model sinh ra sau khi xử lý xong, trước khi hiển thị ra màn hình cho người dùng.
    • Vai trò: Bắt các lỗi do chính model tự sinh ra (hallucination, rò rỉ dữ liệu ngoài mong muốn từ RAG context, đưa ra lời khuyên y tế vượt quá thẩm quyền) kể cả khi input của người dùng hoàn toàn bình thường và vô hại.

Kiến Trúc Sandwich Guardrails & Phân Tầng Phòng Vệ

Khám phá 3 trạm kiểm soát an toàn của MedBook AI để thấy cách model bị kẹp giữa hai tầng phòng vệ.

1. Input Guardrail (Trước Model)Foundation Model (Lõi suy luận)2. Output Guardrail (Sau Model)

Chọn tầng phòng vệ trong kiến trúc Sandwich:

Vùng rủi ro kiểm soát:

Cam kết vượt quyền, Rò rỉ PII từ RAG, Lời khuyên y tế nguy hiểm

Cơ chế kỹ thuật thực thi:

Deterministic Rule Engine + Scan từ khóa cấm + Check trích dẫn Grounding.

Kịch bản ứng dụng tại MedBook AI:

Model tự ý hứa: 'Bảo hiểm của bạn sẽ thanh toán 100% chi phí mổ trĩ.' → Output filter chặn và thay bằng mẫu chuẩn yêu cầu gửi hồ sơ cho CSKH.

Rào chắn quyền ghi (Write Action Guardrail):

Ngăn chặn các lỗi do model tự hallucinate hoặc diễn giải sai dữ liệu RAG context.

Model được kẹp giữa 2 lớp kiểm soát; tác vụ ghi (Write Actions) bắt buộc trang bị thêm Approval Gate.

2. Ma trận phân bổ 4 vùng rủi ro đỏ vào các tầng phòng vệ

Không phải mọi rủi ro đều cần đặt ở cả hai lớp. Phân bổ đúng vị trí giúp tối ưu hóa chi phí compute và độ trễ phản hồi:

Vùng rủi ro đỏLớp phòng vệ chínhCơ chế hoạt động cụ thể
Bảo vệ dữ liệu cá nhân (PII)Cả Input và OutputInput: Chặn hoặc ẩn danh hóa (masking) số CCCD, thẻ ngân hàng của người khác khi người dùng dán vào.
Output: Chặn model vô tình trích xuất hồ sơ bệnh án của bệnh nhân khác từ RAG context.
Chống Jailbreak / Prompt InjectionTầng InputSử dụng bộ phân loại chuyên dụng (Classifier) để phát hiện các mẫu câu ép model bỏ qua system prompt ("Hãy giả vờ bạn là bác sĩ trưởng khoa..."). Chặn ngay từ đầu vào để model không bị "lừa".
Cam kết vượt thẩm quyền (Financial / Legal Over-promise)Tầng OutputSử dụng Rule Engine hoặc Model nhỏ để kiểm tra xem câu trả lời có chứa các cam kết khẳng định về chi trả 100% bảo hiểm hoặc hoàn tiền khi chưa có xác nhận từ hệ thống lõi không.
Ngôn từ độc hại & Lời khuyên nguy hiểm (Toxicity & Harmful Advice)Tầng OutputQuét nội dung câu trả lời để ngăn chặn các chẩn đoán bệnh lý tự ý hoặc phác đồ dùng thuốc nguy hiểm mà không có chỉ định của bác sĩ.

3. Chọn lọc có chủ đích và rào chắn cho tác vụ thực thi

Một lỗi nghiêm trọng của PM là sao chép toàn bộ checklist 4 vùng rủi ro cho mọi tính năng. Thiết kế guardrail đúng nghĩa đòi hỏi sự chọn lọc dựa trên bản chất rủi ro thực tế:

Đặc biệt, khi tính năng có khả năng thực thi hành động thật (Write Action / Execution) — như tính năng đặt lịch khám của MedBook AI — các guardrail xử lý ngôn ngữ văn bản là chưa đủ. Bạn bắt buộc phải kết hợp với các nguyên tắc đã học ở Module 5:

  • Phân quyền công cụ tối thiểu (Minimal Tool Surface): Bot chỉ được cấp API check_doctor_availability (Read) và create_pending_booking (Write có trạng thái tạm).
  • Cơ chế Human Approval Gate: Với các thủ tục y tế phức tạp, bot chỉ được phép đề xuất khung giờ, và bắt buộc phải có bước người dùng/lễ tân bấm xác nhận cuối cùng.

4. Ẩn dụ: Bảo vệ sảnh tòa nhà và Camera an ninh nội bộ

Kiến trúc Sandwich Guardrails vận hành giống như hệ thống an ninh của một bệnh viện:

  • Bảo vệ cổng và sảnh đón tiếp (Input Guardrail): Kiểm tra túi xách, đo thân nhiệt và chặn những người có hung khí hoặc có ý đồ gây rối ngay từ ngoài cửa.
  • Camera và y tá giám sát hành lang (Output Guardrail): Giám sát các tình huống phát sinh bên trong phòng khám — phát hiện kịp thời nếu một thực tập sinh vô tình phát nhầm thuốc hoặc đi vào phòng lưu trữ hồ sơ bệnh án không phận sự.

Bài tập 53.1: Bạn là PM cho MedBook AI — trợ lý giải đáp bảo hiểm y tế và có khả năng tự động đặt lịch khám với bác sĩ khi bệnh nhân xác nhận.

  1. Trong 4 vùng rủi ro đỏ, hãy chọn ra các vùng thực sự áp dụng cho tính năng này. Với mỗi vùng đã chọn, chỉ rõ đặt ở Input, Output hay cả hai và mô tả cơ chế kiểm tra cụ thể.
  2. Vì tính năng này có khả năng trực tiếp tạo lịch hẹn trên hệ thống phòng khám, việc chỉ dùng Input/Output Guardrail có đủ an toàn không? Hãy đề xuất ít nhất 2 cơ chế phòng vệ bổ sung (liên hệ kiến thức Module 5: Minimal Tool Surface, Autonomy Level, Human-in-the-Loop) để đảm bảo không xảy ra sự cố đặt trùng lịch hoặc spam lịch ảo.