Module 4 • Bài 1250 phút

Agent "quyết định" bước tiếp theo như thế nào

Vòng lặp suy luận ReAct (Thought → Action → Observation), cơ chế Tool Calling, thang 4 cấp độ tự chủ và chốt chặn an toàn Infinite Loop.

Vòng lặp suy luận ReAct: Thought → Action → Observation
Thang 4 cấp độ tự chủ và nguyên tắc Human-in-the-Loop
Thiết lập chốt chặn an toàn: Max Steps, Circuit Breaker, Session Token Cap

Agent "quyết định" bước tiếp theo như thế nào?

Làm thế nào AI biết nên gọi công cụ nào trước, công cụ nào sau và khi nào công việc đã thực sự hoàn thành? Câu trả lời nằm ở Vòng lặp suy luận ReAct (Reasoning + Acting) - cơ chế tư duy cốt lõi giúp Agent vừa hành động vừa tự điều chỉnh hướng đi theo kết quả thực tế.

1. Vòng lặp suy luận ReAct: Thought → Action → Observation

Khác với script chạy cứng nhắc A → B → C, Agent suy luận linh hoạt qua chu trình 3 bước lặp:

  1. Suy nghĩ (Thought): Não bộ phân tích mục tiêu và hiện trạng: "Để đạt mục tiêu này, bước tiếp theo tôi cần làm gì?".
  2. Hành động (Action): Chọn một công cụ phù hợp từ bộ Tools và gửi lệnh thực thi (ví dụ: gọi API tra cứu kho hàng).
  3. Quan sát (Observation): Đọc dữ liệu thực tế trả về từ công cụ: "Kết quả này có giúp ích gì cho mục tiêu không?".

Vòng lặp suy luận ReAct (Thought → Action → Observation)

Agent không chạy theo kịch bản cứng mà liên tục suy nghĩ, gọi công cụ và đọc phản hồi để tự điều chỉnh hướng đi.

Mục tiêu ban đầu giao cho Agent:

“Khách hàng phàn nàn đơn hàng #7124 bị trễ 45 phút. Hãy kiểm tra tình trạng, xử lý sự cố và đền bù cho khách nếu lỗi do sàn.”

Nhấn vào từng lượt (Turn) để theo dõi luồng tư duy của Agent:
01. Suy nghĩ (Thought):

Tôi cần kiểm tra vị trí hiện tại của shipper và lý do đơn hàng #7124 bị giao trễ so với giờ hẹn.

02. Hành động (Action):
get_driver_location(order_id='7124')
Tham số: {"order_id": "7124"}
03. Quan sát (Observation):

Dữ liệu trả về: Shipper gặp sự cố thủng lốp xe tại Đường Nguyễn Thị Minh Khai, đã đứng yên 35 phút.

Sau mỗi bước Quan sát, Agent lại bắt đầu một vòng Suy nghĩ mới cho đến khi mục tiêu được giải quyết trọn vẹn.

Quy luật: Sau mỗi bước Quan sát, Agent tiếp tục vòng Suy nghĩ mới cho đến khi mục tiêu hoàn tất thì dừng lại và xuất báo cáo.

2. Cơ chế Tool Calling: AI ra lệnh cho hệ thống như thế nào?

Quy trình điều phối của AI diễn ra qua 3 bước:

  1. Định nghĩa công cụ: Kỹ sư cung cấp danh sách Tools kèm mô tả chi tiết (ví dụ: cancel_order nhận vào order_idreason).
  2. Xuất lệnh có cấu trúc: Thay vì viết văn xuôi, model trả về khối JSON: {"action": "cancel_order", "parameters": {"order_id": "9821"}}.
  3. Thực thi và phản hồi: Backend đọc lệnh JSON, gọi database cập nhật trạng thái và nạp kết quả ngược lại cho AI tiếp tục suy luận.

3. Thang 4 cấp độ tự chủ (Autonomy Levels) trong sản phẩm

Cấp độTên gọiCơ chế vận hànhVí dụ tại EcoCart
Level 1Chỉ gợi ý (Advisory)AI phân tích & khuyến nghị, con người tự tay làmGợi ý 3 sản phẩm bán chạy cho banner
Level 2Có người duyệt (HITL)AI soạn sẵn lệnh, chờ con người bấm duyệt mới chạyLệnh hoàn tiền 1.000.000 VNĐ chờ CSKH duyệt
Level 3Tự làm & Báo cáo lạiAI tự chạy tác vụ rủi ro thấp và gửi log báo cáoTự hủy đơn chưa thanh toán sau 24h & gửi mail
Level 4Hoàn toàn tự hànhAI tự chạy ngầm liên tục không cần can thiệpĐồng bộ tồn kho 5 chi nhánh mỗi 10 phút

Thang 4 cấp độ tự chủ của AI Agent trong sản phẩm

Ranh giới tự chủ quyết định mức độ tự do hành động của Agent dựa trên chi phí sai sót và tính nhạy cảm của nghiệp vụ.

Quy tắc vàng cho PM:

Mọi hành động làm thay đổi số dư tài chính, hợp đồng pháp lý hoặc xóa dữ liệu vĩnh viễn bắt buộc phải đặt ở Level 2 (Có người duyệt).

Nhấn vào từng cấp độ để xem cơ chế vận hành và ví dụ thực tế:

Level 2: Xin phép trước khi làm (Human Approval / HITL)

Trung bình (Kiểm soát hoàn toàn trước khi tác động)
Vai trò của con người:

Kiểm tra bản nháp và bấm nút 'Phê duyệt' hoặc 'Từ chối'.

Quyền hạn của Agent:

Tự động chuẩn bị sẵn 100% dữ liệu hành động, tạm dừng chờ lệnh người duyệt.

Ứng dụng thực tế tại EcoCart:

Agent chuẩn bị sẵn lệnh hoàn tiền 1.500.000 VNĐ cho khách bị vỡ màn hình tivi, chờ quản lý CSKH bấm xác nhận.

Hướng dẫn triển khai cho PM: Bắt buộc cho mọi giao dịch hoàn tiền, hủy hợp đồng hoặc can thiệp dữ liệu tài chính quan trọng.
Cấp độ tự chủ càng cao thì trải nghiệm càng mượt, nhưng đòi hỏi hệ thống đánh giá và guardrail càng khắt khe.

Quy tắc vàng cho PM: Mọi hành động thay đổi số dư tài chính, hợp đồng pháp lý hoặc xóa dữ liệu bắt buộc phải đặt ở Level 2 (Human-in-the-Loop).

4. Kiểm soát rủi ro kẹt vòng lặp vô tận (Infinite Loop)

Sự cố: Gọi API lỗi mạng → Thử lại → Lỗi mạng → Lặp liên tục hàng trăm lần. Hậu quả: Đốt sạch ngân sách token và làm treo hệ thống.

Bài tập thực hành70 phút

Thiết kế Trợ lý Agent Tự hành Xử lý Sự cố Đơn hàng cho EcoCart

  1. Thiết kế Tools (Bài 11): Liệt kê 4 công cụ tối thiểu (tra cứu GPS, nhắn tin tài xế, tạo voucher, cập nhật đơn hàng).
  2. Chu trình ReAct (Bài 12): Viết chi tiết 3 vòng lặp suy luận (Thought → Action → Observation) từ khi nhận phản ánh giao trễ đến khi giải quyết xong.
  3. Phân bổ Cấp độ tự chủ (Bài 12): Gán đúng cấp độ (Level 1 đến Level 4) cho từng hành động của Agent.
  4. Chốt chặn an toàn: Xác định Max Steps và kịch bản dự phòng khi shipper mất kết nối GPS.