Agent "quyết định" bước tiếp theo như thế nào
Vòng lặp suy luận ReAct (Thought → Action → Observation), cơ chế Tool Calling, thang 4 cấp độ tự chủ và chốt chặn an toàn Infinite Loop.
Agent "quyết định" bước tiếp theo như thế nào?
Làm thế nào AI biết nên gọi công cụ nào trước, công cụ nào sau và khi nào công việc đã thực sự hoàn thành? Câu trả lời nằm ở Vòng lặp suy luận ReAct (Reasoning + Acting) - cơ chế tư duy cốt lõi giúp Agent vừa hành động vừa tự điều chỉnh hướng đi theo kết quả thực tế.
1. Vòng lặp suy luận ReAct: Thought → Action → Observation
Khác với script chạy cứng nhắc A → B → C, Agent suy luận linh hoạt qua chu trình 3 bước lặp:
- Suy nghĩ (Thought): Não bộ phân tích mục tiêu và hiện trạng: "Để đạt mục tiêu này, bước tiếp theo tôi cần làm gì?".
- Hành động (Action): Chọn một công cụ phù hợp từ bộ Tools và gửi lệnh thực thi (ví dụ: gọi API tra cứu kho hàng).
- Quan sát (Observation): Đọc dữ liệu thực tế trả về từ công cụ: "Kết quả này có giúp ích gì cho mục tiêu không?".
Vòng lặp suy luận ReAct (Thought → Action → Observation)
Agent không chạy theo kịch bản cứng mà liên tục suy nghĩ, gọi công cụ và đọc phản hồi để tự điều chỉnh hướng đi.
“Khách hàng phàn nàn đơn hàng #7124 bị trễ 45 phút. Hãy kiểm tra tình trạng, xử lý sự cố và đền bù cho khách nếu lỗi do sàn.”
Tôi cần kiểm tra vị trí hiện tại của shipper và lý do đơn hàng #7124 bị giao trễ so với giờ hẹn.
Dữ liệu trả về: Shipper gặp sự cố thủng lốp xe tại Đường Nguyễn Thị Minh Khai, đã đứng yên 35 phút.
Quy luật: Sau mỗi bước Quan sát, Agent tiếp tục vòng Suy nghĩ mới cho đến khi mục tiêu hoàn tất thì dừng lại và xuất báo cáo.
2. Cơ chế Tool Calling: AI ra lệnh cho hệ thống như thế nào?
Quy trình điều phối của AI diễn ra qua 3 bước:
- Định nghĩa công cụ: Kỹ sư cung cấp danh sách Tools kèm mô tả chi tiết (ví dụ:
cancel_ordernhận vàoorder_idvàreason). - Xuất lệnh có cấu trúc: Thay vì viết văn xuôi, model trả về khối JSON:
{"action": "cancel_order", "parameters": {"order_id": "9821"}}. - Thực thi và phản hồi: Backend đọc lệnh JSON, gọi database cập nhật trạng thái và nạp kết quả ngược lại cho AI tiếp tục suy luận.
3. Thang 4 cấp độ tự chủ (Autonomy Levels) trong sản phẩm
| Cấp độ | Tên gọi | Cơ chế vận hành | Ví dụ tại EcoCart |
|---|---|---|---|
| Level 1 | Chỉ gợi ý (Advisory) | AI phân tích & khuyến nghị, con người tự tay làm | Gợi ý 3 sản phẩm bán chạy cho banner |
| Level 2 | Có người duyệt (HITL) | AI soạn sẵn lệnh, chờ con người bấm duyệt mới chạy | Lệnh hoàn tiền 1.000.000 VNĐ chờ CSKH duyệt |
| Level 3 | Tự làm & Báo cáo lại | AI tự chạy tác vụ rủi ro thấp và gửi log báo cáo | Tự hủy đơn chưa thanh toán sau 24h & gửi mail |
| Level 4 | Hoàn toàn tự hành | AI tự chạy ngầm liên tục không cần can thiệp | Đồng bộ tồn kho 5 chi nhánh mỗi 10 phút |
Thang 4 cấp độ tự chủ của AI Agent trong sản phẩm
Ranh giới tự chủ quyết định mức độ tự do hành động của Agent dựa trên chi phí sai sót và tính nhạy cảm của nghiệp vụ.
Mọi hành động làm thay đổi số dư tài chính, hợp đồng pháp lý hoặc xóa dữ liệu vĩnh viễn bắt buộc phải đặt ở Level 2 (Có người duyệt).
Level 2: Xin phép trước khi làm (Human Approval / HITL)
Trung bình (Kiểm soát hoàn toàn trước khi tác động)Kiểm tra bản nháp và bấm nút 'Phê duyệt' hoặc 'Từ chối'.
Tự động chuẩn bị sẵn 100% dữ liệu hành động, tạm dừng chờ lệnh người duyệt.
Agent chuẩn bị sẵn lệnh hoàn tiền 1.500.000 VNĐ cho khách bị vỡ màn hình tivi, chờ quản lý CSKH bấm xác nhận.
Quy tắc vàng cho PM: Mọi hành động thay đổi số dư tài chính, hợp đồng pháp lý hoặc xóa dữ liệu bắt buộc phải đặt ở Level 2 (Human-in-the-Loop).
4. Kiểm soát rủi ro kẹt vòng lặp vô tận (Infinite Loop)
Sự cố: Gọi API lỗi mạng → Thử lại → Lỗi mạng → Lặp liên tục hàng trăm lần. Hậu quả: Đốt sạch ngân sách token và làm treo hệ thống.
Thiết kế Trợ lý Agent Tự hành Xử lý Sự cố Đơn hàng cho EcoCart
- Thiết kế Tools (Bài 11): Liệt kê 4 công cụ tối thiểu (tra cứu GPS, nhắn tin tài xế, tạo voucher, cập nhật đơn hàng).
- Chu trình ReAct (Bài 12): Viết chi tiết 3 vòng lặp suy luận (Thought → Action → Observation) từ khi nhận phản ánh giao trễ đến khi giải quyết xong.
- Phân bổ Cấp độ tự chủ (Bài 12): Gán đúng cấp độ (Level 1 đến Level 4) cho từng hành động của Agent.
- Chốt chặn an toàn: Xác định Max Steps và kịch bản dự phòng khi shipper mất kết nối GPS.