Module 4 • Bài 1645 phút

Hệ thống Eval Toàn diện cho Agent

Phân định ranh giới giữa An ninh và Đánh giá, 5 chiều đo lường (Outcome, Trajectory, Safety, Latency, Cost), LLM-as-a-Judge và chống Denial of Wallet.

Xây dựng bộ chỉ số đánh giá đa chiều: Outcome, Trajectory, Safety, Latency, Cost
Kết hợp kiểm thử xác định (Deterministic Tests) với giám khảo LLM (LLM-as-a-Judge)
Thiết lập giới hạn ngân sách và chốt chặn phòng chống cạn kiệt tài chính (Denial of Wallet)

Quan sát luồng thực thi và chặn lệch hướng

Một mã trạng thái HTTP thành công không thể giải thích được lý do tại sao agent lại hành động như vậy. Sản phẩm cần một chuỗi trace theo mốc thời gian kết nối ý định người dùng, ngữ cảnh được truy xuất, các quyết định của model, đầu vào và đầu ra của tool, các bước kiểm tra phân quyền, độ trễ và trạng thái cuối cùng.

Hãy thiết lập một luồng thực thi có thể quan sát (Vibe Trajectory) từ yêu cầu mở đầu tới code hoặc Cây cú pháp trừu tượng (, AST) được tạo ra và các tác động tool thực tế. OpenTelemetry có thể biểu diễn toàn bộ tác vụ bằng một span agent.session, các chu kỳ suy luận và prompt bằng span agent.think được bảo vệ, và mỗi tương tác môi trường bằng span agent.tool chứa argument, kết quả, độ trễ, quyết định chính sách và chi phí. Ghép trace với cơ chế quét nội dung tập trung cho các đoạn thông tin động được truy xuất hoặc sinh ra trong runtime.

Cách làm này làm cho Tấn công làm cạn kiệt ngân sách vận hành (Denial of Wallet - DoW) trở nên có thể quan sát được. Một agent thành công về mặt kỹ thuật vẫn có thể rơi vào một vòng lặp suy luận hoặc gọi tool vô tận và đốt sạch ngân sách token cùng chi phí cloud. Hãy đặt giới hạn token, số lần gọi tool, số lần thử lại, độ trễ và chi phí cho từng phiên làm việc; phát cảnh báo trước khi ngân sách cạn kiệt và lưu giữ bản ghi trace giải thích cho vòng lặp đó.

Khả năng quan sát hỗ trợ cả security lẫn đánh giá. Nó có thể phát hiện vòng lặp thử lại vô hạn, tool bất thường, chi phí quá cao, tự sửa lặp lại hoặc hành động lệch khỏi yêu cầu ban đầu. Checkpoint trong kiểm soát phiên bản và stateful circuit breaker tạo điểm dừng an toàn. Nếu trust giảm dưới ngưỡng đã xác định, hệ thống có thể thu hồi tool, khôi phục checkpoint gần nhất và giữ bằng chứng để review.

Hãy biến lệch hướng ý định (intent drift)suy giảm trust (trust decay) thành cơ chế vận hành cụ thể, không chỉ là khẩu hiệu. Khi bắt đầu lượt chạy, hãy ghi ràng buộc mục tiêu ngắn gọn gồm mục tiêu, kết quả bị cấm, tài nguyên được phép, ngân sách và thời hạn. So sánh từng mục tiêu phụ, tool hoặc nguồn dữ liệu mới với ràng buộc đó và AgBOM hiện tại. Trust suy giảm khi agent thêm phạm vi chưa duyệt, thử lại quá ngân sách, đổi đối tượng, xin credential mạnh hơn hoặc không giải thích được dependency mới.

Một stateful circuit breaker cần xác định:

Tín hiệu kích hoạt (Trigger)Phản ứng tự độngBằng chứng để khôi phục
Tool hoặc điểm đến không có trong AgBOMTạm dừng thực thi và thu hồi token của toolKế hoạch mới và sự phê duyệt lại rõ ràng
Vượt quá ngân sách thử lại, token, độ trễ hoặc chi phíĐóng băng vòng lặp tại điểm kiểm tra gần nhấtNguyên nhân gốc rễ và kế hoạch thử lại nhỏ hơn
Hành động đề xuất lệch khỏi ràng buộc mục tiêuCách ly lượt chạy mà không xóa memoryVibe Diff chỉ rõ điểm không khớp
Ràng buộc an ninh hoặc quét nội dung thất bạiChặn hành động và giữ lại thành phẩmQuét lại sạch sẽ cùng kiểm duyệt bản vá của Green Team

Theo dõi độ chính xác cảnh báo lệch hướng, tỷ lệ dừng nhầm, thời gian cách ly, tỷ lệ khôi phục checkpoint thành công, số lần ngắt mạch lặp lại và chi phí tránh được. Circuit breaker luôn kích hoạt thì không thể dùng; nếu chỉ kích hoạt sau khi hành động bên ngoài đã xảy ra, nó chỉ là bộ ghi log sự cố.

Chỉ sử dụng điểm số niềm tin động của Agent (Dynamic Agent Trust Score) như một đầu vào kiểm soát rõ ràng, tuyệt đối không dùng như một con số thần kỳ không giải thích được. Đánh số phiên bản cho các tính năng và ngưỡng của điểm số, hiển thị cho operator thấy tín hiệu nào làm giảm niềm tin và test các thay đổi ngưỡng trên các dữ liệu trace an toàn và không an toàn đã biết. Trước mỗi lần sửa đổi codebase, hãy tạo một điểm kiểm tra có thể khôi phục. Việc lấy mẫu dựa trên kết quả cuối () có thể bỏ qua các trace thành công thông thường sau khi hoàn tất nhưng phải giữ lại các sự cố thất bại, chi phí cao, vi phạm chính sách và việc tự sửa chữa quá mức; theo dõi độ bao phủ của trace được lấy mẫu cùng chi phí lưu trữ để các sự cố hiếm gặp vẫn có thể tái dựng được.

Không để lộ các suy luận riêng tư hay secret trong các log hiển thị cho người dùng. Thay vào đó, hãy hiển thị bằng chứng vận hành hữu ích: agent đang làm gì, dùng nguồn hay tool nào, điều gì thay đổi và người dùng khôi phục ra sao. Duy trì một luồng trace được bảo vệ chi tiết hơn cho các operator được cấp quyền.