Về Thư viện Skills

Kỹ sư hỏi "lấy gì để đo độ chính xác của AI?" khi sản phẩm chưa có người dùng - bạn bắt đầu tạo dataset từ đâu?

Tự tạo bộ test đánh giá AI (Eval) khi chưa có sẵn dữ liệu

AI Agent Skills tương ứng

Thiết kế bộ rubric đánh giá mô hình ngôn ngữ lớn, chấm điểm tự động bằng LLM-as-a-judge và đo lường tỷ lệ vượt qua bài kiểm tra.

EvaluationLLM EvalsBenchmarking
2026-07-0810.3k

Quy trình đánh giá tác nhân AI tự động dựa trên Pass@k, đo lường độ chính xác của lệnh gọi công cụ (tool calls) và khả năng hoàn thành mục tiêu.

AgentsEvalsGoogle AI
2026-08-0198.3k

Bộ khung đánh giá tác nhân AI (agentic eval) chuẩn từ GitHub, đo lường độ chính xác và độ tin cậy của các bước suy luận/agent.

Agent EvaluationTestingGitHub
2026-07-1010.1k

Khung hành động

  1. Tự viết tay 20 kịch bản người dùng cốt lõi (10 câu hỏi chuẩn, 5 câu hỏi bẫy/mơ hồ, 5 câu hỏi ngoài phạm vi).
  2. Định nghĩa đáp án chuẩn (Ground Truth) và tiêu chí chấm đạt/không đạt (Rubric) cho từng câu.
  3. Giao cho 2 người khác trong team đọc và trả lời độc lập - nếu họ trả lời khác nhau, rubric của bạn chưa đủ rõ.
  4. Chạy model qua 20 test case này và ghi lại tỉ lệ pass baseline làm mốc so sánh trước khi tối ưu prompt/RAG.
  5. Cập nhật thêm test case mới mỗi khi phát hiện một bug hoặc câu trả lời kỳ quặc trong quá trình thử nghiệm.

Trước

"Chờ ra mắt có người dùng thật rồi mới gom dữ liệu đánh giá."

Sau

"Bắt đầu với 20 golden test cases có rubric rõ ràng (10 happy + 5 edge + 5 adversarial), đo baseline pass rate 65%, đặt mục tiêu 85% trước khi ra mắt beta."

Học sâu hơn: Bài 11 - AI Agents for PM