Về Thư viện Skills
Agent EvaluationTestingGitHubAI Agent Skill

agentic-eval

Bộ khung đánh giá tác nhân AI (agentic eval) chuẩn từ GitHub, đo lường độ chính xác và độ tin cậy của các bước suy luận/agent.

github/awesome-copilot
10.1k sao
10.1k installs
Cập nhật: 2026-07-10

Tuỳ chọn cài đặt

Cài đặt vào Claude Code, Cursor, Codex hoặc Antigravity bằng lệnh sau:

$ npx skills add github/awesome-copilot@agentic-eval

Tình huống thực tế ứng dụng Skill này

Tự tạo bộ test đánh giá AI (Eval) khi chưa có sẵn dữ liệu

Kỹ sư hỏi "lấy gì để đo độ chính xác của AI?" khi sản phẩm chưa có người dùng - bạn bắt đầu tạo dataset từ đâu?

Khung hành động 5 bước

  1. 1Tự viết tay 20 kịch bản người dùng cốt lõi (10 câu hỏi chuẩn, 5 câu hỏi bẫy/mơ hồ, 5 câu hỏi ngoài phạm vi).
  2. 2Định nghĩa đáp án chuẩn (Ground Truth) và tiêu chí chấm đạt/không đạt (Rubric) cho từng câu.
  3. 3Giao cho 2 người khác trong team đọc và trả lời độc lập - nếu họ trả lời khác nhau, rubric của bạn chưa đủ rõ.
  4. 4Chạy model qua 20 test case này và ghi lại tỉ lệ pass baseline làm mốc so sánh trước khi tối ưu prompt/RAG.
  5. 5Cập nhật thêm test case mới mỗi khi phát hiện một bug hoặc câu trả lời kỳ quặc trong quá trình thử nghiệm.
Trước khi dùng Skill

"Chờ ra mắt có người dùng thật rồi mới gom dữ liệu đánh giá."

Sau khi áp dụng Skill

"Bắt đầu với 20 golden test cases có rubric rõ ràng (10 happy + 5 edge + 5 adversarial), đo baseline pass rate 65%, đặt mục tiêu 85% trước khi ra mắt beta."

Bài học đào sâu trong giáo trình

AI Agents for PMBài 11

Vào bài học

Nội dung chỉ dẫn SKILL.md

SKILL.md • Read-only preview
# Agentic Eval Skill

Define task-completion rubrics for agent workflows, run repeatable evaluation passes, and track pass/fail trends across agent versions.