Về Thư viện Skills
EvaluationLLM EvalsBenchmarkingAI Agent Skill

llm-evaluation

Thiết kế bộ rubric đánh giá mô hình ngôn ngữ lớn, chấm điểm tự động bằng LLM-as-a-judge và đo lường tỷ lệ vượt qua bài kiểm tra.

wshobson/agents
10.3k sao
10.3k installs
Cập nhật: 2026-07-08

Tuỳ chọn cài đặt

Cài đặt vào Claude Code, Cursor, Codex hoặc Antigravity bằng lệnh sau:

$ npx skills add wshobson/agents@llm-evaluation

Tình huống thực tế ứng dụng Skill này

Tự tạo bộ test đánh giá AI (Eval) khi chưa có sẵn dữ liệu

Kỹ sư hỏi "lấy gì để đo độ chính xác của AI?" khi sản phẩm chưa có người dùng - bạn bắt đầu tạo dataset từ đâu?

Khung hành động 5 bước

  1. 1Tự viết tay 20 kịch bản người dùng cốt lõi (10 câu hỏi chuẩn, 5 câu hỏi bẫy/mơ hồ, 5 câu hỏi ngoài phạm vi).
  2. 2Định nghĩa đáp án chuẩn (Ground Truth) và tiêu chí chấm đạt/không đạt (Rubric) cho từng câu.
  3. 3Giao cho 2 người khác trong team đọc và trả lời độc lập - nếu họ trả lời khác nhau, rubric của bạn chưa đủ rõ.
  4. 4Chạy model qua 20 test case này và ghi lại tỉ lệ pass baseline làm mốc so sánh trước khi tối ưu prompt/RAG.
  5. 5Cập nhật thêm test case mới mỗi khi phát hiện một bug hoặc câu trả lời kỳ quặc trong quá trình thử nghiệm.
Trước khi dùng Skill

"Chờ ra mắt có người dùng thật rồi mới gom dữ liệu đánh giá."

Sau khi áp dụng Skill

"Bắt đầu với 20 golden test cases có rubric rõ ràng (10 happy + 5 edge + 5 adversarial), đo baseline pass rate 65%, đặt mục tiêu 85% trước khi ra mắt beta."

Bài học đào sâu trong giáo trình

AI Agents for PMBài 11

Vào bài học

Nội dung chỉ dẫn SKILL.md

SKILL.md • Read-only preview
# LLM Evaluation Skill

Construct golden datasets, establish multi-dimensional scoring rubrics (Relevance, Groundedness, Safety), and automate benchmark runs.