Module 3 • Bài 1050 phút

Fine-tune - "Đào tạo lại" phản xạ của AI bằng dữ liệu riêng

Bản chất can thiệp trọng số của Fine-tuning, khi nào nên chọn và thang leo thang 4 cấp độ tùy biến AI cho Product Manager.

Phân biệt In-context (Prompt/Skill/RAG) vs. Parametric Adaptation (Fine-tune)
Đánh giá trường hợp nên và không nên Fine-tune theo chi phí, dữ liệu, độ trễ
Làm chủ thang leo thang 4 cấp độ tùy biến AI từ thấp đến cao

Fine-tune - "Đào tạo lại" phản xạ của AI bằng dữ liệu riêng

RAG và Skills có điểm chung: không làm thay đổi bản thân model, chỉ thay đổi nội dung đưa vào context window tại thời điểm gọi API. Fine-tune (Tinh chỉnh mô hình) là con đường hoàn toàn khác: can thiệp trực tiếp vào cấu trúc bên trong của model để biến tri thức và phong cách riêng thành phản xạ tự nhiên.

1. Fine-tune là gì: Can thiệp trực tiếp vào trọng số bên trong model

Đối chiếu cơ chế:

  • In-context (Prompt / RAG / Skill): Nhân viên mang cẩm nang SOP và sách tra cứu vào phòng thi - làm việc dựa trên tài liệu cầm trên tay (Model gốc giữ nguyên 100%).
  • Fine-tune (Parametric Adaptation): Nhân viên thực tập qua hàng chục nghìn ca thực tế - phản xạ tư duy ngấm vào bên trong mà không cần giở sách (Trọng số bên trong model bị biến đổi).

Can thiệp Ngữ cảnh (In-Context) vs Điều chỉnh Trọng số (Fine-tune)

RAG và Skills chỉ thay đổi những gì model 'nhìn thấy' trong Context Window. Fine-tune can thiệp trực tiếp vào 'não bộ' bên trong model.

Chuyển đổi giữa 2 cơ chế để so sánh cấu trúc vận hành:
Architecture Flow
[Dữ liệu ngoài / SOP] ──► [Context Window] ──► [Model đóng băng (Không đổi)] ──► [Output]

Model hoàn toàn không bị chỉnh sửa trọng số. Mọi tri thức riêng được bơm qua đường dẫn ngữ cảnh đầu vào.

Can thiệp vào đâu?

Chỉ thay đổi nội dung gửi vào Context Window ở mỗi lần gọi API (Model gốc giữ nguyên 100%).

Thời gian triển khai & Dữ liệu

Tức thì (vài phút đến vài giờ viết tài liệu / nạp file).

Cơ cấu chi phí

Tốn chi phí token cho mỗi lượt gọi (System Prompt & ngữ cảnh dài).

Khả năng thay đổi (Agility)

Cực kỳ linh hoạt: Cập nhật chính sách mới là áp dụng ngay lập tức.

Ẩn dụ trực quan: Nhân viên cầm cẩm nang SOP và tài liệu tham khảo khi làm bài thi. Bản thân nhân viên không đổi, nhưng làm theo tài liệu đang cầm.
In-context (Prompt/RAG/Skill) tối ưu cho tri thức biến động; Fine-tune tối ưu cho phong cách cố định và tiết kiệm token ở quy mô lớn.

Quy trình: Chuẩn bị hàng nghìn cặp ví dụ mẫu chất lượng cao (Input chuẩn → Output chuẩn) và chạy huấn luyện bổ sung trên hạ tầng GPU.

2. Khi nào nên và KHÔNG nên chọn Fine-tune?

Sai lầm phổ biến: "Muốn AI biết dữ liệu nội bộ thì phải fine-tune." Đây là cái bẫy tốn kém chi phí và công sức.

  • KHÔNG NÊN Fine-tune khi:
    • Dữ liệu thay đổi thường xuyên: Bảng giá, khuyến mãi, tồn kho (mỗi lần đổi lại phải train lại).
    • Cần trích dẫn nguồn chính xác: Model chỉ "ngấm" trực giác, không trích dẫn được số trang/điều khoản cụ thể (RAG tốt hơn nhiều).
  • NÊN Fine-tune khi:
    • Định hình phong cách/giọng văn đặc thù: Đồng bộ tông giọng thương hiệu qua 50.000 mẫu hội thoại chuẩn.
    • Ép chuẩn định dạng đầu ra phức tạp: Bảo AI luôn trả lời đúng cấu trúc bảng hoặc định dạng tệp đặc thù, không tự tiện thêm bớt trường.
    • Tiết kiệm chi phí & giảm độ trễ (Latency): Rút ngắn System Prompt dài 2.000 token thành prompt gọn nhẹ ở quy mô hàng triệu lượt gọi.

3. Ma trận tổng kết 4 cách tùy biến AI cho Product Manager

Phương phápVị trí can thiệpĐiểm mạnh nhấtĐánh đổi lớn nhấtKhi nào chọn?
1. Buy / Prompting (gọi API thương mại nguyên bản)Context windowNhanh nhất, chi phí kỹ thuật $0Dễ trôi ngữ cảnh, tốn tokenThử nghiệm ý tưởng, tác vụ đơn giản
2. SkillsQuy trình & Ràng buộcChuẩn hoá luồng, kiểm soát rủi roCần chuyên gia viết và duy trì SOPQuy trình nghiệp vụ nhiều bước
3. RAGKho tri thức ngoàiCập nhật tức thì, có trích dẫnPhụ thuộc chất lượng tìm kiếmDữ liệu lớn, biến động thường xuyên
4. Fine-tuningTrọng số bên trongTối ưu giọng văn, tốc độ caoChi phí cao, khó sửa đổiTông giọng đặc thù, quy mô triệu lượt gọi

Thang leo thang 4 cấp độ tùy biến AI cho PM

Nguyên tắc vàng: Luôn bắt đầu từ phương án đơn giản, rẻ nhất (Level 1) và chỉ leo thang khi gặp giới hạn thực sự.

Nguyên tắc leo thang của PM

Bắt đầu bằng Prompt → Sai quy trình thì đóng gói Skill → Thiếu tri thức ngoài thì gắn RAG → Chỉ Fine-tune khi cần tối ưu chi phí quy mô lớn hoặc tông giọng đặc thù.

Nhấn vào từng cấp độ để xem đánh đổi và điều kiện leo thang:

1. Prompt Engineering

Dễ nhất · Rẻ nhất
Ưu tiên sử dụng cho:

Thử nghiệm tính năng mới (PoC), tác vụ đơn lẻ, yêu cầu chung.

Điểm mạnh lớn nhất:

Triển khai trong vài phút, không tốn chi phí kỹ sư backend, dễ sửa đổi.

Đánh đổi / Hạn chế:

Bị giới hạn bởi độ dài context window, dễ bị AI quên hoặc mâu thuẫn khi chat dài.

Khi nào nên leo thang cấp độ tiếp theo? Khi AI trả lời đúng kiến thức nhưng làm sai format hoặc bỏ sót bước quy trình → Leo thang lên Level 2 (Skills).
Hơn 80% bài toán AI sản phẩm được giải quyết xuất sắc ở Cấp 1–3 mà không cần chi phí Fine-tune tốn kém.

4. Tình huống PM: Vạch trần sự nhầm lẫn giữa Prompt dài và Fine-tune

Phát biểu sai lầm: "Hệ thống đã được fine-tune: mỗi câu hỏi sẽ dán toàn bộ 200 trang hợp đồng vào đầu prompt."

  • Vạch trần: Đây là nhồi nhét ngữ cảnh thô (Prompt Stuffing), gây nghẽn context, đắt đỏ và tăng độ trễ.
  • Giải pháp đúng: Dùng RAG để trích xuất 1–2 điều khoản liên quan + dùng Skill để định dạng câu trả lời dễ hiểu.
Bài tập thực hành70 phút

Thiết kế Chiến lược Tùy biến AI cho Nền tảng EcoCart

  1. RAG (Bài 8): Thiết kế tính năng Trợ lý Tra cứu Chính sách Đổi trả Quốc tế (500 trang) với đủ 3 bước Retrieval, Context và Generation có trích dẫn.
  2. Skills (Bài 9): Đóng gói Skill Xử lý khiếu nại hàng thất lạc: Xác định Trigger, 3 bước SOP và 2 điều cấm kỵ.
  3. Fine-tuning (Bài 10): Đánh giá bài toán phân loại 500.000 đánh giá sản phẩm mỗi ngày thành 25 danh mục: Phân tích 2 lợi ích về chi phí và độ trễ.
  4. Ma trận kiến trúc: Lập bảng phân bổ 4 phương pháp (Buy / Prompting, Skill, RAG, Fine-tune) cho 4 bài toán thực tế của EcoCart kèm lý do.