Module 2 • Bài 1355 phút

Lựa chọn chiến lược triển khai trên quang phổ Buy, RAG, Skills và Fine-tune

Điều hướng quang phổ triển khai từ Buy (API) đến Customize (RAG vs Skills) và Fine-tune; phân tích đánh đổi toàn diện và xác lập tín hiệu leo thang kỹ thuật.

4 mức độ trên quang phổ: Buy, RAG, Skills, Fine-tune
Phân biệt bản chất: RAG (Truy xuất dữ liệu thô) vs Skills (Quy tắc đúc kết)
Nguyên tắc bắt đầu từ Buy và xác lập tín hiệu leo thang (Escalation Triggers)

Lựa chọn chiến lược triển khai trên quang phổ Buy, RAG, Skills và Fine-tune

Sau khi đã xác định được vị trí an toàn trên ma trận Capability-Task Fit ở bài 8, câu hỏi kiến trúc tiếp theo của PM là: Chúng ta nên hiện thực hoá tính năng này bằng cách nào? Đây không phải là quyết định nhị phân "Tự xây (Build) hay Đi mua (Buy)" như phần mềm truyền thống, mà là một quang phổ nhiều tầng tuỳ biến (Customization Spectrum).

Ví dụ xuyên suốt bài: Nền tảng tuyển dụng công nghệ FinTrack Talent muốn phát triển tính năng: "AI tự động đọc CV và bản mô tả công việc (JD), sau đó tạo ra 3 câu hỏi phỏng vấn chuyên sâu bóc tách đúng lỗ hổng kỹ năng của ứng viên".

TIẾP CẬN CŨ / LỖI THỜI
Tư duy Nhị phân Cũ: Tự Xây vs. Đi Mua
Bỏ qua các tầng tuỳ biến ngữ cảnh trung gian mang lại ROI cao nhất
CHUẨN AI PM / HIỆN ĐẠI
Quang phổ Chuẩn AI: 4 Tầng Tuỳ Biến
Buy (API) → Customize (RAG / Skills) → Fine-tune → Build from Scratch
TÀI CHÍNH & UNIT ECONOMICSToken Costs, Latency & Mô Hình Cascading Đa Tầng

Tính toán Unit Economics của AI: Token cost, Latency và ROI thực tế

Sản lượng truy vấn / tháng (Monthly Volume):100,000 truy vấn
Kiến trúc mô hình (Model Architecture):
Tỷ lệ chuyển duyệt cho người (Human Escalation):2%
TIỀN TOKEN LLM
$1,500
CHI PHÍ REVIEWER
$1,600
CHI PHÍ / TRUY VẤN
$0.0313
BIÊN LỢI NHUẬN GỘP
61%
Nguyên tắc Unit Economics: Tính toán toàn diện CPA (Token + Hạ tầng + Reviewer). Áp dụng Model Cascading (80% SLM + 20% Frontier) để bảo vệ biên lợi nhuận gộp trên 70% và giảm 76% chi phí suy luận.