Token là gì
Token là đơn vị đo giới hạn và chi phí của model, nguyên nhân tiếng Việt tốn nhiều token hơn tiếng Anh và bài toán tối ưu ngôn ngữ System Prompt.
Token - đơn vị model thực sự "nhìn thấy", không phải chữ hay từ
Ở Bài 2, ta đã biết model sinh output từng mảnh nhỏ gọi là token. Token là đơn vị duy nhất dùng để đo lường mọi giới hạn kỹ thuật và chi phí vận hành của mô hình.
Góc nhìn PM: Tránh bẫy ngộ nhận "viết ngắn theo cảm giác = tốn ít token". Đặc biệt với tiếng Việt, số lượng token luôn chênh lệch đáng kể so với tiếng Anh.
1. Model cắt văn bản thành token, không phải theo chữ hay từ
Model không đọc theo "từ" hay "ký tự". Thành phần Tokenizer sẽ băm nhỏ văn bản đầu vào trước khi đưa vào mạng nơ-ron:
- Mỗi token có thể là một từ ngắn, một phần của từ, dấu câu, hoặc khoảng trắng.
- Cách băm được cố định sẵn từ lúc huấn luyện Tokenizer (vốn sử dụng tập dữ liệu tiếng Anh chiếm đa số).
Hệ quả sản phẩm: Độ dài input/output tối đa, tốc độ streaming và chi phí API đều tính bằng token, không phải số từ.
Cùng một nghĩa, số token khác nhau
Tokenizer được huấn luyện chủ yếu trên tiếng Anh giữ nguyên các từ tiếng Anh quen thuộc - từ tiếng Việt thì không may mắn như vậy.
2. Vì sao tiếng Việt luôn tốn token hơn tiếng Anh cho cùng nội dung
- Tiếng Anh: Câu
"The cat is happy"(4 từ) khớp đúng 4 token vì các từ thông dụng đã được lưu nguyên vẹn trong từ điển của Tokenizer. - Tiếng Việt: Câu cùng nghĩa
"Con mèo đang vui"(4 từ) bị băm thành 6 token - các từ có dấu như "mèo", "đang" bị tách làm đôi do âm tiết tiếng Việt ít xuất hiện trong tập huấn luyện ban đầu.
Quy luật thực tế: Văn bản tiếng Việt thường tốn nhiều hơn 1,5–2× số token so với tiếng Anh cho cùng một nội dung.
3. Ba quyết định sản phẩm bị ảnh hưởng trực tiếp bởi Token
- Ngân sách Context Window: System Prompt tiếng Việt chiếm nhiều token hơn, làm giảm không gian lưu trữ lịch sử hội thoại và tài liệu tham chiếu (RAG).
- Chi phí vận hành API: Nhà cung cấp tính phí theo tổng token (input + output). Cùng một tính năng, phục vụ người dùng tiếng Việt thường tốn chi phí cao hơn.
- Độ trễ phản hồi (Latency): Số lượng token xử lý và sinh ra càng nhiều thì thời gian chờ streaming càng lâu.
4. Ứng dụng: Có nên dịch System Prompt sang tiếng Anh để tối ưu chi phí?
Tình huống EcoCart: Đội ngũ muốn dịch System Prompt CSKH (800 từ) từ tiếng Việt sang tiếng Anh để tiết kiệm token (~1.500 token giảm còn ~950 token).
Dịch sang tiếng Anh giảm token - nhưng đánh đổi vẫn còn đó
Bấm để đổi ngôn ngữ system prompt CSKH EcoCart (800 từ) và so sánh ước tính token.
Chi phí & độ trễ tương đối
Số liệu minh hoạ, không phải đo thực tế - tỷ lệ khớp với những gì bài học ở trên đã mô tả.
Đánh giá đánh đổi của PM:
- Lợi ích: Tiết kiệm chi phí token (~35%) và giảm độ trễ phản hồi.
- Rủi ro: Sắc thái xử lý khiếu nại và tông giọng tiếng Việt có thể bị sai lệch khi dịch; đội ngũ vận hành khó rà soát, tinh chỉnh nhanh nếu không dùng ngôn ngữ làm việc hàng ngày.
- Quyết định: Chỉ dịch sang tiếng Anh khi logic đã ổn định và có bộ test đối soát chất lượng đầu ra tiếng Việt.