Insight Hub
Learned Routing: Huấn luyện Router từ Chính Dữ liệu Vận hành

Learned Routing: Huấn luyện Router từ Chính Dữ liệu Vận hành

Thay vì đánh giá từng request từ đầu, learned router huấn luyện trên chính outcome đã log của hệ thống để dự đoán đúng tầng chỉ trong một forward-pass - đánh đổi bằng giai đoạn khởi động lạnh và rủi ro trôi dạt âm thầm.

Thuộc chuỗi bài: Model Routing: Cách giảm chi phí LLM mà không đánh đổi chất lượng

Mọi kỹ thuật routing đã nhắc tới trong loạt bài này đều có chung một đặc điểm: mỗi lần có request mới, chúng đều phải phán đoán độ khó lại từ đầu. Classifier-based Router đọc prompt mới toanh và suy luận về nó. Model Cascading chạy thử model rẻ rồi kiểm tra kết quả. Không kỹ thuật nào trong số đó "nhớ" được điều gì đã xảy ra ở mười nghìn request tương tự trước đó.

Learned Routing phá vỡ khuôn mẫu đó. Thay vì phán đoán từng request từ con số không, nó huấn luyện một model nhẹ dựa thẳng trên lịch sử vận hành thật của hệ thống - tầng nào đã thực sự xử lý thành công request nào trong quá khứ - rồi để model đã huấn luyện đó dự đoán đúng tầng chỉ trong một lượt forward-pass gần như tức thì. Bài viết tổng quan đã gọi đây là "bước đi tự nhiên tiếp theo sau ba kỹ thuật trên", và bài viết này sẽ mổ xẻ chính xác bước đi đó tốn gì để thực hiện, và tốn gì nếu bỏ qua.

Learned Router thực sự "học" cái gì?

Learned router không phải một dạng gọi LLM thứ tư - nó là một model phân loại nhỏ, chuyên dụng (có thể là model đã distill, gradient-boosted tree, đôi khi đơn giản chỉ là logistic regression) được huấn luyện offline trên một tập dữ liệu mà hệ thống của bạn đã tự sinh ra như một sản phẩm phụ của việc routing.

Mỗi request đi qua Classifier Router hay pipeline Cascading đều tạo ra một điểm dữ liệu: đặc trưng của request, tầng nó được gửi tới, và output của tầng đó có được chấp nhận hay không. Ghi log đủ nhiều bộ ba như vậy, bạn có ngay một tập huấn luyện supervised mà không cần gắn nhãn thủ công - nhãn chính là khái niệm "được chấp nhận" hay "bị escalate" vốn đã tồn tại sẵn trong hệ thống production.

Sau khi huấn luyện xong, learned router thay thế hoàn toàn lượt gọi LLM ở đầu vào. Nó đọc cùng những đặc trưng request mà một classifier sẽ đọc, nhưng thay vì sinh ra một phán quyết có suy luận từng token, nó chạy một forward-pass duy nhất qua một model chỉ vài nghìn tham số và trả về tầng dự đoán kèm một điểm tin cậy.

Interactive Learned Router Inspector

Vòng đời của Router Huấn luyện từ Dữ liệu Production

Mô phỏng 3 giai đoạn: vận hành ổn định (4ms), khởi động lạnh khi thiếu dữ liệu (fallback), và trôi dạt âm thầm khi phân phối traffic thay đổi.

Chọn giai đoạn mô phỏng:
1. Payload Request Đầu VàoDữ liệu thô

"Tính tổng số tiền hoàn trả cho 3 đơn hàng bị huỷ trong tháng này."

2. Learned Router (Model Distill từ Lịch sử)
Phí Triage: $0,00003Độ trễ: 4ms
Phán quyết có cấu trúc (JSON):
{
  "predicted_tier": "small",
  "confidence": 0.96,
  "trained_on": "2.400.000 outcome đã gắn nhãn"
}
3. Cổng Kiểm Soát Độ Tin Cậy (Confidence Gate)
ĐẠT NGƯỠNG AN TOÀN
✓ Độ tin cậy đạt ngưỡng — Dispatch trực tiếp theo phán quyết Router
4. Điều Hướng & Thực Thi Tại Model Đích: Small Model Tier (Haiku / GPT-4o-mini)
Phí Model: $0,0008Độ trễ: 310ms
Kết quả thực thi: Chuẩn xác. Router dispatch đúng tầng ngay từ lần đầu, không tốn phí triage đáng kể.
Tổng kết kinh tế & độ trễ toàn trình (End-to-End)
Tổng: $0,00083|Độ trễ: 314ms
Chiêm nghiệm kiến trúc: Trạng thái lý tưởng: Chi phí triage gần như triệt tiêu, độ chính xác cao nhờ học trực tiếp từ outcome thực tế.

Bài toán khởi động lạnh: Chưa có dữ liệu, chưa có router

Sự thật khó chịu đầu tiên của learned routing: nó không thể tồn tại ngay từ ngày đầu tiên. Một router huấn luyện trên 4.000 ví dụ là một router huấn luyện trên nhiễu - nó vẫn sẽ tự tin dự đoán tầng dựa trên những pattern chưa hề tổng quát hoá được, và nó không có cách nào để báo hiệu rằng nó đang đoán mò.

Cách giải quyết thực tế là một lộ trình triển khai theo giai đoạn, không phải một quyết định ra mắt một lần. Chạy Classifier Router hoặc pipeline Cascading như cơ chế chính ngay từ đầu, ghi log mọi outcome. Khi đã tích luỹ đủ ví dụ đã gắn nhãn cho một dạng request cụ thể - ngưỡng chính xác phụ thuộc vào độ đa dạng traffic của bạn, nhưng các team production thường muốn có hàng chục nghìn ví dụ cho mỗi pattern riêng biệt trước khi tin tưởng một dự đoán học được - hãy huấn luyện router và triển khai nó phía sau một cổng kiểm soát độ tin cậy. Dưới ngưỡng, nó nhường lại cho tầng tạm thời thay vì đoán mò. Trên ngưỡng, nó dispatch trực tiếp.

Đây chính là bản năng "luật ghi đè cứng" mà bài Classifier Router đã giới thiệu cho rủi ro bất đối xứng, chỉ khác là áp dụng cho một dạng bất định khác: không phải "request này quá rủi ro để tin vào một phán quyết xác suất", mà là "router này chưa thấy đủ nhiều dạng request này để tin vào chính dự đoán của nó".

Định nghĩa "thành công": Bài toán gắn nhãn

Một learned router chỉ tốt bằng chính nhãn mà nó được huấn luyện để dự đoán, và "thành công" lại là một khái niệm khó định nghĩa một cách nhất quán ở quy mô lớn hơn bạn tưởng.

Với những request được xác minh bởi các bài kiểm tra tự động của Model Cascading - một schema JSON hợp lệ, một bộ test pass - nhãn gần như tự viết ra: tầng nào tạo ra output pass thì đó là tầng đúng. Với văn bản mở, nơi không tồn tại phép kiểm tra tất định nào, các team thường phải dựa vào những tín hiệu đại diện yếu hơn: người dùng có generate lại câu trả lời không, họ có escalate lên hỗ trợ con người không, có sự kiện chuyển đổi nào ở hạ nguồn xảy ra không. Mỗi tín hiệu đại diện đều mang theo một thiên vị riêng. Một người dùng không bấm generate lại một câu trả lời tầm thường không nhất thiết là hài lòng - họ có thể chỉ đơn giản là bỏ cuộc.

Huấn luyện trên một nhãn thiên vị sẽ tạo ra một router tự tin tối ưu hoá cho đúng cái sai. Đây không phải lý do để tránh learned routing - đây là lý do để coi việc thiết kế nhãn là một quyết định hạng nhất, được đưa ra trước khi bắt đầu huấn luyện, chứ không phải một điều phát hiện sau khi hành vi của router bắt đầu trông kỳ lạ ở production.

Trôi dạt âm thầm: Khi ánh xạ đã hết tác dụng

Một classifier đánh giá lại từng request theo prompt hiện tại và hiểu biết hiện tại của nó về thế giới. Một learned router thì không làm cả hai việc đó - nó phát lại một bản chụp traffic đã đóng băng tại thời điểm nó được huấn luyện lần cuối.

Bản chụp đó lỗi thời theo những cách không hề chạm vào chi phí hay độ trễ của chính router. Một lần nâng cấp model frontier có thể thay đổi hoàn toàn khái niệm "khó". Một tính năng sản phẩm mới tạo ra một dạng request mà router chưa từng thấy, và nó sẽ âm thầm phân loại sai theo pattern gần nhất mà nó nhận ra. Một thay đổi trong cơ cấu request của người dùng có thể biến những dự đoán tự tin hôm qua thành những thất bại lặng lẽ hôm nay - và vì điểm tin cậy của router phản ánh sự chắc chắn theo dữ liệu huấn luyện, chứ không phải độ đúng theo thực tế hiện tại, một câu trả lời sai với độ tin cậy cao trông y hệt một câu trả lời đúng với độ tin cậy cao, cho tới khi có gì đó ở hạ nguồn bắt được nó.

Đây chính xác là kiểu lỗi mà giám sát chất lượng production tồn tại để bắt - lấy mẫu traffic thực, theo dõi hiện tượng trôi dạt phân phối (distribution shift), và khép kín vòng lặp phản hồi về lại tập huấn luyện trước khi sự trôi dạt tích tụ quá lớn.

Bảng phân rã kinh tế đơn vị (Unit Economics Ledger)
Kinh tế học Router

Chi phí Suy luận Cận Zero & Chi phí Xây dựng Bị Ẩn

Sau khi huấn luyện xong, mỗi lần gọi Learned Router chỉ tốn một phần rất nhỏ của cent ($0,00003). Nhưng con số đó bỏ qua toàn bộ chi phí gom nhãn ban đầu và rủi ro trôi dạt khi mô hình đã lỗi thời.

Công thức Chi phí Trung bình:
Blended Cost=C_router+Σ ( P_i × C_i )+C_logging
Chọn giai đoạn vòng đời của Learned Router:
Chi phí Suy luận Router: $0,00003
Độ trễ Router: ~4ms
Suy luận Router (Model Distill)
Một forward-pass qua mô hình nhỏ, không tốn token LLM
$0,00003
Thực thi model đích (80% Small / 15% Med / 5% Frontier)
(0,80 × $0,0015) + (0,15 × $0,0060) + (0,05 × $0,0300)
$0,00360
Hạ tầng Logging (Nuôi tập train)
Ghi log outcome liên tục để phát hiện trôi dạt và tái huấn luyện
$0,00002
Chi phí trung bình mỗi request (Blended Cost)
$0,00003 (Router) + $0,00360 (Model) + $0,00002 (Logging) =
$0,00365/ request
Tiết kiệm 87,8%
So với gọi thẳng Frontier 100% ($0,0300 / req)
So sánh với Classifier Router (Bài spoke 2): Chi phí suy luận router rẻ hơn 13 lần so với Classifier Router ($0,00003 vs $0,00040).
↳ Kết luận PM:Một khi đã huấn luyện xong, learned router là cơ chế triage rẻ nhất trong toàn bộ loạt bài.

Learned Routing so với Classifier Routing và Cascading

Tiêu chí đánh giáLearned RouterClassifier RouterModel Cascading
Cơ sở ra quyết địnhPattern đã học từ outcome lịch sửSuy luận mới cho từng requestKiểm tra hồi cứu sau khi thực thi
Chi phí biên (Vận hành ổn định)~$0,00003 (một forward-pass)~$0,00040 (một lượt gọi LLM)$0 ở cửa ngõ, nhưng gánh chi phí Tầng 1 ở mọi request
Thời gian triển khai lần đầuChậm nhất - cần một cơ chế tạm sinh dữ liệu trướcNhanh - triển khai ngay đượcNhanh - triển khai ngay được
Khả năng diễn giảiYếu nhất - lý do của một model đã huấn luyện không thể xem lại như trường reason của classifierMạnh - trả về lý do tường minhMạnh - thất bại là một phép assertion cụ thể
Kiểu lỗi đặc trưngTrôi dạt âm thầm khi pattern production thay đổiBị đánh lừa bởi câu chữ đối kháng (adversarial steering)Thuế chi phí hai tầng trên mọi request khó

Khi nào Learned Routing thắng thế

Bài toán kinh tế ủng hộ learned routing chính xác ở nơi chi phí lặp lại của các kỹ thuật khác cộng dồn nhiều nhất: sản phẩm lưu lượng cao với cơ cấu request tương đối ổn định. Nếu một sản phẩm xử lý hàng triệu request mỗi tháng và hình dạng của những request đó không thay đổi quá nhiều theo tuần, mức giảm ~13 lần chi phí triage mỗi request so với classifier sẽ cộng dồn rất nhanh, và chính traffic của tầng classifier tạm thời đã cung cấp gần như miễn phí dữ liệu huấn luyện.

Khi nào nó không phù hợp

Sản phẩm lưu lượng thấp không bao giờ tích luỹ đủ outcome đã log để biện minh cho khoản đầu tư này - tầng classifier hay cascading mà nó định thay thế đã đủ rẻ về giá trị tuyệt đối ở quy mô đó rồi. Sản phẩm có bề mặt thay đổi nhanh là một trường hợp không phù hợp vì lý do khác: mỗi tính năng mới lại tạo ra một dạng request router chưa từng huấn luyện, khiến nó mắc kẹt vĩnh viễn ở trạng thái khởi động lạnh với đúng những phần sản phẩm thay đổi nhanh nhất.

Và bất kể quy mô nào, một learned router không bao giờ nên là tuyến phòng thủ cuối cùng cho rủi ro bất đối xứng. Nguyên tắc ghi đè cứng từ bài Classifier Router vẫn áp dụng ở đây, thậm chí còn quan trọng hơn - quyết định của một model đã huấn luyện khó audit ngay lúc đó hơn nhiều so với lý do tường minh của một classifier, khiến nó trở thành lựa chọn kém hơn để xử lý các tình huống biên về y tế, pháp lý hay tài chính nếu không có một luật ghi đè tất định đứng chắn phía trước.

Checklist thẩm định của AI PM cho Learned Routing

Như đã trình bày trong chương trình AI Product Management (Lesson 55), chất lượng production không kết thúc ở lúc ra mắt - nó đòi hỏi giám sát liên tục để bắt đúng kiểu trôi dạt mà một learned router luôn phải đối mặt.

Trước khi bật đèn xanh cho Learned Routing trong một tính năng production, hãy thẩm định qua 4 câu hỏi sau:

  1. Sản phẩm có sinh đủ khối lượng đã gắn nhãn để việc huấn luyện đáng công không? Nếu một pattern có ít hơn vài chục nghìn outcome đã log, router sẽ hoặc mắc kẹt vô thời hạn ở chế độ fallback khởi động lạnh, hoặc huấn luyện trên nhiễu. Cứ giữ tầng tạm thời cho tới khi khối lượng đủ lớn để biện minh cho khoản đầu tư.
  2. "Thành công" có được định nghĩa bằng thứ gì đáng tin hơn sự im lặng của người dùng không? Xác minh tự động (kiểm tra schema, chạy test) tạo ra nhãn đáng tin cậy. Các tín hiệu đại diện như "người dùng không bấm generate lại" nên được coi là tín hiệu yếu, không phải sự thật nền tảng.
  3. Có pipeline giám sát nào bắt được trôi dạt trước khi nó tích tụ không? Một learned router không đi kèm giám sát chất lượng production sẽ thất bại một cách âm thầm và tốn kém. Hãy tính hạ tầng giám sát là một phần chi phí của router, không phải một tính năng tuỳ chọn.
  4. Luật ghi đè cứng có còn được thực thi phía trước router cho các miền rủi ro bất đối xứng không? Điểm tin cậy của một model đã huấn luyện không phải là một dấu vết audit. Các tình huống biên về y tế, pháp lý và tài chính vẫn cần một cổng tất định bỏ qua hoàn toàn dự đoán đã học.

Learned routing là kỹ thuật có đòn bẩy cao nhất trong cả loạt bài một khi sản phẩm đã kiếm đủ dữ liệu để xứng đáng dùng nó - và cũng là một trong những kỹ thuật dễ bị triển khai non nhất vào một hệ thống chưa sẵn sàng.