如何為生產環境 AI 選擇 LLM 路由策略

Fiber optic cables representing LLM routing strategy paths

分享這篇文章:

目前,LLM 路由策略的理論依據已相當清楚:將簡單查詢交給低成本模型,將複雜查詢升級到高階模型,並取得其中的成本差額。RouteLLM 於 2025 年的論文展示了在維持 GPT-4 95% 品質的同時,成本降低 85%。The Sandbox 和 Decentraland 展示了如何……等等,拿錯筆記了。

這些數字是真實的。較少被明確寫下來的是:為什麼路由實作在生產環境中經常低於其設計規格,以及哪一種失效模式正因為悄無聲息而最危險。

路由正在解決的成本問題

在深入機制之前,先量化其中的利害關係會很有幫助。高階模型——GPT-4 等級、Claude Opus 以及相近層級——每百萬個 token 的成本為 30–60 美元。Claude Haiku、GPT-4o-mini 以及類似的輕量模型成本僅為其中一小部分。在處理客服、內部工具或內容工作流程的生產 AI 部署中,大多數查詢在結構上都很簡單:狀態查詢、範本化摘要、短文本分類、是/否資格檢查。這些都不需要前沿模型才能正確處理。

與使用智慧路由的部署相比,將所有流量都導向單一高階模型的組織,通常會多支付 40–85% 的成本。這不是供應商的基準測試,而是 SIRAYA 在審查亞太地區客戶 AI 基礎架構支出時,一再觀察到的分布情況。節省的成本是真實的;實作的複雜性也同樣真實,而這正是多數團隊遇到困難的地方。

五種策略及其實際取捨

基於規則的路由 是最簡單的形式:透過關鍵字比對、意圖模式偵測或輸入長度門檻,將請求對應到特定模型。將所有低於 200 個 token 的請求送往廉價模型的路由規則,執行成本低(次毫秒級開銷)、容易理解,但也很脆弱。它會在簡短但語意複雜的查詢上失效,也會在剛好包含觸發關鍵字、但其實不需要那些關鍵字所暗示能力的查詢上失效,並且隨著查詢模式演變,需要持續進行人工維護。

基於語意/機器學習的路由 使用分類器——通常是小型 BERT 類型模型或微調過的嵌入分類器——來評估提示的複雜度或領域,並據此進行路由。它比規則更準確,但每個請求會增加 10–50 毫秒的分類開銷。對於能容忍延遲的工作負載來說,這是可以接受的;但對於端到端延遲目標低於 500 毫秒的即時對話式 AI 而言,這項開銷並非微不足道。

級聯路由 是最常被實作的策略,也是本文其餘部分的主題,因為它也是最可能在生產環境中悄悄退化的策略。

基於延遲的路由 會根據目前負載,將請求路由到速度最快的模型端點——這對容錯移轉和地理分散很有用,但本身並不提供成本最佳化。它需要疊加在具備品質感知的路由之上,而不是作為替代方案使用。

共識路由 將相同提示送往多個模型並彙總回應。它對高風險決策確實有用——研究估計相較於單一模型回應,準確率可提升 7–15 個百分點,GPQA-diamond 基準也從 46.9% 躍升至 68.2%。成本會隨著被呼叫模型的數量成倍增加,因此這適合低量、高價值的決策,而不適合任何流量顯著的工作負載。

級聯路由:門檻校準問題

級聯路由遵循一個簡單迴圈:將請求送往最便宜且具備能力的模型;如果模型對其回應的信心低於某個門檻,就升級到下一層級;重複此流程,直到到達高階模型,或某個回應通過門檻為止。

設計是健全的。校準才是生產部署偏離設計意圖之處。

信心閾值幾乎總是依據基準資料集—MMLU、HellaSwag、內部精心整理的查詢集—進行調校。這些資料集具有乾淨、可分類的難度分布。生產環境中的查詢分布則不是如此。客戶會用十種不同方式表述同一個根本問題。一個在結構上看似簡單的查詢(簡短、常見詞彙、沒有技術術語),在語境中可能在語義上很複雜。反之也同樣常見:一個措辭冗長且技術性的查詢,輕量模型卻能正確處理,因為它符合其訓練資料中涵蓋充分的模式。

這兩種失敗模式沿著相反的軸線分化:

如果閾值設得太低,大多數查詢都會升級——有時會有 60–70% 的查詢升級,相較之下,校準良好的級聯系統通常只會升級 15–25%。你會為大部分流量支付高階模型的費用,同時對每個升級的請求額外承擔一開始經過低成本模型往返的延遲成本。你的成本儀表板會顯示比單一模型路由更糟的數字。你的 p95 延遲也會惡化。團隊通常會在幾天內發現這種失敗模式,因為成本和延遲訊號都很明顯。

如果閾值設得太高,真正需要高階模型的查詢就不會升級。輕量模型會回傳聽起來合理但含有錯誤的回答。 這種失敗模式是靜默的。 沒有警報觸發。回應延遲看起來很好。成本指標看起來非常出色。路由似乎正完全按照預期運作——直到下游稽核、使用者投訴,或業務成果指標揭示,在那些本應升級的查詢子集中,答案品質已悄悄下降了 20–30%。

在處理面向客戶查詢的生產環境中,靜默失敗才是危險的。複雜查詢的答案品質下降 30%,可能數週內都不會反映在一般滿意度分數上。

為什麼基準測試無法校準生產環境閾值

大多數路由相關論文和供應商文件都會根據基準資料集校準閾值,然後將由此產生的成本降低呈現為生產環境中的預期成果。這會造成系統性的高估。

基準資料集經過整理,通常具有明確的正確答案和可衡量的難度等級。它們無法捕捉真實生產查詢中的模糊性、情境依賴性和領域特定性。金融服務應用的查詢分佈——合約解讀、法規交叉參照、細緻情境分析——其升級行為會與消費者支援應用的查詢分佈非常不同。

在實務上,正確的閾值校準需要採用影子模式部署:將你的級聯路由邏輯與單一模型路由並行執行,在實際生產流量上比較不同層級的輸出品質,並根據觀察到的升級行為而非基準測試表現來設定閾值。這需要為具代表性的生產查詢樣本建立真值標籤——這成本高昂,但也是校準出不會隨時間靜默退化的閾值的唯一方法。

SIRAYA 在亞太地區部署中常見的一種模式是:團隊採用知名開源技術棧中的級聯路由,套用論文建議的閾值,運行 30 天後回報成本大幅降低。六個月後,一次不相關的產品審查發現,負責處理 75% 查詢的模型層級,其錯誤率已高到原本會無法通過初始驗收標準。初始部署後,該閾值從未重新校準,而查詢分布也已發生漂移。

低流量下的開銷陷阱

存在一個流量下限;低於此下限時,級聯路由與語義路由策略不但無法降低成本,反而會增加成本。

語義路由需要維護一個嵌入模型(或呼叫嵌入 API)來分類每個提示。如果你的部署每天處理 10,000 個請求,而每次嵌入分類呼叫的成本為每個請求 0.0001 美元,分類開銷就是每天 1 美元,微不足道。但若每天有 1,000 萬個請求,分類開銷就是每天 1,000 美元——這仍可能遠低於路由帶來的節省,也可能會根據你的模型層級組合,佔整體 LLM 支出中相當可觀的一部分。

對於級聯路由而言,開銷來自每個最終升級的請求都必須先呼叫第一層模型。如果 30% 的請求會升級,這些請求就要支付兩次模型呼叫的成本——便宜模型加上高階模型——而便宜模型的呼叫增加的是延遲,而不是價值。在高升級率下,級聯路由的成本可能高於直接路由到高階模型。

損益平衡點取決於升級率、流量,以及模型層級之間的價格差異。以 RouteLLM 研究中的數字來看(成本降低 85%,26% 的請求需要高階模型),在幾乎任何生產流量下,這筆帳都相當有吸引力。但若閾值校準不當,導致升級率達 65%,且高階模型價格僅為 2 倍,級聯路由就會增加開銷,卻無法帶來有意義的節省。

實際應該觀察什麼

大多數監控 LLM 路由的團隊會關注每次請求成本與回應延遲。這些指標是必要的,但並不足夠。

能夠捕捉無聲品質退化的指標是 隨時間變化的升級率,作為時間序列追蹤。校準良好的串接流程會有穩定的升級率——如果你的查詢分布相當一致,每個月大致應有相同比例的請求被升級。升級率上升可能表示查詢複雜度正在增加,或閾值校準正在漂移。 下降的 升級率下降但沒有伴隨品質改善是一個警訊:要麼你的查詢確實變得更簡單,要麼你的閾值已經偏移,導致複雜查詢不再被升級。

第二個指標是 回應品質抽樣:定期由人工審查或以 LLM 為基礎的自動化方式,對分層抽樣的回應進行評估,特別篩選出升級率低但模式符合已知複雜請求類型的查詢。這在營運上成本高昂,因此多數團隊會略過它——也正因如此,無聲的品質退化會持續未被偵測。

在架構層級:如果你跨區域進行路由(這在亞太地區很常見——新加坡、東京、雪梨、孟買都有不同的模型可用性與延遲特徵),你的路由邏輯需要獨立考量各區域端點的健康狀態。若某個路由策略假設特定模型層級永遠可用,則在區域性中斷期間會悄悄降級到備援層級,卻沒有任何跡象顯示該區域流量的品質預期已不再被滿足。

多數團隊最常做錯的決策

最常見的部署決策錯誤,是把 LLM 路由視為一個設定步驟,而不是一個校準流程。團隊選定路由策略、設定閾值,然後就繼續前進。隨著查詢分布改變、模型供應商更新 API,以及業務需求演進,該路由機制便會原地老化。

有效的 LLM 路由策略需要持續的校準週期——至少每季一次;對於高流量或品質敏感的工作負載,理想上應每月一次。上線時正確的閾值,六個月後很可能已不再正確。第一季能處理你邊界案例的模型層級,可能在第三季已被供應商更新,並以某種方式改變了其能力邊界。

對於從零開始建置此系統的團隊:請先以基於規則的路由作為基準,而不是級聯路由。基於規則的方式能提供明確、可觀察的行為,便於你推理與追蹤。在建置基於機器學習的路由之前,先建立品質衡量工具——你需要真實的品質資料來校準任何基於閾值的策略。當你擁有足夠的生產環境訊號,可根據實際查詢分佈而非基準測試來設定閾值時,再引入級聯路由。

成本節省確實足以證明這項投資是值得的。校準紀律將決定這些節省是否會以你無法察覺的品質下降為代價。

分享這篇文章:

若要了解更多博彩產業洞察與技術解決方案,請訂閱我們的官方 Telegram 頻道
Telegram:@siraya_official

若要了解更多遊戲產業洞察與技術解決方案,請訂閱我們的官方 Telegram 頻道。您也可以聯絡我們申請 免費 試用!

看看 SIRAYA 能為您做些什麼 為您!

您可以成為下一個精彩案例。讓我們向您展示如何做到!