2026 年 AI 模型路由實戰:砍 50–80% LLM 成本不犧牲品質
兩年前,選 LLM 是一次性的決定。你把 prompt 寫給 GPT-4,月底看帳單,日子照過。那個時代結束了。模型市場在 2025 到 2026 年間裂解成幾十個真正能打的選項,token 價格整體掉了大約 80%,而你 AI 技術棧裡最關鍵的一行程式碼,現在變成「決定哪個模型來回答這個請求」。這就是 AI 模型路由(model routing),而它在 2026 年是大部分團隊手中最大的一根成本槓桿——比快取重要、比壓 prompt 重要,更比 2024 年顧問在賣的「從 GPT-4 換到 Claude」這種說法重要得多。
這篇文章走工程路線:路由決策本身、沒人整理在一處的成本數學、廠商不會提的延遲開銷、五個覆蓋各種團隊規模的生產級工具、生產環境真正會咬人的品質退化、以及一份誠實的檢查表——告訴你什麼時候路由值得做,什麼時候應該完全跳過。
為什麼 2026 年路由比以往更重要
原因很單純:價格差距。最低可用的模型和最強的模型之間,價差大約 100 倍。DeepSeek V4 一百萬 input token 大約 0.44 美元,Haiku 4.5 大約 1 美元,Sonnet 4.6 大約 3 美元,GPT-5.5 是 5 美元,Opus 4.8 來到 25 美元——全部都是 input 價格。Output 價差更誇張:GPT-5.5-pro 一百萬 output token 逼近 180 美元,而開源小模型可以用幾美分回答問題。同一段 prompt,依哪個模型答,可能花不到零頭,也可能花好幾美分。路由決策自然就成了團隊最大的成本開關。
這不是理論數字。LMSYS 的 RouteLLM 經過同儕審核的工作在 MT Bench 上把推論成本砍了 85%,同時保留 GPT-4 Turbo 95% 的品質。多份生產環境的滾動數據落在 40% 到 85% 這個區間。高標可達到,地板則是多數團隊實際能落地的位置。
路由器實際上怎麼做決定
每個請求都帶有一個隱含的難度。一封短信的摘要、一段結構化抽取、一個例行分類——這些交給小模型就夠,幾乎沒有可感知的品質損失。多步推理、模糊指令、高風險的生成任務,則升級到旗艦模型。難處在於那個難度估計本身。
2026 年一份關於動態路由與 cascade 的綜述把設計空間切成三條軸:決策何時做(請求之前、推論過程中、或第一次回應之後)、依什麼資訊做(查詢特徵、模型中繼資料、過往表現)、怎麼計算(規則、分類器、強化學習、或 cascade)。2026 年的多數生產路由器都是混合型:便宜分類器處理 80–90% 的流量,邊界情況再交給比較重的 cascade。
路由決策通常用以下四種方式之一:
- 規則式(Rule-based)。Regex 或關鍵字匹配(「如果 prompt 提到 code review,就送到 Sonnet」)。開銷低於 1 毫秒,可審計,但很脆弱。
- Embedding 式。把查詢與已標註的歷史請求做向量相似度比對。開銷約 5 毫秒,能抓語意,需要標註過的種子語料。
- ML 分類器。用過去路由結果訓練的小模型。開銷 50–100 毫秒,能從回饋學習,但需要穩定的訓練資料流。
- Cascade。先用便宜模型試,若信心分數低於閾值或審核模型標記失敗,就升級到旗艦模型。成本浮動、上限最高、除錯最難。
RouteLLM 研究裡有一個值得帶走的細節:在某對強弱模型上訓練出來的路由器,在測試時換成另一對模型,表現仍然穩定。這個可遷移特性正是路由在每月都有新模型出來的市場裡能站得住的原因。你不用每次廠商推出新 tier 就重訓路由器。
把省錢的數學整理在一張表上
多數文章只給一個標題級的省錢百分比。這對決策沒幫助——你實際能省多少,取決於你的流量分佈和你路由的是哪兩層模型。下表用 input token 牌價做同基準比較;你的真實帳單混合 input 與 output,而 output 才是價差最大的地方,所以 output 比例高的工作流省下的絕對金額會比這個純 input 表更大。
| 流量配比(便宜 / 旗艦) | Haiku $1 / Opus $25 | Sonnet $3 / Opus $25 | Haiku $1 / GPT-5.5 $5 | DeepSeek $0.44 / Opus $25 |
|---|---|---|---|---|
| 10 / 90 | 10% | 9% | 8% | 10% |
| 30 / 70 | 29% | 26% | 24% | 29% |
| 50 / 50 | 48% | 44% | 40% | 49% |
| 70 / 30 | 67% | 62% | 56% | 69% |
| 80 / 20 | 77% | 70% | 64% | 79% |
曲線的形狀才是重點。便宜模型佔比的前 10% 對帳單幾乎沒影響——10/90 到處都省不到 10%,因為你 90% 的請求還在付旗艦價。一旦便宜模型的比例跨過 50%,節省才開始複利。這也是為什麼路由器的準確度比原始價差更重要:所有回報都壓在「你能安全地把便宜流量往上推多少」這件事上。
一個把 70% 流量送到 Haiku、30% 送到 Opus 的團隊,input token 帳單大約砍三分之二。一個能把 80% 推到 DeepSeek V4、只留 20% 給 Opus 的團隊,逼近 79%——剛好踩在業界回報的 40–85% 區間上緣。多數團隊務實的目標落在 50/50 到 70/30 之間,能拿到 40–67% 的節省。
延遲稅,老實算給你看
廠商內容從不告訴你:路由器本身會加延遲——它得先看一下請求才能決定送哪裡。誠實的算法是:開銷是真的,但相對於推論很小。規則式低於 1 毫秒,embedding 式大約 5 毫秒,語意型與 ML 分類器 50–100 毫秒。對照典型的 LLM 回應時間 500–2000 毫秒,圖就清楚了:就算最重的路由策略,整體呼叫也只占個位數百分比。
講具體一點:以典型 p50 推論時間 800 毫秒為基準,就算 100 毫秒的 ML 分類器也只占整體的 12.5%——而它完全可以靠把請求送到一個 300 毫秒而非 1500 毫秒的模型,把這份開銷賺回來好幾倍。「路由會拖慢回應」這個反對意見通常問錯了問題:瓶頸從來不是路由器,是它選的那個模型。
有一個例外要點出來:用 LLM 自己來分類難度的路由器,會多一整輪推論的來回。除非路由決策真的難以用其他方式判斷,否則不要這樣做。
2026 年你真正該評估的五個工具
2026 年的路由器市場切成四個象限,怎麼選取決於團隊規模、流量形狀,以及你多在意把路由邏輯留在自己的基礎設施上。
1. OpenRouter——聚合型
OpenRouter 是覆蓋面最廣的選擇:60 多家供應商、將近 400 個模型,採轉手定價加 5.5% 平台費。你拿到單一端點、單一金鑰,不用動程式碼就能切換底層供應商。據報導營收從 2025 年 5 月的年化 500 萬美元,跳到 2026 年初大約 5000 萬美元——九個月內放大了十倍。市場要的就是這個:對整個模型動物園的單一 API。
代價是平台費,而且 OpenRouter 現在已經升級成關鍵基礎設施等級——2026 年 2 月 17 日與 2 月 19 日的兩次當機(分別 38 分鐘與 35 分鐘,源於第三方快取依賴)對下游用戶拋出 500 與誤導性的 401 錯誤。如果你的代理把路由器當基礎設施用,就必須有 fallback 邏輯。沒有的話,路由器就會變成你的單一故障點。
2. Martian——智慧路由型
Martian 是智慧路由的代表:200 多個模型藏在同一個相容 OpenAI 與 Anthropic 的端點後面,系統即時依 prompt 挑選模型。Martian 自稱在路由請求上能省 20% 到 97%——這是廠商數字、不是獨立基準,但方向與同儕審核的研究一致。那個區間的天花板當行銷看、地板當現實看,比較實在。
3. Not Diamond——代理原生型
Not Diamond 規模較小、階段較早,但它的定位很關鍵:為多步代理工作流優化的路由,不是給一次性 prompt 用的。Samwell AI 報告在 Not Diamond 上 output 品質 +10%、推論成本與延遲 -10%,這個指標在代理評估每晚跑、品質底線不能妥協的場景裡才是真正有意義的。
4. 雲端閘道——Cloudflare、Vercel、Kong
Cloudflare AI Gateway、Vercel AI Gateway、Kong AI Gateway 是通路型玩家。它們本來就在請求路徑上,路由只是它們順手就能上的功能。已經在付這些廠商錢的團隊最適合;從零開始、原本可以不用付任何錢的團隊,相對沒那麼划算。
5. 開源——LiteLLM、Bifrost、vLLM Semantic Router
LiteLLM、Bifrost、vLLM Semantic Router 撐起開源這一端。LiteLLM 是最成熟的 proxy,當跨供應商統一客戶端用很順。Bifrost(Maxim 出品)主打以 Go 寫成的閘道、亞毫秒級開銷。vLLM Semantic Router 加上語意快取,在 0.92 相似度門檻下報告有 40–60% 的命中率。有合規或資料落地限制的團隊、想要能讀能改路由邏輯的團隊,這個象限才是對的。
什麼時候值得做——什麼時候直接跳過
下列情境,路由是強選擇:
- 你每月在 LLM 推論上花超過大約 2000 美元。低於這個數字,工程開銷會吃掉省下的錢。
- 你的流量混合了瑣碎與困難的 prompt。流量分佈雙峰時,路由回報最大。
- 你能逐請求衡量品質——透過評估、用戶回饋、或下游審核模型。沒有這個訊號就在盲飛。
- 你能接受換來較低帳單的額外複雜度。路由是多一個會動的零件,會動的零件會壞。
下列情境,跳過路由:
- 你的流量被單一複雜 prompt 模式主導——例如一律需要旗艦模型的長脈絡法律審查。便宜模型永遠派不上用場,路由毫無意義。
- 你的應用對延遲極敏感,p50 預算低於 300 毫秒。再快的路由都會加上你扛不住的開銷。
- 你還沒有評估管線。沒有量測就上路由,是一筆沒人能捍衛的預算刪減。
- 你在做原型。先寫死一個模型,搞清楚你的流量長什麼樣,再回頭看。
沉默的品質退化——真正會咬人的風險
沒人談的風險不是成本超支。是路由器把困難的 prompt 送給小模型,小模型回答得很有自信、但答錯了。使用者看到一段流暢的回應,你的分析看到一個成功的 200,帳單往下掉。六週後有人注意到某類決策其實在悄悄變差,而你沒有任何 log 能追溯到當初那個路由選擇。
這就是為什麼每一層路由都應該搭配三樣東西:一套每晚跑的 held-out 評估集、一個逐請求的信心分數(與成本一起 log 起來)、以及一條用戶回饋管道讓使用者標記錯誤答案並回灌訓練。那些跳過這幾步的團隊,六個月後會把整個路由關掉,然後說「這主意不行」。
常見錯誤
2026 年失敗的路由上線案例,看起來驚人地一致。短清單附上對應的失敗模式:
- 只依價格路由。能回答的最便宜模型,幾乎從來不是能正確回答的最便宜模型。先建難度分類器,再寫價格策略。
- 跳過評估基準。如果從來沒有在單一模型基準上量過品質,你根本分不出路由器是在幫忙還是扯後腿。先把那個評估跑出來。
- 把路由器當黑盒子。如果你的工程團隊五分鐘內答不出「這個請求是誰答的、為什麼」,那路由器就是配錯了。Log 是功能不是附屬品。
- 把供應商寫死。代理綁死一家供應商,就是在付零售價,而競爭對手已經在批價。路由是離開零售價的那條路。
- 忘記 output token。Input 牌價低估了價差。Output 比例高的工作流(生成、代理步驟)絕對金額省得更多——但前提是路由器讀得懂 output 成本。
- 沒有 fallback 路徑。路由器掛掉的時候,App 必須能繼續跑。把路由器當任何第三方依賴:快取最後已知良好的路由、fail open 到預設模型、異常時告警。
實作檢查表
- 把目前的支出按 prompt 類別拆開——把過去 30 天的流量分成 5 到 10 桶,以目前服務它們的模型分別計價。
- 建一個難度分類器。先用 embedding,搭配 1000–5000 筆已標註的請求做種子語料,目標是與人類標註達到 85% 以上一致。
- 挑一條路由政策。最簡單可用的政策是分類器分數門檻——高於 X 送旗艦、低于 X 送便宜模型。
- 影子路由跑兩週。把線上流量鏡像到路由決策但不真的執行,log「如果真的路由會怎樣」,對照單一模型基準比較品質與成本。
- 把 prompt 快取催到滿。OpenAI 在超過 1024 token 時自動快取、大約 5 折;Anthropic 的 cache_control 對 cached input 給到 9 折;Gemini 隱性快取大約是牌價的 10%。把快取疊在路由之上,節省會複利。
- 上線時帶一個 kill switch。一個環境變數就能把路由關掉、退回原本的單一模型預設。
- 把成本歸因到每一個代理步驟。如果沒辦法把成本對到觸發它的請求,就沒辦法做逐步路由,你就在某個地方多付錢、自己還不知道。
常見問題
什麼是 AI 模型路由?
就是把每個請求送到「最便宜的、能處理它的模型」,而不是對每次呼叫都付旗艦價。路由層估計難度並分流——瑣碎工作交給小模型、困難推理交給旗艦模型。
模型路由實際能省多少?
像 RouteLLM 這種受控基準報告 85% 節省、同時保留 GPT-4 95% 品質。生產環境的滾動數據落在 40–80% 區間,依流量分佈而定。便宜流量跨過 50% 之後,節省才開始複利。
路由會加延遲嗎?
會,但沒有廠商說的那麼多。規則式低於 1 毫秒,embedding 式大約 5 毫秒,ML 分類器 50–100 毫秒。對照典型推論時間 500–2000 毫秒,路由器只占整體呼叫的個位數百分比。
2026 年該選哪個路由器?
看狀況。OpenRouter 適合追求廣度與簡單,Martian 適合智慧逐 prompt 路由,Not Diamond 適合代理原生工作流,本來就用 Cloudflare/Vercel/Kong 的團隊選雲端閘道,需要開源與自託管就選 LiteLLM 或 Bifrost。
路由對生產環境代理安全嗎?
安全,但有兩個前提。搭配一套每晚跑的 held-out 評估集,以及一條逐請求 fallback 到預設模型的路徑。沒有這兩樣,路由器會變成單一故障點——2026 年 2 月已經示範過一次當機會發生什麼事。
誠實的結論
模型路由已經不再是開發者的小工具——它是利潤真正落腳的地方。把路由當基礎設施級處理(搭配評估、fallback、與逐步成本歸因)的團隊,正在悄悄用競爭對手幾分之一的成本跑他們的代理帳單。還在手動寫「全部用 GPT-4」的團隊,是在已經走向批價的市場裡繼續付零售價。如果你的每月 LLM 支出超過 2000 美元、卻在 2026 年還沒架起路由層,那現在就是你做過最便宜的一次工程決策。

