2026 AI 算力經濟學:創辦人真正需要的成本框架

1. 那張讓創辦人措手不及的帳單

一家 B 輪新創在 2026 年中,原本有著漂亮的燒錢預算與清楚的產品路線圖。到了九月底,CFO 把兩位創辦人叫進會議:「模型推論」這一項支出,已經是損益表上漲幅最快的科目——比工程師薪水還好,比房租還高,比公司成立第一天就緊盯的雲端帳單還大。他們的使用量成長了四倍。帳單成長了十九倍。

這已經不是邊緣個案。在 2026 下半年所有進入正式產品階段的 AI 原生公司裡,最常見的策略意外不是能力不足——模型比任何人預期的都還聰明——而是成本。具體來說,是「單位價格」(每百萬 token、每 GPU 小時)與「總支出」之間的關係,已經脫鉤到 2024 年那些試算表完全無法解讀的程度。

這份指南,是我們會寄給創辦人、工程主管、財務夥伴的版本——那些在 2026 下半年必須對 AI 基礎建設做出真實決策的人。它有立場,使用當前定價、當前硬體、當前開源權重版本。它試著回答多數「AI 成本優化」內容迴避的問題:這個季度你到底該做什麼?

2. 變了什麼:2024 → 2026 的成本故事

2024 年,用第三方 API 跑一個 frontier model 的費用在十二個月內下降了約 90%。GPT-4 等級的輸出從每百萬 token 大約 60 美元掉到 10 美元以下。那次崩跌讓大家有理由不仔細想帳單就推出功能。那時候的內部備忘錄很簡單:先上線,之後再說。

到了 2026 年中,三件事同時發生:

  • Token 價格持續下跌。Frontier 等級的輸出現在常見落在每百萬 token 1.50 到 3 美元。「便宜」的等級已經逼近幾美分。
  • 使用量爆炸。代理人式工作流、多步推理、長上下文視窗,讓正式的產品提示長度比 2024 年那種聊天式提示大了 5 到 20 倍。多步代理可能在每一次使用者操作背後發出幾十次模型呼叫。
  • 對於沒有重新設計架構的公司,總支出比營收漲得更快。每個 token 的算術變好了,但每位客戶的算術通常變差了。

這個落差——單位成本下降、總帳單上升——是 2026 下半年 AI 基礎建設經濟學的決定性特徵。任何只比較「每 token 成本」而不比較「每次完成使用者工作流成本」的決策框架,都會誤導你。

3. 你實際付錢的三層成本

多數團隊只看最上面那一層。但帳單由三個獨立的層組成,每一層都有自己的市場、自己的價格曲線、自己的優化工具包。

3.1 第一層 — 模型本身

這是公開 API 價格,或者是在你自己硬體上跑一個開源權重模型的折舊成本。2026 年這是大家盯著的那一層。但它也是最會誤導你的那一層,因為現在最便宜可用的模型和最好的模型之間的價差,已經大到你可以用同樣的錢搬運五倍以上的 token。

3.2 第二層 — 推論基礎建設

不管你呼叫 API 還是自跑權重,總有人要為 GPU 小時、HBM 記憶體、kv-cache、網路出口付錢。在超大規模雲端,這些被打包進每 token 的價格。在自架環境,它以實例時數、GPU 碎片預訂(常常被忘記的閒置容量)出現。2026 年有驚人比例的自架環境,是在為閒置的硬體付 30–50% 的 GPU 帳單。

3.3 第三層 — 模型外的包裝層

檢索、快取、提示組裝、評測、護欄、代理迴圈、重試邏輯、備援路由、可觀測性,全部都有成本。包裝層是大多數團隊在不知不覺中燒錢的地方。一個把技術為一階模型的呼叫,硬體寫進一個 3B 蒸餾模型就能處理,是 2026 年最常見、也最容易修的模式。

如果你只優化第一層,你會留下 60–80% 的省錢空間。

4. 自架 vs API vs 混合:決策座標

下面是我們和團隊合作的框架,故意做得很簡單。正確答案幾乎永遠歸結到三個變數——量、敏感度、流量的形狀。

維度 傾向 API 傾向自架 傾向混合
每日 token 量 每日低於約 5000 萬 每日超過約 5 億,且持續 每日 5000 萬到 5 億,形狀混合
工作量形狀 突發、無法預測、偶爾尖峰 穩定、可預測、可填滿 穩定基線加上週期性尖峰
延遲敏感度 可接受 200–800 毫秒 硬即時預算低於 100 毫秒 不同產品的延遲預算不同
資料敏感度 公開或低度監管資料 嚴格資料落地、受監管產業 依情境不同敏感度
工程能量 小型平台團隊 專職 ML 基礎設施團隊 能維護一套堆疊的平台團隊
功能上線時間 天到週 月(建置、部署、強化) API 半邊週、自架半邊月
單位成本交叉點 每 token 永遠較高,但零維運成本 規模穩定後 6–9 個月每 token 較低 跨曲線最佳

結論:2026 年純開源權重自架與 frontier API 的損益平衡點大約是每日 5 億 token,持續六到九個月。低於這個,幾乎永遠是 API 在考量工程時間後更便宜。高於這個,自架在單位成本上會勝出——但前提是你能把利用率維持住,而多數團隊做不到。

6. 多數團隊最後都走到的混合策略

純自架和純 API 使用都愈來愈少見。2026 下半年的主流模式是分層堆疊:

  • 第一層 — 一個小型、快速、常常是開源蒸餾模型,跑在自家基礎建設上,負責高量、低風險的流量:分類、抽取、路由、簡單問答、嵌入向量。這是你的主力。
  • 第二層 — 一個 frontier 封閉 API,處理真正需要頂級推理或最新知識截止的小部分流量。你要謹慎路由進去。
  • 第三層 — 選配:一個 frontier 開源權重模型自架,跑在長期保留容量上,用於敏感度高必須留在家裡、但量大到 API 帳單會主宰的工作。

這個模式不新,但它已經變成預設,因為它讓你前門簡單(原型階段一組 API key)、中間層便宜(70–90% 流量交給自架的 8B–32B 模型)、頂層保留給真正需要的情境。三層之間的路由器——決定一則客戶訊息要打到哪一層——本身也是一個模型。2026 年大部分正式產品上線的團隊,是用一個 1B–3B 分類器做那個決定,不是 LLM。

7. 2026 下半年真的重要的新選項

過去十二個月有三個發展實質改變了算術。它們都不是什麼「革命性新範式」,但對於採納它們的團隊,它們都是實實在在省錢的東西。

7.1 蒸餾開源權重模型已跨越門檻

2026 下半年的 7B–14B 蒸餾模型,在窄任務上——抽取、分類、摘要、結構化輸出——已經好到可以取代 2024 年那批主力模型。這些模型在自架推論上的每 token 成本,大約是 frontier API 呼叫的 1/15 到 1/40,依批次大小而定。陷阱在於把它們當 frontier 模型的即插即用替代品;它們不是。它們是取代你現在管線中過度付費的那組特定任務。

7.2 邊緣與裝置端推論終於成真

對於特定窄任務——鍵盤建議、IDE 程式碼補全、裝置端語音代理——在 2026 年於使用者機器上跑一個 1B–3B 模型,已從「有趣的展示」跨越到「正式產品預設」。Apple、Google、開源社群都推出了可用的執行環境。但前提是任務要能塞進模型、且延遲預算要緊。任何需要長上下文、網路存取、或最新知識的東西,仍屬於資料中心。

7.3 批次與推測解碼已從研究變成正式產品預設

大部分超大規模 API 現在都在底層批次與推測。自架的話,你若忽略批次就自求多福。一個 naively 在單張 H200 上跑的自架推論迴圈,會浪費 60–80% 的 GPU 容量。持續批次——已是主流雲端的標配——是自架少數還剩下的「免費大贏」,多數開源推論框架現在也預設開啟。

8. 什麼時候自架是錯的決定

值得直接講清楚。自架在以下情境是錯的:

  • 你的量是突發的。你填不滿的 GPU,就是你要付錢的 GPU。
  • 你的模型一年改版超過兩次。驗證一個新開源權重版本的成本——包含迴歸、評測失敗、重訓包裝層——是真實的。
  • 你的團隊裡沒有人全職負責推論堆疊。一個沒人擁有的自架環境,六個月內會變成一個沒人擁有的自架停機。
  • 你的客戶在意的是品質的絕對頂端。2026 下半年開源權重模型很好,但 frontier 封閉模型在硬推理、長時任務上仍有實質領先。如果你的差異化是「我們用最好的模型」,API 就是你的護城河。

反過來說,自架是對的決定,當你的量高且穩定、你的資料敏感度是真實的、你的延遲預算很緊、你的團隊能承諾至少一名工程師擁有這個堆疊。在那個情境下,省錢會複利。低於這個門檻,那是一次昂貴的實驗。

9. 常見地雷

  • 優化錯層。把每百萬 token 砍 0.30 美元,但留下代理迴圈的一層不動,帳單只動 1%。把路由代理管線中一個多餘的 LLM 呼叫砍掉,帳單動 60%。
  • 忽略出口與儲存。某些工作負載下,進出向量儲存的帳單已經大於模型本身的帳單。在你看模型之前,先審視網路層。
  • 把每 token 價格當頭條數字。一個每百萬 token 1 美元的模型,如果需要 10 倍 token 數才能做一樣的工,並沒有比較便宜。要測的是每次完成任務的成本,不是每次 token 的成本。
  • 沒在量測尾端延遲。Frontier API 的 p50 延遲看起來很棒,直到你查 p99。慢的尾端延遲是面向使用者的 AI 產品無聲的兇手。
  • 模型改了卻忘記更新包裝層。蒸餾模型便宜,但它們壞的方式和 frontier 不同。對 70B 模型有效的提示,給 7B 用可能需要重寫。
  • 在一個 benchmark 上過度旋轉。在 MMLU 上贏的模型,不一定是會在你特定任務上贏的那個。建立你自己的評測集。如果你做不到,你不了解你的成本。

10. 90 天決策檢查清單

如果你有 90 天可行動,以下順序能用最低風險產出最高價值。

  1. 把正式產品中每一次模型呼叫對應到它服務的使用者結果。給每一次呼叫標上層級(frontier、mid、small、蒸餾)。
  2. 計算每次完成工作流成本,不是每次 token 成本。光是這個量測通常會揭露:你最貴的三個功能中,有兩個是過度配置的。
  3. 找出占總支出 80% 的那 20% 呼叫。這些才是值得重新架構的呼叫。
  4. 執行一次面對面評測,拿你現在的模型跟一個更小的蒸餾替代品比。不要假設小模型會輸。
  5. 架起一層路由層,在小模型不確定的時候才升級呼叫。多數路由層是 100–300 行程式碼,不是大型平台專案。
  6. 為你打算自架的任何 GPU 容量鎖定長期保留。2026 年的現貨價格劇烈波動;省錢的地方在保留容量。
  7. 設定每季檢視。AI 成本曲線不穩定。2026 Q4 對的,2027 Q2 會錯。沒有重訪的計畫,就是變貴的計畫。

11. 當前常見選項的快速比較

做法 最適合 典型單位成本(相對) 到正式產品時間 隱藏成本
Frontier 封閉 API(頂層) 硬推理、最新知識、低量高價值功能 1x(基準) 小時 帳單不可預測、每位客戶變異
中階封閉 API 通用正式產品工作量、可預測支出 0.3x–0.6x 小時 硬任務的品質天花板
Frontier 開源權重、自架(70B+) 敏感資料、持續高量、硬即時延遲 規模下 0.2x–0.5x 3–9 個月 評測、維運、模型更新稅
中階開源權重、自架(8B–32B) 主力路由、分類、抽取、摘要 0.05x–0.15x 4–12 週 邊緣情境的品質迴歸
蒸餾開源權重、自架(1B–7B) 高量窄任務、分類、嵌入向量相鄰 0.02x–0.08x 2–6 週 任務適配;不能泛用
裝置端 / 邊緣推論 隱私優先功能、低延遲本地 UX、鍵盤/語音 變動;成本轉到使用者裝置 4–10 週 裝置碎片化、模型大小上限

12. 現在值得做的事 vs. 還在過度炒作的事

現在值得做的事:

  • 在小模型和大模型之間建立路由層。這是多數團隊還沒拉的最大成本槓桿。
  • 把窄任務搬到蒸餾開源權重模型。品質門檻對於抽取、分類、結構化輸出已經足夠高。
  • 審視你的出口層、快取層、重試迴圈。多數省下的錢坐在包裝層,不在模型。
  • 年底前如果你打算自架,鎖定保留容量。新 GPU 保留的價格趨勢是上不是下。

還在過度炒作的事:

  • 「AGI 六個月內到來,模型會吃掉你的成本問題。」它不會。為你有的成本曲線做打算,不要為主題演講承諾的那條做打算。
  • 從零訓練一個自訂模型。例外是有專屬訊號價值數千萬美元標籤品質訓練資料的團隊。2026 年的預設是開源權重加微調,不是從零訓練。
  • 用某個新供應商的「一站式」平台取代整個堆疊。鎖定在上升,切換成本在上升。要刻意挑選你的層。
  • 把裝置端推論當成通用替代品。它對於窄任務是真的。它不是 frontier 模型呼叫的替代品。

13. 常見問題

2026 年我該自架還是用 API?

在你每日持續量超過大約 5 億 token、且你有人的工作是推論堆疊之前,用 API。低於這個,API 在總持有成本上勝出,即使它的每 token 價格較高。

開源權重模型真的夠好嗎?

對於窄任務——分類、抽取、摘要、結構化輸出、嵌入向量相鄰——沒問題,2026 下半年的 7B–32B 蒸餾模型已達正式產品等級。對於開放式 frontier 推理,封閉模型仍有實質領先。

多數團隊會錯過的最大省錢動作是什麼?

砍掉代理管線中多餘的 LLM 呼叫。多數團隊有一個多步迴圈,其中一個呼叫可以被一條規則、一個快取命中、或一個更小的模型取代。找到那個呼叫,通常比任何模型切換都更能改變帳單。

我該怎麼估算自架的工程成本?

把一位資深 ML 平台工程師的全額成本算進去,除以 GPU 小時的節省,你就得到一個粗略的損益平衡。如果節省不足以支撐這個 FTE,API 勝出。如果可以,自架合理——但前提是你能把利用率維持在大約 60% 以上。

現在值得打造裝置端推論嗎?

對於特定功能——鍵盤建議、語音代理、IDE 程式碼補全、使用者自有資料的隱私敏感功能——值得。作為伺服器端呼叫的全面替代品,不值得。

14. 12 個月展望:到 2027 Q4 會改變什麼

值得對這個經濟體的下一站下一些粗略的注。它們沒有一個是必然,全部都應該每季重訪。比下錯注更糟的唯一一件事,是完全不下注。

單位 token 價格會持續下跌。蒸餾模型與積極批次會把地板壓得更低。任何假設每 token 價格持平的預測,都是天真的。

多數公司的 AI 總支出會持續上升。更多功能、更多代理迴圈、更豐富的上下文視窗,複合效應是真實的。動的是天花板,不是地板。

混合堆疊會變成預設,不再是例外。到了 2027 年底,還停在純 API 或純自架堆疊的團隊,會是那些為了純粹而付溢價的人。分層模型是正式產品 AI 的作業系統。

開源權重模型會在硬推理任務上持續縮小差距。不會完全追上。但會縮到夠小,讓「frontier 封閉」這一層在範圍而非能力上縮小。把你的架構當作差距會縮小來規畫,不要當作差距會維持來規畫。

裝置端推論會從小眾擴張到主流,針對窄任務。語音代理、IDE 輔助、隱私優先功能。預期明年這個時間點,成熟堆疊中會有 20–30% 的推論呼叫是裝置端。

GPU 供給會鬆動——但不均勻。頂級加速器會持續吃緊。中階與二手硬體會進入買方市場。容量規畫團隊應該為 2027 年的雙層 GPU 市場做計畫。

15. 結語

老實說結論是這樣:2026 下半年的 AI 算力經濟學,獎勵那些會量測每次完成工作流成本的團隊、那些在小模型與大模型之間建立路由層的團隊、那些只在量能支撐時才承諾擁有推論堆疊的團隊。2026 年還在爭論「API vs 開源」的團隊,沒看到重點。真正的問題是哪一次呼叫該屬於哪一層。搞對,帳單砍一半。搞錯,沒有任何 per-token 折扣救得了你。

如果你只能從這份指南帶走一件事,帶走這個:去審視包裝層,不是模型。省下的錢就在那裡,而你的大多數同業現在還沒去找。那就是你的窗口。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *