2026 年中 AI 語音代理:gpt-realtime 對決模組化技術棧決策指南
一年前要做一個語音代理,流程就是 Whisper 接 LLM 再接 TTS,然後祈禱來回延遲不要把對話拖死。到了 2026 年中,兩個截然不同的技術棧悄悄勝出——而大多數團隊在不知不覺中押錯了邊。
OpenAI 的 Realtime API 搭配今年稍早進入 GA 的 gpt-realtime 模型,已經讓「單一模型語音對語音」變成所有語音新手腦中的預設解法。但從實際在 production 跑的團隊身上學到最貴的一課是:單體式 speech-to-speech(S2S)並不是萬靈丹。模組化技術棧——各自最頂尖的 STT、你最熟悉的 LLM、再加上一個能代表你品牌的 TTS——在為數不少的實際工作負載裡仍然是正解。市場沒有收斂,它一分為二了。
這篇指南會帶你走過過去六個月真正改變了什麼、哪些事情還在被過度炒作,以及一套挑選技術棧的決策框架。它不是教學——那種文章外面多的是——它更接近一份從 production 團隊現場回傳的戰報。
自 2025 年底以來真正改變了什麼
有三個變動挪動了語音代理開發者的整個目標線。它們沒有一個是關於漂亮 demo 的,全部都是關於那些會在 production 悄悄壞掉的部分。
語音對語音模型終於聽起來像人
OpenAI 的 gpt-realtime 進入 GA,並在三個真正重要的地方出現可量化的躍進:音訊品質、指令遵循、函式呼叫。在內部基準測試上,新模型在 Big Bench Audio 推理拿到 82.8%(2024 年 12 月版本是 65.6%),MultiChallenge 指令遵循 30.5%(之前是 20.6%),ComplexFuncBench 函式呼叫 66.5%(之前是 49.7%)。它在讀字母數字混排——電話號碼、車身號、帳號——的準確度也明顯提升,無論是西班牙文、中文、日文或法文。同時上線了兩個新聲音(Marin 與 Cedar),既有的八個聲音也經過一輪表現力升級。
同樣重要的是,OpenAI 在 GA 時砍價 20%。音訊輸入現在是 每百萬 token 32 美元(快取輸入 0.40 美元),輸出是 每百萬 token 64 美元。以一分鐘來回對話計算,大約是 18 個月前成本的三分之一到四分之一。「恐怖谷」語音問題在這個等級上幾乎算是解決了——在多數產品場景裡,客戶已經無法單憑聲音分辨對方是人還是代理。
STT 悄悄迎來自己的 GPT 時刻
對多數開發者來說更重大的故事是:語音轉文字真的變強了。Cartesia 的 Ink-2 在 2026 年 7 月 9 日發布,目前在 Artificial Analysis 的串流榜上排名第一。在 AppTek——一個涵蓋 14 種口音的客服中心基準——Ink-2 達到 8% 詞錯誤率,對比 Deepgram Flux 的 10% 與 ElevenLabs Scribe v2 的 12%。在 Cartesia 自家的內部 production 音訊基準(真實客服中心通話,帶有背景噪音與網路降音質)上,Ink-2 達到 6.5%,對手則是 9.2% 與 9.4%。
更關鍵的改進是 Ink-2 所稱的語意端點偵測(semantic endpointing)。過去的語音代理是用靜音門檻來判斷回合結束,這導致客戶地址講到一半被切斷,或是講完之後尷尬地空白兩秒。Ink-2 讀的是語意,不是靜音——它知道使用者還在講 email 網址,於是選擇等待。它原生吐出三種事件(turn.start、turn.eager_end、turn.end),不需要額外的 VAD 層。這就是「一個打磨過的代理」與「感覺像 2023 年電話語音選單」之間的差距。
模組化技術棧變得可組合
單一模型的 S2S 模式很誘人,但模組化的 STT→LLM→TTS 模式有自己的反擊。各個零件現在都各自達到同類最佳。Deepgram 在四月推出 Flux Multilingual——一個串流 STT 模型涵蓋 10 種語言,準確率不亞於各語言獨立模型。ElevenLabs v3 進入 GA(結束 alpha),支援像 [whispers] 與 [sighs] 這種直接寫在腳本裡的音訊標籤,並新增 Text-to-Dialogue 端點幫你處理講者切換與情緒轉換。Hume 在 EVI 2 推出 Voice Control,把十個聲音維度以連續滑桿的方式開放——果斷度、輕快度、自信、興奮度、鼻音、放鬆度、平滑度、遲鈍度、緊繃度——完全不需要走到聲音複製那條路。
這些零件組合起來很順。你可以在一下午之內把 Cartesia Ink-2 → Claude 或 GPT → ElevenLabs 或 Hume 接起來,並針對彼此的失敗模式微調每一層。這種可調性,是單體技術棧至今仍給不出來的東西。
兩種技術棧的誠實取捨
像 gpt-realtime 這樣的語音對語音模型一次做五件事:輪替管理、STT、意圖理解、回應生成、TTS。這換來三個東西,付出兩個代價。
你換來延遲。整條管線只是一次模型跳轉。在調校良好的部署下你可以達到約 300 到 500 毫秒的首字回應時間,聽起來就像正常對話。你換來自然的輪替,因為模型懂得像人類那樣知道什麼時候該停——這一點模組化棧還得小心自己打造。你省掉了 STT 與 LLM 之間的接縫,這代表情緒、「嗯哼」這類語氣訊號不會在轉錄過程中被壓平。
你失去聲音客製化。你可以從 OpenAI 的預設聲音裡挑,或寫聲音指示的提示詞,但你無法複製一個品牌聲音,也沒辦法把鼻音調高 30%。你失去各語言獨立調校的能力,這在需要各地母語者聲音的場景裡很重要。你也失去成本可預測性——音訊 token 計費比以字元計價的 TTS 更難以逐分鐘預估。
模組化技術棧把這個取捨整個翻過來。你可以挑市面上最自然的聲音代表你的品牌。你可以在意圖層用更小、更便宜的 LLM(Haiku、Flash、或微調過的 8B 開源模型)。你可以獨立替換任何一個零件——這在 Ink-2 或 ElevenLabs 某個晚上突然發布 30% 改進、你下週就想用上的時候特別重要。你也得到更清晰的逐零件可觀察性,這正是「這通電話感覺怪怪的」與「是 LLM 在 1.8 秒的函式呼叫上卡住」之間的差別。
代價是工程。你要整合三到四個供應商,每家都有自己的 SDK 怪癖與驗證機制,並且要扛起整條管線的延遲預算。能用模組化棧贏的團隊,都是把語音管線當 production 系統在經營——有 tracing、有評測集、有提示詞變更的回歸測試、有明確的負責人。
決策框架:什麼時候選哪一邊
與其講抽象原則,這是我被團隊問「該走哪條路」時會用的判斷口訣。
| 選這個 | 如果你的情境長這樣 |
|---|---|
| 語音對語音(gpt-realtime、Gemini Live) | 任務以對話為主、工具呼叫很輕(每分鐘一兩次函式呼叫)。你比較在意自然度而不是品牌聲音。你沒有語音團隊,短期也不打算組。你把延遲視為硬性產品限制——電話、IVR 取代、即時家教。 |
| 模組化(Cartesia Ink-2 + LLM + ElevenLabs / Hume) | 聲音是你品牌的一部分。你需要聲音複製或細粒度的情緒控制。你需要為了地區成本、法規或延遲而獨立替換 STT 或 TTS。你在意圖層想要更小、更便宜的 LLM。你為了合規需要地端部署或特定雲區域。 |
| 混合:先 S2S,之後逐步模組化 | 你需要幾天之內交出一個能跑的 v1,不是幾週。你預期會邊做邊看 S2S 在你這個場景會從哪裡壞掉,再把零件一個一個拉出來。這是大多數我認識的 production 語音代理實際走過的路。 |
有一條路是很多團隊忽略的:先用 S2S 起手,邊做邊把失敗的零件抽出來。gpt-realtime 的對話流暢度,是讓你在幾天內就交出能跑的 v1 的好方式。等到你看清楚它會在哪裡壞掉——通常是品牌聲音、複雜多步的工具鏈、或是受監管的工作流——你就可以把 TTS 拉出來,或把 LLM 拉出來,或者兩個都拉。這是我認識的多數 production 語音代理實際走過的路徑。
真正的成本比較(為什麼「每分鐘多少錢」會誤導人)
官方定價並不能告訴你一通電話的真實成本。這裡給一個粗估:一通 3 分鐘、有中等來回量的客服電話。
- OpenAI Realtime API、gpt-realtime:每通電話大約 60 到 90K 輸入 token 加上 30 到 45K 輸出 token 的音訊。以每百萬 $32/$64 計算,每通約 1.90 到 5.75 美元,依對話密度而定。如果走 PSTN 還要再加上 SIP/電話成本。
- 模組化(Cartesia Ink-2 + Claude Sonnet + ElevenLabs Flash):大約每秒 800 個轉錄 token、~500 個 LLM token、每分鐘 ~700 個 TTS 字元。以目前的單位價格計算,典型流量落在每分鐘 0.20 到 0.40 美元,3 分鐘電話約 0.60 到 1.20 美元。同通電話比 S2S 便宜 3 到 5 倍。
但這裡有個陷阱:那 0.60 美元沒有算進去把整個模組化棧壓在 800 毫秒延遲以內的工時。請依你們是否已經有語音工程師在編制內來調整這份帳。
如果你每月出貨量在 1 萬分鐘以下,每通差距不值得額外的工程。如果你每月在 100 萬分鐘以上,差距就是實實在在的錢——而且模組化棧第一季就能 cover 一位專職語音工程師的成本。
沒有人放進 pitch deck 的輪替問題
2026 年語音代理最常見的 production 失敗不是轉錄錯誤,是輪替(turn-taking)。語音代理會在使用者講地址講到一半插話,會在使用者講完之後尷尬地空白兩秒,也會在使用者開始囉嗦時不懂得打斷。失敗發生在 VAD 或端點偵測那層,不在 LLM。
如果你選 gpt-realtime,你會繼承它內建的輪替行為——這個確實不錯但沒辦法客製。如果你走模組化,輪替品質就取決於你的 STT 廠商。這就是為什麼 Ink-2 的語意端點偵測比它的 8% WER 更重要——它解對了問題。你真正想看的指標,是相對於一份真人標註的真實通話集所計算出來的 F1,並且把精確率(不要打斷人)與召回率(不要留白)分開看。
實務結論:不要只用準確率評 STT。請建立一份由真人標註「講者實際在哪一句結束」的真實客戶通話集。精確率與召回率遠比 WER 更能預測你的代理感不感覺像個真人。
2026 年可以跳過的事情
有幾件事還在被大力推銷,但我會勸退。
把多語 S2S 當成已解問題
它還沒解。跨語言 S2S 在資源豐富的語言、安靜環境下可以運作,但遇到夾雜、各地口音或噪音環境就崩潰。真正多語部署應該用有語言感知的 STT(Flux Multilingual、Ink-2 的多語版本推出時),接到一個語言能力強的 LLM,再加上一個能在各地提供母語者聲音的 TTS。
把聲音複製當成賣點
在 EU AI Act 與美國部分州法下,揭露義務已經變嚴。Hume 的 Voice Control 與 ElevenLabs 的 Voice Design 給你 80% 品牌聲音的好處,卻沒有複製的風險。除非你有合法且明確的用途,否則就以它們為預設。
把延遲壓在 200 毫秒以下
低於 250 毫秒的首字回應是排行榜上的炫耀值,不是客戶體驗。人類對話輪替正常落在 200 到 300 毫秒的快對話、500 到 700 毫秒的一般對話。你的預算應該鎖在整體約 500 毫秒。把工程時間花在從 350 推到 250,除非你在做即時家教或無障礙場景,否則都是浪費。
為了隱私而自架 TTS
偶爾是對的(受監管產業、真正的地端需求),但多數團隊高估了隱私紅利。如果你的 STT 與 TTS 都在某個供應商的 GPU 上跑,音訊早就在別人家的雲裡了。真正的隱私問題是端對端的資料處理,而不是推論是不是在你機房。
動手之前先走過這份檢查清單
- 預期最長的通話多長?(決定 token 成本與 S2S 模型要保留多少 context。)
- 你需要的是聲音複製,還是只要一個品牌聲音?(把你推向 ElevenLabs / Hume 或 OpenAI 預設。)
- 尖峰時段同時要跑幾通電話?(避開有帳號級速率限制的供應商。)
- 語言覆蓋需求是什麼?(5 種以上且要品質,就往模組化靠攏。)
- 對你的使用者來說,延遲與聲音品質哪個更重要?(分別推向 S2S 或模組化。)
- 你們有語音工程師,還是全端團隊第一次摸語音?(推向 S2S。)
- 有什麼資料落地或資料主權的規定?(避開地區覆蓋有限的供應商。)
如果你在聲音複製、多語言、地端、高並發這四項裡有兩項以上回答「是」,就走模組化。否則先從 S2S 起手,之後再回頭檢視。
常見錯誤
我在大多數語音代理建置裡都會看到的五個坑。
- 把供應商的展示聲音當成 production 聲音。他們的聲音是為了展示對話調校的。你要的是對著你實際通話流程測過的聲音。建一份 50 通真實客戶互動的評測集,再對它重新挑聲音。
- 在最佳化 WER,而不是任務完成率。詞錯誤率低,不代表代理會幫客戶完成任務。要以後者為評測指標。一個 WER 7% 但填錯表單欄位的模型,比 WER 10% 但填對的模型更糟。
- 忘了代理的聲音就是你品牌的一部分。公司花 20 萬美元做品牌識別,最後出貨一個聽起來像通用 SaaS 聊天機器人的預設 Cartesia 或 OpenAI 聲音。聲音是電話上最強的品牌信任訊號之一。值得花一週好好挑。
- 低估函式呼叫的延遲稅。當你的語音代理要查資料庫或打內部 API 時,通話延遲會飆升。多數團隊的評測集沒量到這個。請建立輪替延遲的分佈,而不是只看平均。
- 跳過對話設計這件事。「把 LLM 接到一組電話號碼」不是策略。客戶會信任並且繼續用的語音代理,與會被掛掉的,差別幾乎永遠是系統提示詞、few-shot 範例、與升級規則。請把對話設計當成工程,而不是內容工作。
什麼時候這個決定是對的——什麼時候不是
2026 年中的語音代理領域已經不是一場賽馬。它很清楚地分成兩個都站得住腳的技術棧,各有誠實的取捨。犯錯不是選了「錯」的那一個,而是只憑 demo 做決定,沒花功夫弄清楚你這個場景會踩到哪個失敗模式。
如果你這個季度要出貨語音,就從能處理你最硬限制的最簡單技術棧開始。S2S 給你開箱即用的對話流暢度。模組化給你品牌聲音與可替換性。然後承諾在規模化之前先建立一份真實通話的評測集。贏的團隊,是把語音當成一個要被量測的系統,而不是一個要被 launch 的功能。
pitch deck 上的答案是「用最新的 realtime 模型」。誠實的答案是:看你要出貨的東西是什麼、目標使用者是誰、你能分給語音工程多少時間。好消息是 2026 年這兩條路都已經好到可以出貨。壞消息是,要選哪條仍然需要你真正了解自己的產品。
常見問題
OpenAI gpt-realtime 可以上 production 了嗎?
可以。它在 2025 年進入 GA、降價 20%、在 preview 模型基礎上有可量化的基準進步,並且支援 SIP 連到公眾電話網路。它是多數團隊最快交出能跑語音代理的路。Remote MCP 支援也代表你可以直接把現有的 MCP 伺服器接進語音,不需要再寫膠水程式。
用 Cartesia Ink-2 還需要 VAD 嗎?
不需要。Ink-2 原生吐出語意輪替事件(turn.start、turn.eager_end、turn.end),所以你不需要額外的語音活動偵測層。這消除了從 2024 年以來一直困擾模組化語音棧的那一整類整合 bug。
2026 年聲音複製還合法嗎?
在歐盟,AI Act 要求明確揭露合成語音,並對提供者加諸義務。在美國,州法不一,但趨勢是要求複製需取得同意。Hume 的 Voice Control 與 ElevenLabs 的 Voice Design 給你大部分品牌聲音的好處,卻沒有複製的風險。請以它們為預設。
我實際需要多少延遲預算?
人類對話落在 200 到 700 毫秒的輪替時間,依情境而定。代理整體鎖定在約 500 毫秒就好。除非你在做即時家教或無障礙場景——更快的確比較有意義——否則要把首字回應壓到 300 毫秒以下通常不值得那份工程成本。
最便宜的可行技術棧是哪個?
Cartesia Ink-2 + 一個小型的開源 LLM(Qwen 3、Llama 4 8B 或一份微調)+ ElevenLabs Flash 或 Cartesia Sonic TTS。每分鐘對話可以壓到 0.20 到 0.40 美元。代價是工程時間,不是 API 費用。

