企業真正買的不是 token,而是能通過驗收的結果。
評估 AI 成本時,最容易算清楚的是每百萬 token 的價格;但只看這個數字,也最容易低估一個任務真正花掉的成本。
價格表回答的問題,和企業真正該問的問題
價格表回答的是:
「使用這個模型時,每個 token 要多少錢?」
但在實際導入時,更應該問的是:
「在相同品質門檻下,完成一個任務到底要多少錢?」
這兩個問題差很多。
單次成本較低,不代表成功結果的成本較低
假設有兩個模型處理同一個任務。以下數字只是為了說明機制:
- **模型 A:**每次執行成本 1 元,驗收通過率 50%。
- **模型 B:**每次執行成本 1.6 元,驗收通過率 90%。
如果每次執行相互獨立、通過率不變,而且失敗後必須重做,在這個非常簡化的估算下:
- 模型 A 每個成功結果的預期模型成本約為 2 元。
- 模型 B 每個成功結果的預期模型成本約為 1.78 元。
單次比較,模型 A 比較便宜;換成「驗收通過的結果」來比較,反而可能是模型 B 比較便宜。
而且,真實系統裡還不只有模型成本。
一次任務有哪些成本來源?
在實務評估時,我會先用一個粗略框架,將成本來源分成四類:
1. 模型計費
包含模型的輸入與輸出用量。
2. 工具或基礎設施費
包含搜尋、資料庫、執行環境及其他外部服務。
3. 重試與返回修正
包含失敗後重新執行、修改結果,或回到前一段流程重新處理。
4. 人工驗證
包含檢查結果、處理例外,以及確認高風險動作。
這是一個可用來評估任務成本的實務框架,並不是 Google 或 OpenAI 提出的嚴格公式。
如果系統能進一步拆分「輸出 token」與「reasoning token」,也要注意兩者可能共同構成模型的輸出用量,不應在總成本中重複相加。實際如何呈現與計費,仍須依供應商、模型及 API 規則確認。
如果任務失敗還會造成等待、人工介入,甚至讓錯誤進入下一段流程,總成本還會繼續增加。
更有意義的指標: Cost per Successful Task
因此,我認為更有意義的指標是:
Cost per Successful Task:每個驗收通過結果的成本。
但要計算這個指標,第一步不是查看價格表,而是先定義「什麼叫成功」。
例如:
- 摘要是否保留必要資訊?
- 程式是否通過測試?
- Agent 是否在正確的邊界內完成動作?
- 失敗時能否安全停止?
如果沒有明確的評估標準,成本優化很容易變成:
模型帳單下降了,但人工檢查與錯誤修正的工作增加了。
模型任務分配:這個任務該交給誰?
不應該把所有任務都固定交給最便宜或最強的模型。
分類、格式轉換等邊界明確的任務,可以先交給較小的模型;需要跨資料推理、工具操作或較高準確度的部分,再路由給能力更合適的模型。
Google Cloud 的 ModelRoutingPreference 官方參考頁,將模型路由偏好分為:
- 成本優先
- 品質優先
- 平衡模式
這個設計至少說明了一件事:模型選擇本來就是品質與成本之間的多目標決策,不只是比較 token 牌價。
模型路由要回答的是:這個任務應該交給哪個模型?
推理策略:選定模型後,要投入多少?
另一個常被低估的變數,是選定模型之後,要投入多少推理與驗證資源。
與其籠統地稱為「思考鏈」,我會更精準地稱為「推理預算」或「推理策略」。
內部推理 token 不等於使用者最後看見的答案;投入更多推理,也不保證一定得到更好的結果。
真正需要調整的是:
- 這個任務值得投入多少推理?
- 何時應該使用工具?
- 何時應該先驗證再繼續?
- 什麼情況應該停止,而不是無限重試?
OpenAI 的模型指南建議依工作負載設定 reasoning.effort,並在具代表性的任務上比較品質、延遲、token 與成本,而不是直接假設推理強度越高越好。
Responses API 文件也指出,降低 reasoning effort 可能帶來較快的回應,並減少用於推理的 token。這是一種可能的取捨,並不是所有任務都必然成立的結果。
所以,即使使用同一個模型,推理設定與驗證策略不同,任務成本與通過率也可能不同。
模型路由與推理策略的差異
可以將兩者簡單區分為:
- **模型路由:**決定「任務交給誰」。
- **推理策略:**決定「選定模型後投入多少,以及何時驗證或停止」。
結論:真正該優化的是成功任務的總成本
Token 單價當然重要,但它只是一個成本來源。
真正要優化的是:
在相同的驗收門檻下,哪一套模型分配、推理策略與驗證流程,能以最低的總成本,穩定完成任務?
如果你曾實際評估或導入 AI 工作流程,目前採用的是哪一個任務成本指標?歡迎交流。
參考資料
- Google Cloud|ModelRoutingPreference
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/reference/rest/v1/ModelRoutingPreference - OpenAI|Model guidance
https://developers.openai.com/api/docs/guides/latest-model - OpenAI|Responses API Reference
https://platform.openai.com/docs/api-reference/responses