前言:當 API 帳單砸下來,一切「氛圍感」都消失
當 API 帳單寄來的時候,「氛圍感」三個字就不再重要了。許多公司最近才驚覺:AI 用起來其實很貴。一個常見、但可能正在默默推高你帳單的習慣,就是用「每百萬 token 多少錢」來比較不同模型。數字比較低,成本應該也比較低,對吧?其實不然。
「每百萬 token 多少錢」根本就沒辦法直接比
每一家前沿模型實驗室都有自己的 tokenizer(斷詞器),用來決定一段文字會被切成幾個 token。拿這篇文章目前為止的文字為例:gpt-4o 會把它切成 160 個 token,但同一段文字餵給 gpt-4(1106-preview,用 tiktokenizer.vercel.app 測的)就會變成 200 個 token。即使同一家實驗室(這裡是 OpenAI)內部,不同模型之間用 token 算的單價也沒辦法直接比。
跨實驗室比就更不用說了——尤其當各家都在持續調整自家專有的 tokenizer 時,這個誤差很難可靠地量化。最近 Anthropic 修改了 Claude 的 tokenizer,導致同樣一段文字會被切成多 30% 的 token。ceteris paribus(其他條件不變)的前提下,這相當於一次陡峭的漲價;不過,還有另一個重要的因素要考慮。
Token「效率」的巨大變異
就算我們先忽略 tokenizer 帶來的影響,另一個重點是「多一個 token 到底值多少」。這裡指的不是 token 的價錢,而是這個 token 實際幫你完成了多少事。如果你把 AI 拿來做嚴肅的工作,多數的 token 消耗其實都花在「思考」上——這部分經常被隱藏、看不到,但費率跟可見的輸出 token 一樣。這種技巧(也就是所謂的「思維鏈 / chain of thought」)可以大幅提升輸出品質;然而,那段「思考」的長度,往往才是影響你 AI 使用總成本的主因——而且變異幅度非常劇烈。
我挑了幾家美國前沿實驗室目前最強的模型,再加上中國實驗室的明星級產品(這些中國模型常被行銷成「跟美國頂級差不多強,但只要 1/x 的成本,x 往往大於 10」),整理成下面這張表。表中也放了每個模型在 Artificial Analysis benchmark 的分數——這個 benchmark 會給 AI 模型出一些任務,研究者的目標一部分是測能力,一部分是測「每完成一個任務要花多少錢」。
| 模型 | 美元 / 百萬 token(輸入 / 輸出) | AA Intelligence 分數 | 單一任務成本 |
|---|---|---|---|
| Claude Fable 5 | $10 / $50 | 60 | $3.25 |
| Claude Opus 4.8 max | $5 / $25 | 56 | $1.78 |
| Claude Sonnet 5 max | $3 / $15 | 53 | $2.29 |
| GPT-5.5 xhigh | $5 / $30 | 55 | $0.99 |
| GLM-5.2 max | $1.40 / $4.40 | 51 | ~$0.46 |
| DeepSeek V4 Pro max | $0.435 / $0.87 | 44 | ~$0.04–$0.05 |
| MiniMax-M3 | $0.30 / $1.20 | 44 | ~$0.18 |
| Kimi K2.6 | $0.95 / $4.00 | 43 | ~$0.31 |
其中最讓我困惑的是 Sonnet 5:它表現比 Opus 4.8 還差,token 效率也明顯更低,導致每個任務的實際成本反而更高。如果有正在用的人能跟我解釋一下這個模型存在的意義,我洗耳恭聽。(陰謀論:會不會是 Anthropic 故意推出一個「帳面單價比較低、但 token 不太有效率」的模型,先用低價把人吸進來,最後帳單反而更貴?)
「便宜到誇張」的真相:DeepSeek 與 MiniMax 的真實代價
表格裡 DeepSeek 跟 MiniMax 的數字,可能是最值得關注的。它們的 benchmark 分數沒有離美國前沿模型太遠,但價格是真正的 1 到 2 個數量級差距。不過事情沒那麼簡單。
當你讓 LLM 跑一個 benchmark 任務時,它基本上會跑到自己覺得夠了為止,等於「token 預算其實是無限的」。真實世界的場景就會變成帳單爆炸——模型為了完成單一任務,可能要思考個幾十分鐘。這些模型在生產環境中的真實成本,其實遠高於用「benchmark 分數 × benchmark 成本」直接乘出來的那個數字。
為什麼這件事重要
這篇分析的真正破壞力,在於它戳破了 AI 採購圈最常見的「每百萬 token 多少錢」這個單一指標。當 Anthropic 改 tokenizer、Cerebras / Groq 推自己的定價、DeepSeek 把推理打到地板價,整個「比 token 價錢」的決策框架都已經過時了。
- 對企業採購:合約上的「$X per 1M tokens」是行銷文案,不是會計科目。實際月度帳單的差距可以輕鬆達到 5-10 倍。
- 對工程師:「這個模型比較便宜」這句話在 spec sheet 上成立,在 production 帳單上往往完全相反——尤其是當你啟用 reasoning / chain-of-thought 後。
- 對中國模型供應商:deepseek 跟 minimax 的「超低價」是真的,但只在短任務、無腦袋思考的情境下成立。一旦任務需要長鏈推理,帳單會迅速追上美國模型。
數據解讀與質疑
- 表格裡 $0.04–$0.05 的 DeepSeek 看起來太漂亮了——這是 benchmark 條件下的「解題成本」,真實世界有 retry、有 system prompt、有 tool calling,每一項都會乘以 token 消耗。實務上,真實成本至少是 benchmark 數字的 3-5 倍。
- Sonnet 5「比 Opus 4.8 還差還貴」這個觀察與原 PO 的陰謀論猜測一致,但更合理的解釋可能是:Sonnet 5 是給「需要便宜名字、但其實可以用 Opus 的人」準備的——Anthropic 用低定價把客戶從 Sonnet 5 推到 Opus 4.8,順便做營收最大化。
- Anthropic 改 tokenizer 多收 30% tokens 這件事,在 Hacker News 引發激烈討論(r/ClaudeCode 上有一篇 1.4K upvote 的抱怨文),多家媒體(developersdigest、age-of-product、fairmind)都點出這是「隱形漲價」。也就是說,這篇部落格觀察到的現象,在業界是公開的秘密。
- GLM-5.2 是這份表裡的「性價比王者」:分數 51 跟 Opus 4.8 的 56 差距只有 9%,但每任務成本只要 26%。
給讀者的一份檢查清單
下次看到「每百萬 token 多少錢」的比較表,請帶著以下問題去讀:
- 同一份文本在每家模型的 tokenizer 下分別會被切成幾個 token?
- 你開的應用有沒有用 chain-of-thought / reasoning?開了之後輸出 token 會膨脹 5-20 倍。
- benchmark 是「完成任務」還是「達到某個分數」?前者更貼近生產環境。
- 你看到的 $X/1M 是 list price 還是 batch API、cache hit 之後的 effective price?
編按:本文綜合整理自 Jan Iłowski 部落格原文、Artificial Analysis 官方 benchmark 頁面、developersdigest.tech 對 Claude tokenizer 改動的分析、age-of-product.com 的 2026 token economics 分析、fairmind.ai 的 list price 分析,以及 Hacker News 原始討論串,並加入 Siami 編輯部觀點與數據解讀。
網友熱門留言 (3)