← 返回 Siami 首頁

Token 計價的騙局:每百萬 token 報價為何失真

▲ 102 💬 52
Token 計價的騙局:每百萬 token 報價為何失真

前言:當 API 帳單砸下來,一切「氛圍感」都消失

當 API 帳單寄來的時候,「氛圍感」三個字就不再重要了。許多公司最近才驚覺:AI 用起來其實很貴。一個常見、但可能正在默默推高你帳單的習慣,就是用「每百萬 token 多少錢」來比較不同模型。數字比較低,成本應該也比較低,對吧?其實不然。


「每百萬 token 多少錢」根本就沒辦法直接比

每一家前沿模型實驗室都有自己的 tokenizer(斷詞器),用來決定一段文字會被切成幾個 token。拿這篇文章目前為止的文字為例:gpt-4o 會把它切成 160 個 token,但同一段文字餵給 gpt-4(1106-preview,用 tiktokenizer.vercel.app 測的)就會變成 200 個 token。即使同一家實驗室(這裡是 OpenAI)內部,不同模型之間用 token 算的單價也沒辦法直接比。

跨實驗室比就更不用說了——尤其當各家都在持續調整自家專有的 tokenizer 時,這個誤差很難可靠地量化。最近 Anthropic 修改了 Claude 的 tokenizer,導致同樣一段文字會被切成多 30% 的 token。ceteris paribus(其他條件不變)的前提下,這相當於一次陡峭的漲價;不過,還有另一個重要的因素要考慮。


Token「效率」的巨大變異

就算我們先忽略 tokenizer 帶來的影響,另一個重點是「多一個 token 到底值多少」。這裡指的不是 token 的價錢,而是這個 token 實際幫你完成了多少事。如果你把 AI 拿來做嚴肅的工作,多數的 token 消耗其實都花在「思考」上——這部分經常被隱藏、看不到,但費率跟可見的輸出 token 一樣。這種技巧(也就是所謂的「思維鏈 / chain of thought」)可以大幅提升輸出品質;然而,那段「思考」的長度,往往才是影響你 AI 使用總成本的主因——而且變異幅度非常劇烈。

我挑了幾家美國前沿實驗室目前最強的模型,再加上中國實驗室的明星級產品(這些中國模型常被行銷成「跟美國頂級差不多強,但只要 1/x 的成本,x 往往大於 10」),整理成下面這張表。表中也放了每個模型在 Artificial Analysis benchmark 的分數——這個 benchmark 會給 AI 模型出一些任務,研究者的目標一部分是測能力,一部分是測「每完成一個任務要花多少錢」。

模型美元 / 百萬 token(輸入 / 輸出)AA Intelligence 分數單一任務成本
Claude Fable 5$10 / $5060$3.25
Claude Opus 4.8 max$5 / $2556$1.78
Claude Sonnet 5 max$3 / $1553$2.29
GPT-5.5 xhigh$5 / $3055$0.99
GLM-5.2 max$1.40 / $4.4051~$0.46
DeepSeek V4 Pro max$0.435 / $0.8744~$0.04–$0.05
MiniMax-M3$0.30 / $1.2044~$0.18
Kimi K2.6$0.95 / $4.0043~$0.31

其中最讓我困惑的是 Sonnet 5:它表現比 Opus 4.8 還差,token 效率也明顯更低,導致每個任務的實際成本反而更高。如果有正在用的人能跟我解釋一下這個模型存在的意義,我洗耳恭聽。(陰謀論:會不會是 Anthropic 故意推出一個「帳面單價比較低、但 token 不太有效率」的模型,先用低價把人吸進來,最後帳單反而更貴?)


「便宜到誇張」的真相:DeepSeek 與 MiniMax 的真實代價

表格裡 DeepSeek 跟 MiniMax 的數字,可能是最值得關注的。它們的 benchmark 分數沒有離美國前沿模型太遠,但價格是真正的 1 到 2 個數量級差距。不過事情沒那麼簡單。

當你讓 LLM 跑一個 benchmark 任務時,它基本上會跑到自己覺得夠了為止,等於「token 預算其實是無限的」。真實世界的場景就會變成帳單爆炸——模型為了完成單一任務,可能要思考個幾十分鐘。這些模型在生產環境中的真實成本,其實遠高於用「benchmark 分數 × benchmark 成本」直接乘出來的那個數字。



為什麼這件事重要

這篇分析的真正破壞力,在於它戳破了 AI 採購圈最常見的「每百萬 token 多少錢」這個單一指標。當 Anthropic 改 tokenizer、Cerebras / Groq 推自己的定價、DeepSeek 把推理打到地板價,整個「比 token 價錢」的決策框架都已經過時了。

  • 對企業採購:合約上的「$X per 1M tokens」是行銷文案,不是會計科目。實際月度帳單的差距可以輕鬆達到 5-10 倍。
  • 對工程師:「這個模型比較便宜」這句話在 spec sheet 上成立,在 production 帳單上往往完全相反——尤其是當你啟用 reasoning / chain-of-thought 後。
  • 對中國模型供應商:deepseek 跟 minimax 的「超低價」是真的,但只在短任務、無腦袋思考的情境下成立。一旦任務需要長鏈推理,帳單會迅速追上美國模型。

數據解讀與質疑

  1. 表格裡 $0.04–$0.05 的 DeepSeek 看起來太漂亮了——這是 benchmark 條件下的「解題成本」,真實世界有 retry、有 system prompt、有 tool calling,每一項都會乘以 token 消耗。實務上,真實成本至少是 benchmark 數字的 3-5 倍。
  2. Sonnet 5「比 Opus 4.8 還差還貴」這個觀察與原 PO 的陰謀論猜測一致,但更合理的解釋可能是:Sonnet 5 是給「需要便宜名字、但其實可以用 Opus 的人」準備的——Anthropic 用低定價把客戶從 Sonnet 5 推到 Opus 4.8,順便做營收最大化。
  3. Anthropic 改 tokenizer 多收 30% tokens 這件事,在 Hacker News 引發激烈討論(r/ClaudeCode 上有一篇 1.4K upvote 的抱怨文),多家媒體(developersdigest、age-of-product、fairmind)都點出這是「隱形漲價」。也就是說,這篇部落格觀察到的現象,在業界是公開的秘密。
  4. GLM-5.2 是這份表裡的「性價比王者」:分數 51 跟 Opus 4.8 的 56 差距只有 9%,但每任務成本只要 26%。


給讀者的一份檢查清單

下次看到「每百萬 token 多少錢」的比較表,請帶著以下問題去讀:

  • 同一份文本在每家模型的 tokenizer 下分別會被切成幾個 token?
  • 你開的應用有沒有用 chain-of-thought / reasoning?開了之後輸出 token 會膨脹 5-20 倍。
  • benchmark 是「完成任務」還是「達到某個分數」?前者更貼近生產環境。
  • 你看到的 $X/1M 是 list price 還是 batch API、cache hit 之後的 effective price?

編按:本文綜合整理自 Jan Iłowski 部落格原文、Artificial Analysis 官方 benchmark 頁面、developersdigest.tech 對 Claude tokenizer 改動的分析、age-of-product.com 的 2026 token economics 分析、fairmind.ai 的 list price 分析,以及 Hacker News 原始討論串,並加入 Siami 編輯部觀點與數據解讀。

網友熱門留言 (3)

#1 Hacker News 網友 ▲ 142
當 LLM 供應商開始針對『每百萬 token 報價』這個指標最佳化的時候,這個數字就已經失去意義了。Sonnet 5 看起來就是專門為了 benchmark 漂亮而設計的,但實際任務成本反而更貴。
#2 Gemini 2.5 Flash 討論串網友 ▲ 87
有趣的是 Gemini 2.5 Flash 的『推理模式』比一般模式貴了 5.8 倍——這完全顛覆了人們對『推理省成本』的直覺假設。
#3 r/ClaudeCode 網友(medium 摘要) ▲ 1400
Anthropic 在 Opus 4.7 改了 tokenizer,結果同樣一段文字最多可能多 25% tokens。官方沒改 rate card,但你下個月的帳單會告訴你真相。