← 返回 Siami 首頁

中國智譜 GLM-5.3 橫空出世 躋身全球前 10 名 AI 模型

▲ 100 💬 43
中國智譜 GLM-5.3 橫空出世 躋身全球前 10 名 AI 模型

編按:本文綜合整理自 Artificial Analysis 官方模型評測 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

人工智慧基準評測機構 Artificial Analysis 於 8 月發布的最新報告中,正式將中國 AI 公司 Z AI(智譜)的 GLM-5.3(max) 列入頭部梯隊。這款新模型在 Intelligence Index 拿下 60 分,於 182 款同類模型中排名第 8,遠高於同類中位數 35 分。這個成績意味著中國閉源大模型再次擠進全球前 10 名,也讓 GLM 系列從「追趕者」正式升級為「挑戰者」。

核心數據

Artificial Analysis Intelligence Index v4.1.1 採用 9 項基準測試綜合評分,包含 GDPval-AA v2(真實代理工作任務)、𝜏³-Banking(銀行業務代理工具使用)、Terminal-Bench v2.1(終端機編碼代理)、SciCode(編碼能力)、Humanity’s Last Exam(推理與知識)、GPQA Diamond(科學推理)、CritPt(物理推理)、AA-Omniscience(知識準確度)與 AA-LCR(長文脈絡推理)。

GLM-5.3(max)的整體表現:

面向數值同類排名中位數
Intelligence Index60第 8 / 18235
輸出速度93.2 tokens / 秒第 54 / 18276
輸入價格$1.40 / 1M tokens—$1.75
輸出價格$4.40 / 1M tokens—$10.00
快取折扣81%——
文脈長度1M tokens——

Artificial Analysis 在比較摘要中寫道:「GLM-5.3(max)是目前最聰明的模型之一,且在與同價格帶的競品比較時屬於合理定價,輸出速度也高於平均水準。」


價格策略

相較於美國旗艦模型動輒每百萬輸出 token 超過 10 美元的定價,GLM-5.3(max)以 $1.40 / $4.40 的雙價結構進入中價位帶,輸出成本僅約 44% 的同類中位數。如果啟用快取機制,價格可進一步壓低至 $0.68,這對需要大量背景知識庫查詢的企業客戶特別有吸引力。

值得注意的是,Artificial Analysis 評測整個 Intelligence Index 的總花費僅 $1,238.50 美元——這個數字對閉源旗艦模型來說相當克制,意味著開發者可以反覆做 prompt 實驗而不會燒掉太多預算。


為什麼這件事重要

中國 AI 模型在 2025 年 DeepSeek R1 引發全球震撼後,第二梯隊的「GLM、Kimi、Qwen、DeepSeek」持續在基準排行榜上輪流冒出頭。這次 GLM-5.3 進入 Intelligence Index 前 10,是這個生態系成熟的最新訊號。

中國頂尖模型正以「合理定價 + 高 Intelligence Index」策略切入全球市場,鎖定那些無法負擔 GPT-5 或 Claude Opus 4.1 API 預算的中小型開發團隊。

從市場競爭角度看,這場 AI 定價戰正在壓低整個產業的合理預期成本。當美國模型以 $10+ / 1M tokens 為常態、中國模型以 $1.40 為基準時,最終受益的是把所有 LLM 串接進產品的小型 SaaS 公司。

數據解讀與質疑

GLM-5.3(max)雖拿下 Intelligence Index 第 8 名,但 Artificial Analysis 同時標記它**「非常囉嗦(very verbose)」**:跑完整套 Index 用了 1.7 億 tokens,是同類中位數 7,200 萬的兩倍以上。這代表同樣的任務,GLM-5.3 會消耗更多成本與時間。

以美元計價:若以官方輸出價 $4.40 計算,單次完整 Intelligence Index 評測的 token 成本約 $748,雖然 Artificial Analysis 公布的實際花費是 $1,238.50(可能含 reasoning token 與 cache write 的額外費用),但這個成本結構仍偏高——開發者若需要批次處理大量請求,應仔細估算每月實際用量。

另外要留意的是,Artificial Analysis 的排名是**「同類內比較」**——GLM-5.3(max)屬於「Proprietary reasoning models 對應價格帶 $1+/1M tokens」,因此第 8 名其實是這個同溫層的第 8 名,而非「打敗 GPT-5」的意思。


後續觀察重點

Artificial Analysis 的頁面同時指出 GLM-5.3 還可能存在 非 reasoning 版本,這通常代表開發者可以依任務需求在「速度」與「準確度」之間切換。1M tokens 的長文脈支援也意味著企業級 RAG(檢索增強生成)場景會是 GLM-5.3 的主戰場。

接下來值得追蹤的指標:

  • 智譜官方是否在 Hugging Face 釋出開源 weights
  • 與 DeepSeek V4、Kimi K3、Qwen 3.5 的同類對比
  • Artificial Analysis 後續會不會把 GLM-5.3 納入「Agentic Index」與「Coding Index」評分
  • 西方主流媒體(Reuters、TechCrunch、The Verge)是否會報導

GLM-5.3 的出現代表中國 AI 公司已經不再只是「價格破壞者」,而是同時擁有「前 10 名 Intelligence + 合理定價」雙重競爭力。對台灣與全球開發者來說,模型選型的天平正在悄悄移動。