← 返回 Siami 首頁

xAI Grok 4.6 拿下 AA Intelligence Index 61 分並列 GPT-5.6 Sol 定價不變成最大武器

▲ 281 💬 41
xAI Grok 4.6 拿下 AA Intelligence Index 61 分並列 GPT-5.6 Sol 定價不變成最大武器

編按:本文綜合整理自 Artificial Analysis、eesel.ai、Hacker News 討論串、xAI 官方 X 帳號、Kingy AI 與 Eigent.ai 的同步評測,並加入 Siami 編輯部觀點與分析。

xAI 在 8 月 12 日正式發表 Grok 4.6,這是相隔 Grok 4.5(7 月 8 日)僅約五週的快速迭代版本。第三方獨立評測機構 Artificial Analysis 的 Intelligence Index 顯示,Grok 4.6 拿下 61 分,與 OpenAI 的 GPT-5.6 Sol 並列,僅次於 Anthropic Claude Opus 5(63 分)與 Claude Fable 5(62 分,含 fallback)。

Grok 4.6 核心評測成績

Artificial Analysis 的 Intelligence Index 是一個綜合九項基準的評分體系。Grok 4.6 在分類中的位置如下:

  • 61 分:與 GPT-5.6 Sol(max)並列
  • 落後:Claude Opus 5(max, 63)、Claude Fable 5(max with fallback, 62)
  • 領先:Kimi K3、Qwen3.8 Max 等其他模型

從時間軸來看,Grok 4.6 比 4.5(56 分)進步 5 分,距離 4.3(38 分)則整整拉開 23 分。短短一個月內就追上 GPT-5.6 Sol,這是 xAI 在 frontier intelligence 區間重新站穩腳步的關鍵節點。

Agentic 工作才是真正戰場

Grok 4.6 最強的表現不是在靜態推理,而是真實世界的 agentic 工作負載。

具體數字:

項目Grok 4.6對比組
GDPval-AA v2 Elo1753僅次於 Claude Opus 5,與 Claude Fable 5、Qwen3.8 Max 信心區間重疊
𝜏³-Banking(多輪客服+工具使用)50.7%與 Qwen3.8 Max(51.3%)並列前二
Terminal-Bench v2.1(終端機軟體任務)88.4%與領先群並列

關鍵指標是 GDPval-AA v2,這是 Artificial Analysis 用來衡量「真實世界知識工作代理」的基準。Grok 4.6 在這個面向幾乎追上 Claude Opus 5,顯示它在企業級知識工作代理(例如分析報告、文件處理、研究整理)的可用性大幅提升。


為什麼這件事重要

Grok 4.6 不是技術突破,而是 商業定位突破。

xAI 在這次發表中做了一件 frontier 模型廠商幾乎不做的事:在 intelligence 大幅進步的同時,把 API 定價維持與上一代完全相同。Grok 4.6 維持 $2 / $6(每百萬 input/output tokens),對比 Claude Opus 5 的 $5 / $25 與 GPT-5.6 Sol 的 $5 / $30,輸出價格便宜了 60% 以上。

這個價差對 reasoning-heavy 工作負載(也就是 frontier 模型真正會被使用的場景)影響最大。Artificial Analysis 實測 Grok 4.6 的每任務成本是 $0.84,與 Kimi K3 持平,但 intelligence 略高,正式進入 Intelligence vs. Cost per Task 的 Pareto frontier。

長時程代理工作更是壓倒性:

  • Grok 4.6:平均 53 輪、0.5B input tokens 完成 AA-Briefcase 任務
  • Claude Opus 5 (max):平均 103 輪、2.0B input tokens

4 倍的 token 效率差異,加上原本就便宜的單價,讓 Grok 4.6 在 long-horizon agentic knowledge work 的實際帳單上,可能只有 Opus 5 的八分之一。

對企業採購而言,這代表「用 GPT-5.6 Sol 等級的 intelligence 但只付 Kimi K3 等級的錢」第一次成為現實選項。對 Cursor、OpenRouter、Vercel、Cloudflare 等下游通路來說,這也直接改寫他們的 model routing 策略 — 預設路由到 Grok 4.6 的誘因非常高。


Siami 觀點:定位矛盾與被低估的贏家

這次發表最有意思的不是分數,而是 xAI 對 Grok 4.6 的定位說辭與實際 benchmark 形狀不一致。

xAI 在官方發文中把 Grok 4.6 主打為「agentic coding」升級,但 eesel.ai 的 Alicia Kirana Utomo 仔細看 benchmark 表後指出:

  • 贏的項目:GDPVal-AA、AA-Briefcase、Harvey LAB(都是 knowledge work / 長時程分析)
  • 輸的項目:DeepSWE(-7.1)、Terminal-Bench(-8.6)

標題說是 coding 升級,實際數據卻顯示這是一次 knowledge work 升級。

這個矛盾有兩種解讀。第一,xAI 的 marketing 部門跟 benchmark 團隊不同步,這在快速迭代的小廠很常見。第二,xAI 真的相信 long-running agent 是未來 — Grok 4.6 的訓練重點確實放在多輪工具使用與長 context 管理上,DeepSWE 這類單題 coding 評測反而不是重點。

如果是第二種,Grok 4.6 真正的客戶不是「寫程式的人」,而是 「想把研究、文件、報告工作外包給 AI agent 的企業」 — 這個市場比純 coding 大得多,而且 Anthropic 目前在這個區段幾乎沒有對手。

質疑與待觀察的三個點

  1. 官方文件還沒更新:Hacker News 上多位用戶反映,xAI 官方 API 文件仍標示 Grok 4.5 為最新旗艦。雖然 Grok 4.6 已可在 Cursor、OpenRouter 等通路呼叫,但走 xAI 官方 API console 的開發者還看不到版本資訊,這對企業採購流程是個麻煩。

  2. 沒有新 pre-train:Grok 4.6 沿用與 4.5 相同的 1.5T V9 foundation,所有進步都來自 SFT 與 RL 改進。這是效率表現,但也是天花板 — 在不擴大模型規模的前提下,SFT/RL 的紅利很快會吃光。Musk 已預告 Grok 4.7 會升級到 2.1T 參數,預計 9 月初釋出。

  3. RL 調校的政治爭議未解:HN 上不少用戶明確表示「不管多便宜都不會用 xAI 模型」,理由是 Musk 對 RL 方向的干預。這個社群信任問題不會靠 benchmark 數字解決。

延伸資源


編按:本文綜合整理自 Artificial Analysis、eesel.ai、Hacker News 討論串、xAI 官方 X 帳號、Kingy AI 與 Eigent.ai 的同步評測,並加入 Siami 編輯部觀點與分析。Siami 不保證所列 benchmark 數字在未來不會被 xAI 官方版本更動,請以原始來源為準。

網友熱門留言 (5)

#1 Hacker News 用戶 @cjalmeida ▲ 87
Fable-like intelligence, beats GPT-5.6-Sol on most benchmarks, cheaper. 看起來 xAI 這次的策略很明確:把 frontier intelligence 砸到 mainstream 價格帶。
#2 Hacker News 用戶 @MWil ▲ 42
Pricing pages haven't been updated yet, still advertises 4.5. 注意 xAI 官方 API 文件還停在 4.5,定價頁沒同步更新 — 想立刻串 API 的人要自己算。
#3 Hacker News 用戶 @mempko ▲ 35
I won't use their models for this reason. Musk tinkering too much with the RL to make it sound more like him is wild. 不管多便宜或多強,xAI 模型背後的 RL 調校方向還是讓很多人卻步。
#4 X 用戶 @kimmonismus ▲ 168
Grok 4.6 released, absolutely insane crazy jump! xAI was cooking! 在 AA Index 跟 GPT-5.6 Sol 並列、CursorBench 還領先,這進步幅度真的太瘋狂。
#5 eesel.ai 評論員 Alicia Kirana Utomo ▲ 56
Grok 4.6 wins the knowledge-work rows and loses the software-engineering rows. It loses DeepSWE by 7.1 points and Terminal-Bench by 8.6. For a launch post titled around agentic coding, that is a curious shape. 標題主打 agentic coding,結果程式工程 benchmark 反而是輸的,這個落差很有趣。