編按:本文綜合整理自 Artificial Analysis、eesel.ai、Hacker News 討論串、xAI 官方 X 帳號、Kingy AI 與 Eigent.ai 的同步評測,並加入 Siami 編輯部觀點與分析。
xAI 在 8 月 12 日正式發表 Grok 4.6,這是相隔 Grok 4.5(7 月 8 日)僅約五週的快速迭代版本。第三方獨立評測機構 Artificial Analysis 的 Intelligence Index 顯示,Grok 4.6 拿下 61 分,與 OpenAI 的 GPT-5.6 Sol 並列,僅次於 Anthropic Claude Opus 5(63 分)與 Claude Fable 5(62 分,含 fallback)。
Grok 4.6 核心評測成績
Artificial Analysis 的 Intelligence Index 是一個綜合九項基準的評分體系。Grok 4.6 在分類中的位置如下:
- 61 分:與 GPT-5.6 Sol(max)並列
- 落後:Claude Opus 5(max, 63)、Claude Fable 5(max with fallback, 62)
- 領先:Kimi K3、Qwen3.8 Max 等其他模型
從時間軸來看,Grok 4.6 比 4.5(56 分)進步 5 分,距離 4.3(38 分)則整整拉開 23 分。短短一個月內就追上 GPT-5.6 Sol,這是 xAI 在 frontier intelligence 區間重新站穩腳步的關鍵節點。
Agentic 工作才是真正戰場
Grok 4.6 最強的表現不是在靜態推理,而是真實世界的 agentic 工作負載。
具體數字:
| 項目 | Grok 4.6 | 對比組 |
|---|---|---|
| GDPval-AA v2 Elo | 1753 | 僅次於 Claude Opus 5,與 Claude Fable 5、Qwen3.8 Max 信心區間重疊 |
| 𝜏³-Banking(多輪客服+工具使用) | 50.7% | 與 Qwen3.8 Max(51.3%)並列前二 |
| Terminal-Bench v2.1(終端機軟體任務) | 88.4% | 與領先群並列 |
關鍵指標是 GDPval-AA v2,這是 Artificial Analysis 用來衡量「真實世界知識工作代理」的基準。Grok 4.6 在這個面向幾乎追上 Claude Opus 5,顯示它在企業級知識工作代理(例如分析報告、文件處理、研究整理)的可用性大幅提升。
為什麼這件事重要
Grok 4.6 不是技術突破,而是 商業定位突破。
xAI 在這次發表中做了一件 frontier 模型廠商幾乎不做的事:在 intelligence 大幅進步的同時,把 API 定價維持與上一代完全相同。Grok 4.6 維持 $2 / $6(每百萬 input/output tokens),對比 Claude Opus 5 的 $5 / $25 與 GPT-5.6 Sol 的 $5 / $30,輸出價格便宜了 60% 以上。
這個價差對 reasoning-heavy 工作負載(也就是 frontier 模型真正會被使用的場景)影響最大。Artificial Analysis 實測 Grok 4.6 的每任務成本是 $0.84,與 Kimi K3 持平,但 intelligence 略高,正式進入 Intelligence vs. Cost per Task 的 Pareto frontier。
長時程代理工作更是壓倒性:
- Grok 4.6:平均 53 輪、0.5B input tokens 完成 AA-Briefcase 任務
- Claude Opus 5 (max):平均 103 輪、2.0B input tokens
4 倍的 token 效率差異,加上原本就便宜的單價,讓 Grok 4.6 在 long-horizon agentic knowledge work 的實際帳單上,可能只有 Opus 5 的八分之一。
對企業採購而言,這代表「用 GPT-5.6 Sol 等級的 intelligence 但只付 Kimi K3 等級的錢」第一次成為現實選項。對 Cursor、OpenRouter、Vercel、Cloudflare 等下游通路來說,這也直接改寫他們的 model routing 策略 — 預設路由到 Grok 4.6 的誘因非常高。
Siami 觀點:定位矛盾與被低估的贏家
這次發表最有意思的不是分數,而是 xAI 對 Grok 4.6 的定位說辭與實際 benchmark 形狀不一致。
xAI 在官方發文中把 Grok 4.6 主打為「agentic coding」升級,但 eesel.ai 的 Alicia Kirana Utomo 仔細看 benchmark 表後指出:
- 贏的項目:GDPVal-AA、AA-Briefcase、Harvey LAB(都是 knowledge work / 長時程分析)
- 輸的項目:DeepSWE(-7.1)、Terminal-Bench(-8.6)
標題說是 coding 升級,實際數據卻顯示這是一次 knowledge work 升級。
這個矛盾有兩種解讀。第一,xAI 的 marketing 部門跟 benchmark 團隊不同步,這在快速迭代的小廠很常見。第二,xAI 真的相信 long-running agent 是未來 — Grok 4.6 的訓練重點確實放在多輪工具使用與長 context 管理上,DeepSWE 這類單題 coding 評測反而不是重點。
如果是第二種,Grok 4.6 真正的客戶不是「寫程式的人」,而是 「想把研究、文件、報告工作外包給 AI agent 的企業」 — 這個市場比純 coding 大得多,而且 Anthropic 目前在這個區段幾乎沒有對手。
質疑與待觀察的三個點
-
官方文件還沒更新:Hacker News 上多位用戶反映,xAI 官方 API 文件仍標示 Grok 4.5 為最新旗艦。雖然 Grok 4.6 已可在 Cursor、OpenRouter 等通路呼叫,但走 xAI 官方 API console 的開發者還看不到版本資訊,這對企業採購流程是個麻煩。
-
沒有新 pre-train:Grok 4.6 沿用與 4.5 相同的 1.5T V9 foundation,所有進步都來自 SFT 與 RL 改進。這是效率表現,但也是天花板 — 在不擴大模型規模的前提下,SFT/RL 的紅利很快會吃光。Musk 已預告 Grok 4.7 會升級到 2.1T 參數,預計 9 月初釋出。
-
RL 調校的政治爭議未解:HN 上不少用戶明確表示「不管多便宜都不會用 xAI 模型」,理由是 Musk 對 RL 方向的干預。這個社群信任問題不會靠 benchmark 數字解決。
延伸資源
- 完整評測報告:Grok 4.6 benchmarks and analysis — Artificial Analysis
- 模型詳細數據:Grok 4.6 model page — Artificial Analysis
- 評論分析:Grok 4.6 review — eesel.ai
- 售價與通路:Grok 4.6 Price, Benchmarks, 500K Context — Kingy AI
- HN 討論串:SpaceXAI’s Grok 4.6 Scores 61 — Hacker News
編按:本文綜合整理自 Artificial Analysis、eesel.ai、Hacker News 討論串、xAI 官方 X 帳號、Kingy AI 與 Eigent.ai 的同步評測,並加入 Siami 編輯部觀點與分析。Siami 不保證所列 benchmark 數字在未來不會被 xAI 官方版本更動,請以原始來源為準。
網友熱門留言 (5)