← 返回 Siami 首頁

Grok 4.6 正式發布:價格智商比稱霸前沿,知識工作奪冠但編碼落後

▲ 279 💬 292
Grok 4.6 正式發布:價格智商比稱霸前沿,知識工作奪冠但編碼落後

xAI 於 2026 年 8 月 12 日發布 Grok 4.6 模型,主打長時程代理(long-running agents)與更具野心的互動、視覺生成能力。本文綜合整理自 xAI 官方公告、eesel.ai 獨立評測、Artificial Analysis 基準報告、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。


Grok 4.6 的定位

xAI 強調 Grok 4.6 是 Grok 4.5 的延伸版本,核心差異在於「能夠持續處理多步驟複雜任務」。無論是研究陌生領域、分析資訊、跨整個程式碼庫工作,或把一個模糊的點子轉化成可運作的應用程式與成品,Grok 4.6 都宣稱能在多輪來回中維持專注。

Grok 4.6 在多項代理編碼(agentic coding)與知識工作基準測試中達到前沿水平,在 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 並列,分數為 61,僅落後 Claude Opus 5 兩分(62 分),但價格更具競爭力。

這個分數組合讓 Grok 4.6 在「價格智商比」這項指標上成為當前最划算的前沿模型之一。xAI 給出的官方定價是每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,快速版本(fast variant)價格為雙倍。對照 GPT-5.6 Sol 的 5 美元 / 30 美元定價,差距相當可觀。


訓練細節:4.5 教 4.6

這次 xAI 把訓練過程寫得比平常詳細。重點有三:

  1. 更長的補充訓練階段:Grok 4.6 經歷了比 4.5 更久的補充訓練,使用策展過的模型生成資料(涵蓋推理與進階技術概念)、高品質工程資料,以及改良過的優化器與訓練配方。
  2. 舊模型教新模型:xAI 用 Grok 4.5 本身重新生成 SFT 軌跡(trajectories),涵蓋推理、代理框架、STEM、軟體工程與知識工作等領域,再用模型檢查機制過濾掉問題樣本。
  3. 代理 RL 階段:在廣泛的代理強化學習任務上訓練,包括知識工作、一般編碼,以及特定領域環境(核心最佳化、網頁開發、電腦輔助設計)。

eesel.ai 的評論指出,這代表 xAI 採用的是「後訓練(post-training)強化」路線,而不是從頭預訓練一個新模型。這種策略的優勢是迭代速度快,劣勢是存在天花板——沒有新預訓練資料,效能提升會受限於舊基礎模型的容量。


基準測試成績

xAI 公布的官方基準測試表(節錄):

基準測試Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%

重點觀察:

  • 知識工作領域奪冠:GDPVal-AA v2、AA-Briefcase、Harvey LAB 三項都是表中最高分。
  • 編碼領域落後:DeepSWE 輸 GPT-5.6 Sol 7.1 分,Terminal-Bench v3.0 輸 8.6 分。
  • 相對 Grok 4.5:Intelligence Index 提升 5 分(56 → 61),5 週內的分代級跳躍。

Artificial Analysis 額外測量了 Grok 4.6 的「非幻覺率」,結果為 65.7%。這個數字代表每三次推論中約有一次會出現幻覺,這對需要嚴格事實查核的企業應用是個明顯警訊。


為什麼這件事重要

Grok 4.6 的發布在當前前沿模型競爭中有三個值得關注的意義:

第一,價格戰正式進入前沿層。過去要達到 Intelligence Index 60+ 的分數,使用者必須付 GPT-5.6 Sol 或 Claude Opus 5 等級的高價。Grok 4.6 用不到一半的價格(甚至不到三分之一)達到 61 分。這會給其他模型供應商帶來明確的降價壓力——OpenAI 與 Anthropic 很難再維持目前的價格區間而不被質疑「值不值」。

第二,xAI 證明了「後訓練強化」路線的天花板與機會。從 4.5 到 4.6 的 5 分提升發生在 5 週內,且不需要新的預訓練。這種迭代速度是 Anthropic 與 OpenAI 較難追上的,因為他們每次大版本需要完整預訓練循環。但天花板也很明顯——當 4.6 的核心仍然是 1.5T 參數的 V9 基礎模型時,後續版本的提升空間會越來越窄,除非 xAI 在未來幾個月啟動新的預訓練。

第三,知識工作 vs 編碼的權重正在重新分配。這次發布明顯把 Grok 4.6 定位成「代理編碼」模型,但基準測試結果顯示它在知識工作(GDPVal-AA、AA-Briefcase、Harvey LAB)表現更佳,在編碼(DeepSWE、Terminal-Bench)反而落後。這對正在評估要用哪個模型處理哪種任務的企業 IT 部門來說,是個重要的選型參考。


數據解讀與質疑

官方公告裡有些數字值得進一步檢視:

  1. 「前沿水平」的定義:xAI 強調 Grok 4.6 達到「前沿水平」,但這個詞在基準測試表裡只對應到 Intelligence Index 61 分。Claude Opus 5(62 分)與 Fable 5 Max(62 分)仍然領先,Grok 4.6 是「並列第三」。在行銷語言中容易被放大成「並列第一」。

  2. 基準測試的選擇:xAI 公布的 10 項基準測試中,3 項知識工作項目 Grok 4.6 奪冠,但 5 項編碼類項目 GPT-5.6 Sol 奪冠。如果把 Anthropic 的 SWE-bench、DeepMind 的 FrontierMath 等更廣泛的基準加進來比較,排名可能會不同。

  3. 非幻覺率 65.7% 的意涵:Artificial Analysis 的測量顯示,每三次中約有一次幻覺。對於寫程式碼來說,這個比例可能可以接受(編譯器會抓錯);但對於法律 Harvey LAB、知識工作 AA-Briefcase 等場景,這個比例可能會造成嚴重的後果。

  4. 「首次推出就給 2x 額度」的訊號:xAI 給 Grok Build 與 Cursor 用戶首週雙倍額度,這顯示他們急於搶佔開發者市場的工作流。但這種促銷策略的長期可持續性需要觀察——如果定價持續上漲,使用者可能會回流到 OpenAI 或 Anthropic。


可用性與定價

  • 發布日期:2026 年 8 月 12 日
  • 可用平台:Grok Build、Cursor、API、OpenRouter、Vercel、Cloudflare
  • 定價:$2 / 1M input tokens、$6 / 1M output tokens(快速版兩倍價格)
  • 首週優惠:Grok Build 與 Cursor 用戶 2x 額度
  • 速率限制:150 RPS、50M tokens/min、跨 us-east-1 / us-west-2
  • 上下文窗口:500,000 tokens
  • 模態:文字+圖像輸入,文字輸出,支援 function calling、結構化輸出、推理

開發者社區反應

Hacker News 上關於 Grok 4.6 的討論串(連結)呈現兩極化的看法:

「Cursor, since Grok 4.5, has had an incredible deal for frontier level models, their subscription now goes way further than OpenAI or Anthropic.」 — Hacker News 用戶 wertyk

「Grok is 3x+ faster than Claude and I can’t tell the diff in engineering work quality. As an engineer, speed is important to me.」 — 工程師在 HN 上的回饋

eesel.ai 的獨立評測則點出一個較少人提及的事實:

「This is a knowledge-work model that got announced as a coding model.」 — eesel.ai

這句話精準捕捉了 Grok 4.6 的定位矛盾——行銷說它是「代理編碼」模型,基準測試卻顯示它更擅長知識工作。


後續觀察重點

  1. Arena 排行榜成績:發布後一週會是 LMArena 盲測排名的關鍵時刻,這是目前最難被行銷話術操控的公開比較。
  2. 企業採用速度:Cursor 與 Grok Build 的首週雙倍額度會吸引多少企業用戶,會是判斷這次定價策略成敗的指標。
  3. Grok 4.7 與新預訓練:Elon Musk 之前提過 Grok 4.7 預計在 4.6 後幾週推出,且會啟動新一輪預訓練循環。如果 4.7 能突破「後訓練天花板」,xAI 的迭代節奏會更具威脅性。

編按:本文綜合整理自 xAI 官方公告、eesel.ai 獨立評測、Artificial Analysis Intelligence Index v4.1 報告、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。xAI 為一手原始來源,符合白名單;eesel.ai 為第三方獨立評測,提供官方公告未涵蓋的批判視角。

網友熱門留言 (3)

#1 Hacker News 用戶 ▲ 41
Cursor 自從 Grok 4.5 起就給了前沿模型令人難以置信的優惠,訂閱額度比 OpenAI 或 Anthropic 多很多。
#2 Hacker News 工程師 ▲ 28
Grok 比 Claude 快 3 倍以上,我在工程工作品質上分不出差別。對工程師來說速度很重要。
#3 eesel.ai 獨立評測 ▲ 15
這是一個知識工作模型,卻被當作編碼模型發布。