← 返回 Siami 首頁

xAI 推出 Grok 4.7:定價不變、推理更長、CursorBench 衝到 46.3%

▲ 434 💬 354
xAI 推出 Grok 4.7:定價不變、推理更長、CursorBench 衝到 46.3%

編按:本文綜合整理自 SpaceXAI 官方公告Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

xAI 於 9 月 21 日正式發布 Grok 4.7,這是該公司目前最強的編碼與知識工作模型。官方說法強調「同樣價格、同樣速度,但能力明顯提升」,目標是把同級距競爭對手擠出開發者首選名單。


官方公告的核心訊息

Grok 4.7 的定位是「為長時間任務而生」。xAI 在官方部落格指出,這一代使用了比 4.6 更大的基礎模型,並透過更長的強化學習訓練,把重心放在「需要花好幾個小時才能完成」的題目。

官方也公布一張完整的價格與效能對照表:

模型輸入價格(每百萬 tokens)輸出價格(每百萬 tokens)CursorBench 4.0
Grok 4.7 xHigh$2$646.3%
Grok 4.6 High$2$640.4%
GPT-5.6 Sol Max$4$2041.7%
Fable 5.1 Max$10$5051.8%

從這張表可以讀出一個關鍵訊息:xAI 沒有漲價,但把 CursorBench 4.0 的成績從 40.4% 拉到 46.3%,逼近 Fable 5.1 Max 的 51.8%。在「每美元能買到的能力」這條軸線上,Grok 4.7 已經把 GPT-5.6 Sol 與 Sonnet 5 都擠到後段班。


升級幅度:哪些基準真的進步?

官方釋出的數據橫跨七個基準,這裡挑出三個最具代表性的:

  • CursorBench 4.0(長時間編碼):40.4% → 46.3%,提升 5.9 個百分點
  • EEBench(電機工程):53.0% → 64.0%,提升 11 個百分點,是這次進步幅度最大的項目
  • Harvey Legal Agent Benchmark(法律代理):15.8% → 19.6%,雖然仍是同級距末段班,但幾乎是 GPT-5.6 Sol 的 8 倍

值得注意的是 AA Briefcase v1.1 這個「長時間辦公室任務」基準,Grok 4.7 拿到 1657 分,比 Fable 5.1 Max 的 1678 分只差 21 分,幾乎打平。


為什麼這件事重要

Grok 4.7 的定價策略,是這一波旗艦模型戰爭裡最具侵略性的一次。在 GPT-5.6 Sol、Fable 5.1、Claude Sonnet 5 這些同級距對手面前,xAI 選擇「不漲價但把效能往上拉」,等於是用毛利換市占。

這個決策背後的脈絡很清楚:xAI 在 4.5、4.6 兩代都主打「比對手便宜」,但開發者社群最在意的是「會不會踩雷」。如果 4.7 在真實工作流上沒有大躍進,光靠價格是守不住 Cursor 預設模型的位子的。從這次公布的基準來看,xAI 顯然押對了籌碼。

另一個值得注意的點是「Grok Build」這個新介面。官方公告把 Grok 4.7 的取得路徑壓在最上面,等於宣告 xAI 不再只是 API 供應商,而是要直接搶 Cursor、Windsurf 的開發者工作流入口。


數據解讀:基準漂亮,但「真實工作流」還沒驗證

官方公布的基準數字雖然漂亮,但 Hacker News 上已經有開發者質疑「這些基準有沒有代表性」。

需要警覺的三件事:

  1. DeepSWE v1.1 高強度設定:Grok 4.7 在這個基準拿到 71.0%,但官方特別標註「high effort」,意思是要花更多推理時間才能達到。一般使用者用預設模式可能拿不到這個分數。
  2. GDPval Elo 評分:Grok 4.7 xHigh 拿到 1695,比 Fable 5.1 Max 的 1735 還低 40 分。這代表在「專業知識工作」的整體排名上,仍是 Fable 5.1 領先。
  3. 延期將近兩週:Hacker News 留言指出,xAI 把發布日從 9 月 12 日延到 9 月 21 日,剛好卡在 Anthropic 據傳將發布 Opus 5.5 的前一天。這個時機選擇本身,就是一種「不想被比較」的訊號。

安全與資安:xAI 同步更新了防禦機制

Grok 4.7 採用全新的 safeguard 棧,在拒答與越獄抵抗測試中都是 xAI 內部最強的版本。在生物安全方面,模型在 LatchBio 的基準上拿到 62.4% 的最高分;在資安方面,HackerBench v0.3 只讓 3.3% 的高風險雙重用途提示通過,但對合法的資安工作幾乎不會誤擋。

xAI 也開始針對資安研究夥伴提供 Grok 4.7 的紅隊能力,雖然是邀請制,但代表 xAI 已經把「資安紅隊」當成正式的合作場景。


定價與可用性

  • API 價格:輸入 $2 / 百萬 tokens、輸出 $6 / 百萬 tokens,與 Grok 4.6 完全相同
  • 快速版:輸出速度加倍,價格也加倍
  • 取得管道:今日起在 Cursor、Grok Build 上線;亦可透過 Grok API 與第三方編碼工具呼叫

官方強調「這是目前為止在 CursorBench 4.0 上性價比最高的模型」。對開發者來說,最直接的問題是:要不要從 4.6 升級?答案取決於你的工作流是否重度依賴長時間編碼與專業文件撰寫。如果是,這次升級值得;如果只是寫短腳本,4.6 的價格已經夠低了。

網友熱門留言 (5)

#1 Hacker News ▲ 412
Apparently Grok 4.7 has 40% more weights than Grok 4.6, but the price ($6 output token, $2 input) is the same. Given that the decrease in their margin and the fact they delayed the release of Grok 4.7 almost two weeks past the original date, xAI must not have been happy with the results for 4.7.
#2 Hacker News ▲ 358
My favorite part of the new Groks has been how they speak in plain english. I simply cannot stand Claudish. Grok has its own feel too. It's not as bad as Claude, but one of the things that bugs me is that it is far too terse.
#3 Hacker News ▲ 287
I wonder how much of this is due to reliance on Twitter data. Or even just RLHF from humans that have a preference for Twitter style information.
#4 Hacker News ▲ 231
It's frustrating that we can't see the 'thinking' - it's like we only have access to half the conversation.
#5 Hacker News ▲ 198
FYI a quick fix for claudish is to ask for the response to be in ASD-STE100 (Simple Technical English). Then it is far more readable.