編按:本文綜合整理自 SpaceXAI 官方公告、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
xAI 於 9 月 21 日正式發布 Grok 4.7,這是該公司目前最強的編碼與知識工作模型。官方說法強調「同樣價格、同樣速度,但能力明顯提升」,目標是把同級距競爭對手擠出開發者首選名單。
官方公告的核心訊息
Grok 4.7 的定位是「為長時間任務而生」。xAI 在官方部落格指出,這一代使用了比 4.6 更大的基礎模型,並透過更長的強化學習訓練,把重心放在「需要花好幾個小時才能完成」的題目。
官方也公布一張完整的價格與效能對照表:
| 模型 | 輸入價格(每百萬 tokens) | 輸出價格(每百萬 tokens) | CursorBench 4.0 |
|---|---|---|---|
| Grok 4.7 xHigh | $2 | $6 | 46.3% |
| Grok 4.6 High | $2 | $6 | 40.4% |
| GPT-5.6 Sol Max | $4 | $20 | 41.7% |
| Fable 5.1 Max | $10 | $50 | 51.8% |
從這張表可以讀出一個關鍵訊息:xAI 沒有漲價,但把 CursorBench 4.0 的成績從 40.4% 拉到 46.3%,逼近 Fable 5.1 Max 的 51.8%。在「每美元能買到的能力」這條軸線上,Grok 4.7 已經把 GPT-5.6 Sol 與 Sonnet 5 都擠到後段班。
升級幅度:哪些基準真的進步?
官方釋出的數據橫跨七個基準,這裡挑出三個最具代表性的:
- CursorBench 4.0(長時間編碼):40.4% → 46.3%,提升 5.9 個百分點
- EEBench(電機工程):53.0% → 64.0%,提升 11 個百分點,是這次進步幅度最大的項目
- Harvey Legal Agent Benchmark(法律代理):15.8% → 19.6%,雖然仍是同級距末段班,但幾乎是 GPT-5.6 Sol 的 8 倍
值得注意的是 AA Briefcase v1.1 這個「長時間辦公室任務」基準,Grok 4.7 拿到 1657 分,比 Fable 5.1 Max 的 1678 分只差 21 分,幾乎打平。
為什麼這件事重要
Grok 4.7 的定價策略,是這一波旗艦模型戰爭裡最具侵略性的一次。在 GPT-5.6 Sol、Fable 5.1、Claude Sonnet 5 這些同級距對手面前,xAI 選擇「不漲價但把效能往上拉」,等於是用毛利換市占。
這個決策背後的脈絡很清楚:xAI 在 4.5、4.6 兩代都主打「比對手便宜」,但開發者社群最在意的是「會不會踩雷」。如果 4.7 在真實工作流上沒有大躍進,光靠價格是守不住 Cursor 預設模型的位子的。從這次公布的基準來看,xAI 顯然押對了籌碼。
另一個值得注意的點是「Grok Build」這個新介面。官方公告把 Grok 4.7 的取得路徑壓在最上面,等於宣告 xAI 不再只是 API 供應商,而是要直接搶 Cursor、Windsurf 的開發者工作流入口。
數據解讀:基準漂亮,但「真實工作流」還沒驗證
官方公布的基準數字雖然漂亮,但 Hacker News 上已經有開發者質疑「這些基準有沒有代表性」。
需要警覺的三件事:
- DeepSWE v1.1 高強度設定:Grok 4.7 在這個基準拿到 71.0%,但官方特別標註「high effort」,意思是要花更多推理時間才能達到。一般使用者用預設模式可能拿不到這個分數。
- GDPval Elo 評分:Grok 4.7 xHigh 拿到 1695,比 Fable 5.1 Max 的 1735 還低 40 分。這代表在「專業知識工作」的整體排名上,仍是 Fable 5.1 領先。
- 延期將近兩週:Hacker News 留言指出,xAI 把發布日從 9 月 12 日延到 9 月 21 日,剛好卡在 Anthropic 據傳將發布 Opus 5.5 的前一天。這個時機選擇本身,就是一種「不想被比較」的訊號。
安全與資安:xAI 同步更新了防禦機制
Grok 4.7 採用全新的 safeguard 棧,在拒答與越獄抵抗測試中都是 xAI 內部最強的版本。在生物安全方面,模型在 LatchBio 的基準上拿到 62.4% 的最高分;在資安方面,HackerBench v0.3 只讓 3.3% 的高風險雙重用途提示通過,但對合法的資安工作幾乎不會誤擋。
xAI 也開始針對資安研究夥伴提供 Grok 4.7 的紅隊能力,雖然是邀請制,但代表 xAI 已經把「資安紅隊」當成正式的合作場景。
定價與可用性
- API 價格:輸入 $2 / 百萬 tokens、輸出 $6 / 百萬 tokens,與 Grok 4.6 完全相同
- 快速版:輸出速度加倍,價格也加倍
- 取得管道:今日起在 Cursor、Grok Build 上線;亦可透過 Grok API 與第三方編碼工具呼叫
官方強調「這是目前為止在 CursorBench 4.0 上性價比最高的模型」。對開發者來說,最直接的問題是:要不要從 4.6 升級?答案取決於你的工作流是否重度依賴長時間編碼與專業文件撰寫。如果是,這次升級值得;如果只是寫短腳本,4.6 的價格已經夠低了。
網友熱門留言 (5)