← 返回 Siami 首頁

字節跳動訓練 10 兆參數 AI 模型正面對決 Anthropic Mythos 中國算力軍備進入新階段

▲ 12 💬 71
字節跳動訓練 10 兆參數 AI 模型正面對決 Anthropic Mythos 中國算力軍備進入新階段

編按:本文綜合整理自 Financial Times 原始報導Ars Technica 轉載Yahoo Finance / Reuters 整合VentureBeat 對 Mythos 5 的基準測試分析The Next Web 對 Qwen3.8-Max 的報導TechNode 對 Seed 團隊的介紹,並加入 Siami 編輯部觀點與分析。

事件:字節跳動正在訓練 10 兆參數 AI 模型

英國《金融時報》8 月 7 日引述三位知情人士報導,TikTok 母公司字節跳動(ByteDance)正進入訓練一個最高可能達到 10 兆(10 trillion)參數的 AI 大語言模型的早期階段。這個規模是中國目前已釋出最大模型——月之暗面(Moonshot)Kimi K3 的 3 倍以上,也比 Anthropic 最先進的 Mythos 5(業界估計約 8 兆參數)更高。

「字節跳動的管理層相信,只有獨立訓練、拒絕依賴模型蒸餾(distillation)的路線,才有機會打造出真正超越對手的模型。」── 知情人士對《金融時報》表示

目前模型仍在預訓練(pre-training)階段,依業界慣例需要 3 到 6 個月,之後才會進入微調與釋出流程。最終的參數規模尚未定案,但「10 兆」這個數字本身已經對外釋出明確訊號:中國 AI 公司不再滿足於「追上美國」,而是準備在最大規模的競賽中正面對決。


規模對照:參數量已進入「兆」級新戰場

把這場較量放到 2026 年的整體脈絡來看:

  • 字節跳動 新模型:~10 兆參數(早期預訓練中)
  • Anthropic Mythos 5:~8 兆參數(業界估計,未公開)
  • Anthropic Fable 5:~5 兆參數(Mythos 5 的公開版本,加裝安全防護)
  • 月之暗面 Kimi K3:2.8 兆參數(2026 年 7 月釋出,目前中國最大公開模型)
  • 阿里 Qwen3.8-Max:2.4 兆參數(2026 年 8 月 3 日釋出)

Mythos 5 是 Anthropic 目前最強的模型,6 月因為資安疑慮被短暫禁用,目前只開放給「經審核的特定組織」使用。Fable 5 則是 Mythos 5 的「公開版」,加上資安、生物、化學、蒸餾等多層安全過濾。在 VentureBeat 整理的基準測試中,Fable 5 在 SWE-Bench Pro 拿到 80.3% 的頂級成績,比 Claude Opus 4.8 的 69.2% 高出一截。

中國這邊的進度同樣驚人。月之暗面的 Kimi K3 在基準測試上已經「跟 Claude 和 GPT 系列互有領先」;阿里 8 月 3 日丟出的 Qwen3.8-Max 雖規模略小,但單次推理只需啟動 950 億參數(MoE 架構),實際運營成本遠低於稠密(Dense)的 1 兆級對手。字節跳動此刻選在 10 兆級參賽,擺明是不計成本要搶「全球最大模型」的頭銜


為什麼這件事重要

這不只是又一個「中國公司發表更大模型」的技術新聞,而是三個層面同時被翻轉:

第一,中國 AI 路線正式跟「依賴美國開源模型」分道揚鑣。 知情人士明確指出,字節跳動 Seed 團隊已經超過一年不走「模型蒸餾」路線——也就是不再透過訓練小模型去模仿西方大模型的輸出。創辦人張一鳴兩週前在內部會議上對 Seed 團隊重申:「短期落後沒關係,長期目標是世界級的模型能力。」這個表態直接對應到 2026 年 6 月 IT 之家報導中張一鳴「就算模型暫時落後,也不依賴 AI 蒸餾」的內部死命令。

第二,Seed 團隊的規模已經是業界頂級。 前 Google DeepMind 副總裁吳永輝帶領的 Seed 團隊,目前在中國與海外合計約 2,000 名成員,涵蓋核心研究員、基礎設施工程師、資料標註團隊與翻譯人員。這個人數字已經接近 OpenAI 早期全盛時期的規模。在「人才即算力」的時代,這是字節跳動敢喊出 10 兆的底氣。

第三,這是一場「算力即國力」的押注。 訓練 10 兆參數的稠密(Dense)模型,業界估算需要數十萬張 H100 等級 GPU 連續運轉 3 到 6 個月,光是電費與硬體折舊就會突破 10 億美元。字節跳動旗下的**火山引擎(Volcano Engine)**已經是中國最大的 AI 雲服務之一,2025 年 12 月更取得 2026 年央視春晚的「獨家 AI 雲夥伴」身份。換句話說,字節跳動是中國少數能同時負擔「自研晶片意圖+自建資料中心+萬人級研發團隊」三條線的公司,這場競賽不是所有中國 AI 公司都能跟。


數據解讀:參數量不是全部,但已是產業風向球

業界對「參數越大越強」的論點一直有保留。參數量決定的是模型儲存資訊的容量上限,但實際能力還取決於訓練資料品質、訓練方法、推理時的啟動參數比例等。 這也是為什麼 Anthropic 與 OpenAI 不願公開模型規模的原因——他們不希望外界用「參數」當唯一指標。

但在 2026 年的市場氛圍中,參數量已經變成一種政治與商業訊號

  1. 對中國客戶:月之暗面、阿里、字節跳動接連釋出 2.4 兆、2.8 兆、10 兆級模型,等於對中國企業客戶宣告「我們也能提供世界級算力」,把原本流向美國 API 的預算拉回國內。
  2. 對西方實驗室:字節跳動 10 兆的消息一出,外界已經在猜測 Anthropic 與 OpenAI 是否會加速釋出下一代旗艦。X 上的評論(@kimmonismus)直白地說:「這讓美國 AI 實驗室更不可能放慢腳步。」
  3. 對開源社群:如果字節跳動沿用 Seedance 2.5 的開放策略,10 兆級權重釋出後,整個開源 AI 的天花板會被瞬間拉高。@cryptopunk7213 的恐慌並非沒有道理:「如果中國真的開源這個等級的模型,後果不堪設想。」

但也要看到限制:Kimi K3 雖然 2.8 兆參數,每次推理只啟動 1,040 億參數;Qwen3.8-Max 是 950 億。這種 MoE(Mixture of Experts,混合專家)架構讓「總參數大」與「實際推理成本」可以脫鉤。字節跳動若走 MoE 路線,10 兆總參數不必然等於 10 兆的推理成本——但這需要等模型實際釋出後才能驗證。


質疑:10 兆參數的三大風險

把讚美放一邊,這場押注也伴隨明確風險:

  1. 訓練成本失控:6 月訓練一個 1 兆級稠密模型已被估算要 5 億美元以上,10 兆級若走稠密路線,預訓練階段單次成本就會突破 10 億美元。如果中途失敗需要重來,整個投資就化為泡沫。
  2. 資料與合規風險:字節跳動的 Doubao 在中國雖然有 3.24 億月活躍用戶(中國 AI 產品第一),但模型若要走向海外,會面臨與 TikTok 相同的地緣政治審查。Seedance 2.5 在好萊塢就因為版權爭議被迫限制——10 兆級模型若開放權重,引發的智財權反彈會更劇烈。
  3. 蒸餾禁令的雙面刃:拒絕蒸餾是長期路線,短期內會讓字節跳動的產品落地速度慢於對手。張一鳴自己也承認「短期落後沒關係」,但市場與股東的耐心終究有限——這也是為什麼 Seedance 2.5 採取「閉源核心+開放 demo」的折衷策略。

後續觀察重點

這場 10 兆參數軍備的下一步,可以從三個時間點觀察:

  • 短期(1-2 個月):預訓練是否順利完成、是否傳出算力短缺或故障的消息。中國 AI 圈的內部會議常常在 X 上提前洩露,可持續關注 @kimmonismus 與 @cryptopunk7213 等業界 KOL。
  • 中期(3-6 個月):模型是否進入微調階段、有無釋出 benchmark 預告。如果字節跳動真的想「超越 Mythos 5」,最直接的證據就是在 SWE-Bench Pro 或 GDPval-AA 上正面擊敗 Fable 5。
  • 長期(6-12 個月):權重是否開源、價格策略(火山引擎對外 API 報價)、是否進入歐美市場。這三個變數會決定 10 兆級模型最終是「中國的內循環武器」還是「全球 AI 基礎設施」。

可以確定的是,2026 年的 AI 競賽已經不再是「誰能追上 GPT」的問題,而是「誰能定義下一個時代的天花板」。字節跳動這次出手,等於宣告中國正式加入「兆級俱樂部」的定義權之戰。


參考資料

網友熱門留言 (3)

#1 X 用戶 @kimmonismus ▲ 1840
多家可信消息來源同時確認,可以推測是真的——他們確實在訓練 10 兆參數的模型。這也讓美國 AI 實驗室更不可能放慢腳步。
#2 X 用戶 @Lentils80 ▲ 612
字節跳動的創辦人也反對蒸餾西方模型。看起來中國真的要全面擴張參數量級了。
#3 X 用戶 @cryptopunk7213 ▲ 387
10 兆參數已經跟 Mythos 同級了!如果中國真的開源這個等級的模型,後果不堪設想。