編按:本文綜合整理自 Financial Times 原始報導、Ars Technica 轉載、Yahoo Finance / Reuters 整合、VentureBeat 對 Mythos 5 的基準測試分析、The Next Web 對 Qwen3.8-Max 的報導、TechNode 對 Seed 團隊的介紹,並加入 Siami 編輯部觀點與分析。
事件:字節跳動正在訓練 10 兆參數 AI 模型
英國《金融時報》8 月 7 日引述三位知情人士報導,TikTok 母公司字節跳動(ByteDance)正進入訓練一個最高可能達到 10 兆(10 trillion)參數的 AI 大語言模型的早期階段。這個規模是中國目前已釋出最大模型——月之暗面(Moonshot)Kimi K3 的 3 倍以上,也比 Anthropic 最先進的 Mythos 5(業界估計約 8 兆參數)更高。
「字節跳動的管理層相信,只有獨立訓練、拒絕依賴模型蒸餾(distillation)的路線,才有機會打造出真正超越對手的模型。」── 知情人士對《金融時報》表示
目前模型仍在預訓練(pre-training)階段,依業界慣例需要 3 到 6 個月,之後才會進入微調與釋出流程。最終的參數規模尚未定案,但「10 兆」這個數字本身已經對外釋出明確訊號:中國 AI 公司不再滿足於「追上美國」,而是準備在最大規模的競賽中正面對決。
規模對照:參數量已進入「兆」級新戰場
把這場較量放到 2026 年的整體脈絡來看:
- 字節跳動 新模型:~10 兆參數(早期預訓練中)
- Anthropic Mythos 5:~8 兆參數(業界估計,未公開)
- Anthropic Fable 5:~5 兆參數(Mythos 5 的公開版本,加裝安全防護)
- 月之暗面 Kimi K3:2.8 兆參數(2026 年 7 月釋出,目前中國最大公開模型)
- 阿里 Qwen3.8-Max:2.4 兆參數(2026 年 8 月 3 日釋出)
Mythos 5 是 Anthropic 目前最強的模型,6 月因為資安疑慮被短暫禁用,目前只開放給「經審核的特定組織」使用。Fable 5 則是 Mythos 5 的「公開版」,加上資安、生物、化學、蒸餾等多層安全過濾。在 VentureBeat 整理的基準測試中,Fable 5 在 SWE-Bench Pro 拿到 80.3% 的頂級成績,比 Claude Opus 4.8 的 69.2% 高出一截。
中國這邊的進度同樣驚人。月之暗面的 Kimi K3 在基準測試上已經「跟 Claude 和 GPT 系列互有領先」;阿里 8 月 3 日丟出的 Qwen3.8-Max 雖規模略小,但單次推理只需啟動 950 億參數(MoE 架構),實際運營成本遠低於稠密(Dense)的 1 兆級對手。字節跳動此刻選在 10 兆級參賽,擺明是不計成本要搶「全球最大模型」的頭銜。
為什麼這件事重要
這不只是又一個「中國公司發表更大模型」的技術新聞,而是三個層面同時被翻轉:
第一,中國 AI 路線正式跟「依賴美國開源模型」分道揚鑣。 知情人士明確指出,字節跳動 Seed 團隊已經超過一年不走「模型蒸餾」路線——也就是不再透過訓練小模型去模仿西方大模型的輸出。創辦人張一鳴兩週前在內部會議上對 Seed 團隊重申:「短期落後沒關係,長期目標是世界級的模型能力。」這個表態直接對應到 2026 年 6 月 IT 之家報導中張一鳴「就算模型暫時落後,也不依賴 AI 蒸餾」的內部死命令。
第二,Seed 團隊的規模已經是業界頂級。 前 Google DeepMind 副總裁吳永輝帶領的 Seed 團隊,目前在中國與海外合計約 2,000 名成員,涵蓋核心研究員、基礎設施工程師、資料標註團隊與翻譯人員。這個人數字已經接近 OpenAI 早期全盛時期的規模。在「人才即算力」的時代,這是字節跳動敢喊出 10 兆的底氣。
第三,這是一場「算力即國力」的押注。 訓練 10 兆參數的稠密(Dense)模型,業界估算需要數十萬張 H100 等級 GPU 連續運轉 3 到 6 個月,光是電費與硬體折舊就會突破 10 億美元。字節跳動旗下的**火山引擎(Volcano Engine)**已經是中國最大的 AI 雲服務之一,2025 年 12 月更取得 2026 年央視春晚的「獨家 AI 雲夥伴」身份。換句話說,字節跳動是中國少數能同時負擔「自研晶片意圖+自建資料中心+萬人級研發團隊」三條線的公司,這場競賽不是所有中國 AI 公司都能跟。
數據解讀:參數量不是全部,但已是產業風向球
業界對「參數越大越強」的論點一直有保留。參數量決定的是模型儲存資訊的容量上限,但實際能力還取決於訓練資料品質、訓練方法、推理時的啟動參數比例等。 這也是為什麼 Anthropic 與 OpenAI 不願公開模型規模的原因——他們不希望外界用「參數」當唯一指標。
但在 2026 年的市場氛圍中,參數量已經變成一種政治與商業訊號:
- 對中國客戶:月之暗面、阿里、字節跳動接連釋出 2.4 兆、2.8 兆、10 兆級模型,等於對中國企業客戶宣告「我們也能提供世界級算力」,把原本流向美國 API 的預算拉回國內。
- 對西方實驗室:字節跳動 10 兆的消息一出,外界已經在猜測 Anthropic 與 OpenAI 是否會加速釋出下一代旗艦。X 上的評論(@kimmonismus)直白地說:「這讓美國 AI 實驗室更不可能放慢腳步。」
- 對開源社群:如果字節跳動沿用 Seedance 2.5 的開放策略,10 兆級權重釋出後,整個開源 AI 的天花板會被瞬間拉高。@cryptopunk7213 的恐慌並非沒有道理:「如果中國真的開源這個等級的模型,後果不堪設想。」
但也要看到限制:Kimi K3 雖然 2.8 兆參數,每次推理只啟動 1,040 億參數;Qwen3.8-Max 是 950 億。這種 MoE(Mixture of Experts,混合專家)架構讓「總參數大」與「實際推理成本」可以脫鉤。字節跳動若走 MoE 路線,10 兆總參數不必然等於 10 兆的推理成本——但這需要等模型實際釋出後才能驗證。
質疑:10 兆參數的三大風險
把讚美放一邊,這場押注也伴隨明確風險:
- 訓練成本失控:6 月訓練一個 1 兆級稠密模型已被估算要 5 億美元以上,10 兆級若走稠密路線,預訓練階段單次成本就會突破 10 億美元。如果中途失敗需要重來,整個投資就化為泡沫。
- 資料與合規風險:字節跳動的 Doubao 在中國雖然有 3.24 億月活躍用戶(中國 AI 產品第一),但模型若要走向海外,會面臨與 TikTok 相同的地緣政治審查。Seedance 2.5 在好萊塢就因為版權爭議被迫限制——10 兆級模型若開放權重,引發的智財權反彈會更劇烈。
- 蒸餾禁令的雙面刃:拒絕蒸餾是長期路線,短期內會讓字節跳動的產品落地速度慢於對手。張一鳴自己也承認「短期落後沒關係」,但市場與股東的耐心終究有限——這也是為什麼 Seedance 2.5 採取「閉源核心+開放 demo」的折衷策略。
後續觀察重點
這場 10 兆參數軍備的下一步,可以從三個時間點觀察:
- 短期(1-2 個月):預訓練是否順利完成、是否傳出算力短缺或故障的消息。中國 AI 圈的內部會議常常在 X 上提前洩露,可持續關注 @kimmonismus 與 @cryptopunk7213 等業界 KOL。
- 中期(3-6 個月):模型是否進入微調階段、有無釋出 benchmark 預告。如果字節跳動真的想「超越 Mythos 5」,最直接的證據就是在 SWE-Bench Pro 或 GDPval-AA 上正面擊敗 Fable 5。
- 長期(6-12 個月):權重是否開源、價格策略(火山引擎對外 API 報價)、是否進入歐美市場。這三個變數會決定 10 兆級模型最終是「中國的內循環武器」還是「全球 AI 基礎設施」。
可以確定的是,2026 年的 AI 競賽已經不再是「誰能追上 GPT」的問題,而是「誰能定義下一個時代的天花板」。字節跳動這次出手,等於宣告中國正式加入「兆級俱樂部」的定義權之戰。
參考資料
- Financial Times:ByteDance trains massive AI model in bid to rival Anthropic
- Ars Technica:ByteDance trains massive AI model in bid to rival Anthropic
- Reuters / Yahoo Finance:ByteDance targets mega AI model that could match Mythos scale
- VentureBeat:Anthropic brings Mythos to the masses with Claude Fable 5
- VentureBeat:Moonshot AI releases Kimi K3, the largest open-source model ever
- The Next Web:Alibaba unveils Qwen3.8-Max
- TechNode:Former Google DeepMind VP joins ByteDance as Seed team research lead
- KrASIA:ByteDance sets four AI priorities for 2026
- Thursdai:July 2026 AI Releases (LongCat-2.0 1.6T, GPT-5.6)
網友熱門留言 (3)