← 返回 Siami 首頁

Reflection AI 發表 Beam:501B 參數開源權重模型,要用 1/4 算力對標中國頂級開源模型

▲ 369 💬 110
Reflection AI 發表 Beam:501B 參數開源權重模型,要用 1/4 算力對標中國頂級開源模型

編按:本文綜合整理自 Reflection 官方部落格、TechCrunch 報導 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

Nvidia 投資、總部位於布魯克林的 Reflection AI 在 10 月 5 日正式推出旗下第一個開源權重(open-weight)模型 Beam。Beam 採用稀疏 Mixture-of-Experts(MoE)架構,總參數 501B、每次推論激活 23B,主打編碼(coding)、推理(reasoning)與代理任務(agentic workloads)。

模型定位與技術規格

Beam 並不是要追求最大的模型,而是要在 推論成本 上跟現有開源模型競爭。Reflection 在官方部落格中明確把比較對手設定為 GLM 5.2 與 Qwen 3.8-Max 等中國大型開源模型:

  • 總參數 501B/激活 23B:比 GLM 5.2 的全參數小,但比 DeepSeek V4.1 Flash 的 active 參數(8B prefill / 16B decode)大
  • 預訓練資料:23.8 兆 tokens,混合公開網路與授權資料集
  • 強化學習規模:在 10,560 張 NVIDIA GB300 GPU 上跑了 4 週,產出 1 億次 rollout
  • 推論效率:官方宣稱在推理基準上比同級模型 省 3 到 4 倍算力

官方說法:「Beam 在編碼與代理任務上追平甚至超越 GLM 5.2,並逼近 Qwen 3.8-Max,但在單純的 raw capability 上仍略遜於 Kimi K3。真正的賣點是 在相同能力下,運算成本壓到最低。」


為什麼這件事重要

開源權重模型戰場在 2026 年已經從「誰參數多」轉向「誰能用更少算力提供同等能力」。這個轉變背後有三層意義:

  1. 企業部署成本定生死。能跑在單張 H200 上的 23B active,比需要 8 張 H100 集群的 70B 模型更貼近中小型企業的現實預算。Beam 把 active 控制在 23B,目的就是讓一台伺服器就能跑。
  2. 西方陣營 vs 中國開源路線的算力戰。DeepSeek、GLM、Kimi 都走「小 active + 強 RL」路線,美國開源陣營如果不跟進,就只能在 API 市場被綁死。Reflection 拿到 Nvidia 投資、又簽下 SpaceX 算力合約,正是為了把這個成本曲線壓下來。
  3. 「開源」定義的模糊地帶。Apache 2.0 計畫在本月稍後釋出權重,但目前「open-weight」≠「完全開源」。Reflection 還沒公開訓練資料集、訓練食譜與 RL 環境,這跟 DeepSeek 的完整技術報告策略不同。

數據解讀與質疑

官方數字很漂亮,但 Hacker News 討論串的前幾則留言都對 Beam 提出質疑:

  • 每瓦效能被質疑。@onlyrealcuzzo 直接說「比 DeepSeek v4.1 Flash 更大、更貴、每一項指標都更差」,點出 501B 總參數 + 23B active 的設計組合在算力支出上不划算。
  • 西方開源模型整體落後。@NorwegianDude 認為 Beam 證明「更大卻更差」的西方開源問題還沒解,Google Gemma 仍是少數例外。
  • 歷史誠信問題。@algoth1 重提 Reflection 70B 當年被抓到「底層其實是 Claude」的事件,質疑這次號稱自研的 Beam 是否同樣是 API 包裝。Reflection 至今未公開 postmortem。
  • 展示效果的偏頗。@Ariarule 指出官方挑選的展示題目(X 上的陸地或水拼圖)雖然炫,但無法排除是 cherry-pick 的最佳案例。

對企業用戶而言,真正的問題不是 Beam 跑分多強,而是 Reflection 這家公司能不能撐過 18 個月、把權重真的開出來。Apache 2.0 承諾與實際釋出之間的落差,才是這次發表最大的風險。


時程與下一步

  • 2026 年 10 月初:官方部落格發表 Beam,本篇新聞來源
  • 2026 年 10 月稍後:釋出模型權重、技術報告、模型卡、開發者工具
  • 目前:紅隊測試與外部評測進行中,可在 Reflection 官網註冊取得早期存取權
  • 長期目標:挑戰中國開源模型在企業部署的成本優勢,同時拉抬西方開源生態

編按:本文綜合整理自 Reflection 官方部落格、TechCrunch 報導 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (5)

#1 Hacker News @wren6991 0
把它跟同級的 DeepSeek V4.1 Flash 對比一下:DS V4.1F 是 552B 總參數、預填 8B、解碼 16B;Beam 是 501B 總參數、預填與解碼都是 23B。Beam 的 active 參數明顯比較大。
#2 Hacker News @onlyrealcuzzo 0
看起來比 DeepSeek v4.1 Flash 更大、運算更貴、而且每一項量測指標都比較差。我是不是漏看了什麼?
#3 Hacker News @NorwegianDude 0
更大卻還比現有更小的中國開源模型差?開源權重模型雖然好,但西方模型看起來遠遠落後中國。Google 倒是做得不錯。
#4 Hacker News @Ariarule 0
很高興看到更多開源權重模型,但第二張展示圖的說明讓我看了兩次:他們重現了 X 上爆紅的『陸地或水』拼圖題,要 Beam 在 180×90 的網格上生成 16,200 個點…
#5 Hacker News @algoth1 0
這個版本是不是又跟 Reflection 70B 一樣,骨子裡其實在呼叫 Claude?我記得他們當年還寫了一個 regex 把『Claude』字樣從輸出裡清掉,然後說會公開完整 postmortem,結果從此沒有下文。