編按:本文綜合整理自 Reflection 官方部落格、TechCrunch 報導 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
Nvidia 投資、總部位於布魯克林的 Reflection AI 在 10 月 5 日正式推出旗下第一個開源權重(open-weight)模型 Beam。Beam 採用稀疏 Mixture-of-Experts(MoE)架構,總參數 501B、每次推論激活 23B,主打編碼(coding)、推理(reasoning)與代理任務(agentic workloads)。
模型定位與技術規格
Beam 並不是要追求最大的模型,而是要在 推論成本 上跟現有開源模型競爭。Reflection 在官方部落格中明確把比較對手設定為 GLM 5.2 與 Qwen 3.8-Max 等中國大型開源模型:
- 總參數 501B/激活 23B:比 GLM 5.2 的全參數小,但比 DeepSeek V4.1 Flash 的 active 參數(8B prefill / 16B decode)大
- 預訓練資料:23.8 兆 tokens,混合公開網路與授權資料集
- 強化學習規模:在 10,560 張 NVIDIA GB300 GPU 上跑了 4 週,產出 1 億次 rollout
- 推論效率:官方宣稱在推理基準上比同級模型 省 3 到 4 倍算力
官方說法:「Beam 在編碼與代理任務上追平甚至超越 GLM 5.2,並逼近 Qwen 3.8-Max,但在單純的 raw capability 上仍略遜於 Kimi K3。真正的賣點是 在相同能力下,運算成本壓到最低。」
為什麼這件事重要
開源權重模型戰場在 2026 年已經從「誰參數多」轉向「誰能用更少算力提供同等能力」。這個轉變背後有三層意義:
- 企業部署成本定生死。能跑在單張 H200 上的 23B active,比需要 8 張 H100 集群的 70B 模型更貼近中小型企業的現實預算。Beam 把 active 控制在 23B,目的就是讓一台伺服器就能跑。
- 西方陣營 vs 中國開源路線的算力戰。DeepSeek、GLM、Kimi 都走「小 active + 強 RL」路線,美國開源陣營如果不跟進,就只能在 API 市場被綁死。Reflection 拿到 Nvidia 投資、又簽下 SpaceX 算力合約,正是為了把這個成本曲線壓下來。
- 「開源」定義的模糊地帶。Apache 2.0 計畫在本月稍後釋出權重,但目前「open-weight」≠「完全開源」。Reflection 還沒公開訓練資料集、訓練食譜與 RL 環境,這跟 DeepSeek 的完整技術報告策略不同。
數據解讀與質疑
官方數字很漂亮,但 Hacker News 討論串的前幾則留言都對 Beam 提出質疑:
- 每瓦效能被質疑。@onlyrealcuzzo 直接說「比 DeepSeek v4.1 Flash 更大、更貴、每一項指標都更差」,點出 501B 總參數 + 23B active 的設計組合在算力支出上不划算。
- 西方開源模型整體落後。@NorwegianDude 認為 Beam 證明「更大卻更差」的西方開源問題還沒解,Google Gemma 仍是少數例外。
- 歷史誠信問題。@algoth1 重提 Reflection 70B 當年被抓到「底層其實是 Claude」的事件,質疑這次號稱自研的 Beam 是否同樣是 API 包裝。Reflection 至今未公開 postmortem。
- 展示效果的偏頗。@Ariarule 指出官方挑選的展示題目(X 上的陸地或水拼圖)雖然炫,但無法排除是 cherry-pick 的最佳案例。
對企業用戶而言,真正的問題不是 Beam 跑分多強,而是 Reflection 這家公司能不能撐過 18 個月、把權重真的開出來。Apache 2.0 承諾與實際釋出之間的落差,才是這次發表最大的風險。
時程與下一步
- 2026 年 10 月初:官方部落格發表 Beam,本篇新聞來源
- 2026 年 10 月稍後:釋出模型權重、技術報告、模型卡、開發者工具
- 目前:紅隊測試與外部評測進行中,可在 Reflection 官網註冊取得早期存取權
- 長期目標:挑戰中國開源模型在企業部署的成本優勢,同時拉抬西方開源生態
編按:本文綜合整理自 Reflection 官方部落格、TechCrunch 報導 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)