編按:本文綜合整理自 The Register 原稿、AMD 投資人關係新聞稿 與 Bloomberg 報導,並加入 Siami 編輯部觀點與分析。
AMD 週四(8 月 6 日)盤後宣布收購加拿大 AI 晶片新創公司 Taalas,這家成立僅兩年半、員工 25 人的多倫多團隊,正用「把模型權重直接蝕刻進矽晶片」的極端路線,挑戰 Nvidia 統治的 AI 推論市場。這是繼 2025 年 12 月 Nvidia 與 Groq 達成 200 億美元授權協議後,AI 推論晶片領域第二次重大整併。
一、把模型燒進晶片是什麼意思?
傳統 GPU 把模型權重放在 HBM 高頻寬記憶體,運行時反覆搬運;Taalas 的做法更激進——直接把 Llama 3.1 8B 的權重蝕刻成晶片上的金屬連線,搭配 SRAM 處理 KV 快取與 LoRA 適配器。這種架構被稱為 MSIC(Model-Specific Integrated Circuit,模型專用積體電路),本質上是「晶片即模型」。
HC1 的實測數據相當驚人:
- 推論速度:16,960 tokens/s(單用戶單晶片)
- 製程:TSMC 6nm,晶粒面積 815mm²,53 億個電晶體
- 對比當時 Nvidia GPU:快 48 倍;對比 Cerebras WSE-3:快 8.5 倍
Taalas 共同創辦人暨執行長 Ljubisa Bajic 接受 The Next Platform 採訪時表示,把模型蝕刻進晶片比訓練一個同等規模的前沿模型便宜 100 倍。
第二代 HC2 預計 2026 年夏季量產,目標把單晶片參數量推到 200 億。若用管線並行擴展到 1 兆參數模型,只需約 50 顆加速器;對照 Nvidia LPX 系統,相同規模需要數十顆 GPU 加 2,000 顆 Groq LPU。能耗與空間效率差距明顯。
二、AMD 的全堆疊推論棋局
AMD 並未揭露交易金額,但確認這是「完整收購」而非單純的人才併購。Taalas 技術將與 AMD 既有的 Helios 機櫃級解決方案、Instinct GPU、EPYC CPU、ROCm 軟體棧整合。AMD AI 事業部資深副總裁 Vamsi Boppana 在聲明中表示,這補強了 AMD 在快速成長的 AI 推論市場的長期路線圖。
從架構推論,AMD 很可能走「分離式部署」路線:
- Prompt 預處理(高運算需求):跑在 Instinct GPU
- Token 生成(低延遲、高吞吐量):跑在 Taalas 加速器
這跟 Nvidia 從 Groq 拿到的 LPU 技術定位類似,但 Taalas 的硬連線方法理論上能提供更高的成本效益。也可能採用「tick-tock」節奏:客戶先在 Instinct 上驗證模型,穩定後再遷移到 Taalas 晶片。
關鍵時程:
| 項目 | 內容 |
|---|---|
| 公告日 | 2026 年 8 月 6 日(美東收盤後) |
| 預定完成 | 2026 Q4(須通過監管核准) |
| HC1 當前狀態 | 已運轉,可於 chatjimmy.ai 公開試用 |
| HC2 量產 | 2026 年夏季 |
三、為什麼這件事重要
這筆交易標誌著 AI 硬體競爭從「訓練」轉向「推論」的結構性轉變。過去三年,整個產業把 GPU 當萬靈丹——同樣的 H100 既訓練 GPT-4 也跑 ChatGPT 推論。但隨著模型迭代週期壓到月等級、推論成本佔比飆升,「通用加速器」的成本結構開始鬆動。
AMD 押注 Taalas 的核心邏輯有三層:
- 速度領先的 Moat:Taalas 在單一模型推論上比 Nvidia Blackwell 快 45 倍(業界 KOL 估算),這不是小幅改進,是架構層面的代差。
- 與 Nvidia 的 Groq 交易對標:Nvidia 花 200 億美元買 Groq 的 IP,AMD 收購 Taalas 等於直接拿到下一代推論技術的入場券。
- AMD 加拿大布局:AMD 過去幾年已在加拿大深耕半導體與 AI 生態,收購 Taalas 鞏固人才與專利(14 項)基礎。
更深層的意義是,這代表 AI 晶片市場開始走向「專用化分化」。通用 GPU 不會消失,但「前沿訓練用 GPU + 部署階段用 ASIC」的雙軌架構成為可能。Etched(Sohu transformer ASIC)、Cerebras(wafer-scale)、Groq(LPU)、SambaNova(dataflow)、AWS Trainium、Google TPU 都已在這條路上佈局,AMD 加入戰局只是時間問題。
四、質疑與風險:模型燒死怎麼辦?
最大的爭議點也是 HN 留言區最熱烈的話題:模型一旦蝕刻進去,就改不掉了。任何比 LoRA 大的改動都需要重新投片(re-spin),這既貴又慢。AI 模型現在以月為單位迭代,這等於買一台跑舊模型的奢華計算機。
Taalas 的辯護是「只需要改兩層金屬層」,不必從頭設計:
- 標準 ASIC 投片週期:1.5–2 年
- Taalas 改模型週期:約 2 個月
這聽起來差距巨大,但前提是「客戶對模型忠誠度極高」。實務上,企業客戶若押注 Llama 4.x 一年半,期間若 GPT-5 或 Claude 4.5 大幅超越,就陷入「繼續用舊模型」或「報廢整批硬體」的兩難。
額外風險:
- 產能限制:HC1 是 815mm² 大晶粒,單一晶圓能切出的數量有限
- 客戶集中:AMD Instinct 既有客戶(OpenAI、Anthropic、Meta)必須同時想用 GPU 訓練和 ASIC 推論,整合複雜度高
- 對手反擊:Nvidia 拿到 Groq IP 後預計 2026 H2 推出 LPX 系統,AMD-Taalas 的速度優勢可能被壓縮
一位業界觀察家 David Bennett 寫道:「市場成熟了,工作負載穩定了,成本結構接管一切。在正確的市場階段,不能改變想法的晶片不是限制,是特色。」
五、Siami 觀點:AI 硬體進入「訓練 vs 部署」分流時代
這次收購背後的真正訊號是:AI 算力市場正式分裂成兩個截然不同的經濟學。
訓練端追求「絕對通用、可重構」,所以仍是 GPU 的天下。Nvidia 在這裡有 H100、H200、Blackwell、Rubin 疊代護城河,加上 CUDA 軟體生態,短期內 AMD、Intel、Google 都難以撼動。
但部署端追求「單模型、長時間、最大吞吐量」,ASIC 的成本與功耗優勢壓倒 GPU。ASIC 化的瓶頸一直是「模型迭代太快、晶片投片太慢」的錯位,Taalas 用「兩層金屬可改」的工程妥協,把這個錯位從「兩年」壓到「兩個月」,經濟模型才跑得通。
對台灣與全球半導體產業的意涵:
- TSMC 將成最大受益者:HC1 已在用 TSMC 6nm,HC2 可能升級到 3nm 或更先進製程,先進封裝產能(CoWoS)需求將進一步吃緊
- 記憶體廠壓力加大:HBM 不再是萬靈丹,SRAM 與 mask-ROM 重新進入推論晶片材料清單
- 台系 IC 設計有新藍海:模型專用加速器的客製化需求,可能為台灣 ASIC 服務公司(如世芯、創意、智原)開出新業務線
AI 推論晶片市場在 2026 H2 進入「Nvidia LPX vs AMD-Taalas vs Etched vs Cerebras」四強混戰的格局,2027 年將是決定勝負的關鍵一年。
參考資料:
網友熱門留言 (5)