← 返回 Siami 首頁

AMD 收購 Taalas:把模型直接燒進晶片 推論速度衝上 17,000 tokens/s

▲ 135 💬 80
AMD 收購 Taalas:把模型直接燒進晶片 推論速度衝上 17,000 tokens/s

編按:本文綜合整理自 The Register 原稿AMD 投資人關係新聞稿Bloomberg 報導,並加入 Siami 編輯部觀點與分析。

AMD 週四(8 月 6 日)盤後宣布收購加拿大 AI 晶片新創公司 Taalas,這家成立僅兩年半、員工 25 人的多倫多團隊,正用「把模型權重直接蝕刻進矽晶片」的極端路線,挑戰 Nvidia 統治的 AI 推論市場。這是繼 2025 年 12 月 Nvidia 與 Groq 達成 200 億美元授權協議後,AI 推論晶片領域第二次重大整併。

一、把模型燒進晶片是什麼意思?

傳統 GPU 把模型權重放在 HBM 高頻寬記憶體,運行時反覆搬運;Taalas 的做法更激進——直接把 Llama 3.1 8B 的權重蝕刻成晶片上的金屬連線,搭配 SRAM 處理 KV 快取與 LoRA 適配器。這種架構被稱為 MSIC(Model-Specific Integrated Circuit,模型專用積體電路),本質上是「晶片即模型」。

HC1 的實測數據相當驚人:

  • 推論速度:16,960 tokens/s(單用戶單晶片)
  • 製程:TSMC 6nm,晶粒面積 815mm²,53 億個電晶體
  • 對比當時 Nvidia GPU:快 48 倍;對比 Cerebras WSE-3:快 8.5 倍

Taalas 共同創辦人暨執行長 Ljubisa Bajic 接受 The Next Platform 採訪時表示,把模型蝕刻進晶片比訓練一個同等規模的前沿模型便宜 100 倍。

第二代 HC2 預計 2026 年夏季量產,目標把單晶片參數量推到 200 億。若用管線並行擴展到 1 兆參數模型,只需約 50 顆加速器;對照 Nvidia LPX 系統,相同規模需要數十顆 GPU 加 2,000 顆 Groq LPU。能耗與空間效率差距明顯。

二、AMD 的全堆疊推論棋局

AMD 並未揭露交易金額,但確認這是「完整收購」而非單純的人才併購。Taalas 技術將與 AMD 既有的 Helios 機櫃級解決方案、Instinct GPU、EPYC CPU、ROCm 軟體棧整合。AMD AI 事業部資深副總裁 Vamsi Boppana 在聲明中表示,這補強了 AMD 在快速成長的 AI 推論市場的長期路線圖。

從架構推論,AMD 很可能走「分離式部署」路線:

  • Prompt 預處理(高運算需求):跑在 Instinct GPU
  • Token 生成(低延遲、高吞吐量):跑在 Taalas 加速器

這跟 Nvidia 從 Groq 拿到的 LPU 技術定位類似,但 Taalas 的硬連線方法理論上能提供更高的成本效益。也可能採用「tick-tock」節奏:客戶先在 Instinct 上驗證模型,穩定後再遷移到 Taalas 晶片。

關鍵時程:

項目內容
公告日2026 年 8 月 6 日(美東收盤後)
預定完成2026 Q4(須通過監管核准)
HC1 當前狀態已運轉,可於 chatjimmy.ai 公開試用
HC2 量產2026 年夏季

三、為什麼這件事重要

這筆交易標誌著 AI 硬體競爭從「訓練」轉向「推論」的結構性轉變。過去三年,整個產業把 GPU 當萬靈丹——同樣的 H100 既訓練 GPT-4 也跑 ChatGPT 推論。但隨著模型迭代週期壓到月等級、推論成本佔比飆升,「通用加速器」的成本結構開始鬆動。

AMD 押注 Taalas 的核心邏輯有三層:

  1. 速度領先的 Moat:Taalas 在單一模型推論上比 Nvidia Blackwell 快 45 倍(業界 KOL 估算),這不是小幅改進,是架構層面的代差。
  2. 與 Nvidia 的 Groq 交易對標:Nvidia 花 200 億美元買 Groq 的 IP,AMD 收購 Taalas 等於直接拿到下一代推論技術的入場券。
  3. AMD 加拿大布局:AMD 過去幾年已在加拿大深耕半導體與 AI 生態,收購 Taalas 鞏固人才與專利(14 項)基礎。

更深層的意義是,這代表 AI 晶片市場開始走向「專用化分化」。通用 GPU 不會消失,但「前沿訓練用 GPU + 部署階段用 ASIC」的雙軌架構成為可能。Etched(Sohu transformer ASIC)、Cerebras(wafer-scale)、Groq(LPU)、SambaNova(dataflow)、AWS Trainium、Google TPU 都已在這條路上佈局,AMD 加入戰局只是時間問題。

四、質疑與風險:模型燒死怎麼辦?

最大的爭議點也是 HN 留言區最熱烈的話題:模型一旦蝕刻進去,就改不掉了。任何比 LoRA 大的改動都需要重新投片(re-spin),這既貴又慢。AI 模型現在以月為單位迭代,這等於買一台跑舊模型的奢華計算機。

Taalas 的辯護是「只需要改兩層金屬層」,不必從頭設計:

  • 標準 ASIC 投片週期:1.5–2 年
  • Taalas 改模型週期:約 2 個月

這聽起來差距巨大,但前提是「客戶對模型忠誠度極高」。實務上,企業客戶若押注 Llama 4.x 一年半,期間若 GPT-5 或 Claude 4.5 大幅超越,就陷入「繼續用舊模型」或「報廢整批硬體」的兩難。

額外風險:

  • 產能限制:HC1 是 815mm² 大晶粒,單一晶圓能切出的數量有限
  • 客戶集中:AMD Instinct 既有客戶(OpenAI、Anthropic、Meta)必須同時想用 GPU 訓練和 ASIC 推論,整合複雜度高
  • 對手反擊:Nvidia 拿到 Groq IP 後預計 2026 H2 推出 LPX 系統,AMD-Taalas 的速度優勢可能被壓縮

一位業界觀察家 David Bennett 寫道:「市場成熟了,工作負載穩定了,成本結構接管一切。在正確的市場階段,不能改變想法的晶片不是限制,是特色。」

五、Siami 觀點:AI 硬體進入「訓練 vs 部署」分流時代

這次收購背後的真正訊號是:AI 算力市場正式分裂成兩個截然不同的經濟學

訓練端追求「絕對通用、可重構」,所以仍是 GPU 的天下。Nvidia 在這裡有 H100、H200、Blackwell、Rubin 疊代護城河,加上 CUDA 軟體生態,短期內 AMD、Intel、Google 都難以撼動。

但部署端追求「單模型、長時間、最大吞吐量」,ASIC 的成本與功耗優勢壓倒 GPU。ASIC 化的瓶頸一直是「模型迭代太快、晶片投片太慢」的錯位,Taalas 用「兩層金屬可改」的工程妥協,把這個錯位從「兩年」壓到「兩個月」,經濟模型才跑得通。

對台灣與全球半導體產業的意涵:

  • TSMC 將成最大受益者:HC1 已在用 TSMC 6nm,HC2 可能升級到 3nm 或更先進製程,先進封裝產能(CoWoS)需求將進一步吃緊
  • 記憶體廠壓力加大:HBM 不再是萬靈丹,SRAM 與 mask-ROM 重新進入推論晶片材料清單
  • 台系 IC 設計有新藍海:模型專用加速器的客製化需求,可能為台灣 ASIC 服務公司(如世芯、創意、智原)開出新業務線

AI 推論晶片市場在 2026 H2 進入「Nvidia LPX vs AMD-Taalas vs Etched vs Cerebras」四強混戰的格局,2027 年將是決定勝負的關鍵一年。


參考資料:

網友熱門留言 (5)

#1 Hacker News ▲ 92
I'm surprised neither OpenAI nor Anthropic made this move first. The Chinese open weight models are pulling ahead and commoditizing their value proposition. Baking models onto silicon would've been the next logical move to get a moat.
#2 Hacker News ▲ 47
ASICs is what took over Bitcoin mining, cheaper in all ways, and lasts longer than Nvidia GPUs for inference.
#3 Hacker News ▲ 38
Considering the rate of model development and rail hopping, seems like baking models into silicon is speed-running obsolescence.
#4 Hacker News ▲ 55
If you're only running models for frontier capabilities, yeah. For tasks where current models are smart enough, running them 100x faster is the most impactful improvement you can make. Consider all the things you could use a model for, but don't, because the latency is just a bit too high.
#5 Hacker News ▲ 22
Not sure. You can fix the transistors but leave the connections between them open for flexibility, so you only need to change the manufacturing process for the upper masks for every new model.