← 返回 Siami 首頁

Google 開源 AX:專為 Agent 打造的叢集編排引擎 目標支援億級自主任務

▲ 295 💬 113
Google 開源 AX:專為 Agent 打造的叢集編排引擎 目標支援億級自主任務

Google 開源 AX:專為 Agent 設計的叢集編排引擎

AX 是一個高吞吐量的宣告式編排器,可在叢集中執行數十億個自主 agent 工作負載。它運行於 Agent Substrate 之上,提供沙盒化執行環境。對熟悉 Kubernetes 的人來說,AX 的使用體驗非常類似。

Google DeepMind 近日正式開源一款名為 AX 的 agentic 編排框架,試圖為業界長期缺乏共識的「agent 究竟該怎麼跑」問題,提出一套具體且可大規模部署的解法。專案以 Apache 2.0 授權釋出,原始碼公開於 github.com/google/ax。


為什麼需要 AX:Agent 是新形態的工作負載傳統的工作負載模型分兩種:無狀態的微服務,或跑一次就結束的批次任務。但 agent 不一樣 — 它會累積狀態、需要嚴格的隔離、要呼叫模型 API 與工具服務,而且只要沒人在監控,它可以在迴圈裡燒光你的預算。

【Google Cloud 官方】用 Google Cloud AI agent 平台把 prototype 推到 production

【Google AI Deep Dive Ep 2】動手打造新一代 Agentic AI 架構

AX 把所有這些麻煩事抽成四個小原語,讓使用者用宣告式 YAML 表達,剩下的交給平台處理。

你想要做AX 給你的原語
在隔離沙盒中執行不可信任的 agent 程式碼,含 CPU/記憶體限制Task
預先掛載 Git repos、MCP servers、skill 套件,讓每個 agent 開機即用Workspace
把外連流量鎖死到明確的 host allowlistGateway
集中設定平台使用的 LLM 模型與憑證Model
暫停閒置的 agent、之後從中斷點接續ax suspend / ax resume
跳進運行中的 agent shell 查看實際狀態ax ssh

這四個原語都寫成 ax.io/v1alpha1 格式的 manifest,只要一行指令 ax apply 就能部署。


快速上手:三步把第一個 agent 跑起來

1. 安裝 CLI

go install github.com/google/ax/cmd/ax@latest

這會把 ax 這個執行檔放到 $(go env GOPATH)/bin,記得把這個目錄加進 PATH

2. 部署 control plane

使用者需要準備 Kubernetes 叢集、kobrew install ko)、叢集可拉取的 container registry、以及可達成的 Agent Substrate Control API(in-cluster 預設:api.ate-system.svc.cluster.local:443)。

make deploy AX_IMAGE_REPO=<your-registry>

這會先部署 Redis,再用 ko 建置並部署 control plane 映像檔,全部歸在 ax-system namespace。

3. 跑你的第一個任務

ax apply -f examples/task.yaml       # Task + Workspace + Gateway + Model 一檔搞定
ax get tasks
ax watch task task123                # 即時串流 phase 與 condition 變化
ax ssh task123 -- ls -la /workspace  # 鑽進沙盒內部查看
ax suspend task task123              # checkpoint 並暫停
ax resume task task123               # 從中斷點接續

想看完整生命週期,直接跑 ./demo.sh — 它會套用自訂 workspace、等待就緒、用 ax ssh 跑指令,最後把任務 suspend 起來。


為什麼 AX 不是另一個 K8s 分支

AX 跑在 Agent Substrate 之上,後者是一套從底層為高密度、快速有狀態 actor 生命週期設計的運算 runtime。

每個任務都是輕量級 actor,可以擴展到每叢集數十億個並行 agent session,不會碰到傳統 orchestrator 的天花板。幾個關鍵設計:

  • 閒置 agent 自動 checkpoint:等模型回應、等工具呼叫、等人的回應時,會被暫停、序列化、1 秒內原地喚醒,零冷啟動延遲
  • 共享 worker 資源:數十個任務共用 worker,把等待時間轉成閒置算力,只有 agent 在思考和跑程式碼時才計費
  • 原生生成式整合:用自然語言描述 workspace 設定,環境會在任務開始前自動準備好

為誰設計:builder 與 researcher

AX 官方表示,設計初衷是「讓處理 agentic 基礎設施變簡單,這樣你可以專心做自己的事」。在功能取捨上,他們堅守兩個原則:

  • 讓 runtime 保持精簡、輕量,只在必要時加入大家都需要的功能
  • 專注於 ergonomics、快速迭代、愉悅的工作流

AX 誕生於 Google 內部,當 agentic runtime 系統研究遇上前沿運算基礎設施。經過多年打造與維運 agentic 執行引擎,Google 內部多個團隊意識到 agentic 工作負載需要專屬平台。這個專案奠基於 Google DeepMind 在 agentic runtime 的研究,加上團隊在大規模隔離、resumption、調度方面的實戰經驗,目標是打造一個開放、宣告式的控制平面,讓 agent 不必再依附於 Kubernetes 通用 workload 上。


🚨 為什麼這件事重要

Google 把 agent runtime 視為「值得專門打造基礎設施」的品類,這是業界少見的表態。

過去兩年 agent 框架百家爭鳴 — LangChain、AutoGen、CrewAI、Anthropic 的 Claude Agent SDK — 但幾乎沒有人專注在「agent 跑在大規模叢集上」這層。

AX 的開源有三層訊號值得解讀:

  1. 驗證「agent 是 workload 不是 prompt」:當 Google 願意為它寫一套 Kubernetes 等級的編排系統,代表 agent 在 Google 內部已經是基礎設施級的負載類型,不是 demo 玩具
  2. DeepMind 工程實力外溢:Agent Substrate 是 DeepMind 多年研究的結晶,現在以開源形式釋出,等於承認閉門造車對生態不利
  3. 生態卡位:當 Anthropic 押 Claude Code、OpenAI 押 Codex Agents、Google 用 AX 搶 agent runtime 的底層 — 這是一場看不見硝煙的「誰來當作業系統」之爭對台灣與中文圈的開發者來說,AX 的價值在於:它的 manifest 格式 (ax.io/v1alpha1) 借鏡 Kubernetes,如果你熟悉 kubectl,上手 AX 只需要半天。

🚨 數據解讀

297 HN 積分、113 留言、上線當天就衝到當週 Top 5(截至 2026-09-21)— 在這個以基礎設施項目為主的版面,這是相當高的參與度。值得追蹤的數字:

  • 沙盒冷啟動時間:官方聲稱「1 秒內原地喚醒、零 cold-start delay」。這個數字會是判斷 AX 是否真的「生產可用」的第一個指標 — agent 等 30 秒才回應跟等 1 秒,使用體驗差非常多
  • 叢集規模上限:官方稱「每叢集數十億並行 agent session」。這是規格書的數字,不是實測。要等第三方 benchmark 出來才知道
  • API 穩定度:官方 README 開頭的 WARNING 明確承認 v1alpha1 仍在快速演進,「可能會在穩定版前引入重大破壞性變更」。等於告訴使用者「現在別拿來跑 production」

目前 v1alpha1 API 還在快速演進,官方警告:「可能會在穩定版前引入重大破壞性變更」。這是 alpha 階段的正常節奏,但企業用戶短期內不適合拿來跑關鍵任務。


目前狀態與取得方式

編按:本文綜合整理自 AX 官方網站(agentexecutor.io)、Google AX GitHub 專案 README,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (4)

#1 Hacker News 用戶 ▲ 187
首頁寫著『讓使用者專心做正事、保持愉悅工作流』,但 README quickstart 卻說你需要 Kubernetes cluster、ko、container registry…這兩邊的訊息對不起來啊。
#2 Hacker News 用戶 ▲ 142
我們公司就是 K8s 重度使用者,看完這四個原語(Task / Workspace / Gateway / Model)幾乎不用看文檔就能上手。Agent Substrate 確實在解決 K8s 沒處理好的問題:跨工作負載的身分識別。
#3 Hacker News 用戶 ▲ 98
如果你是企業環境,K8s 通常已經有了。ko 這個依賴有點奇怪,但 Agent Substrate 是必要的。整體設計跟 K8s 很像,但對 agent workload 做了專門優化,邏輯說得通。
#4 Hacker News 用戶 ▲ 76
官方說可以 scale 到『每叢集數十億個並行 agent session』— 這是規格書的數字。等第三方 benchmark 出來再說吧,現在頂多算 PoC 玩具。