vLLM TPU 是高效率的大型語言模型 (LLM) 供應架構,經過最佳化調整,適用於 Cloud TPU 硬體,並採用 tpu-inference,這是功能多元且強大的新型硬體外掛程式,可將 JAX 和 Pytorch 整合至同一個低階路徑。
如要進一步瞭解這個架構,請參閱 vLLM TPU 網誌文章。
您可以在Model Garden中,透過一鍵部署和筆記本使用 vLLM TPU。
在 Model Garden 中開始使用
vLLM TPU 服務容器已整合至 Model Garden。您只需按一下滑鼠,即可部署這項服務解決方案,並透過各種模型的 Colab Enterprise 筆記本範例存取。
使用一鍵部署功能
您可以透過下列模型的模型資訊卡,使用 vLLM TPU 部署自訂 Agent Platform 端點:
- google/gemma-3-27b-it
- meta-llama/Llama-3.3-70B-Instruct
- meta-llama/Llama-3.1-8B-Instruct
- Qwen/Qwen3-32B
- Qwen/Qwen3-8B
- Qwen/Qwen3-4B
- Qwen/Qwen3-4B-Instruct-2507
步驟:
前往模型資訊卡頁面 (例如 google/gemma-3-27b-it),然後按一下「Deploy model」(部署模型),開啟部署面板。
在「資源 ID」下方,選取要部署的模型變體。
找出要部署的模型變體,然後按一下「編輯設定」,並在「機器規格」下方選取 vLLM TPU 選項,即可進行部署。
按一下面板底部的「部署」,開始部署程序。 端點準備就緒後,您會收到電子郵件通知。
使用 Colab Enterprise 筆記本
如要彈性自訂,可以使用 Colab Enterprise 筆記本範例,透過 Python 適用的 Agent Platform SDK 部署搭載 vLLM TPU 的 Agent Platform 端點。
在 Colab Enterprise 中開啟 vLLM TPU 筆記本。
執行筆記本,使用 vLLM TPU 部署模型,並將預測要求傳送至端點。
申請 Cloud TPU 配額
在 Model Garden 中,預設配額為 europe-west4 區域的 16 個 Cloud TPU v6e 晶片。這項配額適用於一鍵部署和 Colab Enterprise 筆記本部署作業。如果預設配額為 0,或想要求更多配額,請參閱「要求調整配額」。