使用 vLLM TPU 和 Cloud TPU 提供開放原始碼模型

vLLM TPU 是高效率的大型語言模型 (LLM) 供應架構,經過最佳化調整,適用於 Cloud TPU 硬體,並採用 tpu-inference,這是功能多元且強大的新型硬體外掛程式,可將 JAXPytorch 整合至同一個低階路徑。

如要進一步瞭解這個架構,請參閱 vLLM TPU 網誌文章

您可以在Model Garden中,透過一鍵部署和筆記本使用 vLLM TPU。

在 Model Garden 中開始使用

vLLM TPU 服務容器已整合至 Model Garden。您只需按一下滑鼠,即可部署這項服務解決方案,並透過各種模型的 Colab Enterprise 筆記本範例存取。

使用一鍵部署功能

您可以透過下列模型的模型資訊卡,使用 vLLM TPU 部署自訂 Agent Platform 端點:

步驟:

  1. 前往模型資訊卡頁面 (例如 google/gemma-3-27b-it),然後按一下「Deploy model」(部署模型),開啟部署面板。

  2. 在「資源 ID」下方,選取要部署的模型變體。

  3. 找出要部署的模型變體,然後按一下「編輯設定」,並在「機器規格」下方選取 vLLM TPU 選項,即可進行部署。

  4. 按一下面板底部的「部署」,開始部署程序。 端點準備就緒後,您會收到電子郵件通知。

使用 Colab Enterprise 筆記本

如要彈性自訂,可以使用 Colab Enterprise 筆記本範例,透過 Python 適用的 Agent Platform SDK 部署搭載 vLLM TPU 的 Agent Platform 端點。

  1. 在 Colab Enterprise 中開啟 vLLM TPU 筆記本

  2. 執行筆記本,使用 vLLM TPU 部署模型,並將預測要求傳送至端點。

申請 Cloud TPU 配額

在 Model Garden 中,預設配額為 europe-west4 區域的 16 個 Cloud TPU v6e 晶片。這項配額適用於一鍵部署和 Colab Enterprise 筆記本部署作業。如果預設配額為 0,或想要求更多配額,請參閱「要求調整配額」。