本頁說明如何在 Cloud Data Fusion 中,針對現有的 Managed Service for Apache Spark 叢集執行管道。
根據預設,Cloud Data Fusion 會為每個管道建立暫時叢集:在管道執行開始時建立叢集,並在管道執行完成後刪除叢集。雖然這項行為可確保只在需要時建立資源,進而節省成本,但在下列情況下,這種預設行為可能不盡理想:
如果為每個管道建立新叢集所需的時間,會對您的用途造成阻礙。
如果貴機構需要集中管理叢集建立作業,例如想對所有 Managed Service for Apache Spark 叢集強制執行特定政策。
在這些情況下,請改為對現有叢集執行管道,步驟如下。
事前準備
你需要下列項目:
Cloud Data Fusion 執行個體。
現有的 Managed Service for Apache Spark 叢集。
如果您在 Cloud Data Fusion 6.2 版中執行管道,請使用較舊的Apache Spark 適用的代管服務映像檔 (例如 1.5-debian10),或升級至最新版 Cloud Data Fusion。
連線至現有叢集
在 Cloud Data Fusion 6.2.1 以上版本中,建立新的 Compute Engine 設定檔時,可以連線至現有的 Managed Service for Apache Spark 叢集。
前往執行個體:
在 Google Cloud 控制台中,前往 Cloud Data Fusion 頁面。
如要在 Cloud Data Fusion Studio 中開啟執行個體,請依序按一下「Instances」和「View instance」。
按一下「系統管理員」。
按一下 [設定] 標籤。
按一下 「系統運算設定檔」。
按一下「建立新的設定檔」。系統會開啟供應商頁面。
按一下「現有的 Managed Service for Apache Spark」。
輸入設定檔、叢集和監控資訊。
點選「建立」。
設定管道以使用自訂設定檔
前往執行個體:
在 Google Cloud 控制台中,前往 Cloud Data Fusion 頁面。
如要在 Cloud Data Fusion Studio 中開啟執行個體,請依序按一下「Instances」和「View instance」。
前往「Studio」(工作室) 頁面中的管道。
按一下 [設定]。
按一下「運算設定」。
按一下您建立的設定檔。
圖 1:按一下自訂設定檔 執行管道。這項服務會針對現有的 Managed Service for Apache Spark 叢集執行。