對現有的 Managed Service for Apache Spark 叢集執行管道

本頁說明如何在 Cloud Data Fusion 中,針對現有的 Managed Service for Apache Spark 叢集執行管道。

根據預設,Cloud Data Fusion 會為每個管道建立暫時叢集:在管道執行開始時建立叢集,並在管道執行完成後刪除叢集。雖然這項行為可確保只在需要時建立資源,進而節省成本,但在下列情況下,這種預設行為可能不盡理想:

  • 如果為每個管道建立新叢集所需的時間,會對您的用途造成阻礙。

  • 如果貴機構需要集中管理叢集建立作業,例如想對所有 Managed Service for Apache Spark 叢集強制執行特定政策。

在這些情況下,請改為對現有叢集執行管道,步驟如下。

事前準備

你需要下列項目:

連線至現有叢集

在 Cloud Data Fusion 6.2.1 以上版本中,建立新的 Compute Engine 設定檔時,可以連線至現有的 Managed Service for Apache Spark 叢集。

  1. 前往執行個體:

    1. 在 Google Cloud 控制台中,前往 Cloud Data Fusion 頁面。

    2. 如要在 Cloud Data Fusion Studio 中開啟執行個體,請依序按一下「Instances」和「View instance」

      前往「Instances」(執行個體)

  2. 按一下「系統管理員」

  3. 按一下 [設定] 標籤。

  4. 按一下 「系統運算設定檔」

  5. 按一下「建立新的設定檔」。系統會開啟供應商頁面。

  6. 按一下「現有的 Managed Service for Apache Spark」

  7. 輸入設定檔、叢集和監控資訊。

  8. 點選「建立」

設定管道以使用自訂設定檔

  1. 前往執行個體:

    1. 在 Google Cloud 控制台中,前往 Cloud Data Fusion 頁面。

    2. 如要在 Cloud Data Fusion Studio 中開啟執行個體,請依序按一下「Instances」和「View instance」

      前往「Instances」(執行個體)

  2. 前往「Studio」(工作室) 頁面中的管道。

  3. 按一下 [設定]

  4. 按一下「運算設定」

  5. 按一下您建立的設定檔。

    使用自訂設定檔。
    圖 1:按一下自訂設定檔
  6. 執行管道。這項服務會針對現有的 Managed Service for Apache Spark 叢集執行。

後續步驟