本文提供高階架構,說明如何建構跨雲端開放式資料湖倉,從原始跨雲端資料孤島直接建立高度控管的安全管道,進而採取 AI 輔助行動。說明如何整合Google Cloud、其他雲端供應商和即時作業資料庫中分散的企業資料,不必依賴容易出錯的擷取、轉換及載入 (ETL) 管道,避免資料重複。
本文件適用於需要設計高效能聯邦系統的資料工程師、資料架構師和 AI 開發人員,這些系統會使用開放式標準。目標對象也可能需要處理企業限制,例如跨雲端網路路由,以及嚴格的身分和存取權管理隔離。
本文的「部署」一節提供程式碼範例,協助您建構及部署本文所述的架構。
架構
下圖顯示跨雲端架構,其中包含 Google Cloud的中央 Lakehouse。
上圖中的架構包含兩個子系統:資料擷取和服務。
- 資料擷取子系統會從外部來源擷取資料。這項服務會使用中央湖倉,將分散的資料庫統一處理成 Google Cloud中的統一客戶設定檔。
- 使用者可以透過服務子系統查詢 AI 助理和資料分析代理程式,分析整合資料。
以下各節說明各子系統的元件。
資料擷取子系統
資料擷取子系統包含下列元件:
| 元件 | 說明 |
|---|---|
| Managed Service for Apache Spark 搭配 Lightning Engine | 這項服務提供分散式處理引擎,可處理複雜的分析工作負載,例如大規模的跨雲端資料聯結和轉換。為盡量提高運算效率,Managed Service for Apache Spark 會使用 Lightning Engine 處理大量多向聯結、複雜的視窗化作業,以及結合跨雲端資料來源時所需的行為彙整作業。 Managed Service for Apache Spark 會使用 Lightning Engine,從下列路徑擷取資料,執行分散式聯結:
|
| 外部資料來源 |
位於其他雲端環境的企業資料資產。 本文說明的架構使用下列外部資料來源:
連線至外部資料來源後,您就能在資料所在位置進行分析,不必耗費時間和金錢遷移資料。雖然這個範例架構使用 Databricks Unity Catalog 和 Amazon S3 值區,但您也可以將這個架構模式與其他外部 Iceberg 目錄服務和雲端儲存空間供應商搭配使用。 |
| AlloyDB | 適用於混合型交易與數據分析處理 (HTAP) 的高效能資料庫,例如管理即時庫存或即時客戶設定檔。BigQuery AlloyDB 連結可讓分析引擎直接從 BigQuery 傳送查詢,至儲存在 AlloyDB 中的即時交易資料。這種做法可消除與變更資料擷取 (CDC) 管道相關聯的延遲和額外負荷。 |
| Cloud Storage | 這項物件儲存服務可擴充,適合處理高總處理量的資料,例如點擊流事件。為確保各種處理引擎都能存取資料,請使用 Cloud Storage 將資料與特定運算服務分離,並以開放的 Apache Iceberg 格式 (例如 Apache Parquet) 儲存資料。 |
| Lakehouse for Apache Iceberg | 這個中央中繼資料和治理系統可實現統一的跨雲端聯盟。如要建立與 Lakehouse 中繼資料的連線,Lakehouse 會執行下列動作:
|
| Cloud NAT 和 Cloud Router | 代管服務,可讓網路中的資源安全存取外部雲端來源的資料,同時避免這些資源暴露於公開網際網路。 Google Cloud |
| 虛擬私有雲 (VPC) | 這項服務會為所有資源提供獨立的私人安全網路,這些資源會部署為這個架構的一部分。 Google Cloud |
| Secret Manager | 這項服務可安全地儲存Databricks 服務主體憑證 (例如用戶端 ID 和密鑰),用於跨雲端驗證。 |
服務子系統
服務子系統包含下列元件:
| 元件 | 說明 |
|---|---|
| 統合客戶資料 | BigQuery 資料庫,用於整合分散式 Spark 工作的輸出內容。BigQuery 資料表會將分散的跨雲端指標轉換為複雜的非正規化資料類型,並做為集中管理的資料存放區,供您進行分析。 |
| BigQuery 資料代理程式 | 對話式分析代理,可讓使用者直接在 BigQuery 中查詢資料,並產生企業洞察資訊。代理程式會對查詢強制執行安全防護和管理防護機制。 |
| BigQuery MCP 伺服器 | Google 管理的 Model Context Protocol (MCP) 伺服器,可提供 BigQuery 資料的存取權。BigQuery MCP 伺服器會安全地將受控 lakehouse 脈絡公開給本機或外部 AI 模型,例如 Gemini CLI。這項功能可實現端對端代理工作流程,AI 工程師不必建構及維護自訂 REST API 中介軟體。 |
| Gemini CLI | 這項 AI 助理可透過指令列與整合式消費者檔案互動,生成以資料為依據的個人化內容,例如個人化行銷活動。Gemini CLI 可做為 BigQuery MCP 伺服器的用戶端,存取儲存在整合式客戶設定檔中的資料。 |
使用的產品
這個範例架構使用下列 Google Cloud 產品和工具:
- Lakehouse for Apache Iceberg:高效能儲存引擎,可讓您建構開放式資料湖倉,並提供統一的介面,用於進階分析和 AI。
- BigQuery:企業資料倉儲,內建機器學習、地理空間分析和商業智慧等功能,有助於管理及分析資料。
- AlloyDB for PostgreSQL:與 PostgreSQL 相容的全代管資料庫服務,專為最嚴苛的工作負載 (包括混合型交易和分析處理作業) 而設計。
- Managed Service for Apache Spark:這項代管服務可在代管運算基礎架構上執行 Apache Spark 批次工作負載。
- Cloud Storage:適用於多種資料類型的物件儲存庫,成本低廉且沒有限制。 資料在 Google Cloud 內外都能存取,且會複製到多個位置,以便提供備援機制。 Google Cloud
- Gemini:Google 開發的一系列多模態 AI 模型。
- Google Cloud MCP 伺服器:Google 管理的遠端服務,可實作 Model Context Protocol (MCP),讓 AI 應用程式存取 Google 和 Google Cloud 產品與服務。
- Cloud NAT:這項服務提供 Google Cloud代管的高效能網路位址轉譯功能。
- Cloud Router:分散式全代管服務,提供邊界閘道通訊協定 (BGP) 發言者和回應者功能。Cloud Router 可搭配 Cloud Interconnect、Cloud VPN 和路由器設備,根據 BGP 接收到的路徑和自訂路徑,在虛擬私有雲網路中建立動態路徑。
- 虛擬私有雲 (VPC):虛擬系統,可為 Google Cloud 工作負載提供全球性、可擴充的網路功能。虛擬私有雲包括虛擬私有雲網路對等互連、私人服務連線、私人服務存取權和共用虛擬私有雲。
這個範例架構使用下列第三方產品:
- Databricks Unity Catalog: Databricks 平台上的資料和 AI 資產統一治理與中繼資料目錄。
- Amazon S3:Amazon Web Services (AWS) 的儲存服務,可將資料儲存及管理為物件。
用途
這個參考架構專為需要整合多個雲端環境和地端系統中孤立資料的機構而設計,可推動分析和 AI 計畫。這項架構可帶來下列好處:
- 跨雲端整合式設定檔:提供企業實體的單一全方位檢視畫面,讓分析師和決策者取得深入洞察。這個整合式資料檢視可提高數據分析的準確率,並確保資料一致且為最新狀態,無論資料儲存在何處皆是如此。
- 降低營運複雜度並減少總持有成本 (TCO): Lakehouse 可免除建構及維護脆弱資料管道的需求。這種做法可讓您直接在不同雲端查詢資料所在位置,可避免實體資料移動相關的作業費用、儲存空間費用和延遲時間。
- 代理式 AI 工作流程:AI 代理可協助資料分析師將複雜的行為匯總資料直接轉化為可執行的業務策略。分析師可透過標準通訊協定,安全存取受管理的結構化湖倉資料。
以下是本文所述架構的應用案例範例:
- 即時零售分析:零售公司需要根據銷售和庫存情況立即做出決策。這項架構可讓他們結合在 AWS 中管理的靜態產品目錄資料,以及 Google CloudAlloyDB 作業資料庫中的即時銷售交易資料。分析師和商店管理員可以在預先定義的批次間隔查詢這個統一檢視畫面,監控銷售成效、找出快速銷售的商品以進行補貨,或分析新興的區域購買模式。
- 客戶個人化:金融服務公司希望為客戶經理提供客戶的完整整合式資料檢視。該公司可運用這項架構,整合 AWS 資料湖泊中的歷來行銷參與度資料,以及 AlloyDB 中的即時客戶帳戶資訊。關係經理接著就能使用 AI 助理提問,例如「總結這位客戶最近三筆交易的重點,並草擬一封個人化電子郵件,建議對方開立新的高收益儲蓄帳戶」。
設計須知
如要在正式環境中實作這項架構,請考慮採用下列建議:
- 網路拓撲和輸出策略:為確保效能穩定,並盡量降低跨雲端網路的資料傳輸費用,請使用 Cross-Cloud Interconnect 在 Google Cloud 和 AWS 之間建立私人連線。否則,透過公開網際網路從 Google Cloud 查詢 AWS 資料可能會產生高昂的輸出費用,且延遲時間難以預測。
- 運算資源選取:為提升效能及節省成本,請為工作負載的每個部分選取最合適的運算服務。現代資料湖倉不依賴單一運算服務。如要對營運資料庫執行完全相符的篩選器,請使用 BigQuery 聯合查詢。如要卸載耗用大量記憶體的複雜資料操作 (例如向量化跨雲端聯結),請使用 Managed Service for Apache Spark 的 Lightning Engine。
- AI 模型基準:為減少 AI 模型產生幻覺,請以統一的客戶設定檔為模型建立基準,強制執行業務定義和統計驗證。如果讓 AI 模型接觸數十億列的原始未匯總跨雲端資料,可能會導致代幣用量過高,以及幻覺率偏高。
身分與存取權管理:為落實最小權限原則,請透過系統管理的身分控管存取權。
- 如要建立及管理 Google Cloud 資源的權限,請使用 Google 的Identity and Access Management (IAM) 服務。
- 如要安全地存取 Cloud Storage 中的原始資料,請使用 BigQuery Cloud 資源連線。
- 如要安全地驗證跨雲端 Databricks 驗證,請搭配使用 Lakehouse REST 目錄聯盟和 Secret Manager。
使用這些身分與存取權管理策略,有助於防止未經授權的資料外洩,並為所有資料存取作業提供統一的稽核追蹤記錄。
部署作業
如要部署這項架構,請參閱建構跨雲端開放式資料湖倉程式碼實驗室。這個範例實作項目可協助您佈建特定網路基礎架構、執行 C++ PySpark 工作流程,以及設定 AI 代理程式,安全地與 Lakehouse 互動。
後續步驟
- 瞭解如何搭配使用 Lakehouse 執行階段目錄和 BigQuery 中的資料表。
- 瞭解如何透過 Lightning Engine 加速處理 Spark 工作。
- 瞭解如何透過對話分析資料。
- 如要瞭解適用於 Google Cloud中 AI 和機器學習工作負載的架構原則和建議,請參閱 Well-Architected Framework 中的AI 和機器學習觀點。
- 如要查看更多參考架構、圖表和最佳做法,請瀏覽 Cloud Architecture Center。
貢獻者
作者:Hyunuk Lim | 開發人員服務代表
其他貢獻者:
- Brad Miro | 資深開發人員服務代表
- Samantha He | 技術文件撰稿者