代理式 AI 用途:多模態 GraphRAG 資源自動調度管理

Last reviewed 2026-04-06 UTC

本文提供多代理系統的整體架構,可將零散的多模態資料整合到可搜尋的知識圖譜中。使用者可透過這個系統上傳資料,然後使用知識圖譜找出潛在問題或系統性風險。這項架構可讓代理程式瀏覽複雜的資料網路,並維持長期個人化設定。確保分散式資源持續符合搜尋需求。

GraphRAG 是以圖表為基礎的檢索增強生成 (RAG) 方法。 RAG 會使用向量搜尋擷取情境相關資料,並將這些資料加入提示,藉此提高 AI 生成回覆的準確度。GraphRAG 結合向量搜尋和知識圖譜查詢,擷取能更準確反映不同來源資料互連關係的比對內容資料。 使用 GraphRAG 擴充的提示詞可生成更詳細且相關的 AI 回覆。

這份文件適用於在雲端建構及管理 AI 基礎架構和應用程式的架構師、開發人員和管理員。本文假設您已具備 AI 代理程式和模型的基本知識。本文並未提供設計和編寫 AI 代理程式的具體指引。

本文的「部署」一節提供程式碼範例,說明如何定義 Spanner Graph 結構定義,以及連結多模態實體以進行代理程式擷取。

架構

下圖顯示多代理程式 AI 系統的架構概略視圖,可啟用多模態 GraphRAG 資源協調:

多代理 AI 系統的整體架構,可啟用多模態 GraphRAG 資源自動化調度管理。

上圖中的架構有兩個工作流程:資料擷取和搜尋。

  • 資料擷取工作流程會將分散的多模態記錄整合到統一的知識圖譜。這項工作流程會使用循序多重代理程式模式,將原始資料上傳至 Cloud Storage、使用 Gemini 擷取複雜關係,並更新 Spanner Graph 知識圖表,確保資料可供擷取。
  • 您可以使用「搜尋」工作流程,透過 GraphRAG 程序擷取洞察資料和以事實為依據的回覆。這項工作流程會使用 Gemini 和專門的子代理程式,在知識圖譜中瀏覽,並根據先前的工作階段資料彙整結果。

下列分頁提供架構,顯示資料擷取和搜尋工作流程:

資料擷取工作流程

下圖詳細說明資料擷取工作流程的架構。

顯示資料擷取工作流程的架構。

上圖顯示下列資料流程:

  1. 使用者與網頁應用程式互動,上傳新資料。舉例來說,財務分析師可能會上傳收益 PDF、股東會議記錄或市場績效圖表。
  2. 網頁應用程式會將要求轉送至根代理程式。根層級代理程式是協調代理程式,會接收要求並部署在 Cloud Run 服務上。
  3. 根代理會從Memory Bank擷取持續性工作階段資料,根據使用者在過去工作階段的偏好設定,提供個人化搜尋結果。
  4. 根代理會使用 Gemini Enterprise Agent Platform 的 Gemini 解讀要求,並將工作委派給多媒體代理,執行資料擷取管道。
  5. 多媒體代理程式會啟動 循序模式,並將原始輸入內容轉送至上傳代理程式。
  6. 上傳代理程式會執行下列工作:
    1. 將原始檔案儲存在 Cloud Storage bucket 中,並偵測媒體類型。
    2. 將執行動作的中間摘要轉送至擷取代理程式。

  7. 擷取代理程式會執行下列工作:
    1. 從儲存空間 bucket 擷取資料 URI,並使用 Gemini 剖析資料及識別結構化實體。舉例來說,財務資料的實體可以包括企業子公司、會計季度和收益情緒。
    2. 將結構化實體和所執行動作的中間摘要轉送至圖表代理程式。
  8. 圖表代理程式會執行下列工作:
    1. 接收結構化實體,並將資料上傳至知識圖譜。Spanner Graph 會建立或連結代表發行者、利害關係人和市場工具的節點。
    2. 將執行動作的中間摘要轉送至摘要代理。
  9. 摘要代理會產生回覆,其中包含擷取結果的文字摘要,以及所有子代理執行的動作。摘要代理程式會將回覆傳送給多媒體代理程式。
  10. 多媒體代理程式會將摘要回覆轉送回根代理程式。
  11. 根代理程式會觸發 回呼函式,將工作階段資料儲存至 Gemini Enterprise Agent Platform Sessions 。根代理程式會從工作階段中擷取自訂 記憶體主題,儲存重要焦點領域的資訊。舉例來說,財務分析師可能會建立記憶體主題,追蹤監管標記或產業趨勢。
  12. 根代理程式將摘要回應轉送至網頁應用程式。
  13. 網頁應用程式會將回應轉送給使用者。

搜尋工作流程

下圖顯示搜尋工作流程的詳細架構。

顯示搜尋工作流程的架構。

上圖顯示下列資料流程:

  1. 使用者向網頁應用程式發出搜尋要求。舉例來說,投資組合管理員提交要求,偵測涉及超過三個實體的任何循環交易模式,且總交易量在 24 小時內超過 $100 萬美元。
  2. 網頁應用程式會將要求轉送至根代理程式。根代理程式是 協調代理程式,會接收要求並部署在 Cloud Run 服務上。
  3. 根代理程式會從Memory Bank擷取持續性工作階段資料,根據投資組合管理員的歷來偏好和病患脈絡,提供個人化搜尋結果。
  4. 根代理程式會使用 Agent Platform 上的 Gemini,判斷最佳搜尋策略:
    • 關鍵字搜尋:使用 SQL LIKE 子句比對完全相符的類別或位置。
    • 語意 RAG 搜尋:使用 嵌入模型餘弦距離,找出語意相似的資料項目。
    • 混合搜尋:執行關鍵字搜尋和語意 RAG 搜尋,並使用倒數排名融合 (RRF) 合併結果,確保高關聯性和涵蓋範圍。
  5. 根代理程式會在知識圖譜上執行適當的搜尋策略,知識圖譜儲存在 Spanner Graph 中。
  6. 知識圖譜會將搜尋結果轉送給根代理程式。
  7. 根層級代理會執行下列工作,更新代理式 AI 系統以回覆應用程式:
    1. 觸發 回呼函式,將工作階段資料儲存至 Gemini Enterprise Agent Platform 的 Agent Runtime Sessions
    2. 從對話中擷取自訂記憶體主題。舉例來說,財務分析師可能會建立記憶體主題,追蹤監管標記或新興產業趨勢。
    3. 將摘要回應轉送至網頁應用程式。
  8. 網頁應用程式會將回應轉送給使用者。

使用的產品

這項參考架構使用下列 Google Cloud產品和功能:

如要瞭解如何為代理式 AI 系統選取替代元件,包括框架、Agent Runtime、工具、記憶體和設計模式,請參閱「選擇代理式 AI 架構元件」。

用途

這項架構專為整合及分析分散的多模態資料而設計,可協助您最佳化資源分配和資訊擷取作業。系統會維護獨立的子代理程式,支援模組化更新,並確保分散式資源與搜尋需求高度相符,持續運作。整合 Spanner Graph 做為知識圖譜後,代理式 AI 系統就能模擬複雜的互連資料。這項整合功能可提供豐富的脈絡理解能力和進階查詢功能,而這些功能在關聯式或 NoSQL 資料庫中可能難以實現或效率不彰。

在下列用途中,圖形資料庫擅長表示從多模態資料衍生的任意和不斷演變的連結。否則,這些連線會在關聯式資料庫中,需要複雜且嚴格的結構定義管理。

以下是本文所述架構的應用案例範例:

  • 企業 HR 人才流動:透過語意擴展功能找出符合資格的內部候選人,改善大規模招募搜尋的關鍵字搜尋功能。這項架構會從多模態作品集和影片簡介中擷取技術能力和軟實力評估結果,建構完整的才能圖表。Spanner 知識圖譜會追蹤員工、能力和專案記錄之間的關係,追蹤結果會根據概念深度找出專家,並標示人力不足的專案。
  • 社群媒體內容分析:在社群媒體平台執行進階內容探索和網路分析,找出特定回憶或趨勢。系統會處理上傳內容 (例如影片、語音備忘錄和影音網誌),然後擷取實體、主題、情緒和提及內容。Spanner 知識圖譜會追蹤使用者、連結 (好友和追蹤者)、貼文、按讚、留言、分享的主題和趨勢之間的關係。

設計須知

以下各節提供設計 AI 代理程式的一般建議,以及如何為正式環境導入這項架構。

AI 代理設計

如要改善代理程式的費用和成效,請考慮下列建議:

  • 代理系統設計:將複雜的工作流程分解為多個專用代理,並明確定義每個代理的職責,而非使用單一代理。這種關注點分離方式可簡化提示工程、減少指令漂移,並實現精細的模型擴縮。這項架構會將大量明確定義的任務轉送給較小、較快的模型,同時保留高容量模型處理複雜的推論任務。
  • 根層級代理轉送:為盡量縮短延遲時間,並避免不必要的子代理呼叫,請在代理指令中清楚定義轉送邏輯。請務必在字串常值中記錄每個工具的用途、輸入參數和預期輸出內容,協助模型選取正確的工具。
  • 工具設計:將工具區隔為多種專注的方法,而非使用單一的單體式方法。這種做法可確保程式碼集的一致性、減少邏輯分支版本,並啟用特定最佳化路徑,例如在叫用直接搜尋方法時略過查詢分析。
  • 代理程式脈絡:如要防止下游代理程式在循序管道中重複查詢上游資料,請透過代理程式狀態傳遞足夠的脈絡。請使用明確定義的 JSON 結構來表示共用狀態,確保每個代理程式都能可靠地剖析資料。
  • 工作階段狀態儲存空間:使用工作階段狀態儲存空間,立即存取對話記錄;使用 Memory Bank,存取各個工作階段的重點事實。在工作階段開始時注入記憶體內容,讓代理程式可以參照偏好設定,而不必重新處理冗長的對話記錄。
  • 記憶體品質:如果使用者的偏好設定或角色隨時間改變,可以清除或更新過時的記憶體
  • 資料庫內建 AI 模型:為減少延遲,請使用 Spanner ML.PREDICT 函式,在 SQL 查詢中直接呼叫模型。監控 Agent Platform 配額用量,因為混合搜尋工作負載可能會針對每個查詢觸發多個模型呼叫。

製作設計

如要在正式環境中實作這項架構,請考慮採用下列建議:

  • 實行精細的存取控管機制:使用精細的存取控管機制,在資料表和資料欄層級授予存取權。限制 Cloud Storage 儲存空間政策,只允許 Cloud Run 服務帳戶存取。
  • 清理推論和回覆:使用 Model Armor 檢查並清理推論要求和模型回覆。這項清除作業可降低使用者上傳多模態內容時,可能發生的提示詞注入攻擊風險。這項功能也有助於防止代理程式輸出內容意外洩漏個人識別資訊 (PII) 或私密資料。
  • 導入代理重試邏輯:如要處理配額限制等暫時性錯誤,請為對 Agent Platform 端點和 Spanner 的呼叫,導入採用指數輪詢的重試邏輯
  • 設定檔案大小限制:為避免大型檔案導致 API 超時,請設定明確的上傳大小限制,並在擷取資料實體前,將大型影片分成區塊。詳情請參閱「自訂影片處理方式」。
  • 成本分析與管理:如要分析及管理 Agent Platform 成本,建議您為每秒查詢次數 (QPS) 和每秒權杖數 (TPS) 建立基準指標。然後在部署後監控這些指標。您在成本管理中建立的基準,有助於判斷容量規劃。舉例來說,基準有助於判斷何時可能需要佈建輸送量
  • 自動執行儲存空間生命週期:為降低儲存空間費用,請使用物件生命週期管理功能,在定義的保留期限過後,將檔案移至 Nearline 或 Coldline 儲存空間級別
  • 使用結構化記錄:使用結構化中繼資料記錄所有代理程式工具叫用和管道結果。 結構化記錄可讓您在 Cloud Monitoring 中查詢記錄和資訊主頁。
  • 實作追蹤:如要診斷延遲熱點,請使用 Cloud Trace 擷取代理程式執行元件和工具執行作業的端對端要求追蹤記錄。
  • 評估代理品質:定期使用 Gen AI Evaluation Service 評估代理輸出內容品質,驗證工具選擇軌跡和回覆品質。
  • 資源分配:視效能需求而定,設定要分配給 Cloud Run 服務的記憶體限制CPU 限制

如要進一步瞭解建構及部署多代理程式 AI 系統的設計因素、最佳做法和建議,請參閱「 Google Cloud中的多代理程式 AI 系統」。

部署作業

如要部署此架構的範例實作,請嘗試「Way Back Home Level 2」程式碼研究室

後續步驟

貢獻者

作者:

其他貢獻者: