Gemini Enterprise Agent Platform 會將指標匯出至 Cloud Monitoring。Agent Platform 也會在 Agent Platform Google Cloud 控制台中顯示部分指標。您可以根據指標使用 Cloud Monitoring 建立資訊主頁或設定快訊。舉例來說,如果 Agent Platform 中模型的預測延遲時間過長,您就能收到快訊。
以下各節說明 Agent Platform Google Cloud 控制台中提供的指標,這些指標可能是 Agent Platform 傳送至 Cloud Monitoring 的直接或計算指標。
如要查看 Agent Platform 匯出至 Cloud Monitoring 的大部分指標清單,請參閱 aiplatform。如需自訂訓練指標,請參閱「ml」一節中以 training 開頭的指標類型。
自訂訓練監控指標
執行自訂訓練時,您可以監控每個訓練節點的下列資源用量類型:
- 每個訓練節點的 CPU 或 GPU 使用率
- 每個訓練節點的記憶體使用率
- 網路用量 (每秒傳送的位元組數和每秒接收的位元組數)
如果您使用超參數調整,可以查看每次試驗的指標。
如要在啟動自訂訓練後查看這些指標,請按照下列步驟操作:
在 Google Cloud 控制台中,根據您是否使用超參數調整功能,前往下列任一頁面:
按一下自訂訓練資源的名稱。
如果您建立自訂
TrainingPipeline資源,請按一下TrainingPipeline建立的工作名稱,例如TRAINING_PIPELINE_NAME-custom-job或TRAINING_PIPELINE_NAME-hyperparameter-tuning-job。按一下「CPU」、「GPU」或「網路」分頁標籤,即可查看您感興趣指標的利用率圖表。
如果您使用超參數調整功能,可以點選「Hyperparamater tuning trials」(超參數調整試驗) 表格中的資料列,查看特定試驗的指標。
如要查看舊版指標或自訂指標的顯示方式,請使用 Monitoring。Agent Platform 會將自訂訓練指標匯出至 Monitoring,做為前置字元為 ml.googleapis.com/training 的指標類型。受監控的資源類型為 cloudml_job。
請注意,AI Platform Training 會將指標匯出至 Monitoring,且指標類型和資源類型相同。
端點監控指標
將模型部署至端點後,您可以監控端點,瞭解模型的效能和資源用量。您可以追蹤流量模式、錯誤率、延遲時間和資源用量等指標,確保模型能持續穩定地回應要求。舉例來說,您可能會使用不同機型重新部署模型,以最佳化成本。變更後,您可以監控模型,檢查變更是否對效能造成負面影響。
在 Cloud Monitoring 中,已部署模型的受監控資源類型為 aiplatform.googleapis.com/Endpoint。
效能指標
成效指標可協助您找出模型流量模式、錯誤和延遲時間的相關資訊。您可以在 Google Cloud 控制台中查看下列成效指標。
- 每秒預測次數:線上和批次預測每秒的預測次數。如果每個要求有多個執行個體,這張圖表會列出每個執行個體。
- 預測錯誤百分比:模型產生錯誤的比率。錯誤率偏高可能表示模型或對模型的要求有問題。請查看回應代碼圖表,判斷發生哪些錯誤。
- 模型延遲時間 (僅適用於表格型和自訂模型):執行運算所花費的時間。
- 額外延遲時間 (僅適用於表格和自訂模型):處理要求所花費的總時間,不包括運算時間。
- 總延遲時間:要求在服務中花費的總時間,也就是模型延遲時間加上額外延遲時間。
資源使用情況
資源用量指標可協助您追蹤模型的 CPU 用量、記憶體用量和網路用量。您可以在Google Cloud 控制台中查看下列用量指標。
- 副本數:已部署模型使用的有效副本數。
- 副本目標:已部署模型所需的有效副本數量。
- CPU 用量:已部署模型副本的目前 CPU 核心用量率。 100% 代表一個 CPU 核心完全使用,因此如果副本的機器類型有多個核心,使用率可能會超過 100%。
- 記憶體用量:已部署模型副本分配的記憶體量,以及目前使用的記憶體量。
- 網路傳送的位元組數:已部署模型副本透過網路傳送的位元組數。
- 收到的網路位元組數:已部署模型副本透過網路接收的位元組數。
- 加速器平均任務週期:在過去取樣期間,一或多個加速器主動處理作業的平均時間比例。
- 加速器記憶體用量:已部署模型副本分配的記憶體量。
查看端點監控指標圖表
前往Google Cloud 控制台的 Agent Platform「端點」頁面。
按一下端點名稱即可查看指標。
在圖表間隔下方,按一下「效能」或「資源用量」,即可查看效能或資源用量指標。
您可以選取不同的圖表間隔,查看特定時間範圍內的指標值,例如 1 小時、12 小時或 14 天。
如果端點部署了多個模型,您可以選取或取消選取模型,查看或隱藏特定模型的指標。如果選取多個模型,控制台會將部分模型指標歸入單一圖表。舉例來說,如果某項指標為每個模型提供的值只有一個,控制台就會將模型指標歸入單一圖表,例如 CPU 使用率。如果某項指標為每個模型提供的值有多個,控制台就會為每個模型提供一個圖表。舉例來說,控制台會為每個模型提供一個回應代碼圖表。
Vertex AI 特徵儲存庫 (舊版) 監控指標
使用 Vertex AI 特徵儲存庫 (舊版) 建構特徵儲存庫後,您可以監控其效能和資源用量,例如線上儲存空間服務延遲時間或線上儲存空間節點數量。舉例來說,更新特徵儲存庫的線上儲存空間節點數後,您可能想監控線上儲存空間服務指標的變化。
在 Cloud Monitoring 中,特徵儲存庫的受監控資源類型為 aiplatform.googleapis.com/Featurestore。
指標
- 要求大小:特徵儲存庫中各實體類型的要求大小。
- 離線儲存空間寫入串流寫入:為離線儲存空間處理的串流寫入要求數量。
- 串流寫入離線儲存空間的延遲時間:呼叫寫入 API 與寫入離線儲存空間之間經過的時間 (以秒為單位)。
- 節點數:特徵儲存庫的線上提供節點數量。
- 延遲:線上提供或串流擷取要求在服務中花費的總時間。
- 每秒查詢次數:特徵儲存庫處理的線上提供或串流擷取查詢次數。
- 錯誤百分比:處理線上提供或串流擷取要求時,特徵儲存庫產生的錯誤百分比。
- CPU 使用率:線上提供儲存空間使用的特徵儲存庫分配 CPU 分數。如果線上提供儲存空間過載,這個數字可能會超過 100%。請考慮增加特徵儲存庫的線上提供節點數量,以降低 CPU 使用率。
- CPU 使用率 - 最繁忙的節點:最繁忙節點的 CPU 負載,位於特徵商店的線上儲存空間。
- 離線儲存空間總計:儲存在特徵商店離線儲存空間的資料量。
- 線上儲存空間總量:儲存在特徵商店線上儲存空間的資料量。
- 線上提供處理量:以 MBps 為單位,線上提供要求的處理量。
查看 Feature Store 監控指標圖表
前往Google Cloud 控制台的 Agent Platform「功能」頁面。
在「Featurestore」(特徵存放區) 欄中,按一下特徵存放區的名稱,即可查看指標。
您可以選取不同的圖表間隔,查看特定時間範圍內的指標值,例如 1 小時、1 天或 1 週。
對於部分線上提供指標,您可以選擇查看特定方法的指標,進一步依實體類型細分指標。舉例來說,您可以查看
ReadFeatureValues方法或StreamingReadFeatureValues方法的延遲時間。
Vertex AI 特徵儲存庫監控指標
使用 Vertex AI 特徵儲存庫設定線上提供後,即可監控服務的效能和資源使用率。舉例來說,您可以監控 CPU 負載、最佳化線上提供的節點數量,以及提供要求數量。
在 Cloud Monitoring 中,網路商店執行個體的受監控資源類型為 aiplatform.googleapis.com/FeatureOnlineStore。
指標
儲存的位元組數:線上商店執行個體中的資料量 (以位元組為單位)。
CPU 負載:網路商店執行個體中節點的平均 CPU 負載。
CPU 負載 (最繁忙的節點):線上商店執行個體中最繁忙節點的 CPU 負載。
節點數量:為 Bigtable 線上提供設定的網路商店執行個體線上提供節點數量。
最佳化節點數量:為最佳化線上提供設定的網路商店執行個體線上提供節點數量。
請求數:網路商店執行個體收到的請求數。
要求延遲時間:網路商店執行個體的伺服器端要求延遲時間。
回應位元組數:在線上提供回應中傳送的資料量 (以位元組為單位)。
提供資料存在時間:以秒為單位計算的提供資料存在時間,計算方式為目前時間與上次同步時間的差異。
執行中的同步處理作業數量:特定時間點正在執行的同步處理作業數量。
提供資料 (按照同步處理時間區分):按照同步處理時間戳記,細分線上商店執行個體中的資料。