標準版即付即用

標準即付即用 (標準 PayGo) 是一種消費選項,可供使用 Gemini Enterprise Agent Platform 的全套生成式 AI 模型,包括 Gemini 模型系列。

標準隨用隨付方案讓您只需要為耗用的資源付費,無須預付任何費用。為確保可擴充工作負載的效能更穩定,標準隨用隨付方案採用用量等級制度。Agent Platform 會根據貴機構在過去 30 天內,於符合資格的 Agent Platform 服務上的支出總額,動態調整機構的基準處理量。隨著貴機構的支出增加,系統會自動將您升級至較高的級別,提供更多共用資源和更高的成效門檻。如果工作負載需要比標準隨用隨付更穩定的效能,請考慮使用優先隨用隨付。如需專屬和保證輸送量,請參閱「佈建輸送量」。

用量等級和處理量

每個標準隨用隨付用量層級都旨在提供以每分鐘權杖數 (TPM) 衡量的基準輸送量,做為貴機構流量的可預測效能下限。輸送量限制是以傳送至全域端點的要求為準。建議使用全域端點,因為這樣可以存取更大的多區域處理量容量集區,並將要求路由至可用性最高的地區,盡可能提升效能。

您的流量不會嚴格限制在基準輸送量上限。 Agent Platform 會盡可能讓流量超出這個限制。不過,在 Agent Platform 需求量高的時段,這類過多的爆量流量可能會導致效能變異性較高。為提升效能並盡量避免收到這類錯誤,最佳做法是盡可能在每分鐘內平均分配流量。避免在第二層尖峰時段突然傳送大量要求。即使每分鐘平均用量低於上限,流量突然暴增仍可能導致節流。更平均地分配 API 呼叫,有助於系統預測負載並提升整體效能。

標準隨用隨付方案提供下列等級:

模型系列 級別 顧客支出 (30 天) 流量 TPM (機構層級)
Gemini Pro 模型 級別 1 $10 至 $250 美元 500,000
級別 2 $250 至 $2,000 美元 1,000,000
第 3 級 > $2000 2,000,000
Gemini Flash 和 Flash-Lite 模型 級別 1 $10 至 $250 美元 2,000,000
級別 2 $250 至 $2,000 美元 4,000,000
第 3 級 > $2000 10,000,000

請注意,模型系列顯示的輸送量上限會分別套用至該系列中的每個模型。舉例來說,第 3 層級的客戶使用 Gemini 2.5 Flash 時,基準輸送量為 10,000,000 TPM。使用量達到其中一項限制,不會影響其他模型的輸送量。各層級沒有個別的每分鐘要求數 (RPM) 限制。不過,每個模型每個區域的系統限制為每分鐘 30,000 次要求。使用多模態輸入內容的 Gemini 請求會受到相應的系統速率限制,包括圖片音訊影片文件

用量層級的運作方式

系統會根據貴機構在過去 30 天內,於符合資格的 Agent Platform 服務上的總支出,自動決定用量層級。隨著機構的支出增加,系統會將您升級至更高的層級,提供更大的輸送量。

支出計算

這項計算涵蓋各種服務,包括所有 Gemini 模型系列的預測功能、Agent Platform CPU/GPU/TPU 執行個體,以及以約定用量為準的 SKU (例如佈建輸送量)。

按一下即可進一步瞭解支出計算中包含的 SKU。

下表列出計入總支出的 Google Cloud SKU 類別。

類別 內含 SKU 的說明
Gemini 模型 所有 Gemini 模型系列 (例如 2.0、2.5、3.0 的 Pro、Flash 和 Lite 版本),可預測所有模態 (文字、圖像、音訊、影片),包括批次、長脈絡、微調和「思考」變體
Gemini 模型功能 所有相關的 Gemini SKU,適用於所有模式和模型版本,包括快取、快取儲存空間和優先層級等功能
Agent Platform CPU 所有以 CPU 為基礎的執行個體系列 (例如 C2、C3、E2、N1、N2 和其變體) 的線上和批次預測
Agent Platform GPU 在所有 NVIDIA GPU 加速執行個體上進行線上和批次預測 (例如 A100、H100、H200、B200、L4、T4、V100 和 RTX 系列)
Agent Platform TPU 在所有以 TPU 為基礎的執行個體 (例如 TPU-v5e、v6e) 上進行線上和批次預測
管理與費用 與各種 Agent Platform 預測執行個體相關的所有「管理費」SKU
佈建輸送量 所有承諾使用佈建輸送量 SKU
其他服務 專業服務,例如「LLM Grounding for Gemini... with Google Search tool」

確認用量層級

如要查看貴機構的使用層級,請前往 Google Cloud 控制台的 Agent Platform 資訊主頁。如要在資訊主頁上查看用量層級,您需要專案的Agent Platform 檢視者角色 (roles/aiplatform.viewer),以及帳單帳戶的帳單帳戶檢視者角色 (roles/billing.viewer)。

前往 Agent Platform 資訊主頁

驗證支出

如要查看 Agent Platform 的支出,請前往Google Cloud 控制台的 Cloud Billing。請注意,支出是在機構層級彙整。

前往 Cloud Billing

資源用盡 (429) 錯誤

如果收到 429 錯誤,並不代表您已達到固定配額。這表示特定共用資源的爭用情況暫時較為嚴重。建議您實作指數輪詢重試策略來處理這些錯誤,因為這個動態環境的可用性可能會快速變更。除了重試策略,我們也建議使用全域端點。與區域端點 (例如 us-central1) 不同,全域端點會動態將要求傳送至當時可用容量最多的區域。這樣一來,應用程式就能存取更大的多區域共用容量集區,大幅提高爆量成功率,並降低發生 429 錯誤的機率。

為獲得最佳效果,請搭配使用全域端點和流量平滑化功能。 請避免在尖峰時段傳送要求,因為即使每分鐘的平均用量在基準輸送量限制內,瞬間流量過高仍可能導致節流。更平均地分配 API 呼叫,有助於系統預測負載並提升整體效能。如要進一步瞭解如何處理資源耗盡錯誤,請參閱「建構彈性 LLM 應用程式並減少 429 錯誤」和「錯誤代碼 429」。

支援的模型

下列正式發布 (GA) 的 Gemini 模型及其監督式微調模型支援標準隨用隨付方案 (含用量層級)

按一下即可展開支援的機型

下列GA的 Gemini 模型和受監督微調模型也支援標準隨用隨付方案,但使用層級不適用於這些模型:

請注意,這些層級不適用於預先發布版模型。如需最準確的最新資訊,請參閱各模型的專屬官方說明文件。

監控處理量和效能

如要監控貴機構的即時權杖用量,請前往 Cloud Monitoring 的 Metrics Explorer。

前往「Metrics Explorer」

如要進一步瞭解如何監控模型端點流量,請參閱「監控模型」。

請注意,用量層級適用於機構層級。如要瞭解如何設定可觀測性範圍,以便繪製貴機構中多項專案的輸送量圖表,請參閱「設定可觀測性範圍,以便查詢多項專案」。

後續步驟

資源

與 Agent Platform 相關的配額和限制,不包括產品專屬限制。

總覽

瞭解 Google Cloud 如何限制 Google Cloud 雲端專案可使用的資源數量,以及配額如何適用於各種資源類型,包括硬體、軟體和網路元件。