標準即付即用 (標準 PayGo) 是一種消費選項,可供使用 Gemini Enterprise Agent Platform 的全套生成式 AI 模型,包括 Gemini 模型系列。
標準隨用隨付方案讓您只需要為耗用的資源付費,無須預付任何費用。為確保可擴充工作負載的效能更穩定,標準隨用隨付方案採用用量等級制度。Agent Platform 會根據貴機構在過去 30 天內,於符合資格的 Agent Platform 服務上的支出總額,動態調整機構的基準處理量。隨著貴機構的支出增加,系統會自動將您升級至較高的級別,提供更多共用資源和更高的成效門檻。如果工作負載需要比標準隨用隨付更穩定的效能,請考慮使用優先隨用隨付。如需專屬和保證輸送量,請參閱「佈建輸送量」。
用量等級和處理量
每個標準隨用隨付用量層級都旨在提供以每分鐘權杖數 (TPM) 衡量的基準輸送量,做為貴機構流量的可預測效能下限。輸送量限制是以傳送至全域端點的要求為準。建議使用全域端點,因為這樣可以存取更大的多區域處理量容量集區,並將要求路由至可用性最高的地區,盡可能提升效能。
您的流量不會嚴格限制在基準輸送量上限。 Agent Platform 會盡可能讓流量超出這個限制。不過,在 Agent Platform 需求量高的時段,這類過多的爆量流量可能會導致效能變異性較高。為提升效能並盡量避免收到這類錯誤,最佳做法是盡可能在每分鐘內平均分配流量。避免在第二層尖峰時段突然傳送大量要求。即使每分鐘平均用量低於上限,流量突然暴增仍可能導致節流。更平均地分配 API 呼叫,有助於系統預測負載並提升整體效能。
標準隨用隨付方案提供下列等級:
| 模型系列 | 級別 | 顧客支出 (30 天) | 流量 TPM (機構層級) |
|---|---|---|---|
| Gemini Pro 模型 | 級別 1 | $10 至 $250 美元 | 500,000 |
| 級別 2 | $250 至 $2,000 美元 | 1,000,000 | |
| 第 3 級 | > $2000 | 2,000,000 | |
| Gemini Flash 和 Flash-Lite 模型 | 級別 1 | $10 至 $250 美元 | 2,000,000 |
| 級別 2 | $250 至 $2,000 美元 | 4,000,000 | |
| 第 3 級 | > $2000 | 10,000,000 |
請注意,模型系列顯示的輸送量上限會分別套用至該系列中的每個模型。舉例來說,第 3 層級的客戶使用 Gemini 2.5 Flash 時,基準輸送量為 10,000,000 TPM。使用量達到其中一項限制,不會影響其他模型的輸送量。各層級沒有個別的每分鐘要求數 (RPM) 限制。不過,每個模型每個區域的系統限制為每分鐘 30,000 次要求。使用多模態輸入內容的 Gemini 請求會受到相應的系統速率限制,包括圖片、音訊、影片和文件。
用量層級的運作方式
系統會根據貴機構在過去 30 天內,於符合資格的 Agent Platform 服務上的總支出,自動決定用量層級。隨著機構的支出增加,系統會將您升級至更高的層級,提供更大的輸送量。
支出計算
這項計算涵蓋各種服務,包括所有 Gemini 模型系列的預測功能、Agent Platform CPU/GPU/TPU 執行個體,以及以約定用量為準的 SKU (例如佈建輸送量)。
按一下即可進一步瞭解支出計算中包含的 SKU。
下表列出計入總支出的 Google Cloud SKU 類別。
| 類別 | 內含 SKU 的說明 |
|---|---|
| Gemini 模型 | 所有 Gemini 模型系列 (例如 2.0、2.5、3.0 的 Pro、Flash 和 Lite 版本),可預測所有模態 (文字、圖像、音訊、影片),包括批次、長脈絡、微調和「思考」變體 |
| Gemini 模型功能 | 所有相關的 Gemini SKU,適用於所有模式和模型版本,包括快取、快取儲存空間和優先層級等功能 |
| Agent Platform CPU | 所有以 CPU 為基礎的執行個體系列 (例如 C2、C3、E2、N1、N2 和其變體) 的線上和批次預測 |
| Agent Platform GPU | 在所有 NVIDIA GPU 加速執行個體上進行線上和批次預測 (例如 A100、H100、H200、B200、L4、T4、V100 和 RTX 系列) |
| Agent Platform TPU | 在所有以 TPU 為基礎的執行個體 (例如 TPU-v5e、v6e) 上進行線上和批次預測 |
| 管理與費用 | 與各種 Agent Platform 預測執行個體相關的所有「管理費」SKU |
| 佈建輸送量 | 所有承諾使用佈建輸送量 SKU |
| 其他服務 | 專業服務,例如「LLM Grounding for Gemini... with Google Search tool」 |
確認用量層級
如要查看貴機構的使用層級,請前往 Google Cloud 控制台的 Agent Platform 資訊主頁。如要在資訊主頁上查看用量層級,您需要專案的Agent Platform 檢視者角色 (roles/aiplatform.viewer),以及帳單帳戶的帳單帳戶檢視者角色 (roles/billing.viewer)。
驗證支出
如要查看 Agent Platform 的支出,請前往Google Cloud 控制台的 Cloud Billing。請注意,支出是在機構層級彙整。
資源用盡 (429) 錯誤
如果收到 429 錯誤,並不代表您已達到固定配額。這表示特定共用資源的爭用情況暫時較為嚴重。建議您實作指數輪詢重試策略來處理這些錯誤,因為這個動態環境的可用性可能會快速變更。除了重試策略,我們也建議使用全域端點。與區域端點 (例如 us-central1) 不同,全域端點會動態將要求傳送至當時可用容量最多的區域。這樣一來,應用程式就能存取更大的多區域共用容量集區,大幅提高爆量成功率,並降低發生 429 錯誤的機率。
為獲得最佳效果,請搭配使用全域端點和流量平滑化功能。 請避免在尖峰時段傳送要求,因為即使每分鐘的平均用量在基準輸送量限制內,瞬間流量過高仍可能導致節流。更平均地分配 API 呼叫,有助於系統預測負載並提升整體效能。如要進一步瞭解如何處理資源耗盡錯誤,請參閱「建構彈性 LLM 應用程式並減少 429 錯誤」和「錯誤代碼 429」。
支援的模型
下列正式發布 (GA) 的 Gemini 模型及其監督式微調模型支援標準隨用隨付方案 (含用量層級):
按一下即可展開支援的機型
下列GA的 Gemini 模型和受監督微調模型也支援標準隨用隨付方案,但使用層級不適用於這些模型:
請注意,這些層級不適用於預先發布版模型。如需最準確的最新資訊,請參閱各模型的專屬官方說明文件。
監控處理量和效能
如要監控貴機構的即時權杖用量,請前往 Cloud Monitoring 的 Metrics Explorer。
如要進一步瞭解如何監控模型端點流量,請參閱「監控模型」。
請注意,用量層級適用於機構層級。如要瞭解如何設定可觀測性範圍,以便繪製貴機構中多項專案的輸送量圖表,請參閱「設定可觀測性範圍,以便查詢多項專案」。