您可以在 Gemini Enterprise Agent Platform 上,以受管理 API 的形式使用 xAI Grok 模型。您可以串流傳送回覆內容,減少使用者對延遲的感受。串流回應會使用伺服器傳送事件 (SSE),逐步串流回應。
管理 xAI 模型
您可以在 Gemini Enterprise Agent Platform 中使用 xAI 的下列模型。如要存取 xAI 模型,請前往 Model Garden 的模型資訊卡。
Grok 4.3
Grok 4.3 是 xAI 的旗艦模型。
Grok 4.20 (推論)
Grok 4.20 (Reasoning) 是 xAI 的旗艦模型,幻覺率為業界最低。擅長處理文件解讀工作,以及長時間的代理工具呼叫。
前往 Grok 4.20 (Reasoning) 模型資訊卡
Grok 4.20 (非推理)
Grok 4.20 (非推理型) 是 xAI 的旗艦非思考型模型,幻覺率為業界最低。非常適合用於需要高度即時反應的服務,例如客戶支援和分類。
Grok 4.1 Fast (推理)
Grok 4.1 Fast (Reasoning) 是 xAI 最具成本效益的模型,提供強大的工具呼叫功能,並能有效率地整合知識庫。擅長處理涉及網路資料和內部知識庫工具的搜尋工作。
前往 Grok 4.1 Fast (Reasoning) 模型資訊卡
Grok 4.1 Fast (不含推理功能)
Grok 4.1 Fast (非推理型) 是 xAI 最具成本效益的非思考型模型,已針對低延遲完成最佳化調整。擅長處理大量工作,例如摘要和分類。
前往 Grok 4.1 Fast (Non-reasoning) 模型資訊卡
使用 xAI 模型
如要使用受管理模型,可以透過下列模型名稱,使用 curl 指令將要求傳送至 Gemini Enterprise Agent Platform 端點。如要瞭解如何對 xAI 模型發出串流和非串流呼叫,請參閱「呼叫開放式模型 API」。
如果是受管理模型,您可以使用 curl 指令,透過下列模型名稱向 Gemini Enterprise Agent Platform 端點傳送要求:
- 如要使用 Grok 4.3,請按
grok-4.3 - 如要使用 Grok 4.20 (推理),請使用
grok-4.20-reasoning - 如要使用 Grok 4.20 (非推理型),請使用
grok-4.20-non-reasoning - 如要使用 Grok 4.1 Fast (Reasoning),請使用
grok-4.1-fast-reasoning - 如要使用 Grok 4.1 Fast (非推理型),請按
grok-4.1-fast-non-reasoning
Grok 配額
Grok 模型有全球配額,配額以每分鐘查詢次數 (QPM) 和每分鐘權杖數 (TPM) 表示。TPM 包含輸入和輸出權杖。
為維持整體服務效能和可接受的使用情形,配額上限可能會因帳戶而異,有時存取權也可能會受到限制。在 Google Cloud 控制台的「配額與系統限制」頁面中,查看專案配額。您也必須擁有下列配額:
global_generate_content_requests_per_minute_per_project_per_base_model定義 QPM 配額。TPM 有兩個配額值適用於特定模型:
global_generate_content_input_tokens_per_minute_per_base_model定義輸入 TPM 配額,global_generate_content_output_tokens_per_minute_per_base_model定義輸出 TPM 配額。
如要瞭解哪些模型會分別計算輸入和輸出詞元,請參閱特定模型頁面。
後續步驟
- 瞭解如何呼叫開放模型 API。
- 瞭解如何呼叫 Responses API。