收集 Metabase 記錄

支援的國家/地區:

本文說明如何使用 Google Cloud Storage V2,將 Metabase 記錄檔擷取至 Google Security Operations。

Metabase 是開放原始碼的商業智慧和分析平台,可讓機構查詢資料庫、建立視覺化內容,以及建構資訊主頁。在 Pro 和 Enterprise 方案中,Metabase 會將使用情況分析和稽核資料 (包括活動記錄、檢視記錄和查詢執行記錄) 儲存在應用程式資料庫中。Cloud Run 函式會查詢 Metabase API 來擷取這項資料,並將資料寫入 GCS bucket,供 Google SecOps 擷取。

事前準備

請確認您已完成下列事前準備事項:

  • Google SecOps 執行個體
  • 已啟用 Cloud Storage、Cloud Run、Pub/Sub 和 Cloud Scheduler API 的 GCP 專案
  • 建立及管理 GCS bucket 的權限
  • 管理 Google Cloud Storage 值區 IAM 政策的權限
  • 建立 Cloud Run 服務、Pub/Sub 主題和 Cloud Scheduler 工作的權限
  • Metabase Pro 或 Enterprise 方案 (Open Source 或 Cloud Starter 版本不提供使用情況分析)
  • Metabase 管理員權限,可建立 API 金鑰
  • 在 Metabase 中新增為資料來源的 Metabase 應用程式資料庫 (透過 API 查詢稽核資料表時必須使用)

設定 Metabase API 存取權

如要讓 Google SecOps 擷取使用情況分析資料,您必須在 Metabase 中建立 API 金鑰,並將應用程式資料庫新增為可查詢的資料來源。

建立 API 金鑰

  1. 以管理員身分登入 Metabase 執行個體
  2. 按一下右上角的齒輪圖示
  3. 選取「管理設定」
  4. 前往「設定」分頁。
  5. 按一下左側選單中的「驗證」分頁標籤。
  6. 捲動至「API 金鑰」,然後按一下「管理」
  7. 按一下「建立 API 金鑰」按鈕。
  8. 請提供下列設定詳細資料:
    • 金鑰名稱:輸入描述性名稱 (例如 Google SecOps Integration)
    • 群組:選取有權存取「使用情況分析」集合,以及查詢應用程式資料庫的群組
  9. 點選「建立」
  10. 複製並妥善儲存 API 金鑰。

將應用程式資料庫新增為資料來源

如要透過 API 查詢稽核資料表,您必須在 Metabase 中新增 Metabase 應用程式資料庫做為資料來源。

  1. 在 Metabase 中,按一下右上角的齒輪圖示
  2. 選取「管理設定」
  3. 前往「資料庫」分頁。
  4. 按一下「新增資料庫」
  5. 設定資料庫連線:
    • 資料庫類型:選取「PostgreSQL」或「MySQL」 (視應用程式資料庫而定)
    • 「Name」(名稱):輸入 Metabase Application Database
    • 主機:輸入應用程式資料庫的主機名稱
    • 通訊埠:輸入資料庫通訊埠 (預設值:PostgreSQL 為 5432,MySQL 為 3306)
    • 資料庫名稱:輸入應用程式資料庫名稱 (例如 metabase)
    • 使用者名稱:輸入資料庫使用者,並對 audit_logview_logquery_execution 資料表擁有 SELECT 權限
    • Password (密碼):輸入資料庫密碼
  6. 按一下 [儲存]
  7. 儲存後,請記下網址中的「資料庫 ID」 (例如 https://metabase.example.com/admin/databases/5 表示資料庫 ID 為 5)。

驗證權限

如要確認 API 金鑰是否具備必要權限,請按照下列步驟操作:

  1. 以管理員身分登入 Metabase。
  2. 依序點選「齒輪圖示」>「管理設定」>「使用者」
  3. 找出指派給 API 金鑰的群組。
  4. 確認群組有權存取「使用情況分析」集合。
  5. 依序前往「管理設定」>「權限」>「資料」
  6. 確認群組對應用程式資料庫具有「無限制」或「查詢」存取權。

測試 API 存取權

  • 請先測試憑證,再繼續進行整合:

    # Replace with your actual values
    METABASE_URL="https://your-metabase-instance.com"
    API_KEY="mb_your_api_key_here"
    DATABASE_ID="5"
    
    # Test API key authentication
    curl -s -H "x-api-key: ${API_KEY}" \
      "${METABASE_URL}/api/database" \
      | python3 -m json.tool
    
    # Test querying the application database for audit_log records
    curl -s -X POST "${METABASE_URL}/api/dataset/json" \
      -H "x-api-key: ${API_KEY}" \
      -H "Content-Type: application/json" \
      -d "{\"database\": ${DATABASE_ID}, \"type\": \"native\", \"native\": {\"query\": \"SELECT * FROM audit_log ORDER BY id DESC LIMIT 5\", \"template-tags\": {}}, \"parameters\": []}" \
      | python3 -m json.tool
    

成功的回應會傳回近期稽核記錄的 JSON 陣列。

建立 Google Cloud Storage bucket

  1. 前往 Google Cloud 控制台
  2. 選取專案或建立新專案。
  3. 在導覽選單中,依序前往「Cloud Storage」>「Bucket」
  4. 按一下「建立值區」
  5. 請提供下列設定詳細資料:

    設定
    為 bucket 命名 輸入全域不重複的名稱 (例如 metabase-audit-logs)
    位置類型 根據需求選擇 (區域、雙區域、多區域)
    位置 選取位置 (例如 us-central1)
    儲存空間級別 標準 (建議用於經常存取的記錄)
    存取控管 統一 (建議)
    保護工具 選用:啟用物件版本管理或資料保留政策
  6. 點選「建立」

為 Cloud Run 函式建立服務帳戶

Cloud Run 函式需要具備 GCS bucket 寫入權限,且可由 Pub/Sub 叫用的服務帳戶。

建立服務帳戶

  1. GCP 控制台中,依序前往「IAM & Admin」(IAM 與管理) >「Service Accounts」(服務帳戶)
  2. 按一下「Create Service Account」(建立服務帳戶)
  3. 請提供下列設定詳細資料:
    • 服務帳戶名稱:輸入 metabase-audit-collector-sa
    • 服務帳戶說明:輸入 Service account for Cloud Run function to collect Metabase audit logs
  4. 按一下「建立並繼續」
  5. 在「將專案存取權授予這個服務帳戶」部分,新增下列角色:
    1. 按一下「選擇角色」
    2. 搜尋並選取「Storage 物件管理員」
    3. 點選「+ 新增其他角色」
    4. 搜尋並選取「Cloud Run Invoker」
    5. 點選「+ 新增其他角色」
    6. 搜尋並選取「Cloud Functions Invoker」(Cloud Functions 叫用者)
  6. 按一下「繼續」
  7. 按一下 [完成]

這些角色適用於:

  • Storage 物件管理員:將記錄檔寫入 GCS bucket,並管理狀態檔案
  • Cloud Run 叫用者:允許 Pub/Sub 叫用函式
  • Cloud Functions 叫用者:允許函式叫用

授予 GCS 值區的 IAM 權限

  1. 依序前往「Cloud Storage」>「Buckets」
  2. 按一下 bucket 名稱 (metabase-audit-logs)。
  3. 前往「權限」分頁標籤。
  4. 按一下「授予存取權」
  5. 請提供下列設定詳細資料:
    • 新增主體:輸入服務帳戶電子郵件地址 (metabase-audit-collector-sa@PROJECT_ID.iam.gserviceaccount.com)
    • 指派角色:選取「Storage 物件管理員」
  6. 按一下 [儲存]

建立 Pub/Sub 主題

  1. GCP Console 中,前往「Pub/Sub」>「Topics」(主題)
  2. 按一下「建立主題」
  3. 請提供下列設定詳細資料:
    • 主題 ID:輸入 metabase-audit-trigger
    • 其他設定保留預設值
  4. 點選「建立」

建立 Cloud Run 函式來收集記錄

Cloud Run 函式會由 Cloud Scheduler 的 Pub/Sub 訊息觸發,從 Metabase API 擷取稽核資料,並寫入 GCS。

  1. 前往 GCP Console 的「Cloud Run」
  2. 按一下「Create service」(建立服務)
  3. 選取「函式」 (使用內嵌編輯器建立函式)。
  4. 在「設定」部分,提供下列設定詳細資料:

    設定
    服務名稱 metabase-audit-collector
    區域 選取與 GCS bucket 相符的區域 (例如 us-central1)
    執行階段 選取 Python 3.12 以上版本
  5. 在「Trigger (optional)」(觸發條件 (選用)) 專區:

    1. 按一下「+ 新增觸發條件」
    2. 選取「Cloud Pub/Sub」
    3. 在「Select a Cloud Pub/Sub topic」(選取 Cloud Pub/Sub 主題) 中,選擇 metabase-audit-trigger
    4. 按一下 [儲存]
  6. 在「Authentication」(驗證) 部分:

    1. 選取「需要驗證」
    2. 檢查 Identity and Access Management (IAM)
  7. 向下捲動並展開「容器」、「網路」和「安全性」

  8. 前往「安全性」分頁:

    • 服務帳戶:選取 metabase-audit-collector-sa
  9. 前往「容器」分頁:

    1. 按一下「變數與密鑰」
    2. 針對每個環境變數,按一下「+ 新增變數」
    變數名稱 範例值 說明
    GCS_BUCKET metabase-audit-logs GCS bucket 名稱
    GCS_PREFIX metabase-audit 記錄檔的前置字串
    STATE_KEY metabase-audit/state.json 狀態檔案路徑
    METABASE_URL https://metabase.yourcompany.com Metabase 執行個體基準網址
    METABASE_API_KEY mb_your_api_key_here Metabase API 金鑰
    DATABASE_ID 5 應用程式資料庫 ID
    LOOKBACK_HOURS 24 初始回溯期
    PAGE_SIZE 2000 每個 API 查詢的記錄數
  10. 在「變數與密鑰」部分,向下捲動至「要求」

    • 要求逾時:輸入 600 秒 (10 分鐘)
  11. 前往「設定」分頁:

    • 在「資源」部分:
      • 記憶體:選取 512 MiB 以上
      • CPU:選取 1
  12. 在「修訂版本資源調度」部分:

    • 執行個體數量下限:輸入 0
    • 執行個體數量上限:輸入 100
  13. 點選「建立」

  14. 等待服務建立完成 (1 到 2 分鐘)。

  15. 服務建立完成後,系統會自動開啟內嵌程式碼編輯器

新增函式程式碼

  1. 在「進入點」欄位中輸入「main」
  2. 在內嵌程式碼編輯器中建立兩個檔案:

    • main.py:

      import functions_framework
      from google.cloud import storage
      import json
      import os
      import urllib3
      from datetime import datetime, timezone, timedelta
      
      http = urllib3.PoolManager(
        timeout=urllib3.Timeout(connect=10.0, read=60.0),
        retries=False,
      )
      
      storage_client = storage.Client()
      
      GCS_BUCKET = os.environ.get('GCS_BUCKET')
      GCS_PREFIX = os.environ.get('GCS_PREFIX', 'metabase-audit')
      STATE_KEY = os.environ.get('STATE_KEY', 'metabase-audit/state.json')
      METABASE_URL = os.environ.get('METABASE_URL', '').rstrip('/')
      API_KEY = os.environ.get('METABASE_API_KEY')
      DATABASE_ID = int(os.environ.get('DATABASE_ID', '1'))
      LOOKBACK_HOURS = int(os.environ.get('LOOKBACK_HOURS', '24'))
      PAGE_SIZE = int(os.environ.get('PAGE_SIZE', '2000'))
      
      TABLES = ['audit_log', 'view_log', 'query_execution']
      
      TABLE_TIME_COLUMNS = {
        'audit_log': 'timestamp',
        'view_log': 'timestamp',
        'query_execution': 'started_at',
      }
      
      @functions_framework.cloud_event
      def main(cloud_event):
        if not all([GCS_BUCKET, METABASE_URL, API_KEY]):
          print('Error: Missing required environment variables')
          return
      
        try:
          bucket = storage_client.bucket(GCS_BUCKET)
          state = load_state(bucket)
          now = datetime.now(timezone.utc)
      
          if isinstance(state, dict) and state.get('last_event_time'):
            try:
              last_val = state['last_event_time']
              if last_val.endswith('Z'):
                last_val = last_val[:-1] + '+00:00'
              last_time = datetime.fromisoformat(last_val)
              last_time = last_time - timedelta(minutes=2)
            except Exception as e:
              print(f"Warning: Could not parse last_event_time: {e}")
              last_time = now - timedelta(hours=LOOKBACK_HOURS)
          else:
            last_time = now - timedelta(hours=LOOKBACK_HOURS)
      
          print(f"Fetching logs from {last_time.isoformat()} to {now.isoformat()}")
      
          all_records = []
          newest_time = None
      
          for table in TABLES:
            time_col = TABLE_TIME_COLUMNS[table]
            records = fetch_table(table, time_col, last_time, now)
            for r in records:
              r['_metabase_table'] = table
              t = r.get(time_col)
              if t and (newest_time is None or str(t) > str(newest_time)):
                newest_time = t
            all_records.extend(records)
            print(f"Table {table}: fetched {len(records)} records")
      
          if not all_records:
            print("No new records found.")
            save_state(bucket, now.isoformat())
            return
      
          timestamp = now.strftime('%Y%m%d_%H%M%S')
          object_key = f"{GCS_PREFIX}/metabase_audit_{timestamp}.ndjson"
          blob = bucket.blob(object_key)
      
          ndjson = '\n'.join(
            [json.dumps(r, ensure_ascii=False, default=str) for r in all_records]
          ) + '\n'
          blob.upload_from_string(ndjson, content_type='application/x-ndjson')
      
          print(f"Wrote {len(all_records)} records to gs://{GCS_BUCKET}/{object_key}")
      
          save_state(bucket, str(newest_time) if newest_time else now.isoformat())
      
          print(f"Successfully processed {len(all_records)} records")
      
        except Exception as e:
          print(f'Error processing logs: {str(e)}')
          raise
      
      def fetch_table(table, time_col, start_time, end_time):
        start_str = start_time.strftime('%Y-%m-%d %H:%M:%S')
        end_str = end_time.strftime('%Y-%m-%d %H:%M:%S')
      
        all_records = []
        offset = 0
        max_pages = 50
      
        for page in range(max_pages):
          sql = (
            f"SELECT * FROM {table} "
            f"WHERE {time_col} >= '{start_str}' "
            f"AND {time_col} < '{end_str}' "
            f"ORDER BY {time_col} ASC "
            f"LIMIT {PAGE_SIZE} OFFSET {offset}"
          )
      
          query_body = {
            "database": DATABASE_ID,
            "type": "native",
            "native": {
              "query": sql,
              "template-tags": {}
            },
            "parameters": []
          }
      
          url = f"{METABASE_URL}/api/dataset/json"
          response = http.request(
            'POST', url,
            body=json.dumps(query_body).encode('utf-8'),
            headers={
              'x-api-key': API_KEY,
              'Content-Type': 'application/json'
            }
          )
      
          if response.status == 429:
            print(f"Rate limited on {table} query. Stopping pagination.")
            break
      
          if response.status != 200:
            print(f"{table} query failed: {response.status} - "
                f"{response.data.decode('utf-8')}")
            break
      
          page_results = json.loads(response.data.decode('utf-8'))
      
          if not page_results:
            break
      
          all_records.extend(page_results)
          print(f"{table} page {page + 1}: {len(page_results)} records "
              f"(total: {len(all_records)})")
      
          if len(page_results) < PAGE_SIZE:
            break
      
          offset += PAGE_SIZE
      
        return all_records
      
      def load_state(bucket):
        try:
          blob = bucket.blob(STATE_KEY)
          if blob.exists():
            return json.loads(blob.download_as_text())
        except Exception as e:
          print(f"Warning: Could not load state: {e}")
        return {}
      
      def save_state(bucket, last_event_time_iso):
        try:
          state = {
            'last_event_time': last_event_time_iso,
            'last_run': datetime.now(timezone.utc).isoformat()
          }
          blob = bucket.blob(STATE_KEY)
          blob.upload_from_string(
            json.dumps(state, indent=2),
            content_type='application/json'
          )
          print(f"Saved state: last_event_time={last_event_time_iso}")
        except Exception as e:
          print(f"Warning: Could not save state: {e}")
      
    • requirements.txt:

    functions-framework==3.*
    google-cloud-storage==2.*
    urllib3>=2.0.0
    
  3. 點選「部署」即可儲存並部署函式。

  4. 等待部署作業完成 (2 到 3 分鐘)。

建立 Cloud Scheduler 工作

  1. 前往 GCP 主控台的「Cloud Scheduler」
  2. 點選「建立工作」
  3. 請提供下列設定詳細資料:

    設定
    名稱 metabase-audit-collector-hourly
    區域 選取與 Cloud Run 函式相同的區域
    頻率 0 * * * * (每小時整點)
    時區 選取時區 (建議使用世界標準時間)
    目標類型 Pub/Sub
    主題 選取「metabase-audit-trigger
    郵件內文 {} (空白 JSON 物件)
  4. 點選「建立」

排程頻率選項

根據記錄檔量和延遲時間要求選擇頻率:

頻率 Cron 運算式 用途
每 5 分鐘 */5 * * * * 大量、低延遲
每 15 分鐘 */15 * * * * 中等
每小時 0 * * * * 標準 (建議)
每 6 小時 0 */6 * * * 少量、批次處理
每日 0 0 * * * 歷來資料集合

測試整合項目

  1. Cloud Scheduler 控制台中,找出您的工作 (metabase-audit-collector-hourly)。
  2. 按一下「強制執行」即可手動觸發工作。
  3. 稍等幾秒鐘。
  4. 前往「Cloud Run」>「Services」
  5. 按一下 metabase-audit-collector
  6. 按一下 [Logs] (記錄) 分頁標籤。
  7. 確認函式是否已順利執行。請注意以下事項:

    Fetching logs from YYYY-MM-DDTHH:MM:SS+00:00 to YYYY-MM-DDTHH:MM:SS+00:00
    Table audit_log: fetched X records
    Table view_log: fetched X records
    Table query_execution: fetched X records
    Wrote X records to gs://metabase-audit-logs/metabase-audit/metabase_audit_YYYYMMDD_HHMMSS.ndjson
    Successfully processed X records
    
  8. 依序前往「Cloud Storage」>「Buckets」

  9. 按一下 metabase-audit-logs

  10. 前往 metabase-audit/ 資料夾。

  11. 確認是否已建立新的 .ndjson 檔案,且檔案名稱包含目前的時間戳記。

如果記錄中顯示錯誤:

  • HTTP 401:確認 METABASE_API_KEY 環境變數正確無誤,且金鑰未遭刪除或重新產生
  • HTTP 403:確認 API 金鑰的群組是否具備應用程式資料庫的查詢權限
  • HTTP 429:頻率限制,函式會停止分頁,並在下次排定的執行時間繼續
  • 缺少環境變數:確認 Cloud Run 函式設定中已設定所有必要變數
  • 結果空白:確認 DATABASE_ID 正確無誤、應用程式資料庫已新增為資料來源,且您使用的是 Metabase Pro 或 Enterprise

擷取 Google SecOps 服務帳戶

  1. 依序前往「SIEM 設定」>「動態饋給」
  2. 按一下「新增動態消息」
  3. 按一下「設定單一動態饋給」
  4. 在「動態饋給名稱」欄位中輸入動態饋給名稱 (例如 Metabase Audit Logs)。
  5. 選取「Google Cloud Storage V2」做為「來源類型」
  6. 選取「METABASE」做為「記錄類型」
  7. 按一下「取得服務帳戶」,系統會顯示專屬服務帳戶電子郵件地址,例如:

    chronicle-12345678@chronicle-gcp-prod.iam.gserviceaccount.com
    
  8. 複製這個電子郵件地址,以便在下一步中使用。

  9. 點選「下一步」

  10. 指定下列輸入參數的值:

    • 儲存空間 bucket URL:輸入 GCS bucket URI,並加上前置路徑:

      gs://metabase-audit-logs/metabase-audit/
      
    • 來源刪除選項:根據偏好設定選取刪除選項:

      • 永不:移轉後一律不刪除任何檔案 (建議用於測試)。
      • 刪除已轉移的檔案:成功轉移檔案後刪除檔案。
      • 刪除已轉移的檔案和空白目錄:成功轉移後刪除檔案和空白目錄。

    • 檔案存在時間上限:包含在過去天數內修改的檔案 (預設為 180 天)

    • 資產命名空間資產命名空間

    • 擷取標籤:要套用至這個動態饋給事件的標籤

  11. 點選「下一步」

  12. 在「Finalize」(完成) 畫面中檢查新的動態饋給設定,然後按一下「Submit」(提交)

將 IAM 權限授予 Google SecOps 服務帳戶

Google SecOps 服務帳戶需要 GCS bucket 的「Storage 物件檢視者」角色。

  1. 依序前往「Cloud Storage」>「Buckets」
  2. 按一下 metabase-audit-logs
  3. 前往「權限」分頁標籤。
  4. 按一下「授予存取權」
  5. 請提供下列設定詳細資料:
    • 新增主體:貼上 Google SecOps 服務帳戶電子郵件地址
    • 指派角色:選取「Storage 物件檢視者」
  6. 按一下 [儲存]

用量分析資料表

Cloud Run 函式會從 Metabase 應用程式資料庫查詢下列資料表:

資料表名稱 說明
audit_log 設定變更、使用者動作和系統事件的記錄
view_log 追蹤資訊卡 (問題/模型)、資訊主頁和表格的瀏覽次數
query_execution 所有資訊主頁執行的所有查詢相關資訊

資料保留

根據預設,Metabase 會保留使用情況數據分析資料 720 天 (約 2 年)。Metabase 每天會自動刪除兩次超過這個門檻的資料列。如要變更保留期限,請在執行 Metabase 時設定環境變數 MB_AUDIT_MAX_RETENTION_DAYS

UDM 對應表

記錄欄位 UDM 對應 邏輯
其他 其他 已從「其他」重新命名
語言代碼 additional.fields 與各自的標籤合併 (例如,locale 的 locale_label、is_active 的 is_active_label 等)
is_active additional.fields
is_qbnewb additional.fields
group_ids additional.fields
is_superuser additional.fields
login_attributes additional.fields
id additional.fields
sso_source additional.fields
personal_collection_id additional.fields
中繼資料 中繼資料 從中繼資料重新命名
updated_at metadata.event_timestamp 使用 ISO8601、RFC 3339 或 yyyy-MM-ddTHH:mm:ss.SSSSSSZ 從 updated_at 剖析的日期
has_userid metadata.event_type 如果 has_userid ==「true」,則設為「USER_UNCATEGORIZED」,否則設為「GENERIC_EVENT」
主體 主體 已從主體重新命名
metabase_host principal.url 直接複製值
date_joined principal.user.attribute.creation_time 使用 ISO8601、RFC 3339 或 yyyy-MM-ddTHH:mm:ss.SSSSSSZ 從 date_joined 剖析的日期
電子郵件 principal.user.email_addresses 從電子郵件地址合併
first_name principal.user.first_name 直接複製值
last_login principal.user.last_login_time 從 last_login 剖析的日期,使用 ISO8601、RFC 3339 或 yyyy-MM-ddTHH:mm:ss.SSSSSSZ
last_name principal.user.last_name 直接複製值
common_name principal.user.user_display_name 直接複製值
電子郵件 principal.user.userid 直接從電子郵件複製值
security_result security_result 從 security_result 合併
目標 目標 已從目標重新命名
metadata.product_name metadata.product_name 設為「METABASE」
metadata.vendor_name metadata.vendor_name 設為「METABASE」

變更記錄

查看這個剖析器的變更記錄

還有其他問題嗎?向社群成員和 Google SecOps 專業人員尋求答案。