收集 Fastly Next-Gen WAF(原 Signal Sciences)日志

支持的平台:

本文档介绍了如何使用 Google Cloud Storage V2 将 Fastly Next-Gen WAF(以前称为 Signal Sciences)日志注入到 Google Security Operations。

Fastly Next-Gen WAF 是一款基于云的 Web 应用防火墙,可为 Web 应用、API 和微服务提供实时威胁检测和拦截功能。它采用基于信号的方法来识别和缓解 SQL 注入、跨站脚本攻击、账号盗用和应用滥用等攻击。Signal Sciences REST API 提供对请求 Feed 数据的程序化访问,其中包含有关标记和屏蔽的请求的详细信息。

准备工作

请确保您满足以下前提条件:

  • Google SecOps 实例
  • 已启用 Cloud Storage API 的 GCP 项目
  • 创建和管理 GCS 存储分区的权限
  • 管理 GCS 存储分区的 IAM 政策的权限
  • 创建 Cloud Run 服务、Pub/Sub 主题和 Cloud Scheduler 作业的权限
  • 通过 API 访问权限对 Fastly 新一代 WAF 控制台进行特权访问
  • 具有公司名称且至少配置了一个网站的 Fastly 新一代 WAF 账号

创建 Google Cloud Storage 存储桶

  1. 前往 Google Cloud 控制台
  2. 选择您的项目或创建新项目。
  3. 在导航菜单中,依次前往 Cloud Storage > 存储分区
  4. 点击创建存储分区
  5. 提供以下配置详细信息:

    设置
    为存储桶命名 输入一个全局唯一的名称(例如 sigsci-waf-logs
    位置类型 根据您的需求进行选择(区域级、双区域、多区域)
    位置 选择营业地点(例如 us-central1
    存储类别 标准(建议用于经常访问的日志)
    访问权限控制 均匀(推荐)
    保护工具 可选:启用对象版本控制或保留政策
  6. 点击创建

收集 Fastly Next-Gen WAF API 凭据

获取 API 访问令牌

  1. 登录 Fastly Next-Gen WAF 控制面板
  2. 点击右上角的用户名,然后选择我的个人资料
  3. 前往 API 访问令牌
  4. 点击 Add API access token(添加 API 访问令牌)。
  5. 为令牌输入一个描述性名称(例如 Google SecOps Integration)。
  6. 点击创建 API 访问令牌
  7. 复制以下详细信息并将其保存在安全的位置:

    • API 令牌:生成的令牌值(仅显示一次)
    • 电子邮件地址:用于身份验证的账号电子邮件地址

获取公司和网站名称

  1. 登录 Fastly Next-Gen WAF 控制面板
  2. 依次点击管理 > 公司 > 公司概览
  3. 记下页面上显示的公司简称(例如 my_corp)。
  4. 依次前往管理 > Google 协作平台
  5. 记下要收集日志的网站的网站简称(例如 my_site)。

验证权限

如需验证账号是否具有所需权限,请执行以下操作:

  1. 登录 Fastly Next-Gen WAF 控制面板
  2. 依次前往管理 > 公司 > 公司用户
  3. 在列表中找到您的用户账号。
  4. 验证您的角色是否为管理员所有者观察者。这些角色具有检索请求 Feed 数据所需的 API 访问权限。
  5. 如果您的角色没有 API 访问权限,请与 Fastly Next-Gen WAF 管理员联系,让其授予您相应的角色。

测试 API 访问权限

  • 在继续进行集成之前,请先测试您的凭据:

    # Replace with your actual credentials
    SIGSCI_EMAIL="your-email@example.com"
    SIGSCI_TOKEN="your-api-token"
    SIGSCI_CORP="your-corp-name"
    SIGSCI_SITE="your-site-name"
    
    # Test API access - get site overview
    curl -v \
      -H "x-api-user:${SIGSCI_EMAIL}" \
      -H "x-api-token:${SIGSCI_TOKEN}" \
      "[https://dashboard.signalsciences.net/api/v0/corps/$](https://dashboard.signalsciences.net/api/v0/corps/$){SIGSCI_CORP}/sites/${SIGSCI_SITE}"
    

为 Cloud Run 函数创建服务账号

Cloud Run 函数需要一个服务账号,该账号具有写入 GCS 存储桶的权限,并且可以由 Pub/Sub 调用。

创建服务账号

  1. GCP 控制台中,依次前往 IAM 和管理 > 服务账号
  2. 点击创建服务账号
  3. 提供以下配置详细信息:

    • 服务账号名称:输入 sigsci-waf-collector-sa
    • 服务账号说明:输入 Service account for Cloud Run function to collect Fastly Next-Gen WAF logs
  4. 点击创建并继续

  5. 向此服务账号授予对项目的访问权限部分中,添加以下角色:

    1. 点击选择角色
    2. 搜索并选择 Storage Object Admin
    3. 点击 + 添加其他角色
    4. 搜索并选择 Cloud Run Invoker
    5. 点击 + 添加其他角色
    6. 搜索并选择 Cloud Functions Invoker
  6. 点击继续

  7. 点击完成

必须拥有这些角色,才能:

  • Storage Object Admin:将日志写入 GCS 存储桶并管理状态文件
  • Cloud Run Invoker:允许 Pub/Sub 调用函数
  • Cloud Functions Invoker:允许调用函数

授予对 GCS 存储桶的 IAM 权限

向服务账号授予对 GCS 存储桶的写入权限:

  1. 前往 Cloud Storage > 存储分区
  2. 点击您的存储桶名称(例如 sigsci-waf-logs)。
  3. 前往权限标签页。
  4. 点击授予访问权限
  5. 提供以下配置详细信息:

    • 添加主账号:输入服务账号电子邮件地址(例如 sigsci-waf-collector-sa@PROJECT_ID.iam.gserviceaccount.com
    • 分配角色:选择 Storage Object Admin
  6. 点击保存

创建 Pub/Sub 主题

创建一个 Pub/Sub 主题,Cloud Scheduler 将向该主题发布消息,而 Cloud Run 函数将订阅该主题。

  1. GCP 控制台中,前往 Pub/Sub > 主题
  2. 点击创建主题
  3. 提供以下配置详细信息:

    • 主题 ID:输入 sigsci-waf-logs-trigger
    • 将其他设置保留为默认值
  4. 点击创建

创建 Cloud Run 函数以收集日志

Cloud Run 函数将由 Cloud Scheduler 中的 Pub/Sub 消息触发,以从 Fastly Next-Gen WAF API 中提取请求 Feed 数据并将日志写入 GCS。

  1. GCP 控制台中,前往 Cloud Run
  2. 点击创建服务
  3. 选择函数(使用内嵌编辑器创建函数)。
  4. 配置部分中,提供以下配置详细信息:

    设置
    Service 名称 sigsci-waf-collector
    区域 选择与您的 GCS 存储桶匹配的区域(例如 us-central1
    运行时 选择 Python 3.12 或更高版本
  5. 触发器(可选)部分中:

    1. 点击 + 添加触发器
    2. 选择 Cloud Pub/Sub
    3. 选择 Cloud Pub/Sub 主题部分,选择主题 sigsci-waf-logs-trigger
    4. 点击保存
  6. 身份验证部分中:

    1. 选择需要进行身份验证
    2. 检查 Identity and Access Management (IAM)
  7. 向下滚动并展开容器、网络、安全性

  8. 前往安全性标签页:

    • 服务账号:选择服务账号 sigsci-waf-collector-sa
  9. 前往容器标签页:

    1. 点击变量和密钥
    2. 为每个环境变量点击+ 添加变量
    变量名称 示例值 说明
    GCS_BUCKET sigsci-waf-logs GCS 存储桶名称
    GCS_PREFIX sigsci-waf 日志文件的前缀
    STATE_KEY sigsci-waf/state.json 状态文件路径
    SIGSCI_EMAIL your-email@example.com Signal Sciences API 电子邮件地址
    SIGSCI_TOKEN your-api-token Signal Sciences API 令牌
    SIGSCI_CORP your-corp-name Signal Sciences 公司简称
    SIGSCI_SITE your-site-name Signal Sciences 网站简称
    MAX_RECORDS 10000 每次运行的记录数上限
    PAGE_SIZE 1000 每页记录数(最多 1,000 条)
    LOOKBACK_HOURS 24 初始回溯期
  10. 变量和 Secret 部分中,向下滚动到请求

    • 请求超时:输入 600 秒(10 分钟)
  11. 前往设置标签页:

    • 资源部分中:
      • 内存:选择 512 MiB 或更高值
      • CPU:选择 1
  12. 修订版本伸缩部分中:

    • 实例数下限:输入 0
    • 实例数上限:输入 100(或根据预期负载进行调整)
  13. 点击创建

  14. 等待服务创建完成(1-2 分钟)。

  15. 创建服务后,系统会自动打开内嵌代码编辑器

添加函数代码

  1. 入口点字段中输入 main
  2. 在内嵌代码编辑器中,创建两个文件:

    • main.py:
    import functions_framework
    from google.cloud import storage
    import json
    import os
    import urllib3
    from datetime import datetime, timezone, timedelta
    import time
    
    # Initialize HTTP client with timeouts
    http = urllib3.PoolManager(
      timeout=urllib3.Timeout(connect=5.0, read=30.0),
      retries=False,
    )
    
    # Initialize Storage client
    storage_client = storage.Client()
    
    # Environment variables
    GCS_BUCKET = os.environ.get('GCS_BUCKET')
    GCS_PREFIX = os.environ.get('GCS_PREFIX', 'sigsci-waf')
    STATE_KEY = os.environ.get('STATE_KEY', 'sigsci-waf/state.json')
    SIGSCI_EMAIL = os.environ.get('SIGSCI_EMAIL')
    SIGSCI_TOKEN = os.environ.get('SIGSCI_TOKEN')
    SIGSCI_CORP = os.environ.get('SIGSCI_CORP')
    SIGSCI_SITE = os.environ.get('SIGSCI_SITE')
    MAX_RECORDS = int(os.environ.get('MAX_RECORDS', '10000'))
    PAGE_SIZE = int(os.environ.get('PAGE_SIZE', '1000'))
    LOOKBACK_HOURS = int(os.environ.get('LOOKBACK_HOURS', '24'))
    
    # Signal Sciences API base URL
    API_BASE = '[https://dashboard.signalsciences.net/api/v0](https://dashboard.signalsciences.net/api/v0)'
    
    @functions_framework.cloud_event
    def main(cloud_event):
      """
      Cloud Run function triggered by Pub/Sub to fetch Fastly Next-Gen WAF
      request feed data and write to GCS.
    
      Args:
        cloud_event: CloudEvent object containing Pub/Sub message
      """
    
      if not all([GCS_BUCKET, SIGSCI_EMAIL, SIGSCI_TOKEN, SIGSCI_CORP, SIGSCI_SITE]):
        print('Error: Missing required environment variables')
        return
    
      try:
        bucket = storage_client.bucket(GCS_BUCKET)
    
        # Load state
        state = load_state(bucket, STATE_KEY)
    
        # Determine time window
        now = datetime.now(timezone.utc)
        last_time = None
    
        if isinstance(state, dict) and state.get("last_event_time"):
          try:
            last_time = datetime.fromisoformat(state["last_event_time"])
            # Overlap by 2 minutes to catch any delayed events
            last_time = last_time - timedelta(minutes=2)
          except Exception as e:
            print(f"Warning: Could not parse last_event_time: {e}")
    
        if last_time is None:
          last_time = now - timedelta(hours=LOOKBACK_HOURS)
    
        # Convert to Unix epoch seconds (Signal Sciences API uses seconds)
        from_epoch = int(last_time.timestamp())
        until_epoch = int(now.timestamp())
    
        print(f"Fetching request feed from {last_time.isoformat()} to {now.isoformat()}")
        print(f"Corp: {SIGSCI_CORP}, Site: {SIGSCI_SITE}")
    
        # Fetch request feed
        records, newest_event_time = fetch_request_feed(
          corp=SIGSCI_CORP,
          site=SIGSCI_SITE,
          from_epoch=from_epoch,
          until_epoch=until_epoch,
          page_size=PAGE_SIZE,
          max_records=MAX_RECORDS,
        )
    
        if not records:
          print("No new request feed records found.")
          save_state(bucket, STATE_KEY, now.isoformat())
          return
    
        # Write to GCS as NDJSON
        timestamp = now.strftime('%Y%m%d_%H%M%S')
        object_key = f"{GCS_PREFIX}/logs_{timestamp}.ndjson"
        blob = bucket.blob(object_key)
    
        ndjson = '\n'.join([json.dumps(record, ensure_ascii=False) for record in records]) + '\n'
        blob.upload_from_string(ndjson, content_type='application/x-ndjson')
    
        print(f"Wrote {len(records)} records to gs://{GCS_BUCKET}/{object_key}")
    
        # Update state with newest event time
        if newest_event_time:
          save_state(bucket, STATE_KEY, newest_event_time)
        else:
          save_state(bucket, STATE_KEY, now.isoformat())
    
        print(f"Successfully processed {len(records)} records")
    
      except Exception as e:
        print(f'Error processing logs: {str(e)}')
        raise
    
    def load_state(bucket, key):
      """Load state from GCS."""
      try:
        blob = bucket.blob(key)
        if blob.exists():
          state_data = blob.download_as_text()
          return json.loads(state_data)
      except Exception as e:
        print(f"Warning: Could not load state: {e}")
    
      return {}
    
    def save_state(bucket, key, last_event_time_iso: str):
      """Save the last event timestamp to GCS state file."""
      try:
        state = {'last_event_time': last_event_time_iso}
        blob = bucket.blob(key)
        blob.upload_from_string(
          json.dumps(state, indent=2),
          content_type='application/json'
        )
        print(f"Saved state: last_event_time={last_event_time_iso}")
      except Exception as e:
        print(f"Warning: Could not save state: {e}")
    
    def fetch_request_feed(corp: str, site: str, from_epoch: int, until_epoch: int, page_size: int, max_records: int):
      """
      Fetch request feed from Fastly Next-Gen WAF (Signal Sciences) API
      with cursor-based pagination and rate limiting.
    
      Args:
        corp: Signal Sciences corp short name
        site: Signal Sciences site short name
        from_epoch: Start time as Unix epoch seconds
        until_epoch: End time as Unix epoch seconds
        page_size: Number of records per page (max 1000)
        max_records: Maximum total records to fetch (max 10000)
    
      Returns:
        Tuple of (records list, newest_event_time ISO string)
      """
      headers = {
        'x-api-user': SIGSCI_EMAIL,
        'x-api-token': SIGSCI_TOKEN,
        'Accept': 'application/json',
        'User-Agent': 'GoogleSecOps-SignalSciencesWAFCollector/1.0'
      }
    
      records = []
      newest_time = None
      page_num = 0
      backoff = 1.0
    
      # Initial URL with time range parameters
      url = f"{API_BASE}/corps/{corp}/sites/{site}/feed/requests?from={from_epoch}&until={until_epoch}&limit={min(page_size, 1000)}"
    
      while url:
        page_num += 1
    
        if len(records) >= max_records:
          print(f"Reached max_records limit ({max_records})")
          break
    
        try:
          response = http.request('GET', url, headers=headers)
    
          # Handle rate limiting with exponential backoff
          if response.status == 429:
            retry_after = int(response.headers.get('Retry-After', str(int(backoff))))
            print(f"Rate limited (429). Retrying after {retry_after}s...")
            time.sleep(retry_after)
            backoff = min(backoff * 2, 30.0)
            continue
    
          backoff = 1.0
    
          if response.status != 200:
            print(f"HTTP Error: {response.status}")
            response_text = response.data.decode('utf-8')
            print(f"Response body: {response_text}")
            return [], None
    
          data = json.loads(response.data.decode('utf-8'))
    
          page_results = data.get('data', [])
    
          if not page_results:
            print(f"No more results (empty page)")
            break
    
          print(f"Page {page_num}: Retrieved {len(page_results)} events")
          records.extend(page_results)
    
          # Track newest event time
          for event in page_results:
            try:
              event_timestamp = event.get('timestamp')
              if event_timestamp:
                event_dt = datetime.fromtimestamp(event_timestamp, tz=timezone.utc)
                event_time = event_dt.isoformat()
                if newest_time is None or event_dt > datetime.fromisoformat(newest_time):
                  newest_time = event_time
            except Exception as e:
              print(f"Warning: Could not parse event time: {e}")
    
          # Cursor-based pagination using next URI
          next_url = data.get('next', {}).get('uri', '')
          if next_url:
            url = f"[https://dashboard.signalsciences.net](https://dashboard.signalsciences.net){next_url}"
          else:
            print("No more pages (no next cursor)")
            break
    
        except Exception as e:
          print(f"Error fetching request feed: {e}")
          return [], None
    
      print(f"Retrieved {len(records)} total records from {page_num} pages")
      return records, newest_time
    
    • requirements.txt:
    functions-framework==3.*
    google-cloud-storage==2.*
    urllib3>=2.0.0
    
  3. 点击部署以保存并部署该函数。

  4. 等待部署完成(2-3 分钟)。

创建 Cloud Scheduler 作业

Cloud Scheduler 会定期向 Pub/Sub 主题发布消息,从而触发 Cloud Run 函数。

  1. GCP Console 中,前往 Cloud Scheduler
  2. 点击创建作业
  3. 提供以下配置详细信息:

    设置
    名称 sigsci-waf-collector-hourly
    区域 选择与 Cloud Run 函数相同的区域
    频率 0 * * * *(每小时一次,整点时)
    时区 选择时区(建议选择世界协调时间 [UTC])
    目标类型 Pub/Sub
    主题 选择主题 sigsci-waf-logs-trigger
    消息正文 {}(空 JSON 对象)
  4. 点击创建

时间表频率选项

根据日志量和延迟时间要求选择频次:

频率 Cron 表达式 使用场景
每隔 5 分钟 */5 * * * * 大批量、低延迟
每隔 15 分钟 */15 * * * * 搜索量中等
每小时 0 * * * * 标准(推荐)
每 6 小时 0 */6 * * * 低成交量、批处理
每天 0 0 * * * 历史数据收集

测试集成

  1. Cloud Scheduler 控制台中,找到您的作业。
  2. 点击强制运行以手动触发作业。
  3. 等待几秒钟。
  4. 前往 Cloud Run > 服务
  5. 点击 sigsci-waf-collector
  6. 点击日志标签页。
  7. 验证函数是否已成功执行。查找:

    Fetching request feed from YYYY-MM-DDTHH:MM:SS+00:00 to YYYY-MM-DDTHH:MM:SS+00:00
    Corp: my_corp, Site: my_site
    Page 1: Retrieved X events
    Wrote X records to gs://sigsci-waf-logs/sigsci-waf/logs_YYYYMMDD_HHMMSS.ndjson
    Successfully processed X records
    
  8. 前往 Cloud Storage > 存储分区

  9. 点击您的存储桶名称 (sigsci-waf-logs)。

  10. 转到 sigsci-waf/ 文件夹。

  11. 验证是否已创建具有当前时间戳的新 .ndjson 文件。

如果您在日志中看到错误,请执行以下操作:

  • HTTP 401:检查环境变量中的 API 电子邮件地址和令牌
  • HTTP 403:验证账号在 Fastly Next-Gen WAF 控制台中是否具有管理员、所有者或观察者角色
  • HTTP 429:速率限制 - 函数将自动重试并进行退避
  • 缺少环境变量:检查是否已设置所有必需的变量

在 Google SecOps 中配置 Feed 以注入 Fastly Next-Gen WAF 日志

  1. 依次前往 SIEM 设置 > Feed
  2. 点击添加新 Feed
  3. 点击配置单个 Feed
  4. Feed 名称字段中,输入 Feed 的名称(例如 Signal Sciences WAF Logs)。
  5. 选择 Google Cloud Storage V2 作为来源类型
  6. 选择 Signal Sciences WAF 作为日志类型
  7. 点击获取服务账号。系统会显示一个唯一的服务账号电子邮件地址,例如:

    chronicle-12345678@chronicle-gcp-prod.iam.gserviceaccount.com
    
  8. 复制此电子邮件地址。

  9. 点击下一步

  10. 为以下输入参数指定值:

    • 存储桶网址:输入带有前缀路径的 GCS 存储桶 URI:

      gs://sigsci-waf-logs/sigsci-waf/
      
      • 替换:
        • sigsci-waf-logs:您的 GCS 存储桶名称。
        • sigsci-waf:存储日志的可选前缀/文件夹路径(留空表示根目录)。
    • 来源删除选项:根据您的偏好选择删除选项:

      • 永不:转移后永不删除任何文件(建议用于测试)。
      • 删除已转移的文件:在成功转移后删除文件。
      • 删除已转移的文件和空目录:成功转移后删除文件和空目录。

    • 文件存在时间上限:包含在过去指定天数内修改的文件(默认值为 180 天)

    • 资产命名空间资产命名空间

    • 注入标签:要应用于此 Feed 中事件的标签

  11. 点击下一步

  12. 最终确定界面中查看新的 Feed 配置,然后点击提交

向 Google SecOps 服务账号授予 IAM 权限

Google SecOps 服务账号需要您的 GCS 存储桶的 Storage Object Viewer 角色。

  1. 前往 Cloud Storage > 存储分区
  2. 点击您的存储桶名称。
  3. 前往权限标签页。
  4. 点击授予访问权限
  5. 提供以下配置详细信息:

    • 添加主账号:粘贴 Google SecOps 服务账号电子邮件地址
    • 分配角色:选择 Storage Object Viewer
  6. 点击保存

UDM 映射表

日志字段 UDM 映射 逻辑
metadata.event_type 设置为“NETWORK_HTTP”
metadata.vendor_name 设置为“Signal Sciences”
metadata.product_name 设置为“WAF”
id metadata.product_log_id 直接复制值
时间戳 metadata.event_timestamp 从 Unix 纪元秒数转换而来
remoteIP principal.ip 直接复制值
remoteHostname principal.hostname 直接复制值
remoteCountryCode principal.location.country_or_region 直接复制值
serverHostname target.hostname 直接复制值
serverName target.asset.hostname 直接复制值
方法 network.http.method 直接复制值
协议 network.application_protocol 直接复制值
路径 target.url 直接复制值
uri network.http.referral_url 直接复制值
userAgent network.http.user_agent 直接复制值
responseCode network.http.response_code 转换为整数
responseSize network.received_bytes 转换为无符号整数
responseMillis additional.fields 已映射为 response_millis 标签
标签 security_result.category_details 映射到类别的标记对象数组
headersIn additional.fields 以键值对形式映射的请求标头
headersOut additional.fields 以键值对形式映射的响应标头
created metadata.timestamp 从变更日志映射
eventType metadata.product_event_type 从变更日志映射
message_data metadata.description 从变更日志映射
username target.user.user_display_name 从变更日志映射
userid target.user.userid 从变更日志映射
attachments.Fields.Title" , "attachments.Fields.Value metadata.ingestion_labels 从变更日志映射
msgData.detailLink network.http.referral_url 从变更日志映射
msgData.name target.resource.name 从变更日志映射
msgData.changes target.resource.attribute.labels 从变更日志映射
msgData.reason security_result.summary 从变更日志映射
msgData.conditions security_result.description 从变更日志映射
msgData.sites network.http.user_agent 从变更日志映射

更新日志

查看相应解析器的更改日志

需要更多帮助?获得社区成员和 Google SecOps 专业人士的解答。