检查数据注入运行状况
本指南适用于希望监控数据注入健康状况并排查 Google Security Operations 内问题的安全工程师。本文介绍了如何使用健康状况中心、配置 Cloud Monitoring 提醒来跟踪数据源和解析器的状态,以及使用静默主机监控 (SHM) 来检测潜在的收集器停止情况。
使用这些监控工作流有助于您识别、诊断和修复数据流水线问题,区分用户可自行解决(可操作)的问题和需要支持团队解决(不可操作)的问题。成功配置可确保可靠的数据传输,这对于有效的安全运维和分析至关重要。
常见使用场景
本部分介绍了提取监控的常见用例。
主动健康检查
- 目标:查看所有已配置数据源的状态和健康状况。
- 价值:在潜在的数据提取问题影响安全可见性之前,及时检测到这些问题。
提醒响应
- 目标:调查并修复自动提醒标记的数据源或解析器问题。
- 价值:最大限度地减少数据丢失或延迟,确保数据可用于及时检测和应对威胁。
主要术语
- 健康状况中心:Google SecOps 中的中央信息中心,用于监控所有已配置的数据源和解析器的状态和健康状况。
- Cloud Monitoring: Google Cloud 用于根据指标(包括来自 Google SecOps 提取的指标)创建提醒政策的服务。
- 静默主机监控:一种监控方法,用于识别环境中已进入静默状态的主机。
- 可操作的问题:您通常可以通过更改配置(例如更新凭据)自行解决的提取问题。
- 无法自行解决的问题:需要 Google 支持团队协助解决的提取问题(例如,内部系统错误)。
- 解析器:一种将原始日志数据标准化为统一数据模型 (UDM) 结构的组件。
准备工作
确保您拥有必要的 Identity and Access Management (IAM) 角色和权限,以便访问 Google SecOps 实例、查看健康状况中心以及在 Cloud Monitoring 中配置提醒。
监控数据注入
本部分详细介绍了监控数据注入的各种方法。
使用健康数据中心进行监控
使用健康数据中心,您可以一目了然地监控整体数据健康状况,并查看每个 Feed、数据源和日志类型的核心健康状况。这有助于您在不配置自定义外部提醒的情况下,识别异常和失败的来源及解析器。
- 在 Google SecOps 侧边导航菜单中,点击健康中心。
- 查看“失败的来源”和“失败的解析器”的大数字微件,以确定需要立即注意的组件。
- 检查按数据源划分的健康状况表格。查看最新问题详情列,了解错误说明,例如
Config credential issue或Normalization issue。 - 点击表格中提供的修改数据源或修改解析器链接,可直接前往相应的配置页面进行修正。
- 检查时间戳(例如上次活动时间和上次提取时间),以验证数据是否按预期提取。
- 应用修复程序后,请监控特定数据源或解析器的健康中心,确保修复成功。
设置自动提取提醒
配置监控,以便在提取值达到某些预定义级别时触发提醒。这样一来,您就可以将电子邮件通知集成到现有工作流中,以便主动修复损坏的 Feed 或检测静默日志来源。
- 在健康中心中,点击设置提醒链接,系统会将您定向到“监控”界面。
- 创建提醒政策:
- 选择指标: 选择 Chronicle Collector > 提取下的指标,例如提取的日志总数或提取的日志总大小。
- 添加
collector_id或log_type的过滤条件,将提醒范围缩小到特定来源。
- 如需检测静默转发器,请选择指标缺失作为条件类型。将其配置为在日志停止流动达到指定时长(例如 60 分钟)时触发提醒。
问题排查
本部分详细介绍了排查数据注入问题的各种方法。
常见问题
- 流水线延迟:上次事件时间与上次提取时间时间戳之间存在显著延迟,表明可能存在延迟。健康数据中心会公开此差值的
95th百分位。值较高表示流水线延迟,而值正常可能表示来源正在发送历史数据。 - 数据提取量激增或骤降:系统使用 z 分数标准化来标记异常情况。如果日标准化差异和周标准化差异均小于
-1.645,则标记为下降。 - 解析失败:如果解析器错误占提取事件总数的比例与前一天相比增加了 5 个百分点或更多,系统会触发提醒。使用健康数据中心中的链接调查解析器配置。
如需详细了解如何识别数据注入和解析问题,请参阅识别和调查数据注入和解析问题。
延迟时间、服务配额和限制
- 数据刷新:健康中心和数据注入信息中心内的数据大约每 15 分钟刷新一次。
错误修复
如需查看完整的错误消息和解决方案列表,请参阅排查数据提取问题。
需要更多帮助?获得社区成员和 Google SecOps 专业人士的解答。