跳到正文
全部标签

# 数据事故

共 2 篇文章

  • 凌晨告警响了 20 次,真正有用的可能只有第 1 次

    凌晨告警响了 20 次,真正有用的可能只有第 1 次

    凌晨值班群连续响了 20 次:同步延迟、分区缺失、看板刷新失败,看起来像 20 场事故,其实可能都来自同一个上游任务。数据开发和值班同事怎样识别告警风暴?本文用时间、依赖和影响对象拆出根因组,并给出先静音副本、再保留新信号、最后补聚合规则的 3 个动作。
  • 48 小时修完数据事故,真正该补的不是告警

    48 小时修完数据事故,真正该补的不是告警

    一次数据事故从周五晚上拖到周日,团队 48 小时修完任务、补跑数据、恢复看板,但复盘时才发现真正缺的不是告警,而是影响面、修复记录、责任边界和上线验证。本文用 5 个问题拆解数据事故复盘,帮数据开发和数据治理团队避免下次重复摔在同一个地方。