跳到正文
全部标签

# 可观测性

共 4 篇文章

  • 凌晨告警响了 20 次,真正有用的可能只有第 1 次

    凌晨告警响了 20 次,真正有用的可能只有第 1 次

    凌晨值班群连续响了 20 次:同步延迟、分区缺失、看板刷新失败,看起来像 20 场事故,其实可能都来自同一个上游任务。数据开发和值班同事怎样识别告警风暴?本文用时间、依赖和影响对象拆出根因组,并给出先静音副本、再保留新信号、最后补聚合规则的 3 个动作。
  • 新同事 3 周做出分析助手,真正说明的不是他会写 Prompt

    新同事 3 周做出分析助手,真正说明的不是他会写 Prompt

    Lyft 把 Analytics & Rides Intelligence Assistant 交给新工程师作为入职项目,并在 3 周内推进到生产环境。真正值得数据从业者注意的,不是 Prompt 写得多快,而是认证、可观测性、状态管理、流式响应和内部文档是否已经铺成一条新人能走通的路。
  • AI 问数成本守门清单:限制查询风暴、重复试探和高价重跑 PRO

    AI 问数成本守门清单:限制查询风暴、重复试探和高价重跑

    AI 问数进入生产后,一次自然语言任务可能拆成大量 SQL,并在字段猜错、结果为空或多 Agent 探索时反复重跑。本文给出一套 Pro 成本守门清单,从任务预算、查询估价、并发与扫描限制,到缓存复用、取消传播和逐问题账单,帮助数据团队防住查询风暴。
  • Agent 可观测性三件套:Trace、Eval、Guardrail

    Agent 可观测性三件套:Trace、Eval、Guardrail

    2026 年 Atlan 把 Agent Observability 列为与 DataOps 平级的新品类。Agent 出错了怎么复现?回归怎么量化?线上怎么兜底?这篇文章把 Agent 可观测性拆成三件套:Trace 追踪调用链、Eval 量化行为质量、Guardrail 拦截风险输出,配合主流工具(Langfuse、Braintrust、Guardrails AI)给出一套可落地的监控方案。