跳到正文

方法

技术方法与最佳实践

专题
标签
供应商文件每天准时到,3 个字段却悄悄变了:数据分析师用 9 条门槛验收外部数据 PRO
外部数据 · 方法

供应商文件每天准时到,3 个字段却悄悄变了:数据分析师用 9 条门槛验收外部数据

数据供应商每天准时交付文件,经营报表却因字段含义、枚举和值域悄悄变化而反复出错。数据分析师怎样在数据 SLA 之外识别语义漂移?本文从一场晨会返工出发,给出 9 条外部数据验收门槛、三级处置方式和一份可直接改写的验收清单,让异常先停在隔离区,不再一路流进经营结论。

数据负责人要删 3 年日志,审计和成本各说各话:用 4 个维度定保留期限 PRO
数据生命周期 · 方法

数据负责人要删 3 年日志,审计和成本各说各话:用 4 个维度定保留期限

数据负责人收到一份“删除 3 年日志”的降本任务,审计要求保留证据,平台团队又承担热存储账单。保留期限到底该听谁的?本文用法律与合同底线、恢复时效、实际使用、全周期成本 4 个维度,为日志、明细和聚合数据建立期限矩阵,并给出起算事件、冷热分层、例外冻结、审批与删除验证模板。

分析师交出下月预测,业务却问凭什么:用 4 项复核写清假设 PRO
经营分析 · 方法

分析师交出下月预测,业务却问凭什么:用 4 项复核写清假设

月度经营会上,分析师给出下月销售额预测,业务负责人却追问:节假日、促销、库存和不确定性算进去了吗?一个预测数字怎样变成可讨论、可复核、能指导备货与排班的判断?本文用 4 项复核和一页假设表,拆开数据口径、季节基线、经营条件、预测区间与条件变化后的三档动作。

周日销量比周六低 20%,分析师先用 3 种基线判断是不是异常
经营分析 · 方法

周日销量比周六低 20%,分析师先用 3 种基线判断是不是异常

周一经营会上,负责人看到周日销量比周六低 20%,马上追问渠道是不是出了故障。可周六和周日本来就可能不同,节假日、促销和库存也会改写曲线。分析师该怎样判断这次下跌是不是真异常?本文给出同星期、可比日期和预期区间 3 种基线,以及一张能在会上说明白的核查表。

一家人共用手机号,数据工程师用 5 层匹配规则避免 OneID 错并 PRO
客户数据 · 方法

一家人共用手机号,数据工程师用 5 层匹配规则避免 OneID 错并

零售团队准备把订单、会员和客服记录合成 OneID,却发现一家人共用手机号、旧号码被重新分配、门店代客下单,自动合并很可能把几个人认成一个。数据工程师该怎样写匹配规则?本文给出 5 层证据、置信度分档、反证优先和版本回滚方法,并附一张可直接评审的身份合并规则表。

同事催着要生产库全权限,数据负责人用 15 分钟拆成最小授权 PRO
数据安全 · 方法

同事催着要生产库全权限,数据负责人用 15 分钟拆成最小授权

线上订单排障时,开发同事催着申请生产数据库全权限,数据负责人怎样既不耽误故障处理,又避免把临时方便变成长期高权限?本文给出一张 15 分钟最小授权单,按任务、数据范围、允许动作、有效时间和留痕要求拆分申请,并附只读排查、受控执行与紧急变更三类授权模板。

A/B 测试显著了,分析师先用 8 个问题复核实验结果 PRO
实验分析 · 方法

A/B 测试显著了,分析师先用 8 个问题复核实验结果

产品评审会上,A/B 测试转化率提升 3.8%,p 值也低于 0.05,为什么数据分析师仍不能马上建议全量上线?本文给出一张实验结果复核表,用 8 个问题逐项检查随机分流、样本比例、埋点缺失、实验污染、指标口径、观察周期与护栏指标,并教你把结论写成可追溯的上线建议。

每次问 AI 都要从头解释,是你的工作还没有留下“说明书”
AI · 方法

每次问 AI 都要从头解释,是你的工作还没有留下“说明书”

很多数据分析师和数据开发已经开始用 AI 写 SQL、查资料、整理分析,但每次提问都要重新解释业务背景、指标口径和项目约束。问题不一定是 AI 记性差,而是你的工作没有沉淀成说明书。本文从普通数据从业者视角,讲怎么把反复解释的内容变成可复用的项目说明、指标说明和判断记录。

上线前多重放 1 次历史数据,可能少背 3 次锅
数据工程 · 方法

上线前多重放 1 次历史数据,可能少背 3 次锅

很多数据分析师和数据开发上线指标、SQL、模型或同步任务前,只用几条干净样本测试,结果上线后才被历史边界数据打脸。Stripe 用 Apache Spark 做历史流量回放测试提供了一个启发:普通数据从业者也可以在上线前多重放 1 次真实历史数据,提前发现口径、异常和兼容问题。

Spark 任务跑了 3 小时,别急着问 AI 怎么调参
数据工程 · 方法

Spark 任务跑了 3 小时,别急着问 AI 怎么调参

Spark 任务跑了 3 小时,很多数据开发第一反应是问 AI 要不要改 executor、shuffle、分区数。但慢任务不是靠一句调参解决的。本文结合 Expedia 分析 Spark SQL Plan 的实践,说明普通数据开发为什么要先拿出执行计划、运行指标和业务上下文这 3 份证据。

让分析报告不再变成一页截图:数据人的结论交付模板 PRO
数据分析 · 方法

让分析报告不再变成一页截图:数据人的结论交付模板

很多数据分析报告最后只剩一页截图:几张图、几行字、一个模糊建议。业务看完不知道该怎么行动,过几天也没人记得结论。本文给一套 Pro 结论交付模板,帮助数据分析师把活动复盘、渠道分析和经营异常报告拆成问题、证据、判断、选项、风险、责任和下一步。

语义层不是新名词,是 AI 时代的数据说明书 PRO
AI · 方法

语义层不是新名词,是 AI 时代的数据说明书

很多数据团队一听语义层,就想到老 BI、指标平台和数据治理文档。但 Power BI、Databricks、MIT 和 Lyft 最近都在重新谈 semantic layer。对数据分析师和数据工程师来说,真正的问题是:怎么从 20 个高频业务问题开始,把指标、维度、权限、质量和拒答规则写成 AI 能调用的数据说明书?

业务改了 3 次口径,真正该问的不是 SQL
数据分析 · 方法

业务改了 3 次口径,真正该问的不是 SQL

数据同学最怕业务反复改口径:今天按下单,明天按支付,后天又要排除退款。很多人第一反应是改 SQL,但真正该问的是业务到底要用这个指标做什么。本文从一次复购指标争议讲起,拆解口径反复背后的 4 个问题,以及一张指标变更卡应该记录什么。

AI 问数 Demo 很顺,为什么一上线就翻车?
AI · 方法

AI 问数 Demo 很顺,为什么一上线就翻车?

AI 问数和 Text-to-SQL Demo 往往很顺:输入一句话,模型生成 SQL,图表立刻出现。但一到真实企业上线,就会遇到权限、口径、表名、脏数据和责任边界。本文从一次上线评审讲起,拆解 AI 问数翻车的 4 个原因,以及上线前必须补的 5 个基础动作。

面试官问项目细节,90% 的人输在证据链
求职面试 · 方法

面试官问项目细节,90% 的人输在证据链

很多数据分析师和数据开发写简历时会写项目背景、技术栈和指标结果,却在面试官追问细节时说不清证据。项目价值不是一句提升效率,而是一条能复原现场的证据链。本文从一次面试追问讲起,拆解数据项目证据链的 5 个环节,帮候选人把普通需求讲成可信项目。