跳到正文

更多文章

数据周刊|Spark 4.2 把 CDC 写进内核,补丁也要先过 SQL 新同事 3 周做出分析助手,真正说明的不是他会写 Prompt AI 问数成本守门清单:限制查询风暴、重复试探和高价重跑 AI 查一次数跑上千条 SQL,数据库扛得住吗? 一个 MCP 工具有 14 个参数,AI 为什么越用越糊涂?
AI 会画图以后,数据分析师最值钱的不是会选颜色

上周,我看见一张很漂亮的增长图。

折线向右上方扬起,颜色克制,标签整齐。要是把它放进经营周报,领导大概会点点头,说一句“趋势不错”。

问题是,纵轴没有从零开始。

原本只有几个百分点的波动,被画成了一段令人心潮澎湃的爬坡。图没有算错,数据也没有造假。它只是选了一个很会说话的角度。

以前,做出这样的图需要一个分析师亲手设置坐标轴。现在,AI 几秒钟就能做完,而且通常做得比我们临时拼的 Excel 图好看。

于是一个有点尴尬的问题来了:如果 AI 已经会写图表代码,数据分析师还值钱在哪里?

一张漂亮图表背后仍有许多需要判断的选择

会生成图,不等于知道该画什么

Microsoft Research 在 7 月 8 日发布了 Flint,一种面向 AI 图表生成的可视化中间语言。

它的思路很直接。让模型完整生成 Vega-Lite、ECharts 或 Chart.js 配置,容易陷入细节:日期格式怎么解析,标签留多少空间,百分比保留几位,颜色怎么映射,坐标轴从哪里开始。配置越长,模型越容易漏掉一个不起眼但重要的参数。

Flint 让 AI 先写一份更短、更容易检查的规格,再由编译器根据字段的语义类型补齐布局、比例尺和格式。同一份规格还可以输出到不同图表库。

换句话说,它把“我要表达什么”和“这张图具体怎么渲染”拆开了。

这对数据分析很重要。因为一张图真正困难的部分,从来不是把柱子画出来,而是做选择:

  • 这是金额还是比例?
  • 是看绝对变化,还是看相对变化?
  • 排名里的第 1 名,是最好还是最差?
  • 缺失值代表没有发生,还是没有采集?
  • 时间是自然日、工作日,还是业务结算日?

这些问题没有一个能靠“图表更漂亮”解决。

字段名给不了 AI 足够的答案

很多公司的数据表里,有一些很有年代感的字段名。

amtratedtrank_no。写表的人当然知道它们是什么意思。三个月后,换了一个同事,只能先在群里问。再过一年,AI 接进来,它会很有礼貌地猜。

rate 可能是小数形式的转化率,也可能已经乘过 100;dt 可能是下单日,也可能是分区日期;rank_no 可能按销售额从高到低排,也可能按风险从高到低排。

模型可以根据字段名和值分布推测,但推测仍然是推测。

同一个字段值,因为语义不同会得到完全不同的图

Flint 强调语义类型,是因为低层参数可以交给编译器,意义不能凭空出现。数据分析师接下来更需要做的,不是背下所有图表配置,而是把意义写成别人和机器都能读懂的约束。

至少要留下四件事:

  1. 字段是什么业务概念;
  2. 值采用什么单位和口径;
  3. 哪些比较是合理的;
  4. 哪些图形会造成误解。

这听起来像文档工作,不太性感。可如果这四件事没写,AI 画图越快,错误进入会议室的速度也越快。

数据分析师的工作,会从“亲手画”变成“负责验”

以前,一张经营图表从取数到出图,分析师几乎全程亲手做。以后,AI 可能包办查询、图表选择、代码和说明文字。

但责任不会跟着自动化一起消失。

业务看到图以后,仍然会问:“为什么这个月突然涨了?”“这个比例能和去年比吗?”“把纵轴拉长以后,趋势是不是没那么明显?”

这时,真正有价值的分析师不是回答“这张图是 AI 生成的”,而是能说清:

  • 为什么选这类图,而不是另一类;
  • 哪个尺度是为了忠实表达,而不是为了好看;
  • 数据里有哪些缺口;
  • 结论可以走到哪里,不能走到哪里。

AI 可以承担制作成本,分析师要承担判断责任。

这并不是坏消息。我们终于有机会少花一点时间调字号、挪图例、改颜色,把时间用在更像分析的事情上。

给自动生成图表加一道“四问”

如果你已经在用 AI 画图,不妨在提交前问四个问题。

第一问:语义对吗?

字段、单位、时间和口径是否被正确理解。尤其检查百分比、累计值、去重人数和排名。

第二问:尺度诚实吗?

坐标轴、区间、颜色和排序有没有放大差异,或者把重要差异压平。

第三问:比较成立吗?

两个群体是否处在相同时间窗口和统计条件下。同比、环比、实验组和对照组不能只看标签像不像。

第四问:结论越界了吗?

图表展示相关性,不等于证明因果;展示均值,不等于每个人都如此。

自动图表发布前的四问验收

这四问不复杂。真正麻烦的是,大家常常在图已经进了 PPT、会议还有五分钟开始时才想起它们。

所以更好的做法,是把它们写进团队的图表验收习惯。让 AI 生成图时同时输出字段解释、尺度选择和风险提示;让分析师检查这些理由,而不只是检查图片能不能打开。

以后最贵的不是画图,是知道哪里不能画

过去,熟练操作 Excel、Tableau 或 ECharts 是一项明确技能。工具不会立刻消失,但“亲手完成每个图表细节”会越来越便宜。

留下来的,是那些不容易被自动补齐的判断。

什么值得比较,什么不能放在一起;什么时候应该从零开始,什么时候需要局部放大;哪个异常值得解释,哪个波动只是噪声;一张图是在帮助决策,还是在替某个期待找证据。

AI 会让图表更多,也会让看起来正确的图更多。

数据分析师最值钱的地方,可能不再是会选颜色,而是在所有人准备点头以前,知道该把哪张图拦下来。


我叫石头,在数据行业里摸爬滚打了十几年,画过的图不少,被图骗过的次数也不少。这里写的,就是这些教训——我觉得值得说出来的那部分。

来源:Microsoft Research:Flint, a visualization language for the AI era

Elazer (石头)
Elazer (石头)

11 年数据老兵,从分析师到架构专家。用真实经历帮数据人少走弯路。

加入免费社群

和数据从业者一起交流成长

了解详情 →

成为会员

解锁全部内容 + 知识库

查看权益 →

1v1 咨询

有具体职业困惑?一小时说清楚

预约咨询 →
← 上一篇 数据周刊|Agent 开始改写数据库、图表和分析助手 下一篇 → Iceberg 迁移决策表:从小文件、查询成本到回滚计划