数据是脏的,AI 跑得越快,你亏得越多
一篇 learn 文章:AI 不会修复脏数据,只会放大旧问题。文章解释为何强监管行业的数据更规矩、客户如何替脏数据买单,并给出五个问题的倒查方法与人、流程、工具三层框架,主张先把数据修干净,再上 AI。

一通电话
前两天,我和一个做了二十多年数据的老朋友,打了一小时电话。
我们以前在 Tempur-Pedic 一起建数据仓库。更早时他做过世界最早那套「以用户为中心」的营销平台,去过 Digitas、WPP,又管过 MRM 的全球数据。现在,数据可靠性公司 iceDQ 的商业和运营,归他管。
一句话,他这辈子的工作,就是判断数据能不能信。
放下电话,我后背发凉。
现在做营销,多少人都在用 AI。写文案,选人群,全交给它。可 AI 有个毛病,让我越想越担心。
它回答快,而且非常自信。对不对,脸色都不变。
用得好,你感觉未来来了。一旦错了呢?写文案还好,你能看出味道不对。可一旦你把选人群甩给它,常常没人发现。直到客户来问你,那组数为什么对不上。
那本对不上的账,很早以前就坏了。
AI 不会修数据。它只是把你数据里的旧病,放大成一个新病,端给你看。
什么叫数据基本功
先问一句老话。
什么叫数据基本功?
就是:你给的数据有多好,出来的结果就有多好。
做数据营销的人,第一课就学这个。过去系统慢,可以用眼去盯,漏掉一个还能拉回来。AI 不一样,它快,它敢说,答案直接就摊桌子上,你连验的时间都没有。
所以越急着上 AI,越要先看地基。
可我这位朋友的担心,正是很多公司没把地基当回事。
有人被管,有人没人管
先给一句结论。监管越严的行业,数据越规矩。
因为怕罚。
银行、保险,持仓的数目一对不上,FINRA 很快就会上门来查。医疗也守得紧,HIPAA 那条线一碰都不行。罚得越狠,规矩越严。
那消费、零售呢?
没人管。也没有谁开我罚单。
于是,做营销的人,常见的台词就是:
- 活动没量,怪创意写得不好。
- 人群不对,怪算法没学会。
- 系统出怪数,怪自己 prompt 不行。
我们把这罪名一个个推给别人,就是不看仪表盘下面的原始数据。
可一上 AI,底料越差,苦味就越重。它不是被藏,而是被放大了给你看。
谁最疼?不是 IT,是客户
数据脏,听起来是工程师的事。其实不是。
客户隔着屏幕,第一个替你买单。
你想想这几个画面。
一个缴费十年的会员,收到一张新人立减券。
同一个人,同一封邮件,收了三遍。
他刚买了豆浆机,推荐位又给他推同一款。
在客户看来,这不是哪里接错线,只觉得:你根本不认识我。这种印象一出来,想洗掉很难。
所以这个账,不该埋在技术清单里,该放到 CMO 的桌面上。
一个词,识别数据坏了
怎么早一点看数据出问题?老朋友给我一个词。
「不可预测」。
一个数据,今天一个样,明天一个样,这就是红旗。
他说了去年一个客户。一场活动,怎么都对不上。团队明明说发给了三百万人,可具体谁收到哪一封,说不清;发送记录和最初的人群定义对不对得上,也答不上来。分群、策略都是对的,就卡在一句:我是不是真的发了该发的那次?
这也是最大的红灯。模型在这种数据上学,学的全是错规律,还会复制到每一处。
一张水图,讲清四层
他打了一个比方,我记下了。不是仓库,是自来水厂。
先看水库。水装得满满的,这是数据第一次进来。
然后水进管网,净化、过滤。这一步,你切人群,洗干净数据。
接下来的水,顺着管道流进每家每户。那一家,是一个员工,一套工具。水一路在变。
最后一站,水从龙头出来。报表、看板,都在这。可大多数营销人,只愿测最后一个。
你自己想,要想喝干净水,只在出水口量一量,有用吗?
没用。得看整条管道:每一段的压力、流量,都要查。哪里卡了,堵在哪一段,一眼就知道。
二十年的题,别怪技术
「客户全景图」这东西,营销人盼了快二十年。
为什么到今天,客户数据平台(CDP),也没真正做成?
老朋友一句话,像泼了冷水。
他说,卡住的不是技术。是「人、流程、平台」。这三样,多数公司一律没变。
一个真能打的 CDP,要有三样并行:把数据收齐,把收数据的标准定清楚,再用工程化的思路,把不同部门的身份和标签拼成一张图。这三样缺一块,再贵的系统都是空转。
两个方法,今天就用
第一个方法,叫倒着追。
你哪怕没有专门的数据团队,一个上午,也能摸清底。
挑场最近的活动,从「客户收到了什么」,倒着追到「数据从哪来」。
五个问题,顺着答:
第一,我们到底发了什么? 第二,它和给平台那个人群文件,对得上吗? 第三,这份文件,和计划一致吗?你稍一犹豫,第一个断点就露出来了。 第四,源头到这之间,数据经历了什么?清洗、去重、配管……每一样都要有人回答。 第五,它从哪来的,怎么证明到了?
走完,再给每一步补三行:今天有没有人盯?谁负责?出了问题谁处理?
跑完一轮,绝大多数团队会看到:中间那列大多空着,第三列完全是空白。这张空表,就是你的计划。做这一步,不需要成本,不需要谁批,只要一间会议室,两小时。
第二个方法,按人、流程、工具,一层层搭。
先说人。很多人漏掉的,不是问题,是问法:到底谁在管数据质量?
首席数据官,当然好。可应用、开发、数据、业务,往往四块独立的墙。有人写代码,没人查质量。业务觉得数据是对的,需求却从没人写成验过的。
两条路走得通:把需求写成人人可测,东西变了就改;再去找能把业务翻译给工程的人,让两边听得懂彼此。
再说流程。这里,他借用工厂的生产线的思路,顺序一点不能乱。
先测,再上。新工具、新平台、新任务,什么都没测过,就别上线。
跑起来,边看。数据一直在流动,你要在路上就盯住,别等它在看板上爆出来。今天该到的数据,今天就得有人知道。
最后才看结果。这一步当然有用。可前两步做到了,大约九成九的脏数据,根本不会走到这一步。
丰田,当年就是这么把质量做上去的。现在很多企业的数据现状,还停在汽车厂上世纪八十年代那个阶段。
Gartner 有份研究算过:数据质量不好,一家企业平均一年要烧掉约 1500 万美元。
关于工具,有一句要提醒:品牌越多,越复杂,你反而看不清。
所以别再问「我买哪款」。改问三个:
- 我为哪个目标负责?
- 路上数据断在哪?
- 这款,是否正好补断?
按这个顺序选,就算以后公司重装,也仍然有意义。理由从来不是那台工具。
最后
听了一晚上,老朋友说得我很想记。
他说,真正在两年后的市场竞争里站住的营销团队,一定会做一件事:**先把数据修干净,再去上 AI。**而不是一上来就上模型。
他们的模型,学的是真实的数据,不是一套最接近的假象。
所以我今天最后给你一句话,也送给自己。
你别一上来就急着上AI。先看你脚底下那份数据,干不干净。水先从源头治起来。
祝你当天晚上,就能把对不上的数字,一条一条查清。
我信。