2.7 有数据为什么仍不能马上做 AI
云枢科技告诉我,CRM 里有三年的销售数据,足够训练成交预测。我抽查后发现,失败原因大多空白,商机阶段常在月底集中补录,优秀销售和普通销售的记录习惯也完全不同。
数据存在,不等于能回答当前问题。
一个预测演示差点让我们走错方向
工程团队用历史数据做了一个成交评分演示,几家大客户得分很高。销售负责人觉得结果很准,因为这些客户后来确实成交。
继续检查后,我发现模型主要学到了“被高级销售持续跟进”的痕迹。那些销售本来就会挑选更有希望的客户,并且记录更完整。若把分数用于分配资源,新客户和新行业会因为历史记录少而更难得到关注。
我撤回了“数据足够做预测”的判断。眼前的准确,不代表它能支持未来决定。
我先问数据准备用来决定什么
如果只是帮助销售发现缺少的信息,数据要求与自动决定资源分配完全不同。风险越高,我需要的完整性、解释能力和人工复核越强。
我会检查来源是否可信、关键字段缺多少、时间是否真实、历史规则是否改变、样本是否只代表部分客户,以及公司是否有权把它用于这个目的。
检查不能只看一张缺失率报表。我会抽取几笔原始业务,核对字段何时填写、为什么填写、未填写代表“不知道”还是“不适用”。云枢科技的失败原因空白,有时是销售忘记,有时是客户仍在观察,两者不能当成同一种数据。
高风险用途还要看错误落到谁身上。若分数决定销售资源,小客户可能永久失去机会;若只是提醒资料缺失,员工仍能纠正,风险小得多。
历史会把旧做法一起带进来
过去成交多的客户,可能只是因为销售更愿意追某类公司。AI 学习这些记录后,可能继续忽略新行业,而不是发现真正的好客户。
所以我会看哪些群体很少出现、哪些结果受人为选择影响,并请业务人员解释历史制度变化。
历史价格、产品和区域策略改变,也会让旧数据失去可比性。数据负责人说明字段与时间,销售负责人解释过去的选择机制,风险岗位检查是否会不公平地排除客户。我负责把这些限制与用途放在一起,而不是只让工程师判断数据“够不够”。
不足的数据不一定让项目停止
有时可以缩小范围:不做成交预测,先做资料缺口提示;不自动给客户评分,先帮助负责人比较相似案例。
我让 AI 全栈工程师在结果旁显示数据时间、缺失和适用范围。超出范围时必须拒绝给出确定结论。
云枢科技最终没有自动预测成交,而是先做三件更可靠的事:指出客户必要信息缺失,找出与历史成功订单的可比条件,提醒销售说明自己为何继续或停止跟进。AI 提供依据,销售负责人仍作资源决定。
我怎样验收数据能支持这项任务
我们选正常、缺失、冲突和新行业客户,让业务人员先独立判断,再看 AI 使用了哪些资料。结果必须能追到来源,缺失时明确说不知道,超出历史范围时不假装有把握。
同时观察错误是否集中在某类客户、员工是否频繁纠正、资料更新后结果是否改变。只有这些边界稳定,才考虑扩大用途。
成交预测最后被缩成了数据缺口提示
| 资料 | 原计划用途 | 抽查发现 | 缩小后的用途 |
|---|---|---|---|
| CRM商机阶段 | 预测成交概率 | 经常月底补录,时间不代表真实进展 | 提示阶段长期未确认 |
| 失败原因 | 学习输单模式 | 大量空白,不知道是遗忘还是不适用 | 要求销售选择“未知”或补充来源 |
| 销售跟进次数 | 判断客户意愿 | 高级销售本来就会选择更有希望的客户 | 只作为上下文,不作为资源分配依据 |
| 客户行业与规模 | 寻找相似成交 | 新行业历史样本很少 | 明确超出范围,不给确定分数 |
因此云枢科技没有让模型决定把销售资源给谁。第一阶段只指出必要资料缺失、展示可比订单条件,并要求销售负责人说明继续或停止的理由。
这张数据证据表告诉我哪些内容适合整理,下一步还要根据稳定程度和错误后果,选择固定规则、AI准备还是人工决定:这件事该交给 AI、规则还是人。