说“我们没有数据”的人,多半在说另外三件事
一位运营负责人告诉我,AI 落地上最大的障碍是没有数据。这句话按字面理解几乎从来不成立:四年的扫码记录和异常代码一直躺在他的仓储系统里,从没有人导出过。这家公司里,“数据”已经等于“仪表盘”:没有仪表盘,就没有数据,这个结论写进预算,代价是买一批本来不需要的数据。
企业已有的数据资产通常不是不够,是没被整理过。只有一种处境真缺数据,另外两种是别的问题:没有人标注过任务的样本,比如哪一张发票的科目后来被改过,这是 schema 问题;数据在,但没有谁有权决定谁可以读,这是需要法律负责人签字的治理决定。真正算缺失的,是流程本身没被记录——纸质单据、口头沟通、某个人的本地表格。
企业已有的数据资产通常已经够用:真正缺的是那份把运营副产品变成可查询资产的 schema,而 schema 是一次性成本,不随数据量或查询次数增长,也不必为每一次提问重新购买。
决策对象就此换掉:买数据集、招数据团队、等数据仓库立项,都在解决错误的问题。
你已经付过钱的系统里躺着什么
每一套系统都已采购、已备份,而且有人的工作依赖它准确——有人要对正确性负责的数据,才会被持续修正。
| 已经在用的系统 | 里面可以直接用的东西 | 成为资产之前缺什么 |
|---|---|---|
| ERP 或财务系统 | 发票、审批流、成本中心、过账日期 | 科目后来被人工更正的那一行 |
| 工单或 ITSM | 工单正文、分类、处理人、时间戳 | 修复有没有站住;重开记录没人建模 |
| CRM | 客户历史、商机阶段、丢单原因 | 同一家客户三种写法下的实体身份 |
| 邮件与文档库 | 合同、补充协议、例外审批 | 要用的条款被埋在正文里 |
| 通话录音与转写 | 老员工怎么描述判断依据和绕开的做法 | 说话人归属,通话结果的原因码 |
| 个人 Excel | 让流程跑起来的对账逻辑和本地规则 | 归属、版本,离开这台电脑的路径 |
把第三列再看一遍:没有一行写“需要更多数据”。每一行要求的都是对身份、结果或结构做决定,这些决定属于 schema,做完一次就固定下来。
副产品与资产之间隔着六个属性
六个属性,一个下午就能审计完一份数据算不算资产。
实体身份稳定:一个真实对象对应一个主键,别名归并干净;事件时间落在同一个时区;状态迁移保留下来,“怎么走到这一步”通常比“最后停在哪”更值钱;有一个结果字段,哪怕很粗;有来源信息,让审阅的人能追回原系统;以及一条在写入第一个 embedding 之前就定好的访问边界。
身份这一条卡住的项目最多。我核过的一套账里,同一家中型供应商有十一种写法:三种带法律后缀,两种拼错,一个商号,五种尾部多了空格。在这件事解决之前,回答“我们在这家供应商身上花了多少”的模型都在回答假问题。归并它用了一个下午:和应付账款负责人过规则,写一个规则文件,再加四十条人工例外——这笔成本此后所有下游问题都在继承。
schema 要花多少钱,为什么说是一次性
两种成本性质不同。抽取和 embedding 是边际成本,且很小:供应商公开价目表上,一款主流小型 embedding 模型约每百万 token 零点零二美元(写这篇时的挂牌价),三百万 token 的历史文档(一家中型后台的规模)嵌入一次大约六美分。在这部分报出大数字的,定价定错了对象。
schema 是固定成本,由人做出来。我最近界定范围的三个项目里,这项工作落在八到十五个工作日:一个工程师,加过程负责人断断续续的时间——只有他知道例外在哪。按工程师全负荷每天九百美元算,一次性支出七千二百到一万三千五百美元。多数团队的替代方案是带指导委员会的数据平台立项,报价单位是季度。
| 成本项 | 性质 | 单个流程的典型量级 |
|---|---|---|
| 实体归并与 schema 定义 | 一次性,人力 | 8–15 天,工程师加过程负责人 |
| 抽取管道搭建 | 一次性,工程 | 3–5 天,之后无人值守 |
| 历史回填与 embedding | 一次性,边际 | API 成本从几美分到几十美元 |
| 刷新与监控 | 经常性,很小 | 每月几小时,随 schema 变更增长 |
| 业务变化后的重新标注 | 经常性,偶发 | 它不“永远免费”的诚实原因 |
代价也要说清楚:一次性指的是它不随数据量放大,也不是每次查询重新买一遍;不是指它永不改动——新增产品线、子公司或审批规则,schema 就要扩展。买的是能便宜吸收这些变化的底座,而不是每次重建。身份、结果、来源三类字段怎么落到具体列上,把运营副产品变成可查询资产的 schema 到底包含什么那篇(英文版)里有更细的拆解。
哪些数据应该主动排除在外
范围纪律决定一次性成本是不是真的只发生一次。写抽取代码前,我会先提三条排除:访问边界无法书面达成一致的,第一版不进来,后加比试点期间打官司便宜;决策用不到的个人数据,在抽取时就丢掉——存储之后再脱敏是承诺,不是控制;负责人说不清一行代表什么的那张表不建模,建在没人理解的字段上的 schema 只会高效地产出自信的错误答案。
捕获率只有六成、价值却依赖完整的数据,通常比没有数据更糟。
什么情况下确实需要新数据
有三种情况我会承认:决策靠口头完成、没有系统记录;要预测的结果从没被写下来过;决策依赖第三方掌握、对方不愿共享的信息——最后一种先是商业问题,然后才是技术问题。
这三种情况下的第一份交付物是埋点,不是模型:用九十天把决策和结果记下来,格式要小到做事的人愿意维护。它同时给你一份 schema 和一份数据集,比建在假设上的试点便宜一个量级。
批预算之前,先问清楚三件事
问 schema 是什么、谁拥有它、建起来要多少钱。如果没有人答得上来,被推销的其实是“一个模型加一批从未被整理过的数据”,失败会以模型效果差的形式出现,尽管问题从一开始就是身份和结果字段没定义。
schema 这份资产的寿命比这一季在用的模型长,它让同一职能里的第二条流程明显比第一条便宜。把预算留给无聊的那一半,拿六个属性审计一条真实流程,再用自己的数字做决定。多数自认数据贫乏的企业其实只是 schema 贫乏,后者好解决得多。
继续阅读
- AI 的投入产出比算不清,问题不在模型,而在这三笔没算的账2026-03-186 分钟AI 成本与回报
- 大模型调用成本测算:决定账单的是三个变量,重试率是预算里最少被写下的那一个2026-02-186 分钟AI 成本与回报
- 企业 AI 落地:卡住的地方是流程归属,不是模型能力2026-03-266 分钟AI 落地