跳到正文
深圳 · 大湾区 · 地球

先自动化哪个流程:第一个目标不该是呼声最大的那个

第一个自动化项目失败,多数时候不是模型的问题,是对象选错了。值得先做的那件事有三个特征,而它几乎从不出现在需求清单的第一行。

6 分钟阅读1,388
AI AdoptionWorkflow Automation暂无译文。

第一个该自动化的流程,几乎不会出现在需求清单第一行

最好的第一个目标同时满足三件事:判断规则说得出口,输入每次都是同一个形状,今天已经有一个具体的人在手工做。

该先自动化的那个流程,是判断规则写得下来、输入形状稳定、并且今天已经有人在手工做的那件事。它几乎不会是立项会上呼声最大的那个,因为呼声衡量的是痛感,不是可重复性。

我接手的项目,第一件事往往不是写代码,而是重新筛一遍候选人名单(我的服务范围与交付方式)。筛完的顺序常和送来时相反。

为什么呼声最大的那个通常过不了筛

提名透露的是痛感在哪一层,不透露工作在哪一层可重复。被提名的流程往往因为模糊才重要:“把续约毛利做上去”“预测下个季度需求”能成为战略议题,恰恰因为没有哪份文件能推导出答案——战略性的模糊正是人的判断值钱的地方,也是最不该放一个需要“正确输出”定义的系统的位置。

第二个毛病:重要流程几乎都跨部门,输入不稳,数据散在三个系统里,其中两个的团队不在会议室。时间最后花在入口修补上,试点被按入口质量评分。

第三个毛病更安静:那件事今天没有一个人端到端地做。手工版本无人拥有,你就没有基线,也没有可标注的样本,出错时分不清是模型答错了还是流程本来就没一致过。

三个测试,一周之内就能跑完

判断规则测试。 请做事的人用一段话写下规则,包括他实际会用的例外,而不是制度文件里写的那些。再找第二个做同一份工作的人,给两人同样的十个真实案例;两人若在一两个以上案例上判断不一致,方差在流程里,不在模型里。

输入稳定性测试。 拉最近 200 个实例,数两件事:多少件进来时完整、格式符合预期;多少件必须先打电话或查系统。三分之一需要先修补,你手头就是披着自动化外衣的数据入口项目,工期按三倍算。

现有操作者测试。 点出今天在手工做、有量、对边界情况有意见的那个人。他给你三样买不到的东西:已标注的样本、正确性基线,以及一个不必被说服就能说“这个输出是错的”的复核人。

筛完之后,名单长这样

下表来自一个中型分销商运营团队的一个下午,计数取自他们自己的工单日志和订单系统——访谈不行。

候选流程判断规则输入稳定(近 200 例)有人在手工做吗月处理量结论
季度需求预测不能,三套方法互相打架无法测量没有单一负责人1 轮/季推迟
大客户报价例外审批部分,下限有、例外没写71% 完整有,两位客户经理90第二个做
采购订单异常处理能,九条规则、两条升级路径88% 完整有,一位分析师全职做1200第一个做
月度董事会材料汇编能,但格式每月都在变低,依赖六个部门有,但只做其中一段1等格式稳定

先建的是第三行,最不性感的一行,却是唯一一行三种条件同时具备的。需求预测那行三条测试全败,却是会上被要求最多的那一项。

为什么“今天有人在做”比“数据干净”更值钱

因为操作者本身就是规格说明。规则不是从制度文件里抄的,而是从一个分析师遇到供应商发来不完整货、收货记录又对不上时怎么处理里写出来的——这种知识不在任何系统里,只有被打断时才会说出来。他同时是兜底路径:剩余案例进复核队列,而那个队列需要一个有权决定遗留案例的人。

工时和钱要按时间戳数,不能按访谈数

访谈会系统性高估手工耗时,因为记得住的都是难案例;取数请取时间戳。下面是一次口径示范,假设都已写明。

  • 月处理量 1200 件、单件接触时间中位 11 分钟,都来自工单时间戳(创建到解决的时间差,减去等待外部回复)。
  • 月度接触时间 220 小时,即 1200 × 11 ÷ 60;分析师全成本按每月 3 万元计(我在深圳参与过的招聘口径,换成你自己的薪资数字),约合 1.3 个全职、每月 4 万元。
  • 自动化后仍需人工确认 3 分钟/件(设计假设,不是实测值):1200 × 8 分钟,实际回收约 160 小时/月。

要拒绝那个诱人的减法:自动化减掉的不是全部接触时间,只是花在判断上的那部分。系统起草正确动作、同一位分析师用 3 分钟复核并提交,你回收的是 160 小时而不是 220,瓶颈当场移到复核队列——这也是第一版该以“人按下确认”结束的原因。推理账单是最不有趣的一项,却总是财务第一个问的:按每次成功运行(含重试)建模,而不是拿席位报价做对比。

第一版应该故意不做什么

范围比模型选型重要。第一版不做决定,只起草决定,把证据交给现有操作者对照两周:分歧的案例变成测试用例,一致率变成你向管理层报的自动化率。不碰写路径,不加第二个流程,也不让入口清洗膨胀:格式照原样收,剩下那 12% 排手工录入的队。

选错了,第四周会在哪里露出来

判据要在开工前定成止损线,第四周对着检查。

  • 操作者跟书面规则的分歧,比跟模型的分歧还多。流程没准备好,换模型也救不了。
  • 入口修补吃掉的时间超过判断逻辑本身,你选的是数据问题。
  • 五个案例里有一个说不出正确输出是什么,而那个通常恰好是客户会看见的。
  • 调了两周,自动化率仍停在 50% 以下,且错的案例是聚集的、不是随机的。聚集通常意味着缺一条规则。

每一条都不是模型故障。提前筛这三件事的意义就在这里:注定失败的自动化项目,可靠信号大多在技术进场之前就写在流程里了。完整链条我写在选错第一个流程之后会发生什么里。

先做那个没人提的流程,它在给后面所有项目出资

那个战略流程半年后还在原地,而且那时更好打:你会有一套入口处理、一个复核队列、一份成本记账,以及一支懂得评审模型输出的团队。第一个项目真正的交付物不是省下来的工时,而是组织能拿证据而不是拿期待去批准第二件事。所以选那个无聊的候选:有规则、有操作者、月处理量能被平静地数出来。如果你今天点不出谁在手工做这件事,你找到的不是第一个自动化对象,而是一场被写成技术项目的重组。

继续阅读

更多「AI 落地」

准备构建一套系统?[ 预约会议 ]