人在回路卡住的地方,是复核人眼前那一屏东西
人工复核拖垮一条流程,通常不是因为复核人不认真,而是界面把模型生成的东西整屏递过去,让他自己重推一遍结论。推一遍要多久,决定这条流程在量上来之后还活不活得下去。
我做过的一条信贷审批流程,试点时一天四十件,两位分析师在共享收件箱里复核,皆大欢喜。放到一天四百件,队列每周多积一天半,议题从「模型够不够好」变成「要不要再招人」。模型没问题,出问题的是界面:一份能往下滚的长文档,底下挂个聊天框。
人工审核只有在人审的是「一个决策加它的证据」而不是「一屏模型输出」时才能扩展,于是界面成了系统里难的那部分,模型反而是简单的那部分。
机制如下。开工时我先做的一件事,是跟复核人一起看他眼前那一屏(我的服务范围与交付方式);这一屏定了,人头和工期才算得出来。
审输出和审决策,不是同一件工作
复核人真正的活是下判断,不是读。审输出把顺序弄反了:先读再判断,而读是无界的那一段——生成得越长,判断越慢,被跳过的也越多。审决策把顺序倒过来,先摆结论,再摆支撑它的那几条特定证据,文本从「必须吸收的」变成「可以翻查的」。
| 维度 | 审模型输出 | 审决策加证据 |
|---|---|---|
| 复核人看到什么 | 一份生成好的文档或草稿 | 一条用系统语言写的动议,加上所套用的规则 |
| 单件耗时 | 分钟级,随输出长度增长 | 几十秒,只随模糊程度增长 |
| 「通过」意味着什么 | 「读起来说得通」 | 「在这个条款下这个动作是对的」 |
| 审计留下什么 | 一句批注,如果有 | 动作、规则、证据片段、模型与 prompt 版本、复核人 |
| 量上来后成本怎么走 | 跟着输出量和人头涨 | 跟着真正模糊的案例占比走 |
最后一行是商业要点:审输出的成本绑在模型生成多少字上,这个数字会被模型选择推高;审决策的成本绑在业务本身有多模糊上,这个数字你能测,也能压。
同一屏里必须同时有这五样东西
少一样,复核人就退回去自己推答案。
- 用系统语言写的动议。「通过发票 4471,金额 12880 元,记在成本中心 2103 下」一眼可判;三段说明「该发票看起来与采购订单一致」不行。
- **规则的原文和位置。**判断来自供应商框架协议第 4.2 条,就让他看到第 4.2 条。
- **两到四条证据,每条指向原文的精确位置。**点不进送货单那一行的复核人只能信任转述,那和模型出现之前一样。
- **与上一次同类案例的差异。**数量涨了 40%、换了供应商、账期缩短,这类提示给复核人的经验一个着力点。
- 反事实。「送货单若是 42 件而不是 24 件,这条就变成驳回。」它把复核人一周后就无视的置信度分数,换成一件具体要核的事。
这一屏底下,整次运行必须可重放:复核人问「它为什么这么说」时,答案应该是一键点进输入、版本和成本,而不是约一个写 prompt 的人开会。这套视图怎么落到实现里,让复核从几分钟压到一分钟内的决策视图设计里有完整清单;补装到一条已经在跑量的流程上,钱就是在这里花掉的。
复核人还要有三个出口——通过、改判断、带理由码驳回。自由文本的驳回框等于没有人驳回,而理由码是这套系统今后最有用的一份数据。
复核时间的算术,试点报告里从来不写
单件复核耗时几乎从不出现在试点报告里,而它才决定这门生意成不成立。下表是我的秒表数据,两个客户的队列,不是公开基准:当成问题的形状,签合同前先量你自己的队列。假设另写一条:一天 600 件,复核人每天按 7 小时有效工时计。
| 600 件/天的复核设计 | 单件耗时 | 每日复核工时 | 需要多少人力 |
|---|---|---|---|
| 读完整输出,自己重建结论 | 4 分钟 | 40 小时 | 约 5.7 个全职 |
| 决策视图,含规则与证据 | 45 秒 | 7.5 小时 | 约 1.1 个全职 |
| 分层:70% 一键确认,30% 走决策视图 | 10 秒 / 45 秒 | 3.4 小时 | 约 0.5 个全职 |
折成钱:一位复核人的全成本按每年 30 万元计,含薪资、社保和管理分摊,这是我在深圳见到的口径。250 个工作日乘 7 小时是 1750 小时,折下来约每小时 170 元。于是 5.7 个全职是每年约 170 万元的一条经常性支出,1.1 个全职 33 万元,0.5 个全职 15 万元。这道差距就是界面工作全部的回报,而且它比任何模型改进都先出现在预算表上。
两条要摆在 CFO 面前:这个省法假设量又大又稳,一天三十件时全都不成立,那就不该建;界面工作也不免费,一版能点进证据的视图是几周工程量。
哪些决定本来就不该过人的手
界面让剩下的复核变便宜,分层决定还剩多少复核要做。
| 层级 | 特征 | 处理方式 |
|---|---|---|
| 自动 | 可逆、有规则、金额低、量大 | 不进人工,按 1/50 抽样审计,留痕 |
| 确认 | 有规则,但输入脏 | 模型给动议,人一键确认,证据可见 |
| 决策 | 不可逆、外部可见或超金额线 | 完整决策视图,具名责任人,加第二读者 |
依据不是「模型有多自信」,而是三件事:动作能不能撤销、客户或监管会不会看见、有没有写下来的规则。规则不在背后的动作,置信度再高也不该进第一层:复核人没有东西判它,审计也没有东西查它。
回路会安静地失效
- **橡皮图章。**只盯一个数:被后手复核或下游审计推翻的通过占多少。通过率长期高于 99%、一次都没被推翻,这套复核就是装饰。
- **队列深度。**两百件待办时,判断比四十件时差。给队列设上限、轮岗;队列变长说明分层有缺陷。
- **会腐烂的证据。**存储路径一改,指向源文档的链接就断。点过三次死链的人会停止点击,决策视图会悄悄退化成加了装饰的输出视图。
- **只审简单的案例。**最省事的抽样是查高置信度那批,因为快。注意力该放在边界带上,反事实那一行就是为它准备的。
花钱之前先问四个问题
复核人在屏幕上看什么;按你预期的量,一件要几秒;多少比例落进完整决策层;通过之后谁来推翻它。第一个答案是「一份文档加一个聊天框」的话,这条系统就带了一条没有上限的人头支出,换模型不会改变它。人在回路真正的版本不是一个人检查机器,而是一台机器把一条决策、它的规则和它的证据摆出来,让人在一分钟之内裁定。预算里给界面留的位置应该和给模型的一样重,因为决定这是一条便宜流程还是一个新增部门的,是复核时间的算术。
继续阅读
- AI 系统可观测性不是一块监控面板:复现不了故障,就等于还在跑演示2026-02-106 分钟AI 系统架构
- MCP 服务端设计:收自然语言指令的工具,写不出回归测试2026-02-147 分钟AI 系统架构
- 企业 AI 落地:卡住的地方是流程归属,不是模型能力2026-03-266 分钟AI 落地