LexiCoach 实时多模态语音智能体
一句话量级
同样 15 分钟口语对练,真人外教按市场价约 $7.5;这条链路压到美分区间,而且能同时陪 1,000 个人——瓶颈是服务器,不是人。
$7.5 = $30/hr ÷ 4,外教时薪取行业报价。美分区间 = 流式识别单价 × 分钟 + LLM token 单价 × 时长,单价待实测填入。两者相差约两个数量级。
你买的到底是什么
你买的是一套实时语音智能体,以及驱动它的 LangGraph 状态机。串行的「录音 → 转写 → 思考 → 合成」被全双工 WebSocket + 流式 VAD 取代,双方可以同时说话。大模型不许自己开口:brain_node 先裁决(PASS / FIX_NEEDED / HELP_REQUEST),action_node 再按裁决生成反馈,所以教练说的每一句都短、准、不跑偏。目标是把「能聊」的 demo,做成员工每天能拿来练话术的系统。
它替代的是什么
- 钱漏在招人这一侧。真人外教 / 企业内训师市场价通常 $30+/hr(行业报价,非我方数据),15 分钟就是约 $7.5。想给 50 个新销售排话术陪练,先要点头的不是技术评审,是排课表和预算表。
- 秒漏在产品这一侧。传统半双工串行架构要等用户说完,才开始录音转写 → 送 LLM 思考 → 合成语音,每一轮都落在 3–5 秒(行业典型量级,非我方测量)。口语对练最要的临场高压感,就是被这几秒磨没的:没有打断和插话,就没有真实对话。通用大模型当教练还会「写小作文」,出不了简短反馈(Micro-lesson)和引导跟读(Shadowing)。
- 账单漏在工程省事这一侧。为了抢响应速度,把昂贵的流式语音厂商 API Key 硬编码进移动客户端;一次逆向抓包就能把这个 Key 拿走,之后账单花多少就不由你说了算了。
架构
三段横向线框:端侧音频流网关 → LangGraph 状态机 → 会话资产沉淀。令牌鉴权点标在 ① 与 ② 之间的 WebSocket 连线上,另有一条虚线回路从状态机回到网关,断线重连时训练上下文不丢。
防护栏
- 动态 TTL 令牌鉴权锁。iOS 先请求 /session/start,后端扣账户算力积分,鉴权通过才向流式语音厂商申请一枚动态 TTL 临时令牌(仅当前 15 分钟存活 + usage:write 限定权限)下发客户端建 WebSocket——API Key 永不进移动端。
- 打断与断线免疫。重写 AVAudioSession 生命周期底层观察者:来电打断、退居后台、基站切换导致 Socket 异常关闭时走指数退避;前台激活 1 秒内触发 reconnectSession 重建音频链路,训练上下文不丢。
- 结构化幻觉防爆层。报告依赖高复杂度 Prompt;JSON 崩溃或关键字段缺失时,后端 Pydantic 与 iOS init(from decoder:) 立即触发类型回退(Type Fallback),灌 N/A 兜底,图表不崩。
你最终拿到手的东西
- iOS 原生流式音频引擎——基于 Swift / AVFoundation 的高性能双工通信与 UI 组件(含 StoreKit 2 积分包管理、SwiftUI 雷达图)。
- 多智能体编排网关——基于 FastAPI 的无状态后端,内置完整的 LangGraph 工作流路由网络与 Vercel Blob 资产上云管线。
- 商用级存储与权限架构——基于 Supabase 的 RLS(Row Level Security)数据模型、实时用户凭证分发与账户安全系统。
4 至 6 周,从业务逻辑抽象、LangGraph 节点编排到 iOS 底层音频框架耦合,按复杂度评估的规划区间。这是排期估算,不是合同承诺。
技术栈
- 编排层
- LangGraph · OpenAI GPT-4o · Qwen (DashScope API)
- 语音流式层
- Deepgram (Aura TTS / Nova-2 STT) · Hume EVI WebSocket
- 端侧与数据层
- SwiftUI · AVAudioEngine · Supabase (Auth / RPC / DB) · FastAPI (httpx)
数字,以及它的算式
- 目标 <500ms(端到端含网络)
- 目标,不是实测,尚未埋点。架构依据是全双工 WebSocket + 流式 VAD,不是串行链路。
- 串行架构每轮 3–5 秒
- 典型半双工架构的行业经验量级,非我方测量。这条链路要对标的是上面那个 <500ms 目标。
- 真人外教 $30+/hr
- 行业报价,既不是我们的数据,也不是我们的报价。15 分钟约 $7.5,$30/hr ÷ 4。
- 15 分钟对练成本:美分区间
- 算式推算,单价待实测填入:流式识别单价 × 分钟 + LLM token 单价 × 时长。对比真人外教 $7.5,差约两个数量级。
- 并发 ×1,000
- 服务端编排能力,不是人力供给,也不是压测结果。真人外教同时只能带 1 个人。
同一个形状,另外三个问题
如果你的事不是上面那个场景,这一段才是重点:同一套架构指向三个互不相关的场景,都不是上一个案例的变体,也不需要从零重建。这些是**可平移的方向,不是已交付的项目**——上面那套系统是我们真跑过的,下面这三条是它的形状接下来能解决什么。这个区别我们标出来,不含糊过去。
企业销售与客服对练(Sales Enablement)
导入《标准话术 SOP 库》生成「刁钻客户」智能体;1,000 个销售同时上机练话术,系统抓取停顿延迟与违规话术做 RAG 评分。
医疗 CBT 心理干预陪伴
24 小时低延迟语音陪伴,brain_node 实时侦测高危情绪词;触发红线即脱离闲聊,接入应急响应链路。
高管媒体采访模拟演练
结合克隆音色库模拟尖锐长提问,训练在高压与突发打断中保持逻辑不乱,做 BLUF(Bottom Line Up Front)回应。
有系统要做?
把情况写下来。你拿到的是针对你情况的书面回复——没有日历、没有 discovery call、没有十五分钟的寒暄。
状态
自研系统。这是我们给自己造的架构能力资产,用来证明我们自己的实时语音与状态机编排工程力,不是客户案例,也不代表任何外部组织在用它。它在我们自己的环境里运行。
自研系统,在我们自己的环境里运行。