ReelForge OS · 工业级 AI 短剧自动化生管体系与多智能体场控中枢
一句话量级
30 集短剧的初剪对轨,人工约 90 个工时。这条管线把云端分镜直接导出成 .fcpxml——剪辑师打开就是达芬奇工程,对轨这一步不见了。
30 集 × 3 小时/集 = 约 90 个工时。3 小时/集为后期经验基线(外部经验值,非我方实测),30 × 3 = 90 为推算。这不是「快多少倍」,而是「这一步没了」。
你买的到底是什么
ReelForge OS 把一部 30 集(设计容量)短剧的「剧本 → 资产 → 分镜 → 导演 → 营销」五段流程串成一条管线:云端生成画面与配音,本地一键导出成剪辑师能直接精调的达芬奇 / FCPX 工程。你买的不是又一个生成工具,是一条能跑长片的产线。
它替代的是什么
- 30 集素材到手,剪辑师第一件事不是剪,是下载、分类、重命名、在时间线上逐条对轨——30 集 × 3 小时/集 = 约 90 个工时(3 小时/集为后期经验基线)。这 90 个工时跟创作无关,但排期表上它一天都不能省,档期就卡在这。
- 剧本 → 分镜 → 生图 → 视频是串行链路:前一步错了,后面全部渲染作废。链路里没有审批闸门,废片率直接变成 API 账单;角色跨集还会「失忆」,返工得从第一集重跑——账单比进度先到。
- 素材是散的,问题只有进时间线才看得见;改一集,就要重走一遍整条链路。设计目标(未实测):让单集的生成、配音、配乐与组装改为异步流转,支撑 30 集量级的长篇批量生产——此为设计目标,未经实测,不构成承诺。
架构
横向三段并排的「地铁线路图」式线框:Trigger(智能体协作网关)→ Brain(全域资产 RAG 与调度)→ Action(FCPXML 导出 / 本地重混),顶部一条细色带标注状态机主干线 Story → Assets → Storyboard → Director → Marketing。图上两个标记:HITL 剧本审批闸门处,Trigger → Brain 的主箭头断开;Brain 内部一条 CACHE_HIT 旁路箭头直取缓存资产,不重复走模型调用。
防护栏
- HITL 状态机阻断(AWAITING_PLOT_APPROVAL)——剧本审批是 LangGraph 图上的必经节点,未放行不推进后续生成;废片还没生成就被挡掉,不用拿 API 账单试错。
- CACHE_HIT 资产复用——底层封装 search_database_record 与 RAG 检索,判定场景或角色未变化时直接拉取缓存资产,阻断重复的昂贵模型调用;省下的调用次数可统计(本期不编造数值)。
- MultimodalAdapter 抹平多模态 API 差异——把 Flux、Midjourney、Kling、Runway 等生图 / 生视频模型的接口差异收敛在适配器内,上层业务只认 standard_ratio 与通用 Payload;底层模型更迭不进上层代码。
- 极限网络退避与本地断点续传——_download_file 指数退避下载重试 + upgrade 离线图纸升级 + 扫描本地物理目录重建映射,网络瞬断也能离线 remix。
- FCPXMLExporter + AnimaticEngine——把含运镜指令与毫秒级音频对齐的分镜落成 .fcpxml 工程文件,并先出一版预览成片(Animatic);剪辑师打开就是能精调的工程,不是一堆散素材。
你最终拿到手的东西
- LangGraph 多智能体编排网络——各节点 Prompt、Router 逻辑及 Checkpointer 配置。
- MultimodalAdapter 与 Skill 插件库——生图、TTS、BGM 匹配、RAG 检索等标准化 Python SDK。
- Forge Local Client——engine_compiler 压制引擎、交互式 CLI 工具及达芬奇 FCPXMLExporter。
6 至 8 周。这是排期估算,不是合同承诺。
技术栈
- 编排层
- LangGraph (master_graph state machine + PostgresSaver checkpointer) · FastAPI gateway · Celery + Redis async queue · MultimodalAdapter skill plugins · LLMs routed through a gateway (OpenAI / Qwen / Claude)
- 数据层
- PostgreSQL (Prisma) · Qdrant vector store for character DNA and asset retrieval · Cloudflare R2 object storage for cloud episode assets
- 呈现层
- FFmpeg (Ken Burns moves, BGM fades, timestamp-burned subtitles) · Python Rich CLI · DaVinci / FCPX (.fcpxml project) · multimodal engines Flux / ElevenLabs / Kling / Runway, all behind the adapter
数字,以及它的算式
- 30 集初剪对轨 ≈ 90 个工时
- 30 集 × 3 小时/集;3 小时/集为后期经验基线(外部经验值,非我方实测),30 × 3 = 90 为推算。导出 .fcpxml 后「对轨」这一环节消失,剪辑师不用再花这 90 个工时。
- 一键导出 .fcpxml,即得达芬奇 / FCPX 工程文件
- 代码事实:FCPXMLExporter 导出内容含运镜指令 + 毫秒级音频对齐。交付物从「一堆散素材」变成「剪辑师打开就能精调的工程」。
- CACHE_HIT 资产复用,不重复调用昂贵模型
- 代码事实:场景 / 角色未变化 → 直接取缓存资产,主链路不走模型。省下的调用次数可统计(本期不编造数值)。省下的是 API 费用,而这笔费用原本随废片率一起涨。
- 30 集批量生产 —— 设计容量
- 设计容量(Phase 1 Story → Phase 5 Marketing 全链路,未实测)。这是人工串行做不完的量。
同一个形状,另外三个问题
如果你的事不是上面那个场景,这一段才是重点:同一套架构指向三个互不相关的场景,都不是上一个案例的变体,也不需要从零重建。这些是**可平移的方向,不是已交付的项目**——上面那套系统是我们真跑过的,下面这三条是它的形状接下来能解决什么。这个区别我们标出来,不含糊过去。
自动化有声书与动态漫生成
输入网文小说,自动切章、抽取角色对话分配不同 TTS 音色、按剧情生成背景插图。
企业级培训视频工厂
把合规文档 / 产品手册转成分镜台词 + 数字人 / TTS 宣讲 + 插图与 BGM。
智能游戏剧情资产管线
由世界观与剧情树批量生成 NPC 立绘、环境概念图与带时间戳语音切片,经 JSON Manifest 导入 Unity / Unreal。
有系统要做?
把情况写下来。你拿到的是针对你情况的书面回复——没有日历、没有 discovery call、没有十五分钟的寒暄。
状态
自研系统。这是我们给自己造的生产管线,不是客户案例,也不是对外产品交付记录,没有任何外部组织在用它。它证明的是我们编排多智能体系统的能力。它在我们自己的环境里运行中。
自研系统,在我们自己的环境里运行。