跳到正文
04 / 06自有服务能力 · 自研系统

ReelForge OS · 工业级 AI 短剧自动化生管体系与多智能体场控中枢

一句话量级

30 集短剧的初剪对轨,人工约 90 个工时。这条管线把云端分镜直接导出成 .fcpxml——剪辑师打开就是达芬奇工程,对轨这一步不见了。

30 集 × 3 小时/集 = 约 90 个工时。3 小时/集为后期经验基线(外部经验值,非我方实测),30 × 3 = 90 为推算。这不是「快多少倍」,而是「这一步没了」。

你买的到底是什么

ReelForge OS 把一部 30 集(设计容量)短剧的「剧本 → 资产 → 分镜 → 导演 → 营销」五段流程串成一条管线:云端生成画面与配音,本地一键导出成剪辑师能直接精调的达芬奇 / FCPX 工程。你买的不是又一个生成工具,是一条能跑长片的产线。

它替代的是什么

  • 30 集素材到手,剪辑师第一件事不是剪,是下载、分类、重命名、在时间线上逐条对轨——30 集 × 3 小时/集 = 约 90 个工时(3 小时/集为后期经验基线)。这 90 个工时跟创作无关,但排期表上它一天都不能省,档期就卡在这。
  • 剧本 → 分镜 → 生图 → 视频是串行链路:前一步错了,后面全部渲染作废。链路里没有审批闸门,废片率直接变成 API 账单;角色跨集还会「失忆」,返工得从第一集重跑——账单比进度先到。
  • 素材是散的,问题只有进时间线才看得见;改一集,就要重走一遍整条链路。设计目标(未实测):让单集的生成、配音、配乐与组装改为异步流转,支撑 30 集量级的长篇批量生产——此为设计目标,未经实测,不构成承诺。

架构

ReelForge OS · 工业级 AI 短剧自动化生管体系与多智能体场控中枢 — 架构线框图三段式架构线框图:触发、推理、执行,并在主连线上标出阻断闸门与复用环。01触发FastAPI gatewayhigh-concurrency intakeRedis + Celery queuerun_phase1 → 5_asyncLangGraph master_graphProducer · Script Writer · VFXSkill libraryVision · Audio · RAG · Planning02推理extract_script_manifestscene + role breakdownCharacter DNA → Qdrantface-ID identity lockgenerate_voice_modelElevenLabs · word timestamps03执行Director agentproduction_manifest.jsonForge engine_compilerKen Burns · BGM · subtitlesFCPXMLExporter → .fcpxmlDaVinci / FCPX finishingasync phase1 → 5 workers人工审批plot approval gateAWAITING_PLOT_APPROVALmanifest handoff→ Forge engine缓存命中asset reuse · no re-callLangGraph · FastAPI · Celery + Redis · PostgreSQL / PostgresSaver · Qdrant · Cloudflare R2 · FFmpeg · Flux / ElevenLabs / Kling / Runway

横向三段并排的「地铁线路图」式线框:Trigger(智能体协作网关)→ Brain(全域资产 RAG 与调度)→ Action(FCPXML 导出 / 本地重混),顶部一条细色带标注状态机主干线 Story → Assets → Storyboard → Director → Marketing。图上两个标记:HITL 剧本审批闸门处,Trigger → Brain 的主箭头断开;Brain 内部一条 CACHE_HIT 旁路箭头直取缓存资产,不重复走模型调用。

防护栏

  • HITL 状态机阻断(AWAITING_PLOT_APPROVAL)——剧本审批是 LangGraph 图上的必经节点,未放行不推进后续生成;废片还没生成就被挡掉,不用拿 API 账单试错。
  • CACHE_HIT 资产复用——底层封装 search_database_record 与 RAG 检索,判定场景或角色未变化时直接拉取缓存资产,阻断重复的昂贵模型调用;省下的调用次数可统计(本期不编造数值)。
  • MultimodalAdapter 抹平多模态 API 差异——把 Flux、Midjourney、Kling、Runway 等生图 / 生视频模型的接口差异收敛在适配器内,上层业务只认 standard_ratio 与通用 Payload;底层模型更迭不进上层代码。
  • 极限网络退避与本地断点续传——_download_file 指数退避下载重试 + upgrade 离线图纸升级 + 扫描本地物理目录重建映射,网络瞬断也能离线 remix。
  • FCPXMLExporter + AnimaticEngine——把含运镜指令与毫秒级音频对齐的分镜落成 .fcpxml 工程文件,并先出一版预览成片(Animatic);剪辑师打开就是能精调的工程,不是一堆散素材。

你最终拿到手的东西

  • LangGraph 多智能体编排网络——各节点 Prompt、Router 逻辑及 Checkpointer 配置。
  • MultimodalAdapter 与 Skill 插件库——生图、TTS、BGM 匹配、RAG 检索等标准化 Python SDK。
  • Forge Local Client——engine_compiler 压制引擎、交互式 CLI 工具及达芬奇 FCPXMLExporter。

6 至 8 周。这是排期估算,不是合同承诺。

技术栈

编排层
LangGraph (master_graph state machine + PostgresSaver checkpointer) · FastAPI gateway · Celery + Redis async queue · MultimodalAdapter skill plugins · LLMs routed through a gateway (OpenAI / Qwen / Claude)
数据层
PostgreSQL (Prisma) · Qdrant vector store for character DNA and asset retrieval · Cloudflare R2 object storage for cloud episode assets
呈现层
FFmpeg (Ken Burns moves, BGM fades, timestamp-burned subtitles) · Python Rich CLI · DaVinci / FCPX (.fcpxml project) · multimodal engines Flux / ElevenLabs / Kling / Runway, all behind the adapter

数字,以及它的算式

30 集初剪对轨 ≈ 90 个工时
30 集 × 3 小时/集;3 小时/集为后期经验基线(外部经验值,非我方实测),30 × 3 = 90 为推算。导出 .fcpxml 后「对轨」这一环节消失,剪辑师不用再花这 90 个工时。
一键导出 .fcpxml,即得达芬奇 / FCPX 工程文件
代码事实:FCPXMLExporter 导出内容含运镜指令 + 毫秒级音频对齐。交付物从「一堆散素材」变成「剪辑师打开就能精调的工程」。
CACHE_HIT 资产复用,不重复调用昂贵模型
代码事实:场景 / 角色未变化 → 直接取缓存资产,主链路不走模型。省下的调用次数可统计(本期不编造数值)。省下的是 API 费用,而这笔费用原本随废片率一起涨。
30 集批量生产 —— 设计容量
设计容量(Phase 1 Story → Phase 5 Marketing 全链路,未实测)。这是人工串行做不完的量。

同一个形状,另外三个问题

如果你的事不是上面那个场景,这一段才是重点:同一套架构指向三个互不相关的场景,都不是上一个案例的变体,也不需要从零重建。这些是**可平移的方向,不是已交付的项目**——上面那套系统是我们真跑过的,下面这三条是它的形状接下来能解决什么。这个区别我们标出来,不含糊过去。

  • 自动化有声书与动态漫生成

    输入网文小说,自动切章、抽取角色对话分配不同 TTS 音色、按剧情生成背景插图。

  • 企业级培训视频工厂

    把合规文档 / 产品手册转成分镜台词 + 数字人 / TTS 宣讲 + 插图与 BGM。

  • 智能游戏剧情资产管线

    由世界观与剧情树批量生成 NPC 立绘、环境概念图与带时间戳语音切片,经 JSON Manifest 导入 Unity / Unreal。

有系统要做?

把情况写下来。你拿到的是针对你情况的书面回复——没有日历、没有 discovery call、没有十五分钟的寒暄。

状态

自研系统。这是我们给自己造的生产管线,不是客户案例,也不是对外产品交付记录,没有任何外部组织在用它。它证明的是我们编排多智能体系统的能力。它在我们自己的环境里运行中。

自研系统,在我们自己的环境里运行。

准备构建一套系统?[ 提交需求 ]