REQUIREMENTS开始之前
准备方式, 有两种
用 API 今天就开拍,还是用本地 GPU 不计数量地拍。两种方式用的是同一份分镜表。
CLOUD API
用 API 运行
无需设备,注册当天即可开始。按用量支付各家的 API 费用。
- fal.ai 的 API 密钥
- Anthropic 或 OpenAI 的 API 密钥
LOCAL GPU
在本地运行
用本地 GPU 加订阅。渲染多少条都不产生 API 费用。
- GPU 机器 + ComfyUI
- Claude 或 ChatGPT 订阅
01—TWO SETS两种运行方式
API 与本地, 两种运行方式
视频在哪里渲染,对话用哪个 AI。各有两种准备方式。
CLOUD API
用 API 运行
LOCAL GPU
在本地运行
VIDEO—渲染视频
- 视频渲染端
- 用 API 运行
fal.ai 的云端 API
- 在本地运行
在本地 GPU 上运行的 ComfyUI
- 可选引擎
- 用 API 运行
fal.ai API 的 MiniMax H3(不做量化,每个镜头 5–15 秒)
fal.ai API 的 MiniMax Hailuo(每个镜头 6 / 10 秒)
- 在本地运行
本地 GPU 的 MiniMax H3(可装进 12GB 的 int8 版)
本地 GPU 的 Seedance(仅预留接口,工作流准备中)
- 需要准备
- 用 API 运行
fal.ai 账号和 API 密钥
粘贴到组织设置 → 生成 AI(組織設定 → 生成 AI)即可。加密保存,只显示末尾 4 个字符
- 在本地运行
搭载 NVIDIA GPU 的机器和 ComfyUI
MiniMax H3 全套模型(约占 93GB 空间)和自定义节点
- 费用方式
- 用 API 运行
fal.ai 的使用费,直接计入你登记的密钥
按分辨率和时长计费。MiniMax H3 默认 768P,改为 2K 时每秒费用约为 2 倍(截至 2026-09-14)
- 在本地运行
不产生 API 费用
只需承担设备和电费
- 等待时间
- 用 API 运行
无需排队等 GPU,镜头并行生成
耗时取决于 fal.ai 的繁忙程度
- 在本地运行
1 个 4 秒镜头约 139 秒(实测)
每台 GPU 逐条依次处理。点击前会显示预计时间
- 目前做不到
- 用 API 运行
2 张以上关键帧的参考模式,以及视频 → 视频(v2v)
生成演员的角色设定表和场景设定表(目前都只能用本地 GPU)
- 在本地运行
长镜头取决于显存。12GB 即使用 480P 也渲染不了 60 秒
渲染不了的时长,点击前就会被拦下
AI—对话 AI
- 对话 AI
- 用 API 运行
Anthropic(Claude)或 OpenAI(GPT)的 API 密钥
按用量计费。在设置 → API 设置 → AI 连接(設定 → API 設定 → AI 連携)中登记
- 在本地运行
Claude Pro / Max 或 ChatGPT Plus / Pro 的订阅额度
由 Konte 的本地 worker(Node 18 及以上)调用本机的官方 CLI(claude / codex)
- 其他选择
- 用 API 运行
兼容 OpenAI 的内部网关(LiteLLM / vLLM 等)
- 在本地运行
本地 LLM(Ollama / LM Studio),无需密钥即可登记
02—COMMON两者通用
两种方式通用的, 4 件事
关于引擎怎么选,以及生成分镜表的 AI。
生成分镜表的 AI
从对话拆分镜头、生成前润色提示词、读取演员和场景,都由运行在 Konte 服务器上的 Claude 负责。
每个组织 1 个引擎
由组织的所有者选定默认生成引擎。因为同一部作品的镜头若因人而异用不同引擎渲染,画面就会对不上。
视频和对话,可以分别选择
也可以这样搭配:视频用本地 GPU,对话用 API 密钥。
用本地 AI 操作分镜表(可选)
通过 MCP 把 Claude Code 或 Codex 接入 Konte,从创建资料、演员、场景、道具、镜头到生成都可以交给它(52 个工具)。只有在你要求时才会生成,无法撤销的删除只能在界面上操作。
03—LOCAL SPEC实测设备
本地 GPU, 实测配置
所有数字都在这 1 台机器上测得。GPU 不同,数字也会不同。
- GPU
- NVIDIA GeForce RTX 4070(显存 12GB)
- CUDA
- 13.0
- 内存
- 分配 24GB(生成 30 秒 480P 时峰值约 22GB)
- 加速
- SageAttention 2.2.0(快速生成工作流必需)
- ComfyUI 节点
- ComfyUI-MiniMaxH3-Easy / ComfyUI-KJNodes / ComfyUI-VideoHelperSuite。生成设定表还需要 ComfyUI-MiniMax-H3-Image-Studio
- 模型
- MiniMax H3 本体(int8)、文本编码器(Qwen3-VL 32B)、VAE、Turbo 8step LoRA、RealESRGAN。约占 93GB 空间
ONE CUT — 1 个 4 秒镜头
- 以 480P 生成(Turbo 8step)84.2 秒
- ESRGAN x2 → 提升到 1080p55.0 秒
1920×1080,带声音139.2 秒
| 分辨率 | 4 秒 | 15 秒 | 30 秒 | 60 秒 |
|---|---|---|---|---|
| 480P | 1 分 24 秒 | 6 分 11 秒 | 31 分 57 秒 | 显存不足 |
| 360P | — | 2 分 47 秒 | 6 分 25 秒 | 52 分 47 秒 |
仅为生成时间,不含放大到 1080p。Konte 会根据这些实测值,在点击前给出预计时间。— 表示未测量。