跳到正文
Konte
开始之前
SH-02 · 6s · KONTE · 本地 GPU 的 MiniMax H3

REQUIREMENTS开始之前

准备方式,有两种

用 API 今天就开拍,还是用本地 GPU 不计数量地拍。两种方式用的是同一份分镜表。

CLOUD API

用 API 运行

无需设备,注册当天即可开始。按用量支付各家的 API 费用。

  • fal.ai 的 API 密钥
  • Anthropic 或 OpenAI 的 API 密钥

LOCAL GPU

在本地运行

用本地 GPU 加订阅。渲染多少条都不产生 API 费用。

  • GPU 机器 + ComfyUI
  • Claude 或 ChatGPT 订阅

01—TWO SETS两种运行方式

API 与本地,两种运行方式

视频在哪里渲染,对话用哪个 AI。各有两种准备方式。

VIDEO—渲染视频

视频渲染端
用 API 运行

fal.ai 的云端 API

在本地运行

在本地 GPU 上运行的 ComfyUI

可选引擎
用 API 运行

fal.ai API 的 MiniMax H3(不做量化,每个镜头 5–15 秒)

fal.ai API 的 MiniMax Hailuo(每个镜头 6 / 10 秒)

在本地运行

本地 GPU 的 MiniMax H3(可装进 12GB 的 int8 版)

本地 GPU 的 Seedance(仅预留接口,工作流准备中)

需要准备
用 API 运行

fal.ai 账号和 API 密钥

粘贴到组织设置 → 生成 AI(組織設定 → 生成 AI)即可。加密保存,只显示末尾 4 个字符

在本地运行

搭载 NVIDIA GPU 的机器和 ComfyUI

MiniMax H3 全套模型(约占 93GB 空间)和自定义节点

费用方式
用 API 运行

fal.ai 的使用费,直接计入你登记的密钥

按分辨率和时长计费。MiniMax H3 默认 768P,改为 2K 时每秒费用约为 2 倍(截至 2026-09-14)

在本地运行

不产生 API 费用

只需承担设备和电费

等待时间
用 API 运行

无需排队等 GPU,镜头并行生成

耗时取决于 fal.ai 的繁忙程度

在本地运行

1 个 4 秒镜头约 139 秒(实测)

每台 GPU 逐条依次处理。点击前会显示预计时间

目前做不到
用 API 运行

2 张以上关键帧的参考模式,以及视频 → 视频(v2v)

生成演员的角色设定表和场景设定表(目前都只能用本地 GPU)

在本地运行

长镜头取决于显存。12GB 即使用 480P 也渲染不了 60 秒

渲染不了的时长,点击前就会被拦下

AI—对话 AI

对话 AI
用 API 运行

Anthropic(Claude)或 OpenAI(GPT)的 API 密钥

按用量计费。在设置 → API 设置 → AI 连接(設定 → API 設定 → AI 連携)中登记

在本地运行

Claude Pro / Max 或 ChatGPT Plus / Pro 的订阅额度

由 Konte 的本地 worker(Node 18 及以上)调用本机的官方 CLI(claude / codex)

其他选择
用 API 运行

兼容 OpenAI 的内部网关(LiteLLM / vLLM 等)

在本地运行

本地 LLM(Ollama / LM Studio),无需密钥即可登记

02—COMMON两者通用

两种方式通用的,4 件事

关于引擎怎么选,以及生成分镜表的 AI。

  • 生成分镜表的 AI

    从对话拆分镜头、生成前润色提示词、读取演员和场景,都由运行在 Konte 服务器上的 Claude 负责。

  • 每个组织 1 个引擎

    由组织的所有者选定默认生成引擎。因为同一部作品的镜头若因人而异用不同引擎渲染,画面就会对不上。

  • 视频和对话,可以分别选择

    也可以这样搭配:视频用本地 GPU,对话用 API 密钥。

  • 用本地 AI 操作分镜表(可选)

    通过 MCP 把 Claude Code 或 Codex 接入 Konte,从创建资料、演员、场景、道具、镜头到生成都可以交给它(52 个工具)。只有在你要求时才会生成,无法撤销的删除只能在界面上操作。

03—LOCAL SPEC实测设备

本地 GPU,实测配置

所有数字都在这 1 台机器上测得。GPU 不同,数字也会不同。

GPU
NVIDIA GeForce RTX 4070(显存 12GB)
CUDA
13.0
内存
分配 24GB(生成 30 秒 480P 时峰值约 22GB)
加速
SageAttention 2.2.0(快速生成工作流必需)
ComfyUI 节点
ComfyUI-MiniMaxH3-Easy / ComfyUI-KJNodes / ComfyUI-VideoHelperSuite。生成设定表还需要 ComfyUI-MiniMax-H3-Image-Studio
模型
MiniMax H3 本体(int8)、文本编码器(Qwen3-VL 32B)、VAE、Turbo 8step LoRA、RealESRGAN。约占 93GB 空间

ONE CUT — 1 个 4 秒镜头

  1. 以 480P 生成(Turbo 8step)84.2 秒
  2. ESRGAN x2 → 提升到 1080p55.0 秒

1920×1080,带声音139.2 秒

生成耗时(按时长)
分辨率4 秒15 秒30 秒60 秒
480P1 分 24 秒6 分 11 秒31 分 57 秒显存不足
360P—2 分 47 秒6 分 25 秒52 分 47 秒

仅为生成时间,不含放大到 1080p。Konte 会根据这些实测值,在点击前给出预计时间。— 表示未测量。

GET STARTED开始使用

你的摄影棚,今天开张

先从创建一位演员开始。欢迎随时联系我们。