REQUIREMENTSはじめる前に
用意するものは、 2 通り
API で今日から撮るか、手元の GPU で本数を気にせず撮るか。どちらも同じ香盤表です。
CLOUD API
API で動かす
機材なしで、登録したその日から。使った分だけ、各社の API 利用料がかかります。
- fal.ai の API キー
- Anthropic か OpenAI の API キー
LOCAL GPU
ローカルで動かす
手元の GPU とサブスクで。何本焼いても API の利用料はかかりません。
- GPU マシン + ComfyUI
- Claude か ChatGPT のサブスク
01—TWO SETS2 つの動かし方
API とローカル、 2 つの動かし方
動画を焼く場所と、チャットの AI。それぞれに 2 通りの用意があります。
CLOUD API
API で動かす
LOCAL GPU
ローカルで動かす
VIDEO—動画を焼く
- 動画を焼く場所
- API で動かす
fal.ai のクラウド API
- ローカルで動かす
手元の GPU で動く ComfyUI
- 選べるエンジン
- API で動かす
fal.ai API の MiniMax H3(量子化なし・1 カット 5〜15 秒)
fal.ai API の MiniMax Hailuo(1 カット 6 / 10 秒)
- ローカルで動かす
ローカル GPU の MiniMax H3(12GB に収める int8 版)
ローカル GPU の Seedance(受け口のみ・ワークフロー準備中)
- 用意するもの
- API で動かす
fal.ai のアカウントと API キー
組織設定 → 生成 AI に貼るだけ。暗号化して保存し、表示は末尾 4 文字
- ローカルで動かす
NVIDIA の GPU を積んだマシンと ComfyUI
MiniMax H3 のモデル一式(置き場 約 93GB)とカスタムノード
- お金のかかり方
- API で動かす
fal.ai の利用料が、登録したキーへ直接
解像度と尺に応じた従量課金。MiniMax H3 の既定は 768P で、2K にすると 1 秒あたり約 2 倍(2026-09-14 時点)
- ローカルで動かす
API の利用料はかからない
かかるのは機材と電気代だけ
- 待ち時間
- API で動かす
GPU の順番待ちなし。カットを並行して生成
所要時間は fal.ai の混み具合しだい
- ローカルで動かす
4 秒のカット 1 本 約 139 秒(実測)
GPU 1 台につき 1 本ずつ順番に。押す前に目安の時間が出る
- 今できないこと
- API で動かす
キーフレーム 2 枚以上の参照モードと、動画 → 動画(v2v)
キャストのプロフィールシートと背景セットのシートの生成(どちらも今は手元の GPU だけ)
- ローカルで動かす
長尺は VRAM しだい。12GB では 480P でも 60 秒は焼けない
焼けない尺は、押す前に止まる
AI—チャットの AI
- チャットの AI
- API で動かす
Anthropic(Claude)か OpenAI(GPT)の API キー
従量課金。設定 → API 設定 → AI 連携で登録
- ローカルで動かす
Claude Pro / Max か ChatGPT Plus / Pro のサブスク枠
手元の公式 CLI(claude / codex)を、Konte のローカルワーカー(Node 18 以降)が呼ぶ
- ほかの選択肢
- API で動かす
OpenAI 互換の社内ゲートウェイ(LiteLLM / vLLM など)
- ローカルで動かす
手元の LLM(Ollama / LM Studio)。キーなしで登録できる
02—COMMONどちらでも共通
どちらでも共通の、 4 つのこと
エンジンの選び方と、構成表をつくる AI について。
構成表をつくる AI
会話からのカット割り、生成直前のプロンプトの清書、キャストや背景セットの読み取りは、Konte のサーバーで動く Claude が受け持ちます。
エンジンは組織ごとに 1 つ
組織のオーナーが既定の生成エンジンを選びます。同じ作品のカットが人によって別のエンジンで焼かれると、絵がそろわないためです。
動画と会話は、別々に選べる
動画は手元の GPU、チャットは API キー、のような組み合わせもできます。
手元の AI から香盤表を操作(任意)
Claude Code や Codex を MCP で Konte につなぐと、香盤表を読む・カットを足す・文面を直すまでできます。MCP とチャットからは、生成は始まりません。
03—LOCAL SPEC実測した機材
手元の GPU、 実測の構成
数字はすべて、この 1 台で測ったもの。GPU が違えば変わります。
- GPU
- NVIDIA GeForce RTX 4070(VRAM 12GB)
- CUDA
- 13.0
- メインメモリ
- 24GB を割り当て(30 秒・480P の生成でピーク約 22GB)
- 高速化
- SageAttention 2.2.0(高速生成のワークフローに必須)
- ComfyUI のノード
- ComfyUI-MiniMaxH3-Easy / ComfyUI-KJNodes / ComfyUI-VideoHelperSuite。シートの生成には ComfyUI-MiniMax-H3-Image-Studio も
- モデル
- MiniMax H3 本体(int8)、テキストエンコーダー(Qwen3-VL 32B)、VAE、Turbo 8step LoRA、RealESRGAN。置き場 約 93GB
ONE CUT — 4 秒のカット 1 本
- 480P で生成(Turbo 8step)84.2 秒
- ESRGAN x2 → 1080p に整える55.0 秒
1920×1080・音声つき139.2 秒
| 解像度 | 4 秒 | 15 秒 | 30 秒 | 60 秒 |
|---|---|---|---|---|
| 480P | 1 分 24 秒 | 6 分 11 秒 | 31 分 57 秒 | VRAM 不足 |
| 360P | — | 2 分 47 秒 | 6 分 25 秒 | 52 分 47 秒 |
1080p への拡大を含まない、生成だけの時間。Konte はこの実測値から、押す前に目安の時間を出します。— は未計測。