本文へ
Konte
はじめる前に
SH-02 · 6s · KONTE · ローカル GPU の MiniMax H3

REQUIREMENTSはじめる前に

用意するものは、2 通り

API で今日から撮るか、手元の GPU で本数を気にせず撮るか。どちらも同じ香盤表です。

CLOUD API

API で動かす

機材なしで、登録したその日から。使った分だけ、各社の API 利用料がかかります。

  • fal.ai の API キー
  • Anthropic か OpenAI の API キー

LOCAL GPU

ローカルで動かす

手元の GPU とサブスクで。何本焼いても API の利用料はかかりません。

  • GPU マシン + ComfyUI
  • Claude か ChatGPT のサブスク

01—TWO SETS2 つの動かし方

API とローカル、2 つの動かし方

動画を焼く場所と、チャットの AI。それぞれに 2 通りの用意があります。

VIDEO—動画を焼く

動画を焼く場所
API で動かす

fal.ai のクラウド API

ローカルで動かす

手元の GPU で動く ComfyUI

選べるエンジン
API で動かす

fal.ai API の MiniMax H3(量子化なし・1 カット 5〜15 秒)

fal.ai API の MiniMax Hailuo(1 カット 6 / 10 秒)

ローカルで動かす

ローカル GPU の MiniMax H3(12GB に収める int8 版)

ローカル GPU の Seedance(受け口のみ・ワークフロー準備中)

用意するもの
API で動かす

fal.ai のアカウントと API キー

組織設定 → 生成 AI に貼るだけ。暗号化して保存し、表示は末尾 4 文字

ローカルで動かす

NVIDIA の GPU を積んだマシンと ComfyUI

MiniMax H3 のモデル一式(置き場 約 93GB)とカスタムノード

お金のかかり方
API で動かす

fal.ai の利用料が、登録したキーへ直接

解像度と尺に応じた従量課金。MiniMax H3 の既定は 768P で、2K にすると 1 秒あたり約 2 倍(2026-09-14 時点)

ローカルで動かす

API の利用料はかからない

かかるのは機材と電気代だけ

待ち時間
API で動かす

GPU の順番待ちなし。カットを並行して生成

所要時間は fal.ai の混み具合しだい

ローカルで動かす

4 秒のカット 1 本 約 139 秒(実測)

GPU 1 台につき 1 本ずつ順番に。押す前に目安の時間が出る

今できないこと
API で動かす

キーフレーム 2 枚以上の参照モードと、動画 → 動画(v2v)

キャストのプロフィールシートと背景セットのシートの生成(どちらも今は手元の GPU だけ)

ローカルで動かす

長尺は VRAM しだい。12GB では 480P でも 60 秒は焼けない

焼けない尺は、押す前に止まる

AI—チャットの AI

チャットの AI
API で動かす

Anthropic(Claude)か OpenAI(GPT)の API キー

従量課金。設定 → API 設定 → AI 連携で登録

ローカルで動かす

Claude Pro / Max か ChatGPT Plus / Pro のサブスク枠

手元の公式 CLI(claude / codex)を、Konte のローカルワーカー(Node 18 以降)が呼ぶ

ほかの選択肢
API で動かす

OpenAI 互換の社内ゲートウェイ(LiteLLM / vLLM など)

ローカルで動かす

手元の LLM(Ollama / LM Studio)。キーなしで登録できる

02—COMMONどちらでも共通

どちらでも共通の、4 つのこと

エンジンの選び方と、構成表をつくる AI について。

  • 構成表をつくる AI

    会話からのカット割り、生成直前のプロンプトの清書、キャストや背景セットの読み取りは、Konte のサーバーで動く Claude が受け持ちます。

  • エンジンは組織ごとに 1 つ

    組織のオーナーが既定の生成エンジンを選びます。同じ作品のカットが人によって別のエンジンで焼かれると、絵がそろわないためです。

  • 動画と会話は、別々に選べる

    動画は手元の GPU、チャットは API キー、のような組み合わせもできます。

  • 手元の AI から香盤表を操作(任意)

    Claude Code や Codex を MCP で Konte につなぐと、香盤表を読む・カットを足す・文面を直すまでできます。MCP とチャットからは、生成は始まりません。

03—LOCAL SPEC実測した機材

手元の GPU、実測の構成

数字はすべて、この 1 台で測ったもの。GPU が違えば変わります。

GPU
NVIDIA GeForce RTX 4070(VRAM 12GB)
CUDA
13.0
メインメモリ
24GB を割り当て(30 秒・480P の生成でピーク約 22GB)
高速化
SageAttention 2.2.0(高速生成のワークフローに必須)
ComfyUI のノード
ComfyUI-MiniMaxH3-Easy / ComfyUI-KJNodes / ComfyUI-VideoHelperSuite。シートの生成には ComfyUI-MiniMax-H3-Image-Studio も
モデル
MiniMax H3 本体(int8)、テキストエンコーダー(Qwen3-VL 32B)、VAE、Turbo 8step LoRA、RealESRGAN。置き場 約 93GB

ONE CUT — 4 秒のカット 1 本

  1. 480P で生成(Turbo 8step)84.2 秒
  2. ESRGAN x2 → 1080p に整える55.0 秒

1920×1080・音声つき139.2 秒

生成にかかる時間(尺ごと)
解像度4 秒15 秒30 秒60 秒
480P1 分 24 秒6 分 11 秒31 分 57 秒VRAM 不足
360P—2 分 47 秒6 分 25 秒52 分 47 秒

1080p への拡大を含まない、生成だけの時間。Konte はこの実測値から、押す前に目安の時間を出します。— は未計測。

GET STARTEDはじめる

あなたの撮影スタジオ、今日から

まずは出演者を 1 人つくるところから。お気軽にご相談ください。