HOW IT WORKSKonte 的原理
从一句话, 到一段影像
对话 AI、分镜表、生成引擎。Konte 内部发生的一切,画成一张图。
01—THE LOOP从对话到拍摄
每聊一次, 作品与素材就多一份
做分镜表、拍摄,都在对话里接着进行。做好的东西都留在项目里。
01—TALK
开口说
用一句话说出想做的视频。也能附上演员、场景和照片。
02—PLAN
分镜表出炉
先出剧情梗概,满意的话再细化成分好章节和镜头的分镜。接着说,就能修改。
03—SHOOT
点击开拍
演员和场景的参考图齐了,就点「用这份分镜表生成」(この構成表で生成する)。之前的版本留在历史记录里。
04—KEEP
留在货架上
作品出现在对话右侧,拍好的镜头进入成品。演员和场景在下一部作品里还能用。
↺ 下一部作品,从这排货架开始

02—THE MAP全局图
Konte, 是包住模型的片场
画面由模型来画。Konte 负责前后的安排和货架。
YOU你
在浏览器里对话
- 一句话说出想做的视频
- 接着说来修改
- 选中镜头来拍摄
本机的 Claude Code / Codex可选
通过 MCP 接入后,可读取分镜表、添加镜头、修改文字。
SHOT LIST分镜表
作品›章节›镜头
1 个镜头 = 1 行。画面备注、机位、演员、时长。
AIClaude
从对话拆分镜头、生成前润色提示词、读取演员和场景。
SHELF货架
演员场景资料成品
每拍一次就多一些,下一部作品从这里开始。
QUEUE生成队列
发往组织的默认引擎
STAGE渲染端(每个组织选其一)
ComfyUI
本地 GPU本地 GPU。按工作流(JSON)渲染
MiniMax H3
以 480P 生成 → ESRGAN x2 → 1080p
Seedance 准备中
放入工作流即可选用的接口
演员、场景设定表
根据参考图生成三视图和远景、近景
OR
fal.ai API
云端无需 GPU。费用计入你自己的 fal 密钥
MiniMax H3
不做量化,5–15 秒
MiniMax Hailuo
6 / 10 秒
03—ONE CUT1 个镜头的渲染过程
从分镜表的 1 行, 到 MP4
拍 1 个镜头时,后台依次发生的事。
01—ROW
分镜表的 1 行
画面备注、带说话人的台词、机位(角度、焦段、运镜、速度)、演员、时长。1 个镜头 = 1 行。
02—CAST
放入演员
登记的参考图作为关键帧放进镜头,让长相和服装对得上。
03—PROMPT
润色提示词
生成前一刻,由 Claude 写成英文提示词。结构和摄影术语由 Konte 决定,AI 只负责描写。锁定后保留你自己的文字。
04—QUEUE
交给引擎
把任务发给组织的默认引擎。本地 GPU 逐条依次处理,云端并行处理。
05—RENDER
渲染
MiniMax H3 会同时生成画面和声音。在本地 GPU 上先以 480P 渲染,再提升到 1080p。
06—SHELF
放上货架
MP4 存入成品。seed、提示词和机位设置都会记下,随时可以回到之前的版本。
04—ENGINES生成引擎
按渲染端, 看生成引擎
名称与分镜表上显示的相同(应用内为日文)。
本地 GPU 的 MiniMax H3
本地 GPUVIA ComfyUI默认引擎。使用能装进 12GB 显存的 int8 版,先以 480P 渲染,再提升到 1080p。4 秒的镜头约需 139 秒(实测)。
本地 GPU 的 Seedance
本地 GPU准备中VIA ComfyUI接口已经备好。放入 ComfyUI 工作流即可选用(工作流准备中)。
fal.ai API 的 MiniMax H3
云端VIA fal.ai与本地相同的模型,不做量化。每个镜头 5–15 秒,默认 768P。费用计入你登记的 fal 密钥。
fal.ai API 的 MiniMax Hailuo
云端VIA fal.ai每个镜头 6 秒或 10 秒。无需排队等 GPU,相应地,费用计入你登记的 fal 密钥。
05—UNDER THE HOOD内核是 ComfyUI
新模型, 也用同一份分镜表
底层是 ComfyUI。引擎以工作流的形式逐个加入。
交出工作流,取回影像
Konte 把 API 格式的工作流(JSON)交给 ComfyUI,再取回生成的影像。节点按名称指定,替换工作流时 Konte 这边无需改动。
GPU 可以在另一台机器上
文件只通过 HTTP 传递。Konte 的服务器和运行 ComfyUI 的 GPU 机器可以分开放置。
模型再多,还是同一份分镜表
新的视频模型以 ComfyUI 工作流的形式加入。Seedance 的接口也是这样预留的。分镜表和演员照常使用。