8 月 20 日,MiniMax 发布多模态创作 Agent 工作台 MiniMax Design,围绕其开源视频模型 H3 构建——你可以把它理解为「视频模型的 Codex」:用户说清创作目标,Agent 自动拆解任务、调用模型与 Skills,完成从素材处理、内容生成、剪辑到成片装配的全流程。亮点「3D 导演台」让你先在 3D 空间里摆角色、调机位、确认构图,再生成视频,把试错成本提前到分镜阶段。
🧩 本教程适合:想用 AI 做短视频的运营、电商、自媒体新手,以及想了解「语义级创作」的 AI 从业者。零代码,全程对话式操作。
先搞懂:MiniMax Design 和「AI 视频生成」有何不同
传统 AI 视频工具的用法是「写提示词 → 生成单条视频」;MiniMax Design 的用法是「说目标 → Agent 组织一条完整生产线」。它把专业能力组织成可执行的节点,调度 H3、图像、音乐、语音等多个模型,并接入 ComfyUI 生态:
| 环节 | 传统做法 | MiniMax Design |
|---|---|---|
| 需求理解 | 你自己写提示词 | Agent 拆解目标、判断需要哪些素材 |
| 分镜规划 | 凭经验脑补 | 3D 导演台摆位、调机位、预演 |
| 素材生成 | 逐条生成再拼 | 调度 H3 + 图像/音乐/语音模型 |
| 成片交付 | 手动剪辑、加字幕 | 自动剪辑 + 字幕 + 成片装配 |
定位提醒:它擅长「目标明确、多环节、需持续修改」的商业内容(KOC、电商种草、品牌短片、PV/MV);探索性、艺术实验型创作仍需要人工主导。
Step 1:准备你的「创作需求包」
1 把目标说清楚,素材给到位
访问 design.minimaxi.com 开始前,
先准备好三样东西:
1. 一句话目标:
「做一支运动鞋电商种草短片,
15 秒,突出轻量缓震」
2. 参考素材(可选但推荐):
· 商品图/实拍片段
· 品牌视觉规范(配色/logo)
· 文案要点(卖点、价格、活动)
3. 约束条件:
· 时长、比例(横/竖屏)
· 语气风格(活泼/高级/专业)
· 是否需要配音/字幕
为什么重要:
Agent 会「判断需要哪些文字、图片、
视频和音频」——你的输入越完整,
它拆解出的任务链越贴近真实需求
💡 保留素材意识:它会识别「需要参考或保留的内容」。品牌资产(logo、标准色)越规范,成品一致性越高。
Step 2:用「3D 导演台」定构图——把试错提前
2 摆角色、调机位、先预演再生成
3D 导演台的价值:
把「模糊的镜头想法」变成
「具体的空间与运动参数」
操作流程:
1. 在 3D 空间放置角色模型
· 调整姿态、朝向
· 设置角色间的位置关系
2. 布置机位
· 镜头角度、景别
· 运镜方式(推/拉/环绕)
3. 多视角检查
· 从不同机位确认构图与人物关系
· 发现空间关系不对,直接调整
4. 确认后生成
· 系统先输出机位运镜参考视频
· 再以此为参考生成最终镜头
示例:想拍「男女主在草地上走,
遇到河,女主跃过、男主在岸边」
——空间关系在导演台里调准,
再交给 H3 生成,避免反复试错烧钱
💡 空间关系是视频生成的难点:人物距离、遮挡、谁在前谁在后,在导演台里一眼就能看出问题,这是它最省成本的功能。
Step 3:把需求「翻译」给 H3——语义级创作
3 你表达意图,Agent 负责翻译与执行
语义级创作 vs 像素级编辑:
像素级(传统):
「第 3 秒画面里的鞋再转 15 度,
光影调亮一点」——你操作像素
语义级(MiniMax Design):
「鞋的展示角度要更有冲击力,
整体氛围更高级」——Agent 理解
意图并完成生成、修改、重组
实际使用时的表达技巧:
1. 说「要什么效果」,不说「怎么调参数」
✗「曝光 +0.3、饱和度 +10」
✓「画面更明亮、色彩更鲜艳」
2. 用多轮对话持续修改
· 改风格:「换成科技感」
· 改节奏:「开头再紧凑一点」
· 改配乐:「换成轻快电子」
3. 让它理解项目级上下文
· 历史对话、多轮版本、品牌资产
· 风格偏好会被记住,连续创作
不会每轮都「失忆」
别用「参数语言」跟它对话:Design 的价值是把模型能力边界、输入方式沉淀在 Agent 里。你越是描述意图而不是参数,它越能发挥调度能力。
Step 4:剪辑、字幕与成片装配——让流水线收尾
4 生成后的事,交给自动装配
镜头生成完成后,Design 继续收尾:
1. 自动剪辑
· 按分镜顺序组织片段
· 节奏、转场由 Agent 编排
2. 字幕添加
· 识别对话/解说生成字幕
· 自动打轴、排版
3. 成片装配
· 分散素材组织成完整视频
· 输出多个可用版本(一个需求
多套成片,适配不同渠道)
4. 精细调整(可选)
· 接入 ComfyUI 工作流
· 本地/云端跑 H3 工作流
· 让 Agent 协助编辑节点、调参数
· 社区精选工作流可直接套用
验收动作:
· 逐段检查镜头一致性(角色/场景)
· 核对字幕是否错字、错轴
· 多版本横向对比再定稿
💡 一次需求多版本:电商场景可直接产出横屏主推 + 竖屏信息流 + 15s 快剪等多个版本,一套商品素材快速铺满不同渠道。
Step 5:套一个「电商种草」完整流程
5 从商品信息到可投放成片
以「运动鞋种草短片」为例:
1. 输入
· 商品图 + 卖点文案(轻量缓震、
透气、适合通勤)
· 目标:15 秒竖屏,小红书/抖音
2. Agent 拆解
· 脚本:痛点开场→产品特写→
上脚场景→行动号召
· 分镜:5 个镜头,每个镜头
明确画面与时长
3. 3D 预演
· 鞋与模特的空间关系
· 特写机位角度
4. 生成
· H3 出镜头,图像模型出封面
· 音乐/配音就位
5. 装配
· 自动剪辑 + 字幕 + 多版本
6. 交付
· 主推版 + 快剪版 + 封面图
把「商品信息 + 传播目标」喂给它,
成品就是一支可直接投放的短视频
注意版权与素材合规:商业投放涉及品牌形象,生成内容里的人物肖像、音乐版权、竞品露出都要人工复核——AI 不替你承担法务责任。
Step 6:把它沉淀成你的创作资产
6 工作流可复用,风格可积累
让 Design 越用越顺手的四个动作:
1. 沉淀工作流
· 成功的创作流程保存/开源
· 社区工作流直接吸收复用
2. 积累品牌资产
· 历史版本、风格偏好持续留存
· 新任务自动继承上下文
3. 建立验收清单
· 一致性 / 字幕 / 音画同步
· 每次交付前逐项过
4. 多工具协同
· 分镜参考图可先用
Midjourney 等生成再喂入
· 与《AI 音乐》
类工具组合,素材更丰富
进阶:把「创作 SOP」封装成
可复用的技能,参照
《录屏蒸馏技能》
与《Agent Skills 标准》
别囤积不产出:工具的复利来自高频使用。先定一个本周要交付的小任务(一条种草视频/一支科普短片),跑通再谈规模化。
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 镜头间角色不一致 | 在 3D 导演台锁定角色设定与姿态,减少逐镜头「重新发明」 |
| 生成结果和想象差很远 | 目标不够具体:补充参考素材、明确时长/风格/渠道 |
| 音画不同步 | 配音与画面节奏冲突:在分镜阶段核对时长分配,或缩短单镜头 |
| 想用 ComfyUI 但不会搭 | 先用内置精选工作流,进阶再让 Agent 协助编辑节点 |
| 分不清该生成还是该人工 | 固定套路(种草、科普、PV)交给 Agent;高艺术性、强叙事的作品人工主导 |