入门 📋 6 个步骤 第 307 / 470 篇

MiniMax Design 上手:一句话到成片——用 Agent 工作台做商业短视频

8-20 MiniMax 发布多模态创作 Agent 工作台 MiniMax Design:说清创作目标,Agent 自动拆解任务、调用 H3 视频模型与 Skills 完成素材、生成、剪辑、字幕与成片装配;3D 导演台先在 3D 空间确认构图再生成。本教程带你完成一支电商种草短片。

2026.08.22· 14 分钟阅读· 约 2067 字· 🎬 MiniMax Design

8 月 20 日,MiniMax 发布多模态创作 Agent 工作台 MiniMax Design,围绕其开源视频模型 H3 构建——你可以把它理解为「视频模型的 Codex」:用户说清创作目标,Agent 自动拆解任务、调用模型与 Skills,完成从素材处理、内容生成、剪辑到成片装配的全流程。亮点「3D 导演台」让你先在 3D 空间里摆角色、调机位、确认构图,再生成视频,把试错成本提前到分镜阶段。

🧩 本教程适合:想用 AI 做短视频的运营、电商、自媒体新手,以及想了解「语义级创作」的 AI 从业者。零代码,全程对话式操作。

先搞懂:MiniMax Design 和「AI 视频生成」有何不同

传统 AI 视频工具的用法是「写提示词 → 生成单条视频」;MiniMax Design 的用法是「说目标 → Agent 组织一条完整生产线」。它把专业能力组织成可执行的节点,调度 H3、图像、音乐、语音等多个模型,并接入 ComfyUI 生态:

环节传统做法MiniMax Design
需求理解你自己写提示词Agent 拆解目标、判断需要哪些素材
分镜规划凭经验脑补3D 导演台摆位、调机位、预演
素材生成逐条生成再拼调度 H3 + 图像/音乐/语音模型
成片交付手动剪辑、加字幕自动剪辑 + 字幕 + 成片装配

定位提醒:它擅长「目标明确、多环节、需持续修改」的商业内容(KOC、电商种草、品牌短片、PV/MV);探索性、艺术实验型创作仍需要人工主导。

Step 1:准备你的「创作需求包」

1 把目标说清楚,素材给到位
访问 design.minimaxi.com 开始前,
先准备好三样东西:

1. 一句话目标:
   「做一支运动鞋电商种草短片,
   15 秒,突出轻量缓震」
2. 参考素材(可选但推荐):
   · 商品图/实拍片段
   · 品牌视觉规范(配色/logo)
   · 文案要点(卖点、价格、活动)
3. 约束条件:
   · 时长、比例(横/竖屏)
   · 语气风格(活泼/高级/专业)
   · 是否需要配音/字幕

为什么重要:
Agent 会「判断需要哪些文字、图片、
视频和音频」——你的输入越完整,
它拆解出的任务链越贴近真实需求
💡 保留素材意识:它会识别「需要参考或保留的内容」。品牌资产(logo、标准色)越规范,成品一致性越高。

Step 2:用「3D 导演台」定构图——把试错提前

2 摆角色、调机位、先预演再生成
3D 导演台的价值:
把「模糊的镜头想法」变成
「具体的空间与运动参数」

操作流程:
1. 在 3D 空间放置角色模型
   · 调整姿态、朝向
   · 设置角色间的位置关系
2. 布置机位
   · 镜头角度、景别
   · 运镜方式(推/拉/环绕)
3. 多视角检查
   · 从不同机位确认构图与人物关系
   · 发现空间关系不对,直接调整
4. 确认后生成
   · 系统先输出机位运镜参考视频
   · 再以此为参考生成最终镜头

示例:想拍「男女主在草地上走,
遇到河,女主跃过、男主在岸边」
——空间关系在导演台里调准,
再交给 H3 生成,避免反复试错烧钱
💡 空间关系是视频生成的难点:人物距离、遮挡、谁在前谁在后,在导演台里一眼就能看出问题,这是它最省成本的功能。

Step 3:把需求「翻译」给 H3——语义级创作

3 你表达意图,Agent 负责翻译与执行
语义级创作 vs 像素级编辑:

像素级(传统):
  「第 3 秒画面里的鞋再转 15 度,
  光影调亮一点」——你操作像素

语义级(MiniMax Design):
  「鞋的展示角度要更有冲击力,
  整体氛围更高级」——Agent 理解
  意图并完成生成、修改、重组

实际使用时的表达技巧:
1. 说「要什么效果」,不说「怎么调参数」
   ✗「曝光 +0.3、饱和度 +10」
   ✓「画面更明亮、色彩更鲜艳」
2. 用多轮对话持续修改
   · 改风格:「换成科技感」
   · 改节奏:「开头再紧凑一点」
   · 改配乐:「换成轻快电子」
3. 让它理解项目级上下文
   · 历史对话、多轮版本、品牌资产
   · 风格偏好会被记住,连续创作
     不会每轮都「失忆」

别用「参数语言」跟它对话:Design 的价值是把模型能力边界、输入方式沉淀在 Agent 里。你越是描述意图而不是参数,它越能发挥调度能力。

Step 4:剪辑、字幕与成片装配——让流水线收尾

4 生成后的事,交给自动装配
镜头生成完成后,Design 继续收尾:

1. 自动剪辑
   · 按分镜顺序组织片段
   · 节奏、转场由 Agent 编排
2. 字幕添加
   · 识别对话/解说生成字幕
   · 自动打轴、排版
3. 成片装配
   · 分散素材组织成完整视频
   · 输出多个可用版本(一个需求
     多套成片,适配不同渠道)
4. 精细调整(可选)
   · 接入 ComfyUI 工作流
   · 本地/云端跑 H3 工作流
   · 让 Agent 协助编辑节点、调参数
   · 社区精选工作流可直接套用

验收动作:
· 逐段检查镜头一致性(角色/场景)
· 核对字幕是否错字、错轴
· 多版本横向对比再定稿
💡 一次需求多版本:电商场景可直接产出横屏主推 + 竖屏信息流 + 15s 快剪等多个版本,一套商品素材快速铺满不同渠道。

Step 5:套一个「电商种草」完整流程

5 从商品信息到可投放成片
以「运动鞋种草短片」为例:

1. 输入
   · 商品图 + 卖点文案(轻量缓震、
     透气、适合通勤)
   · 目标:15 秒竖屏,小红书/抖音
2. Agent 拆解
   · 脚本:痛点开场→产品特写→
     上脚场景→行动号召
   · 分镜:5 个镜头,每个镜头
     明确画面与时长
3. 3D 预演
   · 鞋与模特的空间关系
   · 特写机位角度
4. 生成
   · H3 出镜头,图像模型出封面
   · 音乐/配音就位
5. 装配
   · 自动剪辑 + 字幕 + 多版本
6. 交付
   · 主推版 + 快剪版 + 封面图

把「商品信息 + 传播目标」喂给它,
成品就是一支可直接投放的短视频

注意版权与素材合规:商业投放涉及品牌形象,生成内容里的人物肖像、音乐版权、竞品露出都要人工复核——AI 不替你承担法务责任。

Step 6:把它沉淀成你的创作资产

6 工作流可复用,风格可积累
让 Design 越用越顺手的四个动作:

1. 沉淀工作流
   · 成功的创作流程保存/开源
   · 社区工作流直接吸收复用
2. 积累品牌资产
   · 历史版本、风格偏好持续留存
   · 新任务自动继承上下文
3. 建立验收清单
   · 一致性 / 字幕 / 音画同步
   · 每次交付前逐项过
4. 多工具协同
   · 分镜参考图可先用
     Midjourney 等生成再喂入
   · 与《AI 音乐》
     类工具组合,素材更丰富

进阶:把「创作 SOP」封装成
可复用的技能,参照
《录屏蒸馏技能》
与《Agent Skills 标准》

别囤积不产出:工具的复利来自高频使用。先定一个本周要交付的小任务(一条种草视频/一支科普短片),跑通再谈规模化。

常见问题速查

你遇到的现象大概率原因 & 解决
镜头间角色不一致在 3D 导演台锁定角色设定与姿态,减少逐镜头「重新发明」
生成结果和想象差很远目标不够具体:补充参考素材、明确时长/风格/渠道
音画不同步配音与画面节奏冲突:在分镜阶段核对时长分配,或缩短单镜头
想用 ComfyUI 但不会搭先用内置精选工作流,进阶再让 Agent 协助编辑节点
分不清该生成还是该人工固定套路(种草、科普、PV)交给 Agent;高艺术性、强叙事的作品人工主导
← 返回教程中心