教程中心实战
实战

用 Video-Use 让 AI Agent 帮你剪辑视频:自然语言对话式剪辑

2026.07.14· 7 个步骤 · 19 分钟阅读· 🎬 Video-Use

你有没有一堆拍好却没空剪的视频?Video-Use 是开源项目 browser-use 家族里的新成员,它把「让 AI 操作浏览器」的能力搬到了视频剪辑软件上:你用大白话告诉它「把前 5 秒废话剪掉、加个片头、配段轻音乐」,它就真的帮你把活干完。本教程从装环境到跑通第一条剪辑指令,一步步来。

🎬 本教程适合:有现成素材、想用自然语言快速粗剪的人;也会写几行命令、愿意本地跑 Agent 的进阶玩家。需要 Python 环境和一点点耐心。

先搞懂:Video-Use 和剪映有什么区别?

剪映是「你点它做」,Video-Use 是「你说它做」。它背后是一个会操作剪辑界面的 Agent,像人一样点按钮、拖时间轴,只是由 AI 驱动。

对比剪映等传统工具Video-Use
交互方式手动点选 / 拖拽自然语言指令
适合精细精修快速粗剪、批量处理
门槛要学软件会说中文就行,但要会装环境

它擅长「粗剪」,不擅长「精修」:加字幕、剪废话、拼片段、配乐这些它很强;但调色、关键帧、复杂转场还是回剪映里做更稳。把它当「剪辑助理」,不是「替代剪辑师」。

Step 1:准备 Python 环境

1 先确认版本和虚拟环境
# 需要 Python 3.11+,先检查
python --version

# 建一个干净的虚拟环境(推荐)
python -m venv venv
source venv/bin/activate     # Windows: venv\Scripts\activate
💡 用虚拟环境能避免把依赖装乱。Video-Use 依赖 browser-use 那一套(需要能驱动浏览器),环境干净才跑得起来。

Step 2:安装 Video-Use

2 一行命令装上
# 从官方仓库安装(以 GitHub 发布名 video-use 为例)
pip install video-use

# 装好后确认命令可用
video-use --version

装不上?多半是缺浏览器驱动。Video-Use 需要本机有 Chromium 类浏览器,按报错提示装 playwright 的浏览器内核即可:playwright install chromium

Step 3:配置大模型 API Key

3 让 Agent 有「脑子」
# 用一个支持视觉/工具调用的大模型 Key,例如 OpenAI 或国内模型
export OPENAI_API_KEY="sk-xxxxxxxxxxxxxxxx"

# 国内模型可设 base_url 和模型名(以兼容 OpenAI 接口为准)
export OPENAI_BASE_URL="https://你的模型网关/v1"
🔑 Video-Use 的 Agent 要「看」剪辑界面截图再做决策,所以模型最好支持多模态(能看图)。纯文本模型会让它变「盲剪」,效果差。

Step 4:准备素材并启动

4 把视频放好,开跑
# 建个素材目录,把要剪的 mp4 放进去
mkdir clips && cp 你的视频.mp4 clips/

# 启动 Video-Use,进入对话式剪辑
video-use --workspace ./clips

# 它会打开剪辑软件的网页/桌面界面,等你下指令
💡 第一次启动会慢一点,它在加载剪辑界面并截图给模型「认界面」。等它说「已就绪」再下指令。

Step 5:下第一条剪辑指令

5 用大白话让它剪
在对话里直接输入(中文即可):
「把视频前 5 秒的停顿剪掉,
 在 00:10 到 00:15 之间加一段字幕:
 『这就是我今天要分享的小技巧』,
 整体音量调高 10%。」

Agent 会:
1. 截图识别当前时间轴
2. 找到对应位置,执行裁剪/加字幕/调音量
3. 截图回显,告诉你做完了

指令要「带位置」:说「把前面废话剪了」它得猜;说「前 5 秒」「00:10-00:15」它就精准执行。给时间码 = 给 Agent 坐标,越具体越准。

Step 6:多轮对话式精修

6 像导演一样逐条改
继续对话(它记得上下文):
「再在结尾加 2 秒黑场,叠一行『关注我』字幕。」
「背景音太吵,把原声降到 60%,配一段轻音乐。」

每一步它都会截图确认,你随时喊停 / 撤销。
🔁 这就是「对话式剪辑」的爽点:不用反复在轨道里找位置,直接说下一句需求,Agent 接着干。批量处理多条相似视频时尤其省事。

Step 7:导出与避坑

7 拿到成品,留好原片
指令:「导出成 mp4,保存到 ./output/成片.mp4」
完成后去 ./output 取片。

避坑清单:
· 每次动手前先备份原片,Agent 改的是工作副本
· 复杂转场/调色回剪映精修,别硬刚 Video-Use
· 卡住就「撤销上一步」,重新下更具体的指令

核心结论:Video-Use 把「剪辑」变成了「对话」。它不是要你丢掉剪映,而是把最耗时的粗剪、加字幕、拼片段交给 Agent,你只做创意决策。配合本中心《AI 视频生成新手入门》《Coze 多智能体做短视频》一起看,能搭出更完整的视频生产链。

常见问题速查

你遇到的现象大概率原因 & 解决
启动报错缺浏览器playwright install chromium
Agent 乱剪指令没给时间码,补具体位置
看不懂界面模型不支持多模态,换支持视觉的模型
导出失败output 目录不存在,先 mkdir