video-use:用 Claude Code 剪视频的开源项目,LLM 读视频而不是看视频
video-use 是 browser-use 团队开源的视频剪辑项目:把原始素材丢进一个文件夹,用自然语言和 Claude Code(或 Codex、Hermes 等任何有 shell 权限的 agent)对话,就能得到 final.mp4。适用于口播、混剪、教程、旅行、访谈等任何内容,不需要预设或菜单。
核心能力
- 剪掉语气词和死区:自动去掉 umm、uh、false start 和镜头之间的空档;
- 自动调色:每段按暖色电影感、中性冲击或任意自定义 ffmpeg 链调色;
- 30ms 音频淡入淡出:每个剪切点都做,保证听不到爆音;
- 烧录字幕:默认双词大写分块,完全可定制;
- 动画覆盖层:通过 HyperFrames、Remotion、Manim 或 PIL 生成,每个动画由并行子 agent 负责;
- 自评估渲染输出:在每个剪切边界检查渲染结果,通过后才展示预览;
- 会话记忆持久化:存在 project.md 里,下周的会话接着上次进度。
关键设计:LLM 不"看"视频,而是"读"视频
视频剪辑的难点是让 LLM 理解素材。朴素的方案是把视频抽成 3 万帧、每帧 1500 token——4500 万 token 的噪声。video-use 用两层结构化表示替代:
第一层:音频转写(始终加载)。每个素材调用一次 ElevenLabs Scribe,得到词级时间戳、说话人分离和音频事件(笑声、掌声、叹气)。所有素材压缩进单个约 12KB 的 takes_packed.md,作为 LLM 的主要阅读视图,按短语带时间范围列出每一句。
第二层:视觉合成图(按需调用)。timeline_view 为任意时间段生成胶片条加波形加词标签的 PNG,只在决策点调用——模糊的停顿、重拍对比、剪切点合理性检查。
这和 browser-use 给 LLM 结构化 DOM 而不是截图的思路一脉相承,只是换到了视频领域。
流水线与设计原则
转写 → 打包 → LLM 推理 → EDL → 渲染 → 自评估
│
└─ 有问题?修复并重渲染(最多 3 次)
自评估循环在渲染输出的每个剪切边界运行 timeline_view,捕捉画面跳动、爆音、隐藏字幕。
设计原则五条:文本加按需视觉,不做帧转储;音频为主、视觉跟随(剪切来自语音边界和静音间隙);询问→确认→执行→自评估→持久化,未经策略确认绝不碰剪切点;对内容类型零假设,先看先问再编辑;12 条硬规则管生产正确性,艺术判断留给自由发挥。
项目 100% 开源,安装只需克隆仓库、软链到 agent 的 skills 目录、uv sync、装 ffmpeg、配置 ElevenLabs API key,然后就能把原始素材文件夹指给 agent。