MiniMax M2 智能口播剪辑系统:30倍效率提升
Source: (unknown)
Summary
作者用 MiniMax M2 搭建了一套口播视频智能剪辑系统,将一小时素材的剪辑效率提升约 30 倍。核心设计是将视频剪辑问题转化为文本判断问题:视频 → 音频 → 带时间戳字幕 → AI 分析文本 → ffmpeg 剪切,全程 AI 只消耗文本 Token。系统分三步:AI 初筛标记废话/口误并生成审核稿,人工在时间轴审核修正,系统根据修正行为自进化以适应个人剪辑习惯。下一步计划接入 MiniMax 多模态能力,自动为口播内容补生成图表、解释画面等素材,并已开放 skill 版本供 agent 调用。代码全部开源。
Key Points
- 核心节省 Token 的设计:AI 只读纯文本字幕,视频剪辑问题被转化为文本判断问题
- 四步流程:视频提取音频 → 音频转带时间戳字幕 → AI 分析文本标记废话/口误 → ffmpeg 执行剪切
- 人机协作设计:AI 初筛生成审核稿(含时间戳、原因),人工在界面点击直接跳转画面进行最终把关
- 自进化机制:人工修正后系统自动分析修正逻辑,使用越多越懂个人剪辑风格
- 下一步:接入 MiniMax 多模态(图像/语音/视频),口播提到数据自动生成图表,补充过渡素材
- 已封装为 skill 节点,可直接接入 agent 工作流调用
Transcript
transcript