首页 / 博客 / 让 AI 接管整条视频制作流:六个顶流 ...

让 AI 接管整条视频制作流:六个顶流 Skill 深度拆解 + 一条能直接用的流水线

让 AI 接管整条视频制作流:六个顶流 Skill 深度拆解 + 一条能直接用的流水线

最近刷到一条视频:"用 Codex 做视频搞钱,先装这六个 skills,让它接管整条视频制作流程。"

评论区一堆人问"装了然后呢"。装了然后呢——这正是关键。装六个孤立的 Skill 不等于有一条流水线。 我们把这六个逐个拆开看了源码(能开的都开了),搞清楚每个到底干什么、怎么串,最后干脆把它们融合成了一个成品工具。

这篇是深度拆解 + 一条能直接用的流水线。

先泼一盆冷水:装 Skill ≠ 有流水线

六个 Skill 各管一段:生成、剪辑、批量、配图、中文、数字人。但它们是六个独立的"能力说明书",不是一条跑通的流水线。真到做一条视频,你会发现:

  • 素材从哪来? HyperFrames 和 Jiuma 都能生成,但一个要钱一个不稳
  • 生成的怎么剪? VideoUse 能剪,但它要你先有素材
  • 剪完怎么批量? Remotion 能批量,但它要你会写 React
  • 中文口播谁配? 六个里没有一个把"中文配音"做到位

所以真正的价值不在"装六个",在"把它们串成一条 SOP"。我们逐个拆。

六个 Skill 逐个拆

1. HyperFrames —— 一句话生成动效视频

干什么:输入一句话/一篇文章/一个推文链接,它生成带动效的视频,能直接渲染成 MP4。文章转视频、产品介绍、推文动效是它的主场。

真相:这是一个闭源产品,不是开源代码库。你要订阅它的服务才能用。它本质是"AI 动效生成 SaaS"。

怎么串:它管"从0到1的动效"。如果你想做"文章→动效视频",它是一键的。但如果你要批量、要定制、要数据自己的,闭源就卡脖子了。替代思路:用模板化渲染达到 80% 的效果(后面讲)。

2. Video Use —— 素材自动剪辑(含金量最高)

干什么:把拍好的素材丢给它,自动删停顿、加字幕、调色、做动效。这是六个里工艺最硬核的一个,开源(MIT)。

扒到的硬规则(血泪级):

  • 字幕永远最后加——不然会被后面的 overlay/调色盖住
  • 分段 extract 再无损 concat——别单遍编码两次,画质会掉
  • 每段边界 30ms 音频淡入淡出——防爆音
  • 切点贴词边界,留 30-200ms 缓冲——ASR 时间戳会漂 50-100ms

怎么串:它管"素材→成片"的剪辑段。但注意它的"删停顿"靠的是 VAD(静音检测)+ whisper 逐词时间戳——这套我们正好有更优的(火山豆包 ASR,中文词级毫秒)。

3. Remotion —— 代码批量做视频

干什么:用 React 代码做视频。排行榜、数据周报、固定栏目这种"换个数据就出一条"的视频,Remotion 是王者。开源。

真相:强大但——要装 Node 依赖、要浏览器渲染、要写 React 组件。对不会写代码的创作者,门槛高。

怎么串:它管"批量出片"。核心思想是"数据驱动渲染"——这个思想完全可以用更轻的方式实现(比如 ffmpeg 直接在背景上渲染文字,不用整套 React 渲染管线)。

4. Jiuma AI Video Generation —— 免费 AI 生成

干什么:免费生成 AI 视频,图片/视频/音频全覆盖。韭马出品,调的是各家大模型的免费额度(可灵、即梦等的试用 API)。

真相:免费是有代价的——额度有限、不稳定、随时可能失效。今天能跑,明天 API 改了就废。做正式业务,靠免费额度是走不远的。

怎么串:它管"AI 生成素材"。更稳的做法是直接接官方 API(火山即梦、可灵开放平台),花点钱买稳定。免费额度适合试水,不适合量产。

5. Video Cut Skills —— 中文剪辑专用

干什么:专为中文创作者做的剪辑 Skill,号称"更懂中文剪辑需求"。

中文剪辑的真正痛点(我们判断):

  • 字幕:中文字体渲染(vendor 静态 ffmpeg 常常没编译 drawtext/freetype)、断句贴词边界
  • 横竖屏:抖音/视频号要竖屏 1080x1920,B站/YouTube 要横屏——是裁窄带不是旋转
  • 花字/弹幕感:综艺式的强调字、底部进度条

怎么串:它管"中文特色剪辑"。这些痛点的解法是具体的 ffmpeg 工艺(libass 字幕渲染、裁窄带转竖屏),我们已落地。

6. jiuma-free-meta-human —— 口播数字人

干什么:自定义生成口播数字人。你写文案,数字人替你念。调的是 HeyGen/D-ID 这类数字人服务的免费额度。

真相:同 Jiuma,免费额度不稳。而且数字人涉及合规红线——各大平台要求 AI 生成内容必须显著标识,且必须是本人形象或书面授权。

怎么串:它管"数字人口播"。合规的做法是:本人形象或授权 + 显著标识"AI生成"。这个能力更适合接直播(OBS 方案)而不是离线生成。

串起来:一条能赚钱的视频流水线

六个 Skill 各管一段,串成一条 SOP 是这样的:

选题(数据驱动)文案(AI 生成)素材(AI 生成/拍摄)剪辑(删停顿+字幕)配图(B-roll)批量(模板)发布(多平台)复盘(数据观察)

每一环对应的能力:

环节对应 Skill关键工艺
选题—(数据观察)采集热点/评论区,找真需求
文案—(文案二创)AI 生成口播稿,禁绝对化用语
素材HyperFrames / JiumaAI 生成;免费额度→官方 API
剪辑Video Use / Video Cut删停顿、字幕最后加、分段无损拼接
配图Video Use(B-roll)AI 解说配图层,画中画轮播
批量Remotion数据驱动渲染;可用 ffmpeg 轻量替代
数字人free-meta-human本人形象+授权+标识 AI 生成
发布—(一键发布)多平台免扫码(CDP 复用浏览器)
复盘—(数据观察)采集播放/评论,反哺选题

我们已经把它做成了成品

拆完这六个,我们发现一件事:它们 80% 的能力,用智子现成的底座就能做,而且更稳

于是我们把这条流水线融进了「智子」客户端,叫【视频流水线】

  • 口播自动剪辑(融合 VideoUse):丢入口播视频,自动删停顿/语气词(呃/嗯/这个/那个),烧上字幕。中文走火山豆包 ASR(比 whisper 准),词级毫秒时间戳。
  • 模板视频(融合 Remotion):填数据批量出片——数据播报、排行榜。不用写 React,ffmpeg 直接渲染大标题+数据项,1080x1920 竖屏直接发抖音。
  • B-roll 配图(融合 VideoUse):AI 配图覆盖口播,画中画轮播,不再干巴巴。
  • 视频剪辑工具箱(融合 Video Cut):裁切/横竖屏/压缩/去静音/烧字幕,本机 ffmpeg 处理。
  • 语音字幕:视频/音频一键转字幕,中文最准。

配套的整条链也都是现成的:数据观察(采集热点做选题)→ 文案二创(AI 写口播稿)→ 视频流水线(剪辑出片)→ 一键发布(多平台免扫码)→ 数据观察(复盘)。

需要本地装的软件,智子都给了一键装按钮(FFmpeg 内置自带;whisper 一键装;火山语音/即梦配个凭证就能用)。

合规红线(必须说)

视频搞钱可以,但这几条踩了就前功尽弃:

  • 数字人/AI 生成内容必须显著标识"AI生成",且形象必须是本人或书面授权——各平台都在严打假冒名人数字人
  • 话术禁绝对化用语("最好/第一")、医疗承诺、诱导互动("求关注/求点赞")
  • AI 生成的素材要注意版权,别直接搬运别人的作品
  • 录播/无人直播抖音、视频号明确严打,发现即封

我们把合规做进了工具里:ban 级平台直接拦截,warn 级要你确认自担风险。合规不是束缚,是让账号活得久的前提。

最后

"装六个 Skill"是起点,不是终点。真正值钱的是把它们串成一条能跑通的 SOP

我们把这条 SOP 做成了成品——不是六个孤立的说明书,而是一条从选题到复盘、数据不出本机的完整流水线。你在自己的 Windows 电脑上就能跑:打开智子,【行业工具】→【视频流水线】,从一段口播视频开始,几分钟出一条成片。

这大概就是那 six skills 想给你、但没直接给你的东西。

(本文基于对这六个 Skill 公开资料与源码的独立研究撰写。智子视频流水线为独立实现,仅借鉴工艺思想,未复制其代码。)

📤 分享本文

💬 评论 0

加载评论中...