跳到主要内容
AI教程

使用 anything2explainer 制作配音动态信息图解说视频

了解如何安装 anything2explainer,运行其智能体引导的制作流程,自定义旁白与视觉效果,预览开场片段,渲染最终的 Remotion 影片,并执行量化质量检查。

使用 anything2explainer 制作配音动态信息图解说视频

什么是 anything2explainer?

anything2explainer 是一项适用于 Claude Code 和 Codex 的技能,可将主题、文章或文档转换为带旁白的动态图形讲解视频。它在一个引导式工作流中整合了研究、脚本编写、文本转语音、帧级精准字幕、分镜设计、并行镜头开发、渲染和质量控制。

该项目不是独立的命令行应用,而是为 AI 编程代理提供完整的制作方法:可编译的 Remotion 4 模板、React 和 TypeScript 视觉基础组件、配音与渲染脚本、书面风格规范、多代理构建说明、QC 工具以及参考影片。

每一帧都通过代码绘制,而不是由视频模型生成或从现有素材中复制。动画是帧编号的纯函数,并使用固定种子的随机性,因此重复渲染可以得到一致的结果。

流水线产出

默认输出为 1280×720、30fps 的 H.264 MP4。完成的项目可以包括:

  • 同步的中文或英文配音。
  • 与词语边界对齐的字幕。
  • 章节卡片和底部章节进度条。
  • 顶部胶囊式 HUD,以及可选的流水线轨道。
  • 按镜头划分的 Remotion 组件。
  • 带来源的研究文档、旁白、分镜、QC 报告和交付说明。

视觉系统采用黑色画布、白色线稿、紫色点缀和醒目的标题,并使用带雾效的星空背景或点阵波浪背景。目前的模板仅支持横屏视频,不支持竖屏 9:16 输出。

支持的时长

支持时长为 2 至 8 分钟的影片。2 至 3 分钟的视频通常使用 24–32 行或镜头,耗时约一小时。达到参考影片级别的 3 至 5 分钟制作通常使用 40–50 个镜头,耗时约两小时。较长的 5 至 8 分钟影片可能使用 60–80 个镜头,大约需要两到三小时。

以上是实际耗时估计,并非保证。许多工作由构建代理并行执行。

前置条件

安装前,请准备以下内容:

  • Claude Code 或 Codex。
  • Node.js 18 或更高版本。
  • Python 3。
  • 用于帧提取和转码的 FFmpeg。
  • 并行运行多个构建代理时,至少 5 GB 可用空间。

随附的 shell 脚本使用 zsh,且是在 macOS 上开发和验证的。Linux 应该可以运行,但尚未在 Windows 上测试。不需要 GPU,因为 Remotion 通过无头 Chromium 在 CPU 上渲染。

安装技能

1. 克隆代码库

git clone https://github.com/Vincentwei1021/anything2explainer.git

2. 将其链接到编程代理

对于 Claude Code,请在其技能目录中创建符号链接:

ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer

对于 Codex,请使用对应的 Codex 技能目录:

ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer

3. 安装系统和 Python 依赖

在 macOS 上,使用 Homebrew 安装 FFmpeg:

brew install ffmpeg

创建专用的 Python 环境并安装共享依赖:

python3 -m venv ~/.venvs/a2e
source ~/.venvs/a2e/bin/activate
pip install 'edge-tts==7.2.8' numpy pillow scipy

README 将 edge-tts 固定为 7.2.8 版本,因为它依赖 Microsoft 端点,升级后可能出现问题。scipy 仅供定量 QC 脚本 frame_metrics.py 使用。

4. 添加英文旁白依赖

英文旁白默认使用本地运行的 kokoro-82m 模型和 am_liam 音色。如果计划制作英文视频,请安装其额外依赖:

pip install kokoro soundfile
brew install espeak-ng

中文旁白默认使用基于云端的 edge-tts 音色 zh-CN-YunxiNeural。

使用 Claude Code 或 Codex 创建视频

最简单的方法是用自然语言描述想要制作的影片。代理在可用时应自动激活这项技能。

帮我制作一条关于向量数据库的讲解视频。

你也可以用中文提出请求:

讲一下向量数据库,做成一条讲解视频

你的输入可以是宽泛的主题,也可以是现有的文章或文档。你还需要选择目标时长和语言。

了解九个制作阶段

  1. 搭建:代理将 Remotion 模板复制到新项目中。
  2. 研究:研究代理准备带来源的文档,其中包括实用数据、类比和 URL。
  3. 旁白与时间线:代理编写脚本,生成或导入配音,并将词语边界转换为帧级精准的时间线和字幕表。
  4. 分镜:每个镜头都会获得帧范围、叙事节拍、视觉方案、运动方向、主体元素和灯光方案。
  5. 叠加层与基础组件:项目添加标题、章节卡片、HUD、流水线轨道以及 2 至 5 个主题专属图标。
  6. 试制:一名代理构建第一组镜头,并渲染 30 秒预览。
  7. 并行构建:其他代理构建剩余镜头组,通常每个代理负责 5 至 7 个镜头。
  8. 渲染:渲染完整影片,并使用定量帧指标进行分析。
  9. QC 与修复:QC 代理审查章节,修复代理处理问题,项目在交付前再次完成验证。

使用四个审核检查点

该工作流会有意暂停四次,让你在修改成本变高之前做出重要决策。

检查点 1:时长与语言

在开始编写脚本之前,选择影片时长以及中文或英文。时长会影响素材覆盖范围、旁白长度、镜头数量、磁盘使用量和并行代理数量。语言会通过 src/config.ts 中的 lang 改变字体排版、字幕预算、节奏以及默认语音。

检查点 2:旁白审批

在生成语音之前,审阅完整的旁白。语音锁定后,帧编号会嵌入各个镜头。即使只改动一个词,也可能需要重新调整整部影片的时间轴,因此这是进行编辑修改最经济的时机。

检查点 3:语音选择

选择默认语音、其他 TTS 引擎,或你自己完成的录音。如果不指定替代方案,流水线会对中文使用 edge-tts Yunxi,对英文使用 kokoro-82m Liam。

检查点 4:前 30 秒

在构建其余镜头组之前,审阅试播渲染。在此时修正视觉方向只会影响第一组;完整渲染后再修正,可能需要修改每一个镜头组。

手动驱动模板

如果你希望更好地控制制作流程,可以直接使用随附的脚本。从模板创建项目并进入其目录:

template/scripts/new_project.sh ~/work/my-video myslug
cd ~/work/my-video

然后按照以下手动流程操作:

  1. 在 research/调研.md 中编写研究文件。
  2. 创建 script/narration.txt 并生成配音时间轴。
  3. 编写 script/storyboard_src.md 并渲染分镜。
  4. 在 src/config.ts 中编辑语言、背景和相关设置。
  5. 在 src/shots/G1 到 src/shots/Gn 下实现镜头组。
  6. 渲染开场预览。
  7. 渲染带版本号的最终视频并运行帧指标分析。
  8. 审阅、修正并渲染后续版本,例如 v2 或 v3。
python3 scripts/tts_build.py
python3 scripts/render_storyboard.py
scripts/preview.sh 30
VER=v1 scripts/render.sh
python3 scripts/frame_metrics.py

自定义语言和背景

主要项目设置位于 src/config.ts。将 lang 设置为 'zh' 或 'en'。中文每个字幕块的预算为 16 个字符,英文每个字幕块的预算为 48 个字符。

支持的背景开关为:

bg: 'stars' | 'dots'

stars 选项将星空与雾化渐变结合起来。dots 选项使用点阵场波浪。项目有意通过这两种背景选项提供统一的视觉语言。

如需进行更大范围的视觉调整,请编辑 reference/style-guide.md 和 src/ui.tsx。镜头组件依赖共享基础组件,因此修改这些集中定义比逐个设置镜头样式更合适。

使用自己的配音

你不必局限于内置的 TTS 默认设置。将完成的音频放置在:

public/assets/<slug>/audio.wav

然后手动填充 src/common/timeline.ts 和 subs.ts。所需格式记录在 tts_build.py 顶部。时间轴和字幕数据就绪后,分镜、镜头构建、渲染和质量控制阶段均无需改变。

高级制作技巧

先审批文字,再润色画面

将旁白审批视为硬性锁定。由于镜头使用固定的帧范围,后期脚本编辑比普通的视觉修正更具破坏性。

将试播用于风格测试

在首次 30 秒审阅期间,检查字体排版、构图、运动速度、光照、字幕可读性和背景。不要仅因为试播能够成功渲染就批准它。

谨慎扩大并行工作规模

较长的影片可能会使用 10–14 个构建代理。多个代理可以同时打包 Remotion,这会增加存储和系统负载。至少保留 5 GB 可用空间;接近项目所述的 tmux 窗格上限时,应分批调度代理。

保留来源可追溯性

画面中显示的每个数字、年份、组织和英文术语,都应能追溯到研究文档中的 URL。未经验证的说法不应出现在旁白或画面中。

使用带版本号的渲染

设置 VER=v1,审阅指标和章节级质量控制结果,然后创建 v2 或 v3 等修正版。这样可以保留清晰的审阅历史,而不是覆盖早期输出。

研究参考资料

examples/rag/ 目录包含参考影片的制作轨迹,包括研究、旁白、分镜、镜头源文件、报告和交付说明。examples/contrast/ 目录包含六组优劣画面对比,用于评估构图和光照。

reference/ 目录还记录了安全区域、调色板、字体、运动公式、光照规则、分镜规范、代理协议、提示词模板以及早期影片积累的经验。

重要限制与许可

  • 支持的语言为中文和英文。
  • 模板默认使用 1280×720 横屏视频,目前不支持 9:16 输出。
  • 该模板不适用于人物出镜讲解、以实拍为主的制作,或复刻现有视频。
  • 可选的实拍补充素材必须来自免版税来源,并在清单中记录其来源 URL、许可证、SHA-256 哈希值和使用情况。
  • 该工具包采用 PolyForm Noncommercial 1.0.0 许可证。非商业用途免费,商业用途需事先获得作者授权。
  • 使用该工具包创建的视频归其创作者所有。
  • 随附字体和 Remotion 各自具有独立的许可证条款。

在用于生产或分发之前,请查看代码仓库的 项目页面 和许可证文件,尤其是涉及商业用途时。

结语

anything2explainer 提供的不仅是一个视频模板,更是一个结构化制作系统,可帮助 Claude Code 或 Codex 将经过研究的素材转化为确定性的 Remotion 动画。从聚焦的主题开始,在四个检查点做出审慎决策,在进行 TTS 之前确认旁白,验证 30 秒试片,并通过版本化渲染和量化质检不断完善最终影片。