跳到主要内容
AI教程

用 Codex Skill 制作数字人讲解视频:从任务初始化到质量验收

本教程介绍如何安装和使用 lanshu-create-ai-presenter-video,通过 Codex 或兼容 Agent 完成文案、配音、数字人生成、口型同步、字幕、剪辑、渲染与质量验收。

用 Codex Skill 制作数字人讲解视频:从任务初始化到质量验收

项目简介

lanshu-create-ai-presenter-video 是一个面向 Codex 的通用数字人视频制作 Skill。你只需提供主题或完整文案,以及一张经过授权、包含清晰成年人物的参考图,它就能组织数字人视频的主要制作环节。

完整流程涵盖文案整理、配音、人物生成、口型校准、字幕、关键词动效、剪辑、渲染和质量验收。项目采用能力选择方式,根据当前环境中可用的工具完成任务,不在源码中绑定特定服务商、模型名称或私有接口。

该 Skill 不是独立的视频生成模型。它需要运行在 Codex 或兼容本地 Skill 的 Agent 环境中,并依赖环境内可调用的视频生成、语音生成和口型同步能力。

核心特点

  • 服务商中立:工作流不固定依赖某个模型、平台或私有 API。
  • 完整制作链路:从输入检查、脚本与配音,到剪辑、字幕、封面、导出和验收均有对应流程。
  • 统一时间基准:以完整配音作为全片时间轴,定位人物视频、字幕、镜头、关键词和转场。
  • 按阶段加载参考资料:Codex 只在进入对应阶段时读取相关文档,以减少上下文占用。
  • 成本控制:先进行低成本人物试片,并设置付费生成说明、重试上限和中断恢复规则。
  • 安全与隐私约束:上传人物图片或克隆声音前确认授权,仓库不保存 API 密钥、访问令牌或用户素材。
  • 标准化交付:流程目标包括输出母版、分享版和 QA 报告。

准备输入与运行环境

最少输入

  1. 一个视频主题或一份完整文案。
  2. 一张经过授权、包含清晰成年人物的参考图。

你还可以提供声音样本、屏幕录制、图片、B-roll、品牌素材、目标平台、视频时长、横竖屏比例、视觉风格、水印和结尾引导。声音样本只有在获得相应授权后才能用于声音克隆。

环境要求

  • Codex 或兼容本地 Skill 的 Agent 环境。
  • Python 3.9+
  • FFmpegffprobe
  • Bash、jqawksed
  • 至少一种当前环境可调用的视频生成、语音生成和口型同步能力。

开始任务前,应先确认这些命令和生成能力在当前环境中可用。项目仓库可在 GitHub 查看。

安装 Skill

运行以下命令,将仓库克隆到 Codex 的 Skill 目录:

git clone https://github.com/cclank/lanshu-create-ai-presenter-video.git \
  ~/.codex/skills/lanshu-create-ai-presenter-video

安装完成后的路径应为:

~/.codex/skills/lanshu-create-ai-presenter-video

了解目录结构

lanshu-create-ai-presenter-video/
├── SKILL.md
├── README.md
├── agents/
│   └── openai.yaml
├── assets/
│   └── job.template.json
├── references/
│   ├── generation.md
│   ├── editing.md
│   └── qa-recovery.md
└── scripts/
    ├── init_job.py
    ├── preflight.py
    └── finalize_delivery.sh

三份参考文档分别服务于不同制作阶段:

  • generation.md:处理输入检查、文案、声音、能力选型、付费生成、人物提示词与一致性。
  • editing.md:处理时间轴、开场和结尾、字幕预设、人物侧关键词动效、封面与导出。
  • qa-recovery.md:处理技术验收、人工验收以及常见故障修复。

方法一:在对话中直接创建视频

最简单的使用方式,是在 Codex 对话中明确调用 Skill,并同时给出文案、人物图和成片要求。例如:

使用 $lanshu-create-ai-presenter-video,把这份文案和人物图做成一条 16:9、30 秒、有实时字幕的数字人讲解视频。

提交请求时,建议一并说明素材位置、目标平台、时长、画面比例、字幕形式、风格、水印和结尾引导。若没有授权声音样本,默认会选用合适的库存声音,而不是擅自克隆声音。

方法二:初始化标准任务目录

对于需要检查配置、保留任务记录或分阶段执行的项目,可以先使用仓库脚本建立标准任务目录。

第一步:设置 Skill 路径

SKILL_DIR=~/.codex/skills/lanshu-create-ai-presenter-video

第二步:初始化任务

python3 "$SKILL_DIR/scripts/init_job.py" \
  --job-dir ~/Videos/my-presenter-video \
  --presenter-image ~/Pictures/presenter.png \
  --topic "视频主题" \
  --duration 60 \
  --aspect 9:16 \
  --rights-confirmed \
  --adult-presenter-confirmed

这个示例创建一个时长为 60 秒、比例为 9:16 的任务。--rights-confirmed 表示已经确认人物图片使用权,--adult-presenter-confirmed 表示已经确认参考图中的人物为成年人。

只有在确实完成授权和人物状态检查后,才应使用对应确认参数。远程上传前仍应检查任务配置中的许可信息。

第三步:补全 job.json

初始化后,进入任务目录并查看生成的 job.json。按照任务实际情况补全人工检查项与远程上传许可。不要把未经授权的人物图、声音样本或其他素材提交给远程服务。

第四步:运行预检

python3 "$SKILL_DIR/scripts/preflight.py" ~/Videos/my-presenter-video/job.json

预检用于在正式生成前检查任务配置。应先处理预检发现的问题,再进入可能产生费用的视频、语音或口型同步阶段。

理解完整制作流程

  1. 接收主题或文案与人物图:确认素材可用,并核实图片授权及成年人物状态。
  2. 锁定文案和完整配音:先确定最终讲述内容,再生成全片配音。
  3. 制作低成本人物试片:在大规模付费生成前验证人物效果和技术路线。
  4. 生成连续数字人主素材:根据已确认的配音和人物设置生成主要画面。
  5. 按照同一音频时间轴剪辑:让人物画面、字幕、镜头、关键词和转场共享时间基准。
  6. 添加字幕、关键词动效和封面:完成信息强化和发布包装。
  7. 执行质量验收:检查口型、人物一致性、声音和画面质量。
  8. 完成交付:输出母版、分享版和 QA 报告。

完整配音是流程中的关键基准。先锁定音频,再围绕它安排视频和字幕,可以减少口型漂移以及不同片段之间的衔接问题。

默认输出设置

如果没有提供更具体的要求,工作流采用以下默认方向:

  • 竖屏 9:16,分辨率 1080×1920,帧率 30fps
  • 根据主题生成的视频通常控制在 45 至 75 秒。
  • 没有授权声音样本时使用合适的库存声音。
  • 结构通常包含清晰开场、2 至 4 个内容节拍和简洁结尾。
  • 音乐与商业引导根据需求添加。
  • 发布响度目标约为 -16 LUFS

如果目标是横屏视频,应像对话示例一样明确指定 16:9;如果希望制作短视频平台内容,则可以保留默认的 9:16,或在初始化任务时通过 --aspect 9:16 显式设置。

进阶使用技巧

先锁定配音,再安排所有视觉元素

不要分别为字幕、镜头和人物片段建立互不关联的时间线。先生成并确认完整配音,然后让字幕、人物画面、关键词动效和转场都对齐同一音频,可以提高整体同步性。

付费生成前先制作试片

第一次进入付费生成前,应明确上传内容、生成时长、价格依据、试片方案和重试上限。低成本试片能够提前暴露人物外观、口型效果或工具兼容性问题,避免直接生成完整视频造成浪费。

中断后优先恢复已有任务

如果远程任务中断,不要立即重新提交。应先查询已有任务 ID,确认任务是否仍在运行或已经产生结果,以避免重复扣费。连续三个付费候选失败后,应停止继续生成并总结问题。

区分技术验收与人工验收

技术检查可覆盖文件和媒体层面的异常,人工检查则应关注口型是否自然、人物是否一致、声音是否合适、字幕是否易读,以及画面是否满足发布要求。相关验收和故障恢复规则位于 references/qa-recovery.md

保护任务记录与素材隐私

  • 不要将 API 密钥、访问令牌或签名下载地址写入仓库。
  • 提交任务级请求记录前,移除凭据与临时 URL。
  • 预检与交付报告只保留文件名,不写入开发者机器的绝对路径。
  • 确认人物图片使用权后再远程上传。
  • 确认声音授权后再使用声音克隆能力。

结语

lanshu-create-ai-presenter-video 将数字人视频制作拆分为可检查、可恢复的标准阶段,并通过统一配音时间轴降低口型和剪辑衔接问题。安装 Skill 后,你可以直接在 Codex 对话中发起任务,也可以先初始化 job.json 并执行预检,以更严格地控制授权、成本、生成过程和最终质量。

该项目采用 MIT License,允许自由使用、修改和分发。使用反馈可通过 GitHub Issue 提交,工作流、兼容性和质量检查改进也可以通过 Pull Request 贡献。