一句话主题 → 成品短视频:自动串联 文案→配图/AI视频→配音→字幕→BGM→合成,把 Easel 制作层零件编排成一条'一键出片'流水线。**单条视频、口播/资讯向,画面默认逐句配图 + Ken Burns 缓动,需要动态时才逐段图生视频**。当用户说 一键生成视频、自动做短视频、主题生成视频、帮我做条视频、口播视频一条龙、自动出片、短视频一键生成 时使用。**有剧情/角色/对白/反转/多集的短剧改用 short-drama(每镜强制图生视频、不用静态图冒充);只写脚本用 video-script;只生成单个片段用 ai-video-gen。**
npx skills add https://github.com/ZJU-REAL/Easel --skill auto-short-video
> 输入一个主题,自动产出一条短视频。本 SKILL 是编排层:把已有制作零件串成流水线——
> 文案(video-script) → 逐句配图(ai-image-gen)或片段(ai-video-gen) → 配音(tts-voiceover) →
> 字幕(auto-subtitle) → BGM(ai-music) → 合成(scripts/assemble.py)。
> 沉淀自 Pixelle-Video / MoneyPrinterTurbo 的自动短视频引擎思路。
成品短视频写入 outputs/主题名/final.mp4;分镜图、配音、字幕和 storyboard 写入 outputs/主题名/assets/。
pad 到已确认画幅VOICE_PROVIDER 默认走闭源好嗓子(有情感、像真人),没 key 才退 edge(机械)——想要口播不"生硬"务必配闭源 key。不需要配音才跳过。 python skills/openclaw/auto-short-video/scripts/assemble.py assemble \
--storyboard outputs/主题名/assets/storyboard.json \
-o outputs/主题名/final.mp4
storyboard 结构(图/片二选一,narration/bgm/subtitle 可选,缺 duration 时按配音均分):
{
"size": "<已确认尺寸,如1080x1920或1920x1080>",
"image_motion": "ken-burns",
"shots": [
{"image": "outputs/主题名/assets/shot1.png", "duration": 3, "caption": "第一句", "motion": "static"},
{"video": "outputs/主题名/assets/clip2.mp4", "caption": "第二句"}
],
"narration": "outputs/主题名/assets/voice.mp3",
"bgm": "outputs/主题名/assets/bgm.mp3",
"subtitle": "outputs/主题名/assets/voice.srt"
}
image_motion 设整条图片默认运动,单镜 motion 可覆写:照片用 ken-burns,含文字的 slide/图表/界面必须用
static(等比缩放 + 补边,不裁切、不平移)。
合成器自动做:按 image_motion 生成静帧或 Ken Burns、补边到画幅、拼接、配音+BGM 混音(BGM 自动压低)、烧录字幕。
outputs/主题名/assets/,方便单独替换后重新合成。style.md 取调性/视觉风格贯穿文案与配图 prompt;platforms.md 只用于给出画幅/时长建议,画幅仍须确认;preferences.md 红线过滤。Take zju-real/auto-short-video from the repository into ~/.claude/skills for personal
use, or into .claude/skills inside a project.
The agent identifies a skill by the name field in its header. Two skills with the
same name cannot sit side by side — one of them will be ignored.