Markdown脚本一键生成竖版短视频,自动同步音画字幕,支持自定义TTS与素材。
说明:
## 核心功能
**Video-Gen Skill** 是一款面向内容创作者的开源自动化视频生成工具,采用”以图定音”的同步策略,将 Markdown 脚本转换为 9:16 竖版短视频。核心工作流包括:脚本解析 → TTS 音频生成 → 字幕卡片渲染 → FFmpeg 视频合成。
## 显著优点
– **音画天然同步**:每张字幕卡片的显示时长严格匹配对应音频长度,消除传统剪辑软件中手动对齐的繁琐操作
– **高度可定制**:支持自定义 TTS 命令模板,兼容 Edge TTS 等主流语音合成方案;可通过 `–images-dir` 导入预制素材,实现完全自定义的视觉风格
– **开发者友好**:纯 Python 实现,依赖清晰(FFmpeg + Chrome),支持环境变量灵活配置
– **开源生态整合**:与 `lh-edge-tts`、`lh-html-to-image` 等配套 Skill 形成工具链,扩展性强
## 潜在局限
– **外部依赖较重**:必须预装 FFmpeg 和 Chrome/Chromium,跨平台部署存在一定门槛
– **视觉样式受限**:内置字幕模板为固定 HTML 渲染,复杂动效需借助外部工具生成图片后导入
– **无云端服务**:纯本地运行,批量生成时性能受限于本地硬件
## 适合人群
– 需要批量生产口播类短视频的知识博主、课程讲师
– 追求工作流自动化的技术型内容创作者
– 熟悉命令行操作的开发者与运维人员
## 常规风险
– **TTS 音色版权**:部分云端 TTS 服务(如 Azure Neural Voice)需单独订阅授权
– **字体与素材合规**:内置模板若使用商业字体,需确认授权范围;建议生产环境替换为开源字体
– **Chrome 安全漏洞**:自动截图依赖 Chrome 渲染引擎,建议保持浏览器版本更新,避免处理不受信任的 Markdown 内容
## 使用建议
推荐采用「外部生成素材 + Video-Gen 合成」的分层工作流:用 Figma/Keynote 设计品牌化的字幕卡片,导出为图片序列后通过 `–images-dir` 注入,兼顾效率与视觉品质。







