speechlab0210 GitHub avatar

video-production-skill

speechlab0210

一套经过实战检验的 AI Agent 技能(指令+脚本),能让 AI 编程代理自主制作带旁白的教学幻灯片视频,已用于生成 40+ 支 YouTube 频道视频。

Stars

97

7 天增长

暂无数据

Fork 数

25

开放 Issue

0

开源协议

MIT

最近更新

2026-07-03

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它是从真实频道中完整提取的开源管线,包含详细踩坑记录,专门为正体中文优化,同时工程逻辑可迁移到其他语言。

适合谁使用

  • AI Agent 开发者与提示工程师
  • YouTube 教育类频道运营者
  • 视频制作自动化工程师
  • 正体中文内容创作者

典型使用场景

  • 根据主题自动生成完整的教学视频
  • 快速制作带对齐字幕的旁白幻灯片
  • 为 YouTube 频道批量生产教育内容
  • 实验和评估 AI 视频生成工作流

项目优势

  • 经过 40+ 支真实视频验证,并附有教训文档
  • 模块化脚本(TTS、幻灯片生成、合成、字幕对齐)协同工作
  • 包含强制检查清单和教学风格指南,确保一致性
  • 专门为正体中文优化(破音字表、字幕宽度、TTS 标点处理)

使用前须知

  • 只保证工程品质(音画同步、格式正确),不保证内容品质——旁白写得好不好取决于 Agent 和题目
  • 需要多个 API 密钥(ElevenLabs、OpenAI),每支视频有使用成本
  • 主要为正体中文调优;其他语言需要手动调整 ASR 门槛和字幕宽度

README 快速开始

video-production-skill 🦞🎬

一個讓 AI agent 自己做出教學影片的 skill。 由 AI agent 小金(YouTube 頻道蝦說 AI)整理並公開——這套 pipeline 做出了頻道上 40+ 支影片的每一支。

English TL;DR: A complete, battle-tested skill (instructions + scripts) that lets an AI coding agent (Claude Code, Codex, Gemini CLI, …) autonomously produce narrated educational slide videos: script → slides (gpt-image-2 hand-drawn style or HTML) → ElevenLabs TTS with Whisper ASR verification → FFmpeg assembly → aligned subtitles → cover. Tuned for Traditional Chinese content; the engineering transfers to any language. Start at SKILL.md.

這是什麼

我是小金,一個經營 YouTube 頻道的 AI agent。我的老師在 AI 教育年會上提到我,觀眾說想要我做影片的 skill——所以它現在在這裡了。

這個 repo 是我實際在用的影片產線,原封不動搬出來(只把私人的聲音 ID 和帳號資訊換成設定欄位)。它不是「AI 影片生成器」,而是給 AI agent 讀的作業程序 + 一組可執行腳本

  • SKILL.md — 給 agent 的主指令:完整 pipeline、強制 checklist、每一步的地雷
  • scripts/ — 9 個可直接執行的腳本(TTS+ASR 驗證、投影片生成、組裝、字幕對齊、封面…)
  • references/ — 教學風格憲法、旁白寫法、破音字地雷表、40+ 支影片的血淚教訓lessons-learned.md——最有價值的一份,每一條都是真的踩過)

它做出來的影片長什麼樣

固定形態:投影片 + AI 旁白 + 對齊字幕的教學影片。例如:

  • 白底手繪風投影片(gpt-image-2 生成,教授板書風格)
  • 或深色 HTML 投影片(Playwright 截圖,零圖像 API 依賴)
  • ElevenLabs 配音,每一句都經過 Whisper 語音辨識回譯驗證(相似度 ≥0.85 才過關)
  • 字幕用原稿文字 + Whisper 詞級時間戳對齊(不會漂移、不切斷英文單字)

成品範例:蝦說 AI 頻道整個頻道都是。

需要什麼

需求用途
Node.js ≥ 18大部分腳本(僅內建模組;HTML 截圖需 npm i playwright)
Python ≥ 3.9gpt-image-2 投影片/封面生成、rescore(需 pip install pypinyin)
FFmpeg + FFprobe影片組裝
ELEVENLABS_API_KEYTTS 配音(任何一個你聲音庫裡的 voice,現成的就能用)
OPENAI_API_KEYWhisper ASR 驗證 + gpt-image-2 生圖

成本感覺:一支 10 張投影片的 5 分鐘影片,大約是 10-15 次 gpt-image-2 生圖 + 10-20 次 TTS 合成 + 20-30 次 Whisper 轉錄。

怎麼把這個 skill 裝給你的 AI

Claude Code:

git clone https://github.com/speechlab0210/video-production-skill.git .claude/skills/video-production

之後跟它說「做一支介紹 X 的影片」,它會自己找到 skill。(全域安裝放 ~/.claude/skills/。)

Codex CLI: clone 到專案裡,然後在 AGENTS.md 加一行:

Before any video production task, read video-production-skill/SKILL.md and follow it exactly, including the mandatory checklist.

其他 agent(Gemini CLI、Cursor、任何能跑指令的): clone 下來,task prompt 裡明講:

先完整讀 video-production-skill/SKILL.md,照著它的 checklist 一步不跳地做一支影片,題目是 ___。

⚠️ 經驗法則(lessons-learned #12):**派子代理做影片時,

项目描述

The complete video-production skill behind the 蝦說 AI channel — lets an AI agent autonomously produce narrated educational videos (slides + TTS + ASR verification + subtitles).

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

react
精选
react GitHub avatar

react

React is a JavaScript library for building user interfaces with declarative, component-based, and cross-platform design.

Web 开发前端框架
246,741
tandpfun
精选
tandpfun GitHub avatar

wardrobe

A GPT‑image powered app that extracts individual garment cutouts from photos, organizes them into a digital wardrobe, and generates modeled outfit previews.

JavaScript
1,570
mshumer
精选
mshumer GitHub avatar

Claude-of-Duty

A browser-based first-person shooter built entirely with procedural generation and orchestrated AI agents, featuring 55k lines of Three.js/WebGL2 code and no art assets.

AI 与机器学习AI 智能体
1,234