主題輸入到影片輸出的自動化管線
Pixelle-Video 是一個 Python 與 Streamlit 組成的 AI 短影音製作工具。README 將它定位為「AI Fully Automated Short Video Engine」,也就是把短影音製作中的腳本、視覺、語音、背景音樂與合成步驟放進同一條流程。
使用者在 WebUI 輸入一個主題後,專案流程會依序進行文案生成、配圖規劃、逐格處理與影片合成。README 同時列出 AI 配圖、AI 影片生成、TTS、BGM、模板、直式與橫式尺寸、數位人口播、圖生影片與動作遷移等能力。
模型層採取可替換設計。LLM 可接 GPT、通義千問、DeepSeek 或 Ollama;影像與影片可走 ComfyUI / RunningHub workflow,也可直接接 DashScope、OpenAI、Volcengine ARK / Seedream / Seedance、Kling 等 API。
主題輸入
文案生成
配圖規劃
逐格處理
語音解說
影片合成
AI Fully Automated Short Video Engine
先選安裝路徑, 再開啟 Streamlit WebUI
README 提供兩條啟動路徑。Windows 使用者可下載最新 release 的整合包;macOS / Linux 或需要自訂工作流的使用者,使用原始碼安裝並透過 uv run streamlit run web/app.py 啟動。
# 下載 release 頁面的 Pixelle-Video-v0.1.15-win64.zip
# 解壓縮後執行啟動檔
start.bat原始碼安裝
原始碼路徑需要 uv、ffmpeg 與 Python 3.11 以上。README 的 clone 範例仍指向舊組織名稱;本手冊使用目前 GitHub repo 的 clone URL。
# macOS
brew install ffmpeg
# Ubuntu / Debian
sudo apt update
sudo apt install ffmpeg
# 專案啟動
git clone https://github.com/ATH-MaaS/Pixelle-Video.git
cd Pixelle-Video
uv run streamlit run web/app.py從文案到聲音, 每一段都可替換
README 將 Pixelle-Video 的能力分成內容輸入、AI 文案、AI 配圖、AI 影片、語音、背景音樂、視覺模板與模型供應商設定。下列卡片對應 WebUI 中最常需要先決定的生成模組。
Input · 01
主題或素材
內容入口
輸入短影音主題,或使用 README 列出的自訂素材功能上傳照片與影片,再交由 AI 分析腳本方向。
Script · 02
AI 文案
腳本生成
LLM 依主題生成解說詞。README 列出 GPT、通義千問、DeepSeek、Ollama 等可用模型方向。
Visual · 03
AI 配圖
逐句圖像
每句腳本可產生對應插圖。來源可選 ComfyUI / RunningHub workflow,也可走直連圖像模型 API。
Motion · 04
AI 影片
動態畫面
README 列出 WAN 2.1、Seedance、Kling 等影片生成路徑,並加入圖生影片與動作遷移模組。
Voice · 05
TTS
語音解說
語音層支援 Edge-TTS、Index-TTS 與多語言音色。README 的近期更新列出數位人口播與多語言 TTS 支援。
Style · 06
模板
視覺風格
模板控制視覺風格與素材配置。README 列出多種模板、直式與橫式尺寸、固定腳本分割方式與模板預覽選擇。
Provider · 07
API 媒體模型
直連供應商
WebUI 可設定 DashScope、OpenAI、Volcengine ARK、Kling 等供應商的 API Key、Base URL 與代理選項。
Output · 08
影片合成
輸出檔案
流程完成後輸出影片。README FAQ 指出產物會儲存在專案的 output/ 目錄。
生成路徑選擇表
| 需求 | 使用路徑 | 設定位置 |
|---|---|---|
| Windows 桌面快速試用 | Pixelle-Video-v0.1.15-win64.zip | release 整合包與 start.bat |
| macOS / Linux 原始碼執行 | uv run streamlit run web/app.py | Python 3.11+、uv、ffmpeg |
| 本機 workflow 生成 | ComfyUI 或 RunningHub | WebUI 的 ComfyUI / RunningHub 設定 |
| 直接呼叫媒體模型 | DashScope、OpenAI、ARK、Kling | WebUI 的 API 媒體模型設定 |
先完成供應商設定, 再啟動生成任務
README 的設定順序是先進入 WebUI,再設定 LLM、圖像與影片生成服務。Pixelle-Video 不內建你的模型帳號;每個供應商的 API Key、Base URL、代理與 workflow 參數都需要在本機設定後才會被流程使用。
LLM 設定先行
先在「系統配置」填入 LLM 服務。腳本生成需要模型回應;LLM 未通時,後面的圖像、語音與合成流程沒有穩定輸入。
來源 · README Web 配置說明
ComfyUI 位址檢查
README 範例使用 http://127.0.0.1:8188 作為 ComfyUI 位址。使用本機 workflow 前,先確認 ComfyUI 服務已啟動且 workflow 所需節點已安裝。
來源 · README ComfyUI 設定
RunningHub 作為雲端 workflow
不跑本機 ComfyUI 時,可改用 RunningHub 設定。此路徑仍需要在 WebUI 填入對應 workflow 與憑證。
來源 · README RunningHub 設定
直連媒體 API 分開設定
DashScope、OpenAI、Volcengine ARK 與 Kling 使用不同供應商設定。把 API Key、Base URL 與代理分開維護,不要混用到同一個模型配置。
來源 · README API 媒體模型設定
Prompt Prefix 使用英文
README 建議圖像 Prompt Prefix 使用英文。保留中文腳本,但把視覺風格、鏡頭與材質提示轉成英文,再送進圖像或影片模型。
來源 · README Prompt Prefix 說明
模板類型命名
README 將模板分成靜態、圖片與影片類型,並使用 static_、image_、video_ 這類前綴。新增模板時沿用同一命名方式。
來源 · README 模板說明
輸出目錄管理
README FAQ 指出生成影片儲存在 output/。把此目錄納入磁碟容量監控;長影片、批量生成與多次重試會累積大型媒體檔。
來源 · README FAQ
SelfHost workflow 提醒
v0.1.15 release notes 提到 SelfHost workflow 提醒。使用 Windows 整合包或本機節點時,逐項確認 workflow 與模型位置,再開始正式生成。
來源 · GitHub release v0.1.15
從本機啟動到第一支測試影片
下面是一個最小驗收流程。目標不是立即產出正式短影音,而是確認本機服務、LLM、視覺生成服務、TTS 與輸出目錄都能串接。
$ brew install ffmpeg
$ git clone https://github.com/ATH-MaaS/Pixelle-Video.git
$ cd Pixelle-Video
$ uv run streamlit run web/app.py
ok: Local URL: http://localhost:8501
claude: Browser ›
開啟 http://localhost:8501。
進入「系統配置」。
填入 LLM API 設定。
選擇 ComfyUI / RunningHub 或 API 媒體模型。
$ WebUI ›
主題: 介紹一款可離線使用的筆記工具
尺寸: 直式短影音
語音: Edge-TTS 或 Index-TTS
模板: 先選內建模板,再測自訂模板
Script Generation
Image Planning
Frame-by-Frame Processing
Video Composition
$ ls output/
ok: 驗收: output/ 內出現本次生成的媒體檔或任務輸出
Script Generation → Image Planning → Frame-by-Frame Processing → Video Composition
最小驗收標準
第一輪測試只驗證流程可走通。通過標準是 Streamlit WebUI 可開啟、LLM 設定可保存、視覺生成供應商可被選取、TTS 設定可保存,且 output/ 出現本次任務產物。
第二輪再調整模板、Prompt Prefix、模型與影片尺寸。不要同時更換 LLM、圖像模型、TTS 與模板;一次只改一個變數,方便定位失敗來源。
媒體生成需要憑證、資源與審核
從範例模板走向自訂製作線
完成第一支測試影片後,依序調整模型、模板、workflow 與輸出尺寸。每次只更換一個模組,並保留可重現的主題與腳本,方便比較不同供應商的結果。
進階操作地圖
**1. 固定一組 LLM 與腳本。**先穩定文案生成,再調整視覺模型。腳本文案不穩時,後續畫面與配音比較沒有基準。
**2. 建立供應商矩陣。**以同一段腳本測 DashScope、OpenAI、ARK、Kling、ComfyUI 與 RunningHub。記錄成本、速度、失敗率與畫面一致性。
**3. 自訂模板前綴。**依 README 的模板分類維持 static_、image_、video_ 前綴,並用同一組素材測直式與橫式版型。
**4. 導入圖生影片與數位人。**README 的更新紀錄列出 Digital Human、Image-to-Video 與 Motion Transfer。先用短片段驗證工作流,再導入正式素材。
**5. 將輸出納入審核清單。**正式發布前檢查腳本文案、聲音、素材授權、字幕、商標、人物肖像與平台內容政策。
延伸閱讀
① README.md 與 README_EN.md:功能、流程、WebUI 與 FAQ。 ② latest release:Windows 整合包與 release notes。 ③ pyproject.toml:Python 版本、依賴與 package metadata。 ④ workflows/、templates/、config.example.yaml:workflow、模板與設定範例。
AI-powered video creation platform - Part of Pixelle ecosystem