使用手冊

第 01 期 · AI 影音 / 自動化製作

用一個主題, 生成一支 AI 短影音製作管線。

ATH-MaaS/Pixelle-Video 繁體中文實戰手冊:Windows 整合包、uv + Streamlit 啟動、WebUI 設定、ComfyUI / RunningHub、直連媒體模型 API、TTS、模板與輸出。

Pixelle-Video 是 ATH-MaaS 維護的 AI 短影音生成引擎。它把主題輸入、文案生成、配圖或影片生成、語音解說、背景音樂與合成輸出放進同一個 WebUI,並支援 ComfyUI、RunningHub 與多家直連媒體模型 API。

ath-maas/pixelle-video
星標
—
分支
—
授權
—
資料截至
—
閱讀時間
7 分
更新日期
開啟原始報告
GitHub Stars
24.6k
pyproject 版本
0.2.0
Python 版本
3.11+
2.0 授權
Apache

01專案定位

主題輸入到影片輸出的自動化管線

Pixelle-Video 是一個 Python 與 Streamlit 組成的 AI 短影音製作工具。README 將它定位為「AI Fully Automated Short Video Engine」,也就是把短影音製作中的腳本、視覺、語音、背景音樂與合成步驟放進同一條流程。

使用者在 WebUI 輸入一個主題後,專案流程會依序進行文案生成、配圖規劃、逐格處理與影片合成。README 同時列出 AI 配圖、AI 影片生成、TTS、BGM、模板、直式與橫式尺寸、數位人口播、圖生影片與動作遷移等能力。

模型層採取可替換設計。LLM 可接 GPT、通義千問、DeepSeek 或 Ollama;影像與影片可走 ComfyUI / RunningHub workflow,也可直接接 DashScope、OpenAI、Volcengine ARK / Seedream / Seedance、Kling 等 API。

  1. 主題輸入

  2. 文案生成

  3. 配圖規劃

  4. 逐格處理

  5. 語音解說

  6. 影片合成

AI Fully Automated Short Video Engine

— ATH-MaaS/Pixelle-Video README_EN.md

02快速開始

先選安裝路徑, 再開啟 Streamlit WebUI

README 提供兩條啟動路徑。Windows 使用者可下載最新 release 的整合包;macOS / Linux 或需要自訂工作流的使用者,使用原始碼安裝並透過 uv run streamlit run web/app.py 啟動。

bash
# 下載 release 頁面的 Pixelle-Video-v0.1.15-win64.zip
# 解壓縮後執行啟動檔
start.bat

原始碼安裝

原始碼路徑需要 uv、ffmpeg 與 Python 3.11 以上。README 的 clone 範例仍指向舊組織名稱;本手冊使用目前 GitHub repo 的 clone URL。

bash
# macOS
brew install ffmpeg

# Ubuntu / Debian
sudo apt update
sudo apt install ffmpeg

# 專案啟動
git clone https://github.com/ATH-MaaS/Pixelle-Video.git
cd Pixelle-Video
uv run streamlit run web/app.py

03生成模組

從文案到聲音, 每一段都可替換

README 將 Pixelle-Video 的能力分成內容輸入、AI 文案、AI 配圖、AI 影片、語音、背景音樂、視覺模板與模型供應商設定。下列卡片對應 WebUI 中最常需要先決定的生成模組。

Input · 01

主題或素材

內容入口

輸入短影音主題,或使用 README 列出的自訂素材功能上傳照片與影片,再交由 AI 分析腳本方向。

Script · 02

AI 文案

腳本生成

LLM 依主題生成解說詞。README 列出 GPT、通義千問、DeepSeek、Ollama 等可用模型方向。

Visual · 03

AI 配圖

逐句圖像

每句腳本可產生對應插圖。來源可選 ComfyUI / RunningHub workflow,也可走直連圖像模型 API。

Motion · 04

AI 影片

動態畫面

README 列出 WAN 2.1、Seedance、Kling 等影片生成路徑,並加入圖生影片與動作遷移模組。

Voice · 05

TTS

語音解說

語音層支援 Edge-TTS、Index-TTS 與多語言音色。README 的近期更新列出數位人口播與多語言 TTS 支援。

Style · 06

模板

視覺風格

模板控制視覺風格與素材配置。README 列出多種模板、直式與橫式尺寸、固定腳本分割方式與模板預覽選擇。

Provider · 07

API 媒體模型

直連供應商

WebUI 可設定 DashScope、OpenAI、Volcengine ARK、Kling 等供應商的 API Key、Base URL 與代理選項。

Output · 08

影片合成

輸出檔案

流程完成後輸出影片。README FAQ 指出產物會儲存在專案的 output/ 目錄。

生成路徑選擇表

需求使用路徑設定位置
Windows 桌面快速試用Pixelle-Video-v0.1.15-win64.ziprelease 整合包與 start.bat
macOS / Linux 原始碼執行uv run streamlit run web/app.pyPython 3.11+、uv、ffmpeg
本機 workflow 生成ComfyUI 或 RunningHubWebUI 的 ComfyUI / RunningHub 設定
直接呼叫媒體模型DashScope、OpenAI、ARK、KlingWebUI 的 API 媒體模型設定

04WebUI 設定

先完成供應商設定, 再啟動生成任務

README 的設定順序是先進入 WebUI,再設定 LLM、圖像與影片生成服務。Pixelle-Video 不內建你的模型帳號;每個供應商的 API Key、Base URL、代理與 workflow 參數都需要在本機設定後才會被流程使用。

LLM 設定先行

先在「系統配置」填入 LLM 服務。腳本生成需要模型回應;LLM 未通時,後面的圖像、語音與合成流程沒有穩定輸入。

來源 · README Web 配置說明

ComfyUI 位址檢查

README 範例使用 http://127.0.0.1:8188 作為 ComfyUI 位址。使用本機 workflow 前,先確認 ComfyUI 服務已啟動且 workflow 所需節點已安裝。

來源 · README ComfyUI 設定

RunningHub 作為雲端 workflow

不跑本機 ComfyUI 時,可改用 RunningHub 設定。此路徑仍需要在 WebUI 填入對應 workflow 與憑證。

來源 · README RunningHub 設定

直連媒體 API 分開設定

DashScope、OpenAI、Volcengine ARK 與 Kling 使用不同供應商設定。把 API Key、Base URL 與代理分開維護,不要混用到同一個模型配置。

來源 · README API 媒體模型設定

Prompt Prefix 使用英文

README 建議圖像 Prompt Prefix 使用英文。保留中文腳本,但把視覺風格、鏡頭與材質提示轉成英文,再送進圖像或影片模型。

來源 · README Prompt Prefix 說明

模板類型命名

README 將模板分成靜態、圖片與影片類型,並使用 static_、image_、video_ 這類前綴。新增模板時沿用同一命名方式。

來源 · README 模板說明

輸出目錄管理

README FAQ 指出生成影片儲存在 output/。把此目錄納入磁碟容量監控;長影片、批量生成與多次重試會累積大型媒體檔。

來源 · README FAQ

SelfHost workflow 提醒

v0.1.15 release notes 提到 SelfHost workflow 提醒。使用 Windows 整合包或本機節點時,逐項確認 workflow 與模型位置,再開始正式生成。

來源 · GitHub release v0.1.15

05端到端流程

從本機啟動到第一支測試影片

下面是一個最小驗收流程。目標不是立即產出正式短影音,而是確認本機服務、LLM、視覺生成服務、TTS 與輸出目錄都能串接。

~/projects/Pixelle-Video · streamlit · first run


$ brew install ffmpeg
# Linux 使用: sudo apt update && sudo apt install ffmpeg


$ git clone https://github.com/ATH-MaaS/Pixelle-Video.git
$ cd Pixelle-Video


$ uv run streamlit run web/app.py
# [Streamlit starts the WebUI]
ok: Local URL: http://localhost:8501


claude: Browser ›
  開啟 http://localhost:8501。
  進入「系統配置」。
  填入 LLM API 設定。
  選擇 ComfyUI / RunningHub 或 API 媒體模型。


$ WebUI ›
  主題: 介紹一款可離線使用的筆記工具
  尺寸: 直式短影音
  語音: Edge-TTS 或 Index-TTS
  模板: 先選內建模板,再測自訂模板


# [expected stages]
  Script Generation
  Image Planning
  Frame-by-Frame Processing
  Video Composition


$ ls output/
ok: 驗收: output/ 內出現本次生成的媒體檔或任務輸出

        

Script Generation → Image Planning → Frame-by-Frame Processing → Video Composition

— ATH-MaaS/Pixelle-Video README_EN.md

最小驗收標準

第一輪測試只驗證流程可走通。通過標準是 Streamlit WebUI 可開啟、LLM 設定可保存、視覺生成供應商可被選取、TTS 設定可保存,且 output/ 出現本次任務產物。

第二輪再調整模板、Prompt Prefix、模型與影片尺寸。不要同時更換 LLM、圖像模型、TTS 與模板;一次只改一個變數,方便定位失敗來源。

06風險與邊界

媒體生成需要憑證、資源與審核

07進階路徑

從範例模板走向自訂製作線

完成第一支測試影片後,依序調整模型、模板、workflow 與輸出尺寸。每次只更換一個模組,並保留可重現的主題與腳本,方便比較不同供應商的結果。

進階操作地圖

**1. 固定一組 LLM 與腳本。**先穩定文案生成,再調整視覺模型。腳本文案不穩時,後續畫面與配音比較沒有基準。

**2. 建立供應商矩陣。**以同一段腳本測 DashScope、OpenAI、ARK、Kling、ComfyUI 與 RunningHub。記錄成本、速度、失敗率與畫面一致性。

**3. 自訂模板前綴。**依 README 的模板分類維持 static_、image_、video_ 前綴,並用同一組素材測直式與橫式版型。

**4. 導入圖生影片與數位人。**README 的更新紀錄列出 Digital Human、Image-to-Video 與 Motion Transfer。先用短片段驗證工作流,再導入正式素材。

**5. 將輸出納入審核清單。**正式發布前檢查腳本文案、聲音、素材授權、字幕、商標、人物肖像與平台內容政策。

延伸閱讀

① README.md 與 README_EN.md:功能、流程、WebUI 與 FAQ。 ② latest release:Windows 整合包與 release notes。 ③ pyproject.toml:Python 版本、依賴與 package metadata。 ④ workflows/、templates/、config.example.yaml:workflow、模板與設定範例。

AI-powered video creation platform - Part of Pixelle ecosystem

— ATH-MaaS/Pixelle-Video pyproject.toml