實戰手冊 · Field Manual 2026 春季號
github.com/ATH-MaaS/Pixelle-Video · 24.6k ★
P
第 01 期 · AI 影音 / 自動化製作

用一個主題,
生成一支 AI 短影音
製作管線。

Pixelle-Video 是 ATH-MaaS 維護的 AI 短影音生成引擎。它把主題輸入、文案生成、配圖或影片生成、語音解說、背景音樂與合成輸出放進同一個 WebUI,並支援 ComfyUI、RunningHub 與多家直連媒體模型 API。

24.6k
GitHub Stars
0.2.0
pyproject 版本
3.11+
Python 版本
Apache
2.0 授權
01
專案定位

主題輸入到
影片輸出的自動化管線

Pixelle-Video 是一個 Python 與 Streamlit 組成的 AI 短影音製作工具。README 將它定位為「AI Fully Automated Short Video Engine」,也就是把短影音製作中的腳本、視覺、語音、背景音樂與合成步驟放進同一條流程。

使用者在 WebUI 輸入一個主題後,專案流程會依序進行文案生成、配圖規劃、逐格處理與影片合成。README 同時列出 AI 配圖、AI 影片生成、TTS、BGM、模板、直式與橫式尺寸、數位人口播、圖生影片與動作遷移等能力。

模型層採取可替換設計。LLM 可接 GPT、通義千問、DeepSeek 或 Ollama;影像與影片可走 ComfyUI / RunningHub workflow,也可直接接 DashScope、OpenAI、Volcengine ARK / Seedream / Seedance、Kling 等 API。

Pixelle-Video · 生成流程
主題輸入 文案生成 配圖規劃 逐格處理 語音解說 影片合成
AI Fully Automated Short Video Engine
— ATH-MaaS/Pixelle-Video README_EN.md
02
快速開始

先選安裝路徑,
再開啟 Streamlit WebUI

README 提供兩條啟動路徑。Windows 使用者可下載最新 release 的整合包;macOS / Linux 或需要自訂工作流的使用者,使用原始碼安裝並透過 uv run streamlit run web/app.py 啟動。

# 下載 release 頁面的 Pixelle-Video-v0.1.15-win64.zip # 解壓縮後執行啟動檔 start.bat

原始碼安裝

原始碼路徑需要 uvffmpeg 與 Python 3.11 以上。README 的 clone 範例仍指向舊組織名稱;本手冊使用目前 GitHub repo 的 clone URL。

# macOS brew install ffmpeg # Ubuntu / Debian sudo apt update sudo apt install ffmpeg # 專案啟動 git clone https://github.com/ATH-MaaS/Pixelle-Video.git cd Pixelle-Video uv run streamlit run web/app.py
首次使用設定。README 指出瀏覽器會開啟 http://localhost:8501。進入「系統配置」後,先填入 LLM API、ComfyUI / RunningHub 或直連媒體模型 API,再開始生成影片。
03
生成模組

從文案到聲音,
每一段都可替換

README 將 Pixelle-Video 的能力分成內容輸入、AI 文案、AI 配圖、AI 影片、語音、背景音樂、視覺模板與模型供應商設定。下列卡片對應 WebUI 中最常需要先決定的生成模組。

Input · 01
主題或素材
內容入口
輸入短影音主題,或使用 README 列出的自訂素材功能上傳照片與影片,再交由 AI 分析腳本方向。
Script · 02
AI 文案
腳本生成
LLM 依主題生成解說詞。README 列出 GPT、通義千問、DeepSeek、Ollama 等可用模型方向。
Visual · 03
AI 配圖
逐句圖像
每句腳本可產生對應插圖。來源可選 ComfyUI / RunningHub workflow,也可走直連圖像模型 API。
Motion · 04
AI 影片
動態畫面
README 列出 WAN 2.1、Seedance、Kling 等影片生成路徑,並加入圖生影片與動作遷移模組。
Voice · 05
TTS
語音解說
語音層支援 Edge-TTS、Index-TTS 與多語言音色。README 的近期更新列出數位人口播與多語言 TTS 支援。
Style · 06
模板
視覺風格
模板控制視覺風格與素材配置。README 列出多種模板、直式與橫式尺寸、固定腳本分割方式與模板預覽選擇。
Provider · 07
API 媒體模型
直連供應商
WebUI 可設定 DashScope、OpenAI、Volcengine ARK、Kling 等供應商的 API Key、Base URL 與代理選項。
Output · 08
影片合成
輸出檔案
流程完成後輸出影片。README FAQ 指出產物會儲存在專案的 output/ 目錄。

生成路徑選擇表

需求 使用路徑 設定位置
Windows 桌面快速試用 Pixelle-Video-v0.1.15-win64.zip release 整合包與 start.bat
macOS / Linux 原始碼執行 uv run streamlit run web/app.py Python 3.11+、uvffmpeg
本機 workflow 生成 ComfyUI 或 RunningHub WebUI 的 ComfyUI / RunningHub 設定
直接呼叫媒體模型 DashScope、OpenAI、ARK、Kling WebUI 的 API 媒體模型設定
04
WebUI 設定

先完成供應商設定,
再啟動生成任務

README 的設定順序是先進入 WebUI,再設定 LLM、圖像與影片生成服務。Pixelle-Video 不內建你的模型帳號;每個供應商的 API Key、Base URL、代理與 workflow 參數都需要在本機設定後才會被流程使用。

TIP 01

LLM 設定先行

先在「系統配置」填入 LLM 服務。腳本生成需要模型回應;LLM 未通時,後面的圖像、語音與合成流程沒有穩定輸入。

來源 · README Web 配置說明
TIP 02

ComfyUI 位址檢查

README 範例使用 http://127.0.0.1:8188 作為 ComfyUI 位址。使用本機 workflow 前,先確認 ComfyUI 服務已啟動且 workflow 所需節點已安裝。

來源 · README ComfyUI 設定
TIP 03

RunningHub 作為雲端 workflow

不跑本機 ComfyUI 時,可改用 RunningHub 設定。此路徑仍需要在 WebUI 填入對應 workflow 與憑證。

來源 · README RunningHub 設定
TIP 04

直連媒體 API 分開設定

DashScope、OpenAI、Volcengine ARK 與 Kling 使用不同供應商設定。把 API Key、Base URL 與代理分開維護,不要混用到同一個模型配置。

來源 · README API 媒體模型設定
TIP 05

Prompt Prefix 使用英文

README 建議圖像 Prompt Prefix 使用英文。保留中文腳本,但把視覺風格、鏡頭與材質提示轉成英文,再送進圖像或影片模型。

來源 · README Prompt Prefix 說明
TIP 06

模板類型命名

README 將模板分成靜態、圖片與影片類型,並使用 static_image_video_ 這類前綴。新增模板時沿用同一命名方式。

來源 · README 模板說明
TIP 07

輸出目錄管理

README FAQ 指出生成影片儲存在 output/。把此目錄納入磁碟容量監控;長影片、批量生成與多次重試會累積大型媒體檔。

來源 · README FAQ
TIP 08

SelfHost workflow 提醒

v0.1.15 release notes 提到 SelfHost workflow 提醒。使用 Windows 整合包或本機節點時,逐項確認 workflow 與模型位置,再開始正式生成。

來源 · GitHub release v0.1.15
05
端到端流程

從本機啟動
到第一支測試影片

下面是一個最小驗收流程。目標不是立即產出正式短影音,而是確認本機服務、LLM、視覺生成服務、TTS 與輸出目錄都能串接。

~/projects/Pixelle-Video · streamlit · first run
$ brew install ffmpeg # Linux 使用: sudo apt update && sudo apt install ffmpeg
$ git clone https://github.com/ATH-MaaS/Pixelle-Video.git $ cd Pixelle-Video
$ uv run streamlit run web/app.py [Streamlit starts the WebUI] Local URL: http://localhost:8501
Browser › 開啟 http://localhost:8501。 進入「系統配置」。 填入 LLM API 設定。 選擇 ComfyUI / RunningHub 或 API 媒體模型。
WebUI › 主題: 介紹一款可離線使用的筆記工具 尺寸: 直式短影音 語音: Edge-TTS 或 Index-TTS 模板: 先選內建模板,再測自訂模板
[expected stages] Script Generation Image Planning Frame-by-Frame Processing Video Composition
$ ls output/ # 驗收: output/ 內出現本次生成的媒體檔或任務輸出
Script Generation → Image Planning → Frame-by-Frame Processing → Video Composition
— ATH-MaaS/Pixelle-Video README_EN.md

最小驗收標準

第一輪測試只驗證流程可走通。通過標準是 Streamlit WebUI 可開啟、LLM 設定可保存、視覺生成供應商可被選取、TTS 設定可保存,且 output/ 出現本次任務產物。

第二輪再調整模板、Prompt Prefix、模型與影片尺寸。不要同時更換 LLM、圖像模型、TTS 與模板;一次只改一個變數,方便定位失敗來源。

06
風險與邊界

媒體生成需要
憑證、資源與審核

  • API Key 屬於本機敏感資料。WebUI 會保存 LLM 與媒體模型憑證。不要把設定檔、截圖或錄影中的金鑰提交到 repo。
  • 雲端模型會產生成本。README FAQ 提到本機 Ollama 加本機 ComfyUI 可作為零元路徑;DashScope、OpenAI、ARK、Kling、RunningHub 等雲端服務依各自帳號計費。
  • ComfyUI workflow 需要依賴節點。本機生成不只需要位址可連線,也需要 workflow 所需模型與節點已安裝。先跑短片段測試再批量生成。
  • Windows 整合包仍需設定供應商。release package 提供啟動環境,但不包含你的 LLM、TTS 或媒體模型帳號。第一次啟動後仍要進入 WebUI 設定。
  • 輸出檔會快速占用磁碟。影片、逐格圖像、語音與中間素材會累積在專案目錄。定期整理 output/ 與暫存資料。
  • 內容合規不能外包給流程。README 提到敏感內容會被中性化重試;正式發布前仍需人工審核肖像權、音樂權、商標與平台政策。
  • 模型尺寸限制會影響模板。直式與橫式模板需要配合模型支援的解析度。更換模型後,先重新檢查模板比例與裁切結果。
  • README clone 範例可能使用舊組織。目前 GitHub repo 為 ATH-MaaS/Pixelle-Video。新環境使用目前 repo URL clone,避免安裝到過期來源。
07
進階路徑

從範例模板
走向自訂製作線

完成第一支測試影片後,依序調整模型、模板、workflow 與輸出尺寸。每次只更換一個模組,並保留可重現的主題與腳本,方便比較不同供應商的結果。

進階操作地圖

1. 固定一組 LLM 與腳本。先穩定文案生成,再調整視覺模型。腳本文案不穩時,後續畫面與配音比較沒有基準。

2. 建立供應商矩陣。以同一段腳本測 DashScope、OpenAI、ARK、Kling、ComfyUI 與 RunningHub。記錄成本、速度、失敗率與畫面一致性。

3. 自訂模板前綴。依 README 的模板分類維持 static_image_video_ 前綴,並用同一組素材測直式與橫式版型。

4. 導入圖生影片與數位人。README 的更新紀錄列出 Digital Human、Image-to-Video 與 Motion Transfer。先用短片段驗證工作流,再導入正式素材。

5. 將輸出納入審核清單。正式發布前檢查腳本文案、聲音、素材授權、字幕、商標、人物肖像與平台內容政策。

延伸閱讀

README.mdREADME_EN.md:功能、流程、WebUI 與 FAQ。
latest release:Windows 整合包與 release notes。
pyproject.toml:Python 版本、依賴與 package metadata。
workflows/templates/config.example.yaml:workflow、模板與設定範例。

AI-powered video creation platform - Part of Pixelle ecosystem
— ATH-MaaS/Pixelle-Video pyproject.toml