Pixelle-Video 是 ATH-MaaS 維護的 AI 短影音生成引擎。它把主題輸入、文案生成、配圖或影片生成、語音解說、背景音樂與合成輸出放進同一個 WebUI,並支援 ComfyUI、RunningHub 與多家直連媒體模型 API。
Pixelle-Video 是一個 Python 與 Streamlit 組成的 AI 短影音製作工具。README 將它定位為「AI Fully Automated Short Video Engine」,也就是把短影音製作中的腳本、視覺、語音、背景音樂與合成步驟放進同一條流程。
使用者在 WebUI 輸入一個主題後,專案流程會依序進行文案生成、配圖規劃、逐格處理與影片合成。README 同時列出 AI 配圖、AI 影片生成、TTS、BGM、模板、直式與橫式尺寸、數位人口播、圖生影片與動作遷移等能力。
模型層採取可替換設計。LLM 可接 GPT、通義千問、DeepSeek 或 Ollama;影像與影片可走 ComfyUI / RunningHub workflow,也可直接接 DashScope、OpenAI、Volcengine ARK / Seedream / Seedance、Kling 等 API。
README 提供兩條啟動路徑。Windows 使用者可下載最新 release 的整合包;macOS / Linux 或需要自訂工作流的使用者,使用原始碼安裝並透過 uv run streamlit run web/app.py 啟動。
原始碼路徑需要 uv、ffmpeg 與 Python 3.11 以上。README 的 clone 範例仍指向舊組織名稱;本手冊使用目前 GitHub repo 的 clone URL。
http://localhost:8501。進入「系統配置」後,先填入 LLM API、ComfyUI / RunningHub 或直連媒體模型 API,再開始生成影片。
README 將 Pixelle-Video 的能力分成內容輸入、AI 文案、AI 配圖、AI 影片、語音、背景音樂、視覺模板與模型供應商設定。下列卡片對應 WebUI 中最常需要先決定的生成模組。
output/ 目錄。| 需求 | 使用路徑 | 設定位置 |
|---|---|---|
| Windows 桌面快速試用 | Pixelle-Video-v0.1.15-win64.zip |
release 整合包與 start.bat |
| macOS / Linux 原始碼執行 | uv run streamlit run web/app.py |
Python 3.11+、uv、ffmpeg |
| 本機 workflow 生成 | ComfyUI 或 RunningHub | WebUI 的 ComfyUI / RunningHub 設定 |
| 直接呼叫媒體模型 | DashScope、OpenAI、ARK、Kling | WebUI 的 API 媒體模型設定 |
README 的設定順序是先進入 WebUI,再設定 LLM、圖像與影片生成服務。Pixelle-Video 不內建你的模型帳號;每個供應商的 API Key、Base URL、代理與 workflow 參數都需要在本機設定後才會被流程使用。
先在「系統配置」填入 LLM 服務。腳本生成需要模型回應;LLM 未通時,後面的圖像、語音與合成流程沒有穩定輸入。
來源 · README Web 配置說明README 範例使用 http://127.0.0.1:8188 作為 ComfyUI 位址。使用本機 workflow 前,先確認 ComfyUI 服務已啟動且 workflow 所需節點已安裝。
不跑本機 ComfyUI 時,可改用 RunningHub 設定。此路徑仍需要在 WebUI 填入對應 workflow 與憑證。
來源 · README RunningHub 設定DashScope、OpenAI、Volcengine ARK 與 Kling 使用不同供應商設定。把 API Key、Base URL 與代理分開維護,不要混用到同一個模型配置。
來源 · README API 媒體模型設定README 建議圖像 Prompt Prefix 使用英文。保留中文腳本,但把視覺風格、鏡頭與材質提示轉成英文,再送進圖像或影片模型。
來源 · README Prompt Prefix 說明README 將模板分成靜態、圖片與影片類型,並使用 static_、image_、video_ 這類前綴。新增模板時沿用同一命名方式。
README FAQ 指出生成影片儲存在 output/。把此目錄納入磁碟容量監控;長影片、批量生成與多次重試會累積大型媒體檔。
v0.1.15 release notes 提到 SelfHost workflow 提醒。使用 Windows 整合包或本機節點時,逐項確認 workflow 與模型位置,再開始正式生成。
來源 · GitHub release v0.1.15下面是一個最小驗收流程。目標不是立即產出正式短影音,而是確認本機服務、LLM、視覺生成服務、TTS 與輸出目錄都能串接。
第一輪測試只驗證流程可走通。通過標準是 Streamlit WebUI 可開啟、LLM 設定可保存、視覺生成供應商可被選取、TTS 設定可保存,且 output/ 出現本次任務產物。
第二輪再調整模板、Prompt Prefix、模型與影片尺寸。不要同時更換 LLM、圖像模型、TTS 與模板;一次只改一個變數,方便定位失敗來源。
output/ 與暫存資料。
ATH-MaaS/Pixelle-Video。新環境使用目前 repo URL clone,避免安裝到過期來源。
完成第一支測試影片後,依序調整模型、模板、workflow 與輸出尺寸。每次只更換一個模組,並保留可重現的主題與腳本,方便比較不同供應商的結果。
1. 固定一組 LLM 與腳本。先穩定文案生成,再調整視覺模型。腳本文案不穩時,後續畫面與配音比較沒有基準。
2. 建立供應商矩陣。以同一段腳本測 DashScope、OpenAI、ARK、Kling、ComfyUI 與 RunningHub。記錄成本、速度、失敗率與畫面一致性。
3. 自訂模板前綴。依 README 的模板分類維持 static_、image_、video_ 前綴,並用同一組素材測直式與橫式版型。
4. 導入圖生影片與數位人。README 的更新紀錄列出 Digital Human、Image-to-Video 與 Motion Transfer。先用短片段驗證工作流,再導入正式素材。
5. 將輸出納入審核清單。正式發布前檢查腳本文案、聲音、素材授權、字幕、商標、人物肖像與平台內容政策。
① README.md 與 README_EN.md:功能、流程、WebUI 與 FAQ。
② latest release:Windows 整合包與 release notes。
③ pyproject.toml:Python 版本、依賴與 package metadata。
④ workflows/、templates/、config.example.yaml:workflow、模板與設定範例。