新闻详情

新闻详情

首页 / 资讯中心 / 详情

Pixelle-Video 快速上手指南:从主题输入到 AI 短视频生成的完整实践

发布时间:2026/9/11 8:28:33来源:尧图网络
Pixelle-Video 快速上手指南:从主题输入到 AI 短视频生成的完整实践
Pixelle-Video 快速上手指南从主题输入到 AI 短视频生成的完整实践【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video本指南以 Pixelle-Video 的官方英文首页文档docs/en/index.md为核心骨架结合仓库内的 README.md、config.example.yaml 以及pixelle_video/下的核心源码实现系统讲解这个 AI 全自动短视频引擎的项目定位、核心能力、三种部署与成本方案、以及输入主题 → 自动产出成片的完整使用流程。读完本文你将掌握如何从零安装并配置 Pixelle-Video、理解其模块化的视频生成流水线并能独立生成第一条短视频。项目概览把短视频创作变成一句话的事Pixelle-Video 是一款 AI 全自动短视频生成引擎其设计理念在 docs/en/index.md 中表述得非常直接无需任何视频剪辑经验只需输入一个主题topic系统即可自动完成全部创作环节。官方将其定位为 AI Video Creator - Generate a short video in 3 minutes即约三分钟内产出一条完整短视频。输入主题后Pixelle-Video 会自动完成以下五个环节撰写视频文案Write video scripts由大语言模型根据主题创作解说词生成 AI 配图Generate AI images为每一句解说词生成对应的 AI 插图合成语音解说Synthesize voice narration通过 TTS 将文案转为语音添加背景音乐Add background music为视频叠加 BGM 增强氛围合成最终视频Create the final video将分镜画面、配音、配乐合成为成品视频。从代码层面看这一一句话成片的能力由服务层与流水线层共同支撑。service.py 中的PixelleVideoCore作为统一服务入口聚合了llm文案生成、tts语音合成、media图片/视频素材生成、video视频合成等核心服务而 pipelines/base.py 定义了流水线的抽象基类BasePipeline具体流程则由 pipelines/standard.py 中的StandardPipeline实现——其工作流注释清晰列出了生成/确定标题 → 生成解说词 → 为每句解说词生成图像提示词 → 逐帧处理TTS 音频 图片 模板合成 视频片段→ 拼接所有片段 → 可选叠加 BGM。功能亮点与差异化能力结合 docs/en/index.md 的 Features 章节与 README.md 的功能清单Pixelle-Video 的核心特性可归纳为以下几点全自动生成输入主题即可得到完整视频全流程无需人工剪辑AI 智能文案根据主题自动创作解说词无需自行写脚本AI 生成配图/视频每句话配一句 AI 插图同时支持使用 AI 视频生成模型如 WAN 2.1产出动态视频内容AI 语音合成支持 Edge-TTS、Index-TTS 等主流 TTS 方案config.example.yaml与 schema.py 显示本地 Edge-TTS 默认音色为zh-CN-YunjianNeural语速默认 1.2取值范围 0.5–2.0背景音乐支持内置音乐与自定义 BGM视觉风格模板提供多套 HTML 模板覆盖竖屏1080x1920、横屏1920x1080、方形1080x1080等尺寸多种 AI 模型LLM 侧支持 GPT、通义千问、DeepSeek、Ollama 等llm_presets.py 中预置了 Qwen、OpenAI、Claude、DeepSeek、Ollama、Moonshot 六套预设全部兼容 OpenAI SDK 协议灵活组合的原子能力基于 ComfyUI 架构既可使用预置工作流也可直连 DashScope、OpenAI、Seedream、Seedance、Kling 等图像/视频生成 API按需替换图像、视频、TTS、VLM 等能力。需要特别说明的是docs/en/index.md中的 Video Examples视频示例章节目前标注为 Coming soon示例视频尚未挂载中文版 README.md 中则提供了数字人口播、图生视频、动作迁移、竖屏/横屏等实际生成案例的展示可供了解输出效果。快速开始三步完成第一条视频官方文档给出的快速开始路径非常清晰共三步安装 Pixelle-Video—— 见安装指南配置服务—— 见配置指南配置 LLM 与图像生成服务创建第一条视频—— 见快速上手。安装Windows 整合包与源码安装根据 安装指南 与 README.md安装方式分两条路线路线一Windows 一键整合包推荐 Windows 用户无需安装 Python、uv 或 ffmpeg下载最新整合包解压后双击start.bat即可启动 Web 界面浏览器自动打开http://localhost:8501。首次使用只需在「⚙️ 系统配置」中填入 API Key。仓库中 packaging/windows/templates/start.bat 与 packaging/windows/README.md 提供了整合包的结构说明。路线二从源码安装适合 macOS/Linux 或需要自定义的用户前置依赖为 Python 3.10、包管理器uv或 pip以及视频处理工具 ffmpeg。安装步骤git clone 项目仓库地址 cd Pixelle-Video # 使用 uv推荐自动创建虚拟环境并安装依赖 uv sync # 启动 Web 界面 uv run streamlit run web/app.py若使用 pippython -m venv venv # Windows: venv\Scripts\activate | macOS/Linux: source venv/bin/activate pip install -e . streamlit run web/app.py可选本地部署 ComfyUI。如果希望图片生成完全在本地运行可自行安装 ComfyUI默认运行在http://127.0.0.1:8188。ComfyUI 需要下载模型文件才能工作具体模型配置请参考 ComfyUI 官方文档。配置LLM 与图像/视频生成服务根据配置指南安装完成后需要配置两类核心服务。1. LLM 配置用于生成视频文案支持从下拉菜单快速选择预设模型通义千问、GPT-4o、DeepSeek、Ollama 等选择后系统会自动填充base_url与model再填入 API Key 即可。config.example.yaml中给出了典型预设值# Qwen Max: base_url: https://dashscope.aliyuncs.com/compatible-mode/v1 model: qwen-max # OpenAI GPT-4o: base_url: https://api.openai.com/v1 model: gpt-4o # DeepSeek: base_url: https://api.deepseek.com model: deepseek-chat # Ollama (Local): base_url: http://localhost:11434/v1 model: llama3.2配置文件对应的完整结构如下详见 config.example.yamlproject_name: Pixelle-Video llm: api_key: base_url: model: comfyui: comfyui_url: http://127.0.0.1:8188 # 本地 ComfyUI 地址selfhost 工作流必需 comfyui_api_key: # 可选来自 Comfy Platform runninghub_api_key: # RunningHub 云端工作流必需 runninghub_concurrent_limit: 1 # RunningHub 并发上限1-10普通会员默认 1 tts: default_workflow: selfhost/tts_edge.json image: default_workflow: runninghub/image_flux.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style video: default_workflow: runninghub/video_wan2.1_fusionx.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style template: default_template: 1080x1920/image_default.html配置的底层校验逻辑可参见 config/schema.pyis_llm_configured()要求api_key、base_url、model三者均非空才算 LLM 配置完成而validate_required()仅以 LLM 是否配置作为必需项判定——这意味着即使暂时没有图像服务只要 LLM 可用项目也能启动。2. 图像/视频生成配置两种方案本地部署填写 ComfyUI URL默认http://127.0.0.1:8188点击测试连接验证可选填 ComfyUI API Key。云端部署官方推荐无 GPU 用户注册 RunningHub 并填入 API Key高级选项包括并发上限1–10普通会员默认 1与实例类型可选 24GB 或 48GB 显存机型48GB 用于大规模视频生成。从源码看ComfyUI 与 RunningHub 的切换是动态的。service.py 中_get_or_create_comfykit()采用懒加载 配置哈希变更检测机制当配置发生变化时自动重建 ComfyKit 实例因此修改 ComfyUI/RunningHub 配置后无需重启服务即可生效。而 pipelines/standard.py 显示当使用runninghub/前缀的工作流且并发上限大于 1 时分镜处理会走asyncio.Semaphore控制的并行处理路径。创建第一条视频从主题到成片的完整流程根据快速上手启动 Web 界面http://localhost:8501后按以下步骤操作Step 1检查配置。展开「⚙️ 系统配置」确认 LLM 与图像配置已完成并点击保存配置配置会写入config.yaml。Step 2输入主题。在左侧「 内容输入」面板选择「AI 生成内容」模式输入主题例如Why develop a reading habit可选设置分镜数量场景数默认 5 帧。官方还提供了其他示例主题如何提升工作效率、健康饮食的重要性、旅行的意义等。若已有现成文案可选择「固定文案内容」模式跳过 AI 创作直接输入完整文案。Step 3配置语音与视觉。中间栏中语音设置选择 TTS 工作流默认 Edge-TTS 即可良好工作如需声音克隆上传参考音频MP3/WAV/FLAC适用于支持克隆的 TTS 工作流如 Index-TTS支持输入测试文本点击预览语音试听。视觉设置选择图像生成工作流设置图像尺寸默认 1024x1024注意不同模型对尺寸限制不同填写提示词前缀控制整体风格需为英文选择视频模板官方推荐竖屏 1080x1920。Step 4生成视频。点击右侧「 生成视频」按钮界面实时显示进度生成文案 → 生成配图 → 合成语音 → 合成视频。根据官方说明生成一个 5 分镜视频约需 2–5 分钟耗时取决于 LLM API 响应速度、图像生成速度、TTS 工作流类型与网络状况。这一阶段对应StandardPipeline的八个步骤pipelines/standard.py环境准备与任务目录创建 → 生成/切分解说词 → 确定标题 → 生成图像提示词 → 初始化 Storyboard → 逐帧产出素材音频图片模板渲染视频片段→ 拼接与 BGM 合成 → 结果返回与元数据持久化。进度事件通过progress_callback上报见 pipelines/base.py这正是 Web 界面实时进度条的数据来源。Step 5预览视频。生成完成后右侧自动播放展示视频时长、文件大小、分镜数、分辨率等信息成品保存在output/文件夹。成本方案从 0 元到云端docs/en/index.md 的 Pricing 章节给出了三档成本方案官方明确声明完全免费运行方案LLM图像生成成本适用场景完全免费方案Ollama本地本地 ComfyUI0 元有本地 GPU官方建议 NVIDIA 6GB 显存的用户推荐方案通义千问Qwen本地 ComfyUI每个 3 分镜视频约 $0.01–0.05追求性价比、无本地显存压力云端方案OpenAIRunningHub费用较高但无需本地环境无本地 GPU、不愿搭建环境的用户官方建议本地有显卡优先选择完全免费方案否则推荐通义千问以获得最佳性价比。需要注意的是定价中的费用估算来自官方文档描述实际费用会随模型定价与用量波动。模板体系与自定义扩展模板决定视频画面的布局与设计全部为 HTML 文件位于 templates/ 目录。命名规范见 config.example.yaml 与 README.mdstatic_*.html静态模板无需 AI 生成媒体纯文字样式生成快、成本低、不依赖 ComfyUIimage_*.html图片模板以 AI 生成的图片作为背景video_*.html视频模板以 AI 生成的视频作为背景。仓库已内置竖屏1080x1920、横屏1920x1080、方形1080x1080三类共三十余套模板如image_default.html、image_modern.html、image_elegant.html、image_film.html、image_minimal_framed.html等模板效果图可参考 docs/images 目录下的对应预览图。StandardPipeline.plan_visuals()pipelines/standard.py会根据模板类型自动判断是否需要走媒体生成流水线静态模板会直接跳过图像提示词生成与素材生成节省对应的 LLM 调用与媒体生成开销。工作流方面workflows/ 目录分为runninghub/云端与selfhost/本地两组覆盖图像生成image_flux、image_qwen、image_sdxl 等、视频生成video_wan2.1_fusionx、video_wan2.2 等、TTStts_edge、tts_index2、tts_spark、图像/视频分析等原子能力。理解 ComfyUI 的用户可将自定义工作流放入workflows/文件夹也可在 templates/ 中创建自己的 HTML 模板。许可与致谢Pixelle-Video 采用Apache License 2.0开源许可详见仓库根目录 LICENSE。项目设计受到 Pixelle-MCPComfyUI MCP 服务器、MoneyPrinterTurbo、NarratoAI、MoneyPrinterPlus、ComfyKit 等优秀开源项目的启发见 docs/en/index.md 的 Acknowledgments 章节。结语从 docs/en/index.md 所定义的定位出发Pixelle-Video 的核心价值在于把写文案、配图、配音、配乐、合成整条短视频生产线抽象为一条可配置、可扩展的自动化流水线。无论你选择本地 0 元方案还是云端快速方案只需三步即可完成安装配置并生成第一条视频。后续若希望深入了解可继续阅读仓库中的安装指南、配置指南、快速上手以及 API 使用指南、模板开发指南 等进阶文档。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Starship 常见问题权威解答:跨 Shell 原理、调试排查与配置实战指南 2026/9/11 11:47:10

Starship 常见问题权威解答:跨 Shell 原理、调试排查与配置实战指南

Starship 常见问题权威解答:跨 Shell 原理、调试排查与配置实战指南 【免费下载链接】starship ☄🌌️ The minimal, blazing-fast, and infinitely customizable prompt for any shell! 项目地址: https://gitcode.com/GitHub_Trending/st/starship …

阅读更多 →
磁盘空间管理机制与文件系统优化实践 2026/9/11 11:47:10

磁盘空间管理机制与文件系统优化实践

1. 磁盘空间管理机制的核心价值当你在Windows系统里收到"磁盘空间不足"的红色警告,或是Linux服务器上发现/var分区被日志文件塞爆时,背后起作用的正是操作系统的磁盘空间管理机制。这套机制就像图书馆的管理员,不仅要记录哪些书架格…

阅读更多 →
Prompt提示词工程实战指南:从底层原理到高效模板,让AI输出真正可用 2026/9/11 11:47:10

Prompt提示词工程实战指南:从底层原理到高效模板,让AI输出真正可用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
大学生成长指南:从学习到职业规划的全面建议 2026/9/11 11:47:10

大学生成长指南:从学习到职业规划的全面建议

1. 写给大一新生的成长指南 刚踏入大学校园时那种既兴奋又迷茫的感觉,至今记忆犹新。作为过来人,我想对当初那个站在人生新起点的自己说些话——这些话或许也能给正在阅读的你一些启发。 大学四年是人生中极为特殊的阶段,它既不像高中那样被…

阅读更多 →
Folly 的 Critic-iterate 工作流:作者-评论者循环下的写作、代码与设计质量收敛机制 2026/9/11 11:47:10

Folly 的 Critic-iterate 工作流:作者-评论者循环下的写作、代码与设计质量收敛机制

Folly 的 Critic-iterate 工作流:作者-评论者循环下的写作、代码与设计质量收敛机制 【免费下载链接】folly An open-source C library developed and used at Facebook. 项目地址: https://gitcode.com/GitHub_Trending/fol/folly 导读 critic-iterate 是 …

阅读更多 →
Duix.Avatar Linux部署实操:三步在本地跑起数字人视频 2026/9/11 11:44:10

Duix.Avatar Linux部署实操:三步在本地跑起数字人视频

Duix.Avatar Linux部署实操:三步在本地跑起数字人视频 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Trendi…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞