新闻详情

新闻详情

首页 / 资讯中心 / 详情

Duix.Avatar 开源数字人本地部署完整教程:用 10 秒视频克隆数字人,离线生成口播视频

发布时间:2026/9/20 22:24:27来源:尧图网络
Duix.Avatar 开源数字人本地部署完整教程:用 10 秒视频克隆数字人,离线生成口播视频
Duix.Avatar 开源数字人本地部署完整教程用 10 秒视频克隆数字人离线生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想做口播视频却不想真人出镜也不想把人脸、声音素材传到任何云平台Duix.Avatar 是一款开源的 AI 数字人数字分身工具包你只需提交一段 10 秒左右的视频就能在本地完成数字人形象和声音克隆输入文案即可自动生成口型匹配的口播视频。整个流程完全离线数据不出你的电脑。这篇教程会陪你从环境自检一路走到第一条视频产出并附上避坑对照表。要点速览核心关键词AI 数字人、本地部署、离线视频生成、数字人克隆、口播视频长尾关键词10 秒视频克隆、Docker 部署数字人、数字人避坑、数字人 API 二次开发你将学到Windows / Ubuntu 两套环境的环境自检清单镜像加速到一键启动的完整部署命令界面导览与定制模特 → 合成视频的完整操作路径三个本地服务的分工原理含术语解释常见报错的排查顺序与硬件档位参考动手前环境自检与硬件要求部署前先花两分钟核对下面两张清单任何一项不满足都会让后续服务起不来。Windows 平台清单检查项要求系统版本Windows 10 19042.1526 或更高版本C 盘空间空闲大于 100GB存放 Docker 镜像文件D 盘空间必须有 D 盘空闲大于 30GB存放数字人、作品数据推荐配置i5-13400F / 32GB 内存 / RTX 4070显卡驱动必须有 NVIDIA 显卡且驱动安装正确硬性要求Ubuntu 平台清单检查项要求系统版本Ubuntu 22.04 Desktop官方验证内核 6.8.0-52-generic其他 Linux 版本未做兼容测试磁盘空间空闲大于 100GB推荐配置与 Windows 相同i5-13400F / 32GB / RTX 4070显卡驱动NVIDIA 驱动 用nvidia-smi能正常显示显卡信息为什么显卡是硬性要求这个项目的所有算力都在本地三个 Docker 服务都依赖 NVIDIA GPU没有 NVIDIA 显卡或驱动服务直接启动不了。驱动请到 NVIDIA 官网查找并下载对应型号的版本装完执行nvidia-smi看到显卡信息即算通过。快速部署从环境准备到客户端连接第一步装好 Docker 运行环境WindowsDocker Desktop 依赖 WSL 运行所以先装 WSL 再装 Docker。wsl --list --verbose # 查看是否已装过 WSL没有再执行 wsl --install wsl --update # 安装成功后更新 WSL网络原因可能导致wsl --install失败多试几次即可安装过程中会要求设置新的用户名和密码请设置并记住。之后下载 Docker Windows 版安装包按 CPU 架构选择安装后启动 Docker Desktop首次运行接受协议并跳过登录。Ubuntu先执行docker --version检查是否已装 Docker没有的话执行sudo apt update sudo apt install docker.io sudo apt install docker-composeDocker 要能调用显卡还需安装 NVIDIA Container Toolkit并配置 Docker 使用 NVIDIA 运行时sudo apt-get install -y nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker为什么要装 Toolkit它是 Docker 使用 NVIDIA GPU 的必要组件缺了它容器内的模型服务拿不到显卡算力。第二步镜像加速与存储优化拉镜像会消耗约70GB 流量国内网络直接连官方源经常超时。这一步的目的是让下载不卡死、存得下Ubuntu编辑/etc/docker/daemon.json添加registry-mirrors字段填入可用的国内镜像源镜像源会随时间失效建议自行搜索最新可用的保存后重启 Docker 服务。Windows如果 C 盘不足 100GB安装完 Docker 后可以在 Docker Desktop 的资源设置里把镜像存储位置改到剩余空间大于 100GB 的其他磁盘目录。第三步一键启动服务端先克隆仓库再进入deploy目录启动。deploy目录下有四个 compose 文件按需求选一个文件适用场景启动后服务数docker-compose.ymlWindows 完整版TTS ASR 视频合成3 个docker-compose-lite.ymlWindows 轻量版仅视频生成1 个docker-compose-linux.ymlUbuntu 完整版3 个docker-compose-5090.ymlNVIDIA 50 系显卡5090 测试通过30/40 系 CUDA 12.8 也可用3 个git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy # Windows 完整版 docker-compose up -d # Windows 轻量版 docker-compose -f docker-compose-lite.yml up -d # Ubuntu 完整版 docker-compose -f docker-compose-linux.yml up -d # 50 系显卡方案 docker-compose -f docker-compose-5090.yml up -d预期结果等待约半小时取决于网速打开 Docker 看到三个服务均为 Running 状态即成功轻量版只有Duix.Avatar-gen-video一个服务。三个服务会占用这些本地端口后面调用 API 会用到服务镜像端口语音合成 TTSguiji2025/fish-speech-ziming18180语音识别 ASRguiji2025/fun-asr10095视频合成guiji2025/duix.avatar8383第四步安装客户端并连接Windows从项目 Release 页下载官方安装包双击Duix.Avatar-x.x.x-setup.exe安装启动后自动检测本地服务状态。Ubuntu下载 Linux 版 AppImage双击Duix.Avatar-x.x.x.AppImage即可运行无需安装。注意root 用户下双击可能无法运行需要在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox。上手体验界面导览与第一条视频打开客户端后首页分两个主要功能区短视频制作Create Video入口创建视频用文字或音频驱动数字人说话产出口播视频快速定制模特Create Avatar入口快速定制上传一段视频克隆出你的专属数字模特页面下方是两个管理区我的作品已生成的视频列表可预览、下载和我的数字模特已克隆的模特库可预览、直接做视频。完成一次完整生成的操作路径第 1 步定制模特。点击快速定制上传拍摄好的原始视频。上传前按界面里的标准示例自查五条规则缺一不可视频时长最少 8 秒说话吐字清晰视频前后有且只有同一个人五官清晰不遮挡头部不倾斜或侧向手不挡脸分辨率最低 720P格式为 MP4 / MOV提交后模特进入训练中状态等训练完成即可出现在我的数字模特列表里。第 2 步创建视频。在创建视频流程里选择刚定制的模特然后二选一文本合成直接输入文案支持中英文系统自动转成克隆的语音音频合成上传自己的录音单次最多 1 个文件支持 mp3、wav、flac、m4a单个录音时长小于 30 分钟请传纯干音背景音、噪音会影响合成效果给视频起个名字点击合成视频提交。第 3 步查看结果。去首页 → 我的作品查看进度状态从排队中变成可预览后即可在线预览或下载到本地。设置菜单里可以查看用户协议、打开客户端日志排障必备、在中英文之间切换界面语言。它是怎么实现的三个本地服务的分工你现在已经跑通了完整流程回头看一下背后发生了什么。克隆不是存一个头像而是三条本地服务流水线协作的结果拆解素材你上传的 10 秒视频被分离为静音视频 音频音频会按约定路径放入D:\duix_avatar_data\voice\dataWindows或~/duix_avatar_data/voice/dataLinuxASR 服务端口 10095把视频里的语音转写成文本。ASR 即 Automatic Speech Recognition自动语音识别基于开源的 FunASRTTS 服务端口 18180用你的声音样本克隆音色把新文案合成成你说话的音频。TTS 即 Text-to-Speech文本转语音基于 fish-speech视频合成服务端口 8383接收音频 原始视频做口型驱动让数字人按新音频的发音动嘴输出最终口播视频方案数据隐私网络依赖部署成本定制能力云端 SaaS 数字人人脸/声音素材需上传云端必须联网按使用量付费只能通过 API 调用Duix.Avatar 本地部署全流程本地处理完全离线一次性硬件投入源码可修改可二次开发另外客户端文案合成支持 8 种语言中、英、日、韩、法、德、阿拉伯语、西班牙语。如果你关心数据落盘位置可以查 src/main/config/config.js里面定义了 Windows 与 Linux 下的数据目录约定。场景落地三类典型用法教育培训批量课程口播视频痛点真人录制讲解视频一位讲师反复录、多语言版本成本更高且课程改版后要全部重录落地方式为讲师定制一个数字模特把课程讲义按章节拆成文本模板每章提交一次文本合成需要英文版时直接换语言输入无需重新录制效果同一位讲师可无限量次生成新视频改版只需改文案不再依赖真人档期电商与营销口播带货视频量产痛点促销、新品、多平台分发需要大量口播素材真人出镜拍摄排期紧、场地成本高落地方式用 10 秒视频克隆品牌数字人把商品卖点文案直接输入合成已有主播录音的走音频合成路径保留原声效果视频产出与拍摄档期解耦批量生成时数据全程留在本地素材不外传企业内部标准化培训与通知痛点内部培训、安全提示、制度宣导反复口口相传质量不统一员工离职后资料断档落地方式克隆一位内部讲师形象做固定数字导师把培训材料转成文本批量合成按部门批量产出效果培训视频风格统一、可随时更新且全程离线生成符合内部资料不外发的合规要求进阶API 接口与二次开发本节面向有 HTTP 调用基础的读者接口都在服务端启动后通过http://127.0.0.1本地调用。完整调用逻辑可参考 src/main/service/ 下的model.js、video.js、voice.js。① 模特训练音频预处理先把音频放到D:\duix_avatar_data\voice\data然后调用POST http://127.0.0.1:18180/v1/preprocess_and_tran { format: .wav, reference_audio: xxxxxx/xxxxx.wav, lang: zh }返回asr_format_audio_url和reference_audio_text两个字段记下来下一步要用。② 音频合成用克隆的声音读文案POST http://127.0.0.1:18180/v1/invoke { speaker: {uuid}, text: 需要合成的文本内容, format: wav, reference_audio: {上一步返回的 asr_format_audio_url}, reference_text: {上一步返回的 reference_audio_text}, topP: 0.7, max_new_tokens: 1024, chunk_length: 100, repetition_penalty: 1.2, temperature: 0.7, need_asr: false, streaming: false, is_fixed_seed: 0, is_norm: 0 }speaker传一个唯一 UUID 即可其余为固定参数照抄即可。③ 视频合成驱动数字人POST http://127.0.0.1:8383/easy/submit { audio_url: {音频路径}, video_url: {视频路径}, code: {uuid}, chaofen: 0, watermark_switch: 0, pn: 1 }④ 进度查询code用提交时的值GET http://127.0.0.1:8383/easy/query?code{code}避坑手册常见问题排查按下面顺序自查能覆盖大部分卡点1. 三个服务不是 Running 状态先执行nvidia-smi确认显卡和驱动正常——没有 NVIDIA 显卡或驱动服务一定起不来。其次确认服务端、客户端都是最新版本服务端到deploy目录重新执行docker-compose up -d客户端拉取最新代码重新构建。2.docker-compose up -d拉镜像超时Client.Timeout exceeded这是连不上 Docker Hub 官方源配置国内镜像源即可方法见上文镜像加速一节Windows 下也可在 Docker Desktop 里配置。3. 新增模特报错检查视频是否有声音且在说话。克隆需要用到视频里的声音无声视频或背景音乐主导的视频都会失败请重拍一段本人在自然说话的清晰视频。4. 定制模特报Connection refusedASR 服务启动较慢服务端刚启动完请稍等几分钟再做克隆操作另外机器内存太小如 16GB可能导致 ASR 起不来建议 32GB 起步。5. 生成结果或报错看不懂客户端日志在设置 → 打开日志里查看服务端日志在 Docker 服务列表里点开对应容器复制参考下图操作更多问题可以先翻 doc/常见问题.md项目更新频繁你的问题很可能已经在新版里解决了。硬件档位参考对照表硬件配置建议输出分辨率训练耗时参考生成速度参考RTX 4070 32GB 内存720P约 15 分钟约 1.2 倍实时RTX 4080 64GB 内存1080P约 10 分钟约 2.0 倍实时RTX 4090 128GB 内存1080P约 8 分钟约 3.5 倍实时显存吃紧时可关注deploy配置中的PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512等参数按社区讨论按需调整不要盲目照搬。收尾值不值得投入隐私人脸、声音、文案全程不出本机适合内部资料与合规敏感场景成本一次性硬件投入之后不限次数生成无按量订阅费门槛低10 秒视频即可完成克隆客户端图形界面操作非技术用户也能走完流程可扩展源码开放 本地 API可接进自己的业务系统局限要心里有数依赖 NVIDIA 显卡和 32GB 起步内存镜像下载约 70GB 流量首次部署需要耐心建议的行动步骤先按上文清单自检环境 → 用轻量版lite先跑通视频生成熟悉流程后再上完整版做克隆 → 第一次定制模特严格按标准示例拍素材能少踩一半坑。社区更新活跃遇到报错先查文档和最新版本也欢迎把部署经验与优化方案回馈给开源社区一起把这个数字人工具箱用得更好。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于PyTorch的猫狗图像分类:CNN模型训练与调优实践 2026/9/20 23:57:45

基于PyTorch的猫狗图像分类:CNN模型训练与调优实践

简介:基于PyTorch的猫狗二分类图像识别完整项目,面向深度学习与计算机视觉初学者、算法练习者及竞赛入门用户,提供从模型搭建、数据加载到训练评估的整套可运行代码。资源共647个文件,以604张猫狗jpg图片数据集为主体,…

阅读更多 →
Sails 动态内容国际化(Translating Dynamic Content)实战指南:从 JSON stringfile 到数据库驱动的多语言方案 2026/9/20 23:57:45

Sails 动态内容国际化(Translating Dynamic Content)实战指南:从 JSON stringfile 到数据库驱动的多语言方案

Sails 动态内容国际化(Translating Dynamic Content)实战指南:从 JSON stringfile 到数据库驱动的多语言方案 【免费下载链接】sails Realtime MVC Framework for Node.js 项目地址: https://gitcode.com/gh_mirrors/sa/sails 导读 当…

阅读更多 →
企业级AI Agent落地:如何打通知识库与数据库?开箱即用方案实践 2026/9/20 23:57:45

企业级AI Agent落地:如何打通知识库与数据库?开箱即用方案实践

作为一个常年折腾数据系统的人,我今年最大的感受是:身边问“AI Agent 到底怎么落地”的团队明显变多了,而且问到最后,几乎都会落到同一个具体场景——把内部知识库和业务数据库打通,让 AI 能直接回答业务问题、查询订单…

阅读更多 →
光谱预处理流水线:SNV、MSC与Savitzky-Golay工程实践指南 2026/9/20 23:57:45

光谱预处理流水线:SNV、MSC与Savitzky-Golay工程实践指南

简介:本资源是一套面向化学计量学与光谱分析初学者及科研人员的MATLAB预处理与建模实践工具包,聚焦红外、拉曼及高光谱数据的标准化、散射校正与定量建模全流程。资源完整覆盖SNV标准化、MSC多散射校正、Savitzky-Golay等平滑算法及PLS偏最小二乘回归建模…

阅读更多 →
Huff0 熵压缩:Go 语言下的 zstd 级 Huffman 编解码器实现与实战指南 2026/9/20 23:57:45

Huff0 熵压缩:Go 语言下的 zstd 级 Huffman 编解码器实现与实战指南

Huff0 熵压缩:Go 语言下的 zstd 级 Huffman 编解码器实现与实战指南 【免费下载链接】slim Slim(toolkit): Dont change anything in your container image and minify it by up to 30x (and for compiled languages even more) making it secure too! (free and op…

阅读更多 →
Python自动化达芬奇:DRX批量套用与H.264/H.265/ProRes渲染 2026/9/20 23:54:45

Python自动化达芬奇:DRX批量套用与H.264/H.265/ProRes渲染

简介:达芬奇Python脚本自动化工具包,定位于影视后期流程中的静帧LUT套用、批量转码输出及DRX文件批处理,面向剪辑师、调色师和有一定Python基础的技术人员,用于降低重复劳动、规范输出格式。压缩包共14个文件,包含3个P…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞