新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何用Duix.Avatar实现离线AI数字人视频生成:30分钟本地部署实操手册

发布时间:2026/9/11 13:26:31来源:尧图网络
如何用Duix.Avatar实现离线AI数字人视频生成:30分钟本地部署实操手册
如何用Duix.Avatar实现离线AI数字人视频生成30分钟本地部署实操手册【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar是一款开源的离线AI数字人工具提交一段10秒视频就能克隆你的形象和声音输入文字或上传音频即可生成口播视频。如果你想在自己的电脑上跑一套完全本地运行的数字人视频系统这篇手册带你从装环境到生成第一条视频。 3 分钟快速验证先走一遍最短路径确认你的机器能跑起来再慢慢补齐细节。打开终端执行nvidia-smi能看到显卡信息才说明英伟达驱动装好了可以继续。执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar获取项目代码。进入项目下的 deploy 目录执行docker-compose up -d让 Docker 自动拉取三个服务镜像。首次拉取约消耗 70G 流量耗时半小时左右建议连 WiFi 耐心等待。执行docker ps看到三个服务都是 Running 状态服务端就起来了。再安装官方客户端启动首页出现创建视频 / 创建数字人入口即部署成功。⚙️ 环境与前置条件项目最低要求推荐配置系统Windows 10 19042 或更高 / Ubuntu 22.04Windows 11 / Ubuntu 22.04CPU近年六核以上i5-13400F内存32G16G 可能无法启动服务32G 及以上显卡英伟达显卡且已装驱动RTX 4070磁盘100G 空闲存镜像Windows 另需 D 盘 30G 存放数据NVMe SSD安装之前要知道的坑硬性限制必须是英伟达显卡且驱动装对。本项目所有算力都在本机没有显卡三个核心服务根本起不来。 Windows 下需先装好 WSL2 才能使用 Docker DesktopUbuntu 下要额外安装 NVIDIA Container Toolkit否则容器用不到显卡。 镜像下载体积大约 70G网络差的话先配好 Docker 镜像源再执行拉取方法见文末常见问题。完整搭建流程安装 Docker 并确认显卡Windows 系统执行wsl --list --verbose查看是否装过 WSL没有就执行wsl --install失败多试几次。安装完成后执行wsl --update更新 WSL 内核。下载 Docker Desktop Windows 版安装按你的 CPU 架构选对应安装包。首次启动时接受用户协议并跳过登录。C 盘空闲不足 100G 时进设置 - Resources - Advanced把磁盘镜像位置 Browse 到其他盘。Ubuntu 系统执行sudo apt install docker.io docker-compose安装 Docker。安装英伟达显卡驱动用nvidia-smi验证能显示显卡信息。按官方文档安装 NVIDIA Container Toolkit 并配置 docker 运行时。获取项目并启动服务端终端执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar。进入项目的deploy目录compose 文件就在这里面。执行docker-compose up -d启动完整三服务ASR 语音识别、TTS 语音合成、视频合成。显存或空间紧张可以跑精简版只启动视频合成一个服务docker-compose -f docker-compose-lite.yml up -d。英伟达 50 系显卡如 5090改用docker-compose -f docker-compose-5090.yml up -d。验证三个服务已启动执行docker ps三个服务都应是 Running 状态。点开任一服务进入 Logs 标签页看启动日志右侧的复制按钮方便导出日志排查问题时会用到。安装并打开客户端下载官方构建的安装包Windows 是 exe 安装程序Ubuntu 是 AppImage。Windows 双击安装即可Ubuntu 双击 AppImage 直接启动。Ubuntu 若以 root 用户进桌面双击可能打不开在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox启动。打开后首页应出现创建视频和创建数字人两个入口出现连接错误就回到上一步确认三个容器是否在运行。核心功能实操克隆你自己的数字人创建模型你要做什么做一个长着你的脸、用你的声音说话的模型。具体怎么操作首页点击创建数字人。上传一段 10-15 秒的正面视频人占画面主体光照均匀、面部无遮挡。注意视频里必须有人在说话这段声音会被用来做声音克隆录 10 秒它就能模仿你说话。提交后系统自动分离音轨、做语音识别并生成模型耐心等进度跑完。预期看到什么My Avatars 列表里出现一张带你的名字和头像的模型卡片点击可以看到模型详情。用一段文字生成口播视频你要做什么输入文案让数字人开口念出来。具体怎么操作首页点击创建视频选中刚建好的数字人模型。输入要播报的文本内容也可以直接上传自己的录音文件。在高级设置里按需调整语速等参数。点击生成等待语音合成与口型匹配完成。预期看到什么得到一条口型与语音同步的口播视频在首页我的作品里可以预览、下载或删除。用自己的录音驱动数字人你要做什么不想打字直接用现成的录音。具体怎么操作在创建视频页选择上传音频的方式选中本地音频文件模型保持不变提交生成。预期看到什么成片里的语气、节奏和口型都以你的录音为准适合已经录好稿子的场景。进阶与扩展Docker 服务端启动后会在本地暴露几个端口你可以通过 API 调用数字人能力接到自己的工作流里批量出片。接口地址用途模特预处理POST 127.0.0.1:18180/v1/preprocess_and_tran用样本音频提取语音参考信息参数含 format、reference_audio、lang音频合成POST 127.0.0.1:18180/v1/invoke用克隆的声音合成新文本返回音频文件视频合成POST 127.0.0.1:8383/easy/submit音频加模特视频合成成片需提供 audio_url、video_url 和唯一 code进度查询GET 127.0.0.1:8383/easy/query?code任务code查询合成任务进度和结果音频合成时大多参数是固定值关键在于把上一步预处理返回的 reference_audio 和 reference_text 透传过去。完整调用示例可以参考源码 src/main/service/video.js具体端口和参数以项目实际文档为准。❓ 高频问题速查1.docker-compose up -d拉镜像失败报连接超时原因Docker Hub 官方源连接不稳定。解法在 Docker 设置 - Docker Engine 的 JSON 配置里添加 registry-mirrors 镜像源保存并重启。2. 新增模特时报错提示视频无有效音频原因创建模特的视频必须有人在说话声音是克隆的原料。解法重录一段 10 秒左右的正面讲话视频。3. 定制模特报 Connection refused原因ASR 服务启动比较慢内存太小如 16G时可能起不来。解法服务启动后等几分钟再操作内存升级到 32G。4. 三个服务始终无法启动原因没有英伟达显卡或驱动没装对。解法装好驱动nvidia-smi能显示信息后再重启容器。5. 报错不知道去哪看日志客户端右上角设置里点Open client log能直接打开日志文件。服务端在容器 Logs 标签页查看比如 TTS 日志里出现 file not exists一般就是音频文件路径没对齐。更多报错案例见仓库里的常见问题文档。至此你已能在电脑上用 10 秒视频克隆自己并生成离线口播视频更多细节查阅仓库文档与项目社区。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ArcGIS栅格插值方法解析与实战优化技巧 2026/9/11 14:11:42

ArcGIS栅格插值方法解析与实战优化技巧

1. 项目概述栅格插值是地理信息系统(GIS)中最基础也最强大的空间分析工具之一。作为ArcToolbox中3D Analyst模块的核心功能,它能够将离散的点数据转化为连续的表面模型,广泛应用于地形建模、环境监测、气象预测等领域。在实际工作…

阅读更多 →
四类主流监控与可观测架构的适用边界与落地差异 2026/9/11 14:11:42

四类主流监控与可观测架构的适用边界与落地差异

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
SVM降水预测实战:从气象特征工程到轻量化部署 2026/9/11 14:11:42

SVM降水预测实战:从气象特征工程到轻量化部署

简介:本资源是一套基于SVM支持向量机算法的降水量预测建模代码实现,面向气象数据分析初学者、机器学习实践者及高校相关课程设计学生,聚焦于将经典监督学习方法应用于实际气象回归任务。压缩包共54个文件,涵盖26个MATLAB源码&…

阅读更多 →
Immich 识别出大量误检的非人脸怎么减少 2026/9/11 14:11:42

Immich 识别出大量误检的非人脸怎么减少

Immich 识别出大量误检的非人脸怎么减少 【免费下载链接】immich High performance self-hosted photo and video management solution. 项目地址: https://gitcode.com/GitHub_Trending/im/immich 用 Immich 管理照片一段时间后,Explore 页的"人物&quo…

阅读更多 →
专科生必学8款AI工具,提升就业竞争力 2026/9/11 14:11:42

专科生必学8款AI工具,提升就业竞争力

1. 专科生如何应对AI时代的工具选择困境2026年的就业市场对专科生提出了全新挑战——AI工具正在重塑几乎所有行业的岗位需求。作为从业多年的职业教育顾问,我亲眼见证了大量专科生因为不会使用AI工具而在求职中处于劣势。但更糟糕的是,许多学生盲目跟风使…

阅读更多 →
SerenityOS 用户管理实战:usermod 命令详解与底层实现 2026/9/11 14:08:41

SerenityOS 用户管理实战:usermod 命令详解与底层实现

SerenityOS 用户管理实战:usermod 命令详解与底层实现 【免费下载链接】serenity The Serenity Operating System 🐞 项目地址: https://gitcode.com/GitHub_Trending/se/serenity usermod 是 SerenityOS 系统中用于修改既有用户账户的核心命令行…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞