新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何跑通 SadTalker:音频驱动面部动画的完整部署与配置指南

发布时间:2026/9/12 12:00:01来源:尧图网络
如何跑通 SadTalker:音频驱动面部动画的完整部署与配置指南
如何跑通 SadTalker音频驱动面部动画的完整部署与配置指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个音频驱动面部动画模型给它一张人脸照片加一段音频它就能生成口型、表情和头部动作都自然的说话视频。这份指南按你实际操作顺序展开先自检硬件再搭干净环境把模型文件落到正确位置最后二选一GPU/CPU跑出第一段视频常用报错做成速查问答。动手前先检查你的硬件组件最低线推荐GPU无可走 CPU 路线NVIDIA GPU4GB 显存起步显卡驱动支持 CUDA 11.3 即可torch 1.12.1 自带 CUDA 运行时无需单独装 CUDA 工具包新版驱动内存8GB16GB空闲磁盘10GB模型约 4GB Python 环境20GBPython3.83.8依赖版本均按 3.8 锁定装错版本容易触发编译报错系统Windows 10 / Ubuntu 18.04 / macOS 10.15Ubuntu 20.04低于这条线会怎样没有 NVIDIA 显卡能跑但一段音频要等几分钟4GB 显存开 512 分辨率加增强会紧张可降回 256内存不足 8GB 时进程可能被系统直接杀掉。从零搭一个干净环境先拿到代码git clone https://gitcode.com/GitHub_Trending/sa/SadTalker # 拉取项目代码 cd SadTalkerLinux / macOS依赖 conda没有就先装 Anacondaconda create -n sadtalker python3.8 # 创建 3.8 隔离环境避免污染其他项目 conda activate sadtalker # 激活环境 pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 # 先装 PyTorchwheel 需按 CUDA 版本挑选requirements.txt 里故意不含 torch conda install ffmpeg # 安装系统级视频处理工具SadTalker 输出视频靠它 pip install -r requirements.txt # 一次装齐其余依赖face_alignment、librosa、gfpgan、gradio 等WindowsPowerShell用虚拟环境即可python -m venv .venv :: 创建隔离环境需先装 Python 3.8勾选 Add to PATH .venv\Scripts\activate :: 激活环境 pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 pip install -r requirements.txt scoop install ffmpeg :: 一条命令装 ffmpeg也可下官方二进制包后手动加入 PATH装完顺手验证一句python -c import torch; print(torch.__version__, torch.cuda.is_available())有显卡且驱动正常时第二个值应为True。把模型文件一次放到该在的位置代码和模型是分离的环境装好后模型还没落地。Linux / macOS 用户直接跑仓库自带的脚本bash scripts/download_models.sh # 自动创建 checkpoints/ 和 gfpgan/weights/下全部模型Windows 用户不用跑这个 bash 脚本从项目 Releases 页面找到模型下载源README 里列了 Google Drive / GitHub Releases / 百度云盘或找一台能跑脚本的机器下完后把checkpoints/和gfpgan/两个目录整体拷到 Windows 项目的同一层目录。放完之后长这样用ls -lh checkpoints gfpgan/weights核对checkpoints/ ├── SadTalker_V0.0.2_256.safetensors # 256 分辨率面部渲染模型打包版 ├── SadTalker_V0.0.2_512.safetensors # 512 分辨率面部渲染模型 ├── mapping_00229-model.pth.tar # 映射网络默认 crop 模式用 └── mapping_00109-model.pth.tar # 映射网络全身 full 模式用 gfpgan/weights/ ├── GFPGANv1.4.pth # 人脸增强权重 ├── alignment_WFLW_4HG.pth ├── detection_Resnet50_Final.pth └── parsing_parsenet.pth两条选择规则逻辑写在 src/utils/init_path.pycheckpoints/里只要存在.safetensors文件程序就走新版打包模型实际加载哪个由--size 256/512决定--preprocess full用mapping_00109其余模式用mapping_00229——四个文件都下全别挑着要。完整性一眼过两个.safetensors应为 1GB 量级两个mapping约几百 MB 量级且没有 0 字节文件。有缺就重跑一次脚本wget -nc支持断点续传不会重复下已完整的文件。按硬件二选一生成第一段视频 仓库自带示例音频和示例人像不传任何参数也能直接出片python inference.py # 默认吃内置示例素材结果输出到 results/时间戳.mp4换成自己的素材比如这张仓库示例人像python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/art_5.png \ --enhancer gfpgan # 叠加 gfpgan 人脸增强脸部更清晰按回车之后发生的事路线 A · GPU推荐inference.py默认自动检测 CUDA有卡就直接走 GPU1 分钟音频一般是几十秒量级。默认--size 256、--batch_size 2即可8GB 以上显存可提到--size 512 --batch_size 4。路线 B · CPU先换装 CPU 版 PyTorch再跑命令时加--cpupip install torch1.12.1cpu torchvision0.13.1cpu torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cpu python inference.py --cpu --batch_size 1 --size 256 --driven_audio 音频 --source_image 图片CPU 是分钟级速度--enhancer增强同样很慢首跑建议先关掉音频也别超过 1 分钟。报错自救原文 → 原因 → 一条命令ffmpeg is not recognized as an internal or external command原因ffmpeg 没装或不在 PATH。 解决Linuxconda install ffmpegmacOSbrew install ffmpegWindowsscoop install ffmpeg并确认bin目录在%PATH%里。FileNotFoundError: ... checkpoints\BFM_Fitting\similarity_Lm3D_all.mat原因模型没下全或目录放错位置。 解决在项目根目录跑bash scripts/download_models.sh确认checkpoints/与inference.py同级。RuntimeError: unexpected EOF, expected ... more bytes. The file might be corrupted.原因某个模型文件下载中断、内容不完整。 解决重跑下载脚本断点续传仍报就删掉该文件重新下载。ModuleNotFoundError: No module named ai原因旧版epoch_20.pth检查点文件损坏。 解决重新下载 checkpoints 目录并核对文件大小。RuntimeError: CUDA out of memory原因显存不够常见于 512 分辨率 增强 大 batch 组合。 解决设置环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Linux/macOS 用exportWindows 用set同时把参数降为--batch_size 1 --size 256。Error while decoding stream #0:0: Invalid data found when processing input原因音频格式不支持只收 wav / mp3。 解决ffmpeg -i 原始文件 -ar 16000 -ac 1 out.wav先转码。Illegal HardwareApple Silicon原因dlib 架构不匹配。 解决pip uninstall dlib后pip install dlib重装。更多情况可翻仓库自带的 FAQ。跑通之后往哪走下一步试全身动画加--preprocess full --still --enhancer gfpgan参数含义、ref 模式、自由视角等玩法都在 最佳实践文档 里想要鼠标操作就跑bash webui.sh打开 WebUI。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于 InternLM 与 LangChain 搭建本地知识库助手:从向量库构建到 Gradio Web Demo 全流程实战 2026/9/12 12:36:06

基于 InternLM 与 LangChain 搭建本地知识库助手:从向量库构建到 Gradio Web Demo 全流程实战

基于 InternLM 与 LangChain 搭建本地知识库助手:从向量库构建到 Gradio Web Demo 全流程实战 【免费下载链接】self-llm 《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调(全参数/Lora)、部署国内外开源大模型&#xff0…

阅读更多 →
SpringSecurity与JWT实现安全认证的最佳实践 2026/9/12 12:36:06

SpringSecurity与JWT实现安全认证的最佳实践

1. 为什么需要SpringSecurity与JWT的权限认证组合 在现代Web应用开发中,认证(Authentication)和授权(Authorization)是两个核心的安全需求。SpringSecurity作为Spring生态中的安全框架,提供了强大的认证和授权能力,而JWT(JSON Web Token)则是…

阅读更多 →
纯电动汽车前向仿真Simulink模型解析与参数调优 2026/9/12 12:36:06

纯电动汽车前向仿真Simulink模型解析与参数调优

简介:针对纯电动汽车动力系统建模与仿真需求,这份完整版Matlab/Simulink模型以电池模型和电机模型为核心,并内置前向仿真框架,面向整车性能分析、控制策略优化及系统集成等应用场景,尤其适合汽车工程专业师生、电驱动系…

阅读更多 →
数据仓库调度完整指南:用DolphinScheduler 5分钟跑通ETL自动化 2026/9/12 12:36:06

数据仓库调度完整指南:用DolphinScheduler 5分钟跑通ETL自动化

数据仓库调度完整指南:用DolphinScheduler 5分钟跑通ETL自动化 【免费下载链接】dolphinscheduler Apache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code 项目地址: https://gitcode.co…

阅读更多 →
华为S5700链路聚合配置与优化实战 2026/9/12 12:36:06

华为S5700链路聚合配置与优化实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
AI全栈开发实战:技术选型、RAG、Agent与生产化全攻略 2026/9/12 12:33:05

AI全栈开发实战:技术选型、RAG、Agent与生产化全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞