新闻详情

新闻详情

首页 / 资讯中心 / 详情

SadTalker上手指南:一张人像加一段音频生成会说话的人脸动画

发布时间:2026/9/12 14:48:24来源:尧图网络
SadTalker上手指南:一张人像加一段音频生成会说话的人脸动画
SadTalker上手指南一张人像加一段音频生成会说话的人脸动画【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 发表的人脸动画工具只需一张人像图片和一段音频就能生成口型、表情与头部动作同步的说话人脸视频。下面是从环境搭建到跑通第一条视频的完整本地路径。能力速览单张人像加音频生成说话人脸视频支持全身图输入保留原始姿态可从参考视频借用眨眼与头部动作GFPGAN 一键增强面部清晰度 最短路径装好依赖并跑出第一条视频克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker创建独立的 Python 3.8 环境并依次安装依赖。README 中钉死的是 torch 1.12.1 cu113如果你的显卡需要别的 CUDA 版本按 README 换对应版本即可conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio conda install ffmpeg pip install -r requirements.txt接着下载全部预训练权重一条命令拿齐音频到表情、音频到姿态、256/512 两档渲染器以及 GFPGAN 权重并自动建好 checkpoints/ 与 gfpgan/ 目录bash scripts/download_models.sh下载脚本用了断点续传重复执行不会重复下载如果网络环境下源站较慢可以按脚本里的清单手动取文件放到相同目录。跑之前确认两件事python -c import torch; print(torch.__version__)能打印版本ffmpeg -version不报错——前者影响模型加载后者影响视频合成。仓库自带中文新闻音频和全身人像直接作为首次输入组合python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png --result_dir results流水线依次做三件事从图片提取 3DMM 系数、音频预测运动系数、渲染合成。成片在results/时间戳/时间戳.mp4。习惯点选界面的话Linux/Mac 跑webui.sh、Windows 双击webui.bat会启动一个功能相近的 Gradio 演示。 用法配方三组输入组合输入组合关键参数产出效果近景人像 音频默认自动裁脸表情与头部动作丰富全身图 音频--still --preprocess full贴回原图保留原始姿态头部几乎不动人像 音频 参考视频--ref_pose 视频头部动作借自参考视频更自然--ref_eyeblink 视频可单独使用只借眨眼节奏任意配方加--enhancer gfpgan生成后再做面部增强examples/ 目录里有多组人像与音频样本可自由组合完整参数说明见最佳实践文档。 高频故障速查ffmpeg 不被识别单独安装 ffmpeg 并加入 PATHconda install ffmpeg或brew install ffmpeg即可解决。CUDA out of memory运行前设置export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set。FileNotFoundError / ModuleNotFoundError: No module named ai都是模型文件缺失或下载不完整重跑bash scripts/download_models.sh补齐。音频解码报错只支持 wav 或 mp3 输入其他格式先转成 wav。更多疑难可以参考官方 FAQ。 延伸社区已将 SadTalker 做成 Stable Diffusion WebUI 扩展见 WebUI 文档配合 GFPGAN 与 Real-ESRGAN它能扩展进一条完整的数字人口播视频生产线。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

CodeMagicianT:智能HTML代码生成与优化工具 2026/9/12 15:27:29

CodeMagicianT:智能HTML代码生成与优化工具

1. CodeMagicianT项目概述 CodeMagicianT是一个专注于HTML代码高效生成与优化的开发工具。作为一名拥有十年Web开发经验的从业者,我深知在项目开发过程中,重复编写基础HTML结构的痛苦。这个工具正是为了解决这个痛点而生,它能通过智能化的方…

阅读更多 →
teamai-cli:面向团队协作的MCP协议命令行中枢 2026/9/12 15:27:29

teamai-cli:面向团队协作的MCP协议命令行中枢

1. 从零理解 teamai-cli:它不是另一个“AI CLI”,而是团队协作的命令行中枢你有没有试过在终端里敲下teamai init,然后看着一个带交互式菜单的项目骨架瞬间生成?或者用teamai deploy --envstaging一键把前端后端配置推送到预发环境…

阅读更多 →
B站视频转结构化笔记的5款实测工具深度对比 2026/9/12 15:27:29

B站视频转结构化笔记的5款实测工具深度对比

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
SerenityOS 移植 ScummVM:malloc.h 缺失问题的补丁解析与移植实践 2026/9/12 15:27:29

SerenityOS 移植 ScummVM:malloc.h 缺失问题的补丁解析与移植实践

SerenityOS 移植 ScummVM:malloc.h 缺失问题的补丁解析与移植实践 【免费下载链接】serenity The Serenity Operating System 🐞 项目地址: https://gitcode.com/GitHub_Trending/se/serenity 导读 本文围绕 SerenityOS 仓库中 ScummVM 移植所需…

阅读更多 →
SpringBoot宠物医院管理系统设计与实践 2026/9/12 15:27:29

SpringBoot宠物医院管理系统设计与实践

1. 项目背景与核心需求宠物医疗行业近年来呈现爆发式增长,根据行业数据显示,2022年中国宠物医疗市场规模已突破600亿元。传统宠物医院普遍面临管理效率低下、预约混乱、病历管理不规范等问题。这套基于SpringBoot的宠物医院管理系统正是为解决这些痛点而…

阅读更多 →
Mastra 可观测性 Traces 测试指南:从本地冒烟测试到云端 Trace 管线验证 2026/9/12 15:24:28

Mastra 可观测性 Traces 测试指南:从本地冒烟测试到云端 Trace 管线验证

Mastra 可观测性 Traces 测试指南:从本地冒烟测试到云端 Trace 管线验证 【免费下载链接】mastra Mastra is the modern TypeScript framework for AI-powered applications and agents. 项目地址: https://gitcode.com/GitHub_Trending/ma/mastra 本篇指南以…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞