新闻详情

新闻详情

首页 / 资讯中心 / 详情

kohya_ss 在 AMD 显卡上 3 步跑通 AI 绘画模型训练:ROCm 实操手册

发布时间:2026/9/13 14:21:19来源:尧图网络
kohya_ss 在 AMD 显卡上 3 步跑通 AI 绘画模型训练:ROCm 实操手册
kohya_ss 在 AMD 显卡上 3 步跑通 AI 绘画模型训练ROCm 实操手册【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss想在 RX 7900 XTX 上花两小时练出一个 LoRAkokya_ss 拼写是 kohya_ss——一套支持 LoRA、DreamBooth 与全量训练的 AI 绘画模型训练工具配合 ROCm 技术栈可以直接跑在 AMD 显卡上无需 NVIDIA 硬件。环境速查项目推荐配置操作系统Ubuntu 22.04 / 24.04 LTSROCm 版本6.3对应 torch 2.7.1rocm6.3Python 版本3.11最低显存12 GBSDXL LoRA 官方建议sudo apt update sudo apt install -y rocm-hip-sdk git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss pip install -r requirements_linux_rocm.txt python -c import torch; print(torch.__version__, torch.cuda.is_available())requirements_linux_rocm.txt固定了 PyTorch ROCm 版、tensorflow-rocm 与 onnxruntime-rocm 的版本最后一行命令输出2.7.1rocm6.3 True即环境就绪。能力全景训练模式矩阵训练模式数据量典型耗时产物大小LoRA10~50 张1~2 小时10~100 MBLoConLoRA 变体10~50 张1~2 小时10~100 MBDreamBooth20~100 张3~5 小时2~7 GB完整模型全量训练数百~数千张8 小时以上2~7 GB完整模型可视化操作台kohya_gui/ 下的 Gradio 界面替代了全部命令行操作LoRA、DreamBooth、全量微调、Textual Inversion 各有独立标签页分辨率、batch_size、优化器、学习率全部以表单呈现。本地启动用./gui.sh --use-rocm远程 SSH 场景追加--headless --listen 0.0.0.0。数据与预设工具箱数据处理脚本位于 tools/caption.py按文件名规则批量生成 caption 文本文件group_images.py把相似比例的图片分组到子目录convert_images_to_webp.py将图片转为 webp 压缩体积。presets/ 里收录了社区验证过的训练配置 JSON如 SDXL - LoRA AI_characters standard v1.1test/ 内置一套 8 张 512×512 的示例图片和dataset.toml配置模板可直接用于验证环境。完整实操一次 LoRA 训练走通全流程第一步数据准备准备 10~50 张目标风格图片512×512 起步逐张配同名 .txt 描述文件先用 test/ 目录的小数据集验证流程python tools/caption.py test/img/10_darius\ kawasaki\ person --caption_text a person即可生成 caption第二步参数配置batch_size 起点RX 7900 XTX24 GB从 2 开始试跑通后再上调16 GB 卡从 1 开始FP16 开关SDXL 勾选 full_fp16显存占用明显下降若出现 NaN 或异常退回 fp16 模式梯度检查点显存吃紧时在 advanced 选项开启牺牲约 20% 速度换 30%~50% 显存rank 设 8~32learning_rate 参考 1e-4SD1.5或 4e-7SDXLepoch 按数据集大小调到 10~30第三步启动训练在 GUI 的 LoRA 标签页选择底模、填入数据集路径点 Start 即可或在命令行启动带 ROCm 环境的界面./gui.sh --use-rocm第四步检查产出训练完成后在输出目录找到*_epoch-N.safetensors文件体积通常在几十 MB观察 TensorBoard 的 loss 曲线是否平稳下降用产出的 LoRA 在生图端加载验证风格命中性能与显存调优显存溢出OOM→ batch_size 减半并开启梯度检查点FP16 混合精度→ 显存占用约降 30%~50%、速度小幅提升代价是极少数情况下数值不稳定需留意 loss 异常数据加载 IO 慢→ 数据集放 SSD开启cache_latents预计算 latentsworker 数不超过 CPU 物理核心数训练速度慢→ 用rocm-smi确认 GPU 利用率排除数据加载瓶颈多卡场景→ 结合梯度累积gradient_accumulation_steps模拟大 batch而非盲目堆 batch_size显卡型号推荐 batch_size 起点RX 7900 XTX24 GB2可试 4RX 7800 XT16 GB1RX 7600 XT8 GB1建议 512 分辨率 检查点踩坑速查hipErrorNoBinaryForGpuPyTorch 预编译核不支持你的 GPU 架构。rocminfo确认显卡被识别 →sudo apt install --only-upgrade rocm-hip-sdkHIP out of memory/ OOM显存溢出降低 batch_size 并开启梯度检查点。 GUI 中将 Train batch size 改为 1 → 勾选 gradient_checkpointing 后重跑TensorFlow 导入报版本冲突ROCm 版 TF 与 CPU 版 TF 混装所致。pip uninstall tensorflow tensorflow-rocm→pip install tensorflow-rocmGPU 利用率低、训练异常慢多为数据加载或驱动问题。rocm-smi监控利用率 →rocminfo | grep -i gfx确认架构与 torch 编译目标匹配下一步行动清单用 test/ 的小数据集 test/config/dataset.toml跑通一次 LoRA 训练把本次训练的 rank、learning_rate、batch_size、epoch 记入文档作为下次基线跑通后换成自己的数据集分辨率从 512 起步参考 docs/ 的 LoRA 章节与安装文档跟进项目更新从今天的 8 张小图开始先跑通再谈调优。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

turbovec Python 索引实战指南:基于 TurboQuant 的 2–4bit 向量压缩与 SIMD 检索 2026/9/13 14:57:22

turbovec Python 索引实战指南:基于 TurboQuant 的 2–4bit 向量压缩与 SIMD 检索

turbovec Python 索引实战指南:基于 TurboQuant 的 2–4bit 向量压缩与 SIMD 检索 【免费下载链接】turbovec A vector index built on TurboQuant, written in Rust with Python bindings 项目地址: https://gitcode.com/GitHub_Trending/tu/turbovec turbo…

阅读更多 →
基于Matlab与MFC的MFSK调制解调仿真与可视化实现 2026/9/13 14:57:22

基于Matlab与MFC的MFSK调制解调仿真与可视化实现

简介:一套基于Matlab的MFSK(多进制频移键控)水声通信仿真代码,面向通信工程、信号处理领域的学生与研究人员,可辅助理解MFSK调制原理,并用于水下信道中抗噪声、抗多径性能的初步实验与算法改进。资源共11个…

阅读更多 →
三步构建 10.5GHz 相控阵雷达:AERIS-10 完全指南 2026/9/13 14:57:22

三步构建 10.5GHz 相控阵雷达:AERIS-10 完全指南

三步构建 10.5GHz 相控阵雷达:AERIS-10 完全指南 【免费下载链接】PLFM_RADAR Open-source, low-cost 10.5 GHz PLFM phased array RADAR system 项目地址: https://gitcode.com/GitHub_Trending/pl/PLFM_RADAR 概览:一套完全开源的 10.5GHz 相控…

阅读更多 →
连续两稿栽在重复率和AIGC检测后,我把从开题到终稿的AI工具分工重新捋顺了 2026/9/13 14:57:22

连续两稿栽在重复率和AIGC检测后,我把从开题到终稿的AI工具分工重新捋顺了

又到开题、初稿、查重、降 AIGC 连轴转的时候。很多同学的问题不是“没用 AI”,而是把同一个 AI 用在了所有环节:用 ChatGPT 想选题、找文献、写初稿、润色、降重,最后发现参考文献像真的、重复率没降下来,AIGC 率反而更高。 实际…

阅读更多 →
别迷信AI一键生成答辩PPT:2026开题答辩四类AI工具选用指南 2026/9/13 14:57:22

别迷信AI一键生成答辩PPT:2026开题答辩四类AI工具选用指南

又到开题和答辩季,很多同学一上来就问: “现在哪个AI最强?” “能不能直接帮我生成答辩PPT?” “ChatGPT、Claude、DeepSeek、Kimi、豆包、Gamma、WPS AI……到底用哪个?” 说实话,2026年的AI工具已经非常分…

阅读更多 →
某度翻译Acs-Token算法逆向分析与安全机制解析 2026/9/13 14:54:22

某度翻译Acs-Token算法逆向分析与安全机制解析

1. Acs-Token算法背景与应用场景某度翻译作为国内领先的机器翻译服务提供商,其API接口采用了名为Acs-Token的安全验证机制。这种算法本质上是一种动态签名技术,主要用于:防止未授权调用翻译API限制接口滥用和恶意爬取实现请求来源的身份验证保…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞