新闻详情

新闻详情

首页 / 资讯中心 / 详情

【已解决---->“重点在后面”】win10+gpu,keras-yolov3,执行train.py训练模型,loss: nan

发布时间:2026/10/2 12:52:13来源:尧图网络
【已解决---->“重点在后面”】win10+gpu,keras-yolov3,执行train.py训练模型,loss: nan
keras-yolov3在win10cpu下训练模型正常但同样的代码在win10gpu环境下训练模型一直显示loss:nan。1.错误信息如下Epoch 1/502021-12-24 18:31:54.894750: I tensorflow/stream_executor/platform/default/dso_loader.cc:44] Successfully opened dynamic library cudnn64_7.dll2021-12-24 18:31:57.850212: W tensorflow/stream_executor/cuda/redzone_allocator.cc:312] Internal: Invoking ptxas not supported on WindowsRelying on driver to perform ptx compilation. This message will be only logged once.2021-12-24 18:31:58.171032: I tensorflow/stream_executor/platform/default/dso_loader.cc:44] Successfully opened dynamic library cublas64_100.dll1/19 [.............................] - ETA: 4:01 - loss: nan2/19 [...........................] - ETA: 1:57 - loss: nan3/19 [..........................] - ETA: 1:31 - loss: nan4/19 [........................] - ETA: 1:24 - loss: nan5/19 [.......................] - ETA: 1:17 - loss: nan2.解决办法如下# filter out inf/nan values encountered here: raw_true_wh K.switch(tf.is_inf(raw_true_wh), raw_true_wh, K.zeros_like(raw_true_wh)) raw_true_wh K.switch(tf.is_nan(raw_true_wh), raw_true_wh, K.zeros_like(raw_true_wh))3.注意yolov3样本集打标注时候选区域不能太小最好一张图只有一个标注框这样不影响后续检测可以检测出多个目标---------------------------------------------------------------------------------------------------------------------2022年1月5日理解补充①当图片样本集数量比较大分类比较大多时若batch_size太大本例是64lr太小本例是1e-4则loss开始就是nan原因可能是不同图片之间的差别不大lr值过小尤其是freeze_body2时只有三层数据参与计算252-249算法根本就无法计算图片之间的差异导致梯度消失所以lossnan。②训练过程中loss会在nan和数值之间波动原因是每个epoch的采样不同如果正好取的三张图片本例batch_size3同属于一个分类那么计算梯度就会非常小可能比学习率都要小这个时候loss就会是nan。下面是训练过程中的截图从上往下看。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

小鱼的数字游戏:数组倒序输出的多语言解法与踩坑指南 2026/10/2 19:47:32

小鱼的数字游戏:数组倒序输出的多语言解法与踩坑指南

1. 一道"小鱼的数字游戏",为什么能让新手原地卡壳这道题我第一次刷的时候,心里想的是"这也算必刷?"。题目短、场景萌,读起来不过三行:小鱼看到一串数字,以 0 结尾,它要把这…

阅读更多 →
Flask+Echarts生产级可视化大屏系统实战 2026/10/2 19:47:19

Flask+Echarts生产级可视化大屏系统实战

简介:这是一套基于Flask后端与ECharts前端的Python可视化大屏数据展示系统,面向计算机及相关专业(如人工智能、物联网、电子信息等)的高校学生、教师及初学者,适用于毕业设计、课程设计、项目演示与Web数据可视化入门实…

阅读更多 →
BM25与RRF协同的轻量级RAG系统实战设计 2026/10/2 19:47:13

BM25与RRF协同的轻量级RAG系统实战设计

1. 项目概述:这不是一场术语背诵考试,而是一次系统性思维的现场验证DocResearch 这个项目名字听起来像一个文档研究工具,但实际它是一个典型的现代 RAG(检索增强生成)系统落地案例——不是那种教科书里抽象的概念演示&…

阅读更多 →
大模型推理加速三板斧:量化、投机采样与PD分离 2026/10/2 19:47:13

大模型推理加速三板斧:量化、投机采样与PD分离

大模型跑起来太慢了,这个问题做推理的人天天都在撞。不是显卡不够好,而是很多算力都花在了没必要的地方。我这段时间用 nano-vllm 把量化、投机采样、PD 分离这三招挨个过了一遍,踩了不少坑,也摸清了它们各自的脾气。这篇就把我怎…

阅读更多 →
模型部署精度与硬件匹配:从FP16、INT8量化到显存带宽的选型指南 2026/10/2 19:47:13

模型部署精度与硬件匹配:从FP16、INT8量化到显存带宽的选型指南

做模型部署和推理优化这些年,我见过太多人卡在同一步:模型训练好了,也验证过了,一到落地阶段就开始纠结——同一个模型,到底该用什么精度跑?该配什么硬件才合适?这个问题看起来简单,…

阅读更多 →
模型部署的精度与硬件匹配指南:从显存、带宽到量化实战 2026/10/2 19:47:12

模型部署的精度与硬件匹配指南:从显存、带宽到量化实战

这篇博文主要围绕“同一个模型,该用什么精度、配什么硬件”来展开。模型部署里精度选择和硬件匹配是绕不开的坎,很多人在这一步踩坑:要么显存不够直接爆掉,要么精度选错导致速度反而不如低配机器,要么量化后质量明显下…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉