新闻详情

新闻详情

首页 / 资讯中心 / 详情

使用 MMSegmentation 在 breastCancerCellSegmentation 病理图像数据集上进行乳腺癌细胞分割实战指南

发布时间:2026/9/16 14:36:47来源:尧图网络
使用 MMSegmentation 在 breastCancerCellSegmentation 病理图像数据集上进行乳腺癌细胞分割实战指南
使用 MMSegmentation 在 breastCancerCellSegmentation 病理图像数据集上进行乳腺癌细胞分割实战指南【免费下载链接】mmsegmentationOpenMMLab Semantic Segmentation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmsegmentation导读本文是一份面向医学图像分割开发者的实战指南聚焦于 MMSegmentation 仓库projects/目录下提供的breastCancerCellSegmentation乳腺癌细胞分割完整示例项目。该示例以 58 张 HE 染色组织病理图像为基础展示了如何基于 UNet 语义分割模型完成二分类细胞分割任务。读完本文你将掌握该数据集的统计特性与标注格式、从原始数据到 MMSegmentation 标准格式的整理流程、UNet 训练/测试配置的完整含义以及如何在单卡环境下用mim工具复现训练与推理。项目背景与数据集概述breastCancerCellSegmentation 是 MMSegmentation 医学影像示例项目位于 projects/medical 目录下的一个独立子项目属于projects/medical/2d_image/histopathology/breastCancerCellSegmentation/路径。它遵循 MMSegmentation 的projects/规范以模块化、可独立运行的方式演示如何将一个真实医学数据集接入工具箱。数据集来源与特点该数据集包含58 张 HE 染色的组织病理图像用于乳腺癌细胞的检测与分割研究。这里涉及的 HE 染色Hematoxylin and Eosin苏木精-伊红染色是组织学中最为常规的组合染色方式大多数细胞本身透明、几乎不含内源色素因此需要通过染色来增强对比某些特殊染色可选择性结合特定组分从而用于识别细胞等生物学结构。该数据集正是利用 HE 染色图像进行细胞级别分割的典型真实世界数据。原始统计信息项目 README 给出了该数据集的原始统计信息整理如下数据集名称解剖区域任务类型模态类别数训练/验证/测试图像数标注情况发布时间许可证breastCancerCellSegmentationcell细胞segmentationhistopathology组织病理258/-/-是/-/-2020CC-BY-NC 4.0各类别像素占比统计如下类别名称训练图像数训练集像素占比验证图像数验证集像素占比测试图像数测试集像素占比background背景5898.37----breastCancerCell乳腺癌细胞581.63----说明Pct表示该类别像素占全部像素的百分比。从上表可以明显看出这是一个极度类别不均衡的二分类任务——前景乳腺癌细胞仅占约 1.63% 的像素这对分割模型的训练提出了更高要求。项目配套代码结构在深入讲解之前先总览该项目在仓库中的完整文件布局相对路径均以仓库根目录为起点projects/medical/2d_image/histopathology/breastCancerCellSegmentation/ ├── README.md # 项目说明文档本文依据 ├── configs/ │ ├── breastCancerCellSegmentation_512x512.py # 数据集与流水线公共配置 │ ├── fcn-unet-s5-d16_unet_1xb16-0.0001-20k_breastCancerCellSegmentation-512x512.py │ ├── fcn-unet-s5-d16_unet_1xb16-0.001-20k_breastCancerCellSegmentation-512x512.py │ └── fcn-unet-s5-d16_unet_1xb16-0.01-20k_breastCancerCellSegmentation-512x512.py ├── datasets/ │ └── breastCancerCellSegmentation_dataset.py # 数据集类定义 └── tools/ └── prepare_dataset.py # 数据整理与训练/验证集划分脚本环境准备Prerequisites在运行项目前需要准备符合要求的 Python 环境。项目 README 列出的版本要求如下依赖版本要求Pythonv3.8PyTorchv1.10.0pillow (PIL)v9.3.0scikit-learn (sklearn)v1.2.0MIMv0.3.4MMCVv2.0.0rc4MMEnginev0.2.0 或更高MMSegmentationv1.0.0其中scikit-learn是数据准备阶段划分训练/验证集所必需的依赖详见下文tools/prepare_dataset.py的源码分析MIM则用于执行后续的训练与测试命令。更完整的依赖清单可参考仓库根目录的 requirements.txt 及各子目录下的 requirements/mminstall.txt。设置 PYTHONPATH所有后续命令都依赖正确的PYTHONPATH配置使其指向项目目录从而保证 Python 能够定位到模块文件。在breastCancerCellSegmentation/根目录下执行以下命令将当前目录加入PYTHONPATHexport PYTHONPATHpwd:$PYTHONPATH数据准备Dataset Preparing第一步下载并解压原始数据从数据集主页下载 breastCancerCellSegmentation 原始数据并保存到项目的data/目录将压缩包解压到data/路径下此时会生成名为data/breastCancerCellSegmentation/的文件夹其中包含原始图像数据。第二步运行整理脚本执行python tools/prepare_dataset.py对数据进行格式化并生成训练/验证划分文件。脚本运行完成后目录结构如下mmsegmentation ├── mmseg ├── projects │ ├── medical │ │ ├── 2d_image │ │ │ ├── histopathology │ │ │ │ ├── breastCancerCellSegmentation │ │ │ │ │ ├── configs │ │ │ │ │ ├── datasets │ │ │ │ │ ├── tools │ │ │ │ │ ├── data │ │ │ │ │ │ ├── breastCancerCellSegmentation │ │ │ │ │ │ │ ├── train.txt │ │ │ │ │ │ │ ├── val.txt │ │ │ │ │ │ │ ├── images │ │ │ │ │ │ │ │ ├── xxx.tif │ │ │ │ │ │ │ ├── masks │ │ │ │ │ │ │ │ ├── xxx.TIF可以看到整理后的data/breastCancerCellSegmentation/目录包含images/原始 HE 病理图像.tif后缀小写masks/分割标注.TIF后缀大写train.txt/val.txt训练集与验证集样本清单仅包含文件名去后缀后的样本名。整理脚本源码解析prepare_dataset.py 的核心逻辑可以拆解为以下几步与 README 描述一一对应收集图像与掩码通过glob分别匹配images/*.tif与masks/*.TIF并排序同时用assert len(img_list) len(mask_list)校验图像与标注数量一致划分训练/验证集调用sklearn.model_selection.train_test_split以test_size0.2、random_state42将 58 张图像按 80%/20% 划分为训练集与验证集即训练集约 46 张、验证集约 12 张具体划分由固定随机种子决定保证可复现保存划分结果save_anno函数通过x.split(/)[-1][:-len(suffix)]截取纯文件名去掉_ccd.tif后缀分别写入train.txt与val.txt。脚本还支持通过--data_root参数自定义数据根目录默认data/breastCancerCellSegmentation/python tools/prepare_dataset.py --data_root /path/to/your/data/breastCancerCellSegmentation/数据集类实现剖析数据集类定义在 breastCancerCellSegmentation_dataset.py 中它继承自 MMSegmentation 的BaseSegDataset并通过DATASETS.register_module()注册到全局注册表。关键实现要点METAINFO dict(classes(background, breastCancerCell)) def __init__(self, img_suffix_ccd.tif, seg_map_suffix.TIF, reduce_zero_labelFalse, **kwargs) - None:类别元信息METAINFO声明了两个类别(background, breastCancerCell)与 README 统计表中的类别一一对应reduce_zero_label固定为False即背景标签 0不会被忽略而是作为正常类别参与训练文件后缀约定img_suffix默认_ccd.tifseg_map_suffix默认.TIF。结合prepare_dataset.py的划分逻辑可知图像文件名形如xxx_ccd.tif掩码文件名形如xxx.TIFtrain.txt/val.txt中保存的是去掉后缀后的样本名标签语义由于reduce_zero_labelFalse标签 0 对应背景、标签 1 对应乳腺癌细胞。配置文件详解项目提供了 4 个配置文件其中 1 个公共数据集配置 3 个完整训练配置。三个训练配置的差异仅在于初始学习率0.0001 / 0.001 / 0.01用于对比不同学习率对这个小规模医学分割任务的影响。公共数据集与流水线配置breastCancerCellSegmentation_512x512.py 定义了数据集类型、数据根目录、图像尺寸以及训练/测试数据流水线dataset_type breastCancerCellSegmentationDataset data_root data/breastCancerCellSegmentation img_scale (512, 512)训练流水线train_pipeline组件关键参数作用LoadImageFromFileimdecode_backendtifffile使用 tifffile 后端读取.tif格式图像LoadAnnotationsimdecode_backendtifffile读取.TIF格式分割标注Resizescale(512, 512), keep_ratioFalse不保持宽高比直接缩放到 512×512RandomFlipprob0.5以 50% 概率随机水平翻转做数据增强PhotoMetricDistortion默认参数光度畸变增强亮度、对比度、饱和度等PackSegInputs-打包图像与分割标签为模型输入测试流水线test_pipeline仅包含加载、缩放与打包不做随机增强。数据加载器训练加载器batch_size16、num_workers4、persistent_workersTrue采用InfiniteSampler无限采样配合按 iteration 的训练循环验证/测试加载器batch_size1采用DefaultSampler不 shuffle。评估器使用IoUMetric同时计算mIoU与mDice两项指标。注意由于原始图像是.tif流水线中两个加载组件都显式指定了imdecode_backendtifffile这是该项目区别于常规 JPEG/PNG 数据集的关键点。完整训练配置以 0.0001 学习率为例主训练配置 通过继承四个基础配置组装完整训练流程_base_ [ mmseg::_base_/models/fcn_unet_s5-d16.py, ./breastCancerCellSegmentation_512x512.py, mmseg::_base_/default_runtime.py, mmseg::_base_/schedules/schedule_20k.py ] custom_imports dict(importsdatasets.breastCancerCellSegmentation_dataset) img_scale (512, 512) data_preprocessor dict(sizeimg_scale) optimizer dict(lr0.0001) optim_wrapper dict(optimizeroptimizer) model dict( data_preprocessordata_preprocessor, decode_headdict(num_classes2), auxiliary_headNone, test_cfgdict(modewhole, _delete_True)) vis_backends None visualizer dict(vis_backendsvis_backends)逐项解读如下custom_imports声明datasets.breastCancerCellSegmentation_dataset使自定义数据集类在配置解析阶段被自动导入并注册optimizer仅覆盖学习率。基础调度配置 schedule_20k.py 中默认优化器为SGDlr0.01, momentum0.9, weight_decay0.0005此处通过optimizer dict(lr0.0001)仅替换学习率其余超参保持不变另外两个配置分别使用lr0.001与lr0.01model.decode_head.num_classes2解码头输出 2 类背景 乳腺癌细胞auxiliary_headNone显式关闭辅助头基础配置fcn_unet_s5-d16.py中默认带有辅助 FCNHead此处置空以简化模型test_cfgdict(modewhole, _delete_True)使用_delete_True强制删除基础配置中的测试模式将推理方式从基础的滑窗modeslide改为全图整图推理modewhole数据已缩放到 512×512小尺寸图像适合整图推理vis_backends None关闭可视化后端覆盖 default_runtime.py 中的LocalVisBackend。基础模型配置FCN-UNets5-d16模型骨架继承自 fcn_unet_s5-d16.py采用UNet 编码器-解码器 FCN 解码头结构数据预处理器SegDataPreProcessorImageNet 均值/标准差归一化mean[123.675, 116.28, 103.53]std[58.395, 57.12, 57.375]bgr_to_rgbTrue骨干网络UNet输入 3 通道、base_channels64、num_stages5个下采样阶段每阶段 2 个卷积编码器逐级下采样解码器用InterpConv上采样使用SyncBN与ReLU激活解码头FCNHeadin_channels64、in_index4取最深层特征、dropout_ratio0.1、num_classes2损失为CrossEntropyLossuse_sigmoidFalse, loss_weight1.0辅助头基础配置中附带一个权重为 0.4 的辅助 FCNHeadin_index3本项目配置已将其关闭默认测试配置基础模型采用滑窗modeslide, crop_size256, stride170项目配置改写为整图模式。训练调度与运行时继承自 schedule_20k.py 的训练调度学习率策略PolyLRpower0.9, eta_min1e-4按 iteration 衰减训练循环IterBasedTrainLoopmax_iters20000每 2000 次迭代验证一次日志/检查点钩子每 50 次迭代记录日志log_metric_by_epochFalse每 2000 次迭代保存 checkpointby_epochFalse。训练与测试命令训练在单机单卡环境下训练模型${CONFIG_FILE}替换为具体配置文件名mim train mmseg ./configs/${CONFIG_FILE}例如使用 0.0001 学习率的配置mim train mmseg ./configs/fcn-unet-s5-d16_unet_1xb16-0.0001-20k_breastCancerCellSegmentation-512x512.py注意命令中的配置路径相对于breastCancerCellSegmentation/目录请确保按前文所述设置了PYTHONPATH并在该目录下执行。测试在单机单卡环境下测试模型${CONFIG_FILE}替换为配置文件名${CHECKPOINT_PATH}替换为权重文件路径mim test mmseg ./configs/${CONFIG_FILE} --checkpoint ${CHECKPOINT_PATH}测试将输出IoUMetric计算的mIoU与mDice指标分别反映像素级交并比与 Dice 相似系数两者对背景占绝对多数的类别不均衡场景均具有参考价值。实验要点与进阶建议结合源码与配置针对本项目可以总结以下实践要点类别不均衡是首要问题前景像素仅占约 1.63%默认使用CrossEntropyLoss可能对前景学习不足。可以在decode_head.loss_decode中调整loss_weight或引入加权损失也可以对照三个学习率配置0.0001/0.001/0.01观察收敛差异选择最稳定的一组数据规模小仅 58 张图像、约 46 张用于训练训练轮次 20k iterations 下应重点关注验证集指标防止过拟合PhotoMetricDistortion与RandomFlip增强在有限数据上尤为关键TIF 格式处理务必确认环境安装了 tifffile 后端且流水线中imdecode_backendtifffile与图像/掩码的实际后缀_ccd.tif/.TIF保持一致整图 vs 滑窗推理512×512 输入尺寸下配置采用modewhole整图推理若后续更换更大分辨率输入可参考基础配置中的modeslide, crop_size256, stride170滑窗方案降低显存占用。结语本文从数据、代码、配置到命令完整梳理了 MMSegmentation 中 breastCancerCellSegmentation 乳腺癌细胞分割示例项目。该项目是理解如何将自定义医学影像数据集接入 MMSegmentation 并在projects/规范下独立组织代码的最小可运行范本一个自定义数据集类、一个数据整理脚本、一套继承式配置即可完成从原始 HE 病理图像到 UNet 分割模型的端到端落地。读者可在此基础上替换数据路径与类别数快速迁移到其他二分类医学分割任务。【免费下载链接】mmsegmentationOpenMMLab Semantic Segmentation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmsegmentation创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

SkyPilot SkyServe 鉴权实战:为 vLLM 推理服务配置 API Key 访问控制 2026/9/16 15:12:52

SkyPilot SkyServe 鉴权实战:为 vLLM 推理服务配置 API Key 访问控制

SkyPilot SkyServe 鉴权实战:为 vLLM 推理服务配置 API Key 访问控制 【免费下载链接】skypilot The AI Compute Platform for frontier teams. SkyPilot turns fragmented AI compute into one AI supercomputer, so frontier AI teams build custom intelligence …

阅读更多 →
微信小程序考试系统与SSM框架:架构、接口与部署全解析 2026/9/16 15:12:52

微信小程序考试系统与SSM框架:架构、接口与部署全解析

简介:一套基于微信小程序与SSM框架的在线考试系统源码,专为Java毕业设计及课程作业场景打造,适合计算机科学与技术、软件工程等专业学生参考。系统涵盖用户管理、题库管理、考试流程控制、自动评分等核心模块,前端采用微信小程序与…

阅读更多 →
es-toolkit 深拷贝完全指南:`cloneDeep`(Lodash 兼容版)使用与源码实现解析 2026/9/16 15:12:52

es-toolkit 深拷贝完全指南:`cloneDeep`(Lodash 兼容版)使用与源码实现解析

es-toolkit 深拷贝完全指南:cloneDeep(Lodash 兼容版)使用与源码实现解析 【免费下载链接】es-toolkit A modern JavaScript utility library thats 2-3 times faster and up to 97% smaller, a major upgrade to lodash. 项目地址: https:…

阅读更多 →
tsParticles 仓库 Nx Cloud CI 监控全流程:monitor-ci 命令与自愈修复机制深度解析 2026/9/16 15:12:52

tsParticles 仓库 Nx Cloud CI 监控全流程:monitor-ci 命令与自愈修复机制深度解析

tsParticles 仓库 Nx Cloud CI 监控全流程:monitor-ci 命令与自愈修复机制深度解析 【免费下载链接】tsparticles tsParticles - Easily create highly customizable JavaScript particles effects, confetti explosions and fireworks animations and use them as …

阅读更多 →
MMPose CPM 卷积姿态机:Sub-JHMDB 人体 2D 关键点模型配置、训练结果与源码解析 2026/9/16 15:12:52

MMPose CPM 卷积姿态机:Sub-JHMDB 人体 2D 关键点模型配置、训练结果与源码解析

MMPose CPM 卷积姿态机:Sub-JHMDB 人体 2D 关键点模型配置、训练结果与源码解析 【免费下载链接】mmpose OpenMMLab Pose Estimation Toolbox and Benchmark. 项目地址: https://gitcode.com/GitHub_Trending/mm/mmpose 本文围绕 MMPose 模型库中的 CPM&…

阅读更多 →
ASP经典技术实战:GM推广系统v6.0部署与归因开发解析 2026/9/16 15:09:52

ASP经典技术实战:GM推广系统v6.0部署与归因开发解析

简介:这是一套基于ASP技术构建的游戏推广系统源码,面向游戏管理员提供用户管理、推广链接追踪、数据分析、广告投放与奖励发放等一体化后台功能,适合熟悉服务器端脚本开发的运营人员或学习者参考和二次开发。压缩包共四百九十个文件&#xff…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞