新闻详情

新闻详情

首页 / 资讯中心 / 详情

Python打卡第26天

发布时间:2026/9/27 6:56:20来源:尧图网络
Python打卡第26天
浙大疏锦行001002003004005006007008009010011012013014015016017018019020021022023024025026027028029030031032033034035036037038039040041042043044045046047048049050051052053054055056057058059060061062063064065066067068069070071072073074075076077078079080081082083084085086087088089090091092093094095096097098099100101102103104105106107108109110111112113114115116117118119120121122123124125126importpandas as pdimportnumpy as npimportmatplotlib.pyplot as pltimportseaborn as snsimporttime# 导入 time 库importwarningswarnings.filterwarnings(ignore)plt.rcParams[font.sans-serif][SimHei]plt.rcParams[axes.unicode_minus]False# 防止负号显示问题# 导入 Pipeline 和相关预处理工具fromsklearn.pipelineimportPipeline# 用于创建机器学习工作流fromsklearn.composeimportColumnTransformer# 用于将不同的预处理应用于不同的列之前是对datafame的某一列手动处理如果在pipeline中直接用standardScaler等函数就会对所有列处理所以要用到这个工具fromsklearn.preprocessingimportOrdinalEncoder, OneHotEncoder, StandardScaler# 用于数据预处理fromsklearn.imputeimportSimpleImputer# 用于处理缺失值# 机器学习相关库fromsklearn.ensembleimportRandomForestClassifierfromsklearn.metricsimportclassification_report, confusion_matrix, accuracy_score, precision_score, recall_score, f1_scorefromsklearn.model_selectionimporttrain_test_split# 只导入 train_test_split# --- 加载原始数据 ---datapd.read_csv(D:\Desktop\Postgraduate\PythonStudy\Python打卡训练营\Python打卡训练营\python60-days-challenge-master\data.csv)# Pipeline 将直接处理分割后的原始数据 X_train, X_test# 原手动预处理步骤 (将被Pipeline替代):# Home Ownership 标签编码# Years in current job 标签编码# Purpose 独热编码# Term 0 - 1 映射并重命名# 连续特征用众数补全# --- 分离特征和标签 (使用原始数据) ---ydata[Credit Default]Xdata.drop([Credit Default], axis1)# --- 划分训练集和测试集 (在任何预处理之前划分) ---# X_train 和 X_test 现在是原始数据中划分出来的部分不包含你之前的任何手动预处理结果X_train, X_test, y_train, y_testtrain_test_split(X, y, test_size0.2, random_state42)# --- 定义不同列的类型和它们对应的预处理步骤 (这些将被放入 Pipeline 的 ColumnTransformer 中) ---# 这些定义是基于原始数据 X 的列类型来确定的# 识别原始的 object 列 (对应你原代码中的 discrete_features 在预处理前)object_colsX.select_dtypes(include[object]).columns.tolist()# 有序分类特征 (对应你之前的标签编码)# 注意OrdinalEncoder默认编码为0, 1, 2... 对应你之前的1, 2, 3...需要在模型解释时注意# 这里的类别顺序需要和你之前映射的顺序一致ordinal_features[Home Ownership,Years in current job,Term]# 定义每个有序特征的类别顺序这个顺序决定了编码后的数值大小ordinal_categories[[Own Home,Rent,Have Mortgage,Home Mortgage],# Home Ownership 的顺序 (对应1, 2, 3, 4)[ 1 year,1 year,2 years,3 years,4 years,5 years,6 years,7 years,8 years,9 years,10 years],# Years in current job 的顺序 (对应1-11)[Short Term,Long Term]# Term 的顺序 (对应0, 1)]# 先用众数填充分类特征的缺失值然后进行有序编码ordinal_transformerPipeline(steps[(imputer, SimpleImputer(strategymost_frequent)),# 用众数填充分类特征的缺失值(encoder, OrdinalEncoder(categoriesordinal_categories, handle_unknownuse_encoded_value, unknown_value-1))])# 分类特征nominal_features[Purpose]# 使用原始列名# 先用众数填充分类特征的缺失值然后进行独热编码nominal_transformerPipeline(steps[(imputer, SimpleImputer(strategymost_frequent)),# 用众数填充分类特征的缺失值(onehot, OneHotEncoder(handle_unknownignore, sparse_outputFalse))# sparse_outputFalse 使输出为密集数组])# 连续特征# 从X的列中排除掉分类特征得到连续特征列表continuous_featuresX.columns.difference(object_cols).tolist()# 原始X中非object类型的列# 先用众数填充缺失值然后进行标准化continuous_transformerPipeline(steps[(imputer, SimpleImputer(strategymost_frequent)),# 用众数填充缺失值 (复现你的原始逻辑)(scaler, StandardScaler())# 标准化一个好的实践])# --- 构建 ColumnTransformer ---# 将不同的预处理应用于不同的列子集构造一个完备的转化器preprocessorColumnTransformer(transformers[(ordinal, ordinal_transformer, ordinal_features),(nominal, nominal_transformer, nominal_features),(continuous, continuous_transformer, continuous_features)],remainderpassthrough# 保留没有在transformers中指定的列如果存在的话或者 drop 丢弃)# --- 构建完整的 Pipeline ---# 将预处理器和模型串联起来# 使用你原代码中 RandomForestClassifier 的默认参数和 random_state这里的参数用到了元组这个数据结构pipelinePipeline(steps[(preprocessor, preprocessor),# 第一步应用所有的预处理 (ColumnTransformer)(classifier, RandomForestClassifier(random_state42))# 第二步随机森林分类器])# --- 1. 使用 Pipeline 在划分好的训练集和测试集上评估 ---print(--- 1. 默认参数随机森林 (训练集 - 测试集) ---)start_timetime.time()# 记录开始时间# 在原始的 X_train 上拟合整个Pipeline# Pipeline会自动按顺序执行preprocessor的fit_transform(X_train)然后用处理后的数据拟合classifierpipeline.fit(X_train, y_train)# 在原始的 X_test 上进行预测# Pipeline会自动按顺序执行preprocessor的transform(X_test)然后用处理后的数据进行预测pipeline_predpipeline.predict(X_test)end_timetime.time()# 记录结束时间print(f训练与预测耗时: {end_time - start_time:.4f} 秒)# 使用你原代码的输出格式print(\n默认随机森林 在测试集上的分类报告)# 使用你原代码的输出文本print(classification_report(y_test, pipeline_pred))print(默认随机森林 在测试集上的混淆矩阵)# 使用你原代码的输出文本print(confusion_matrix(y_test, pipeline_pred))
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

佛山网站建设公司3lue:5个免费工具搞定丑站痛点 2026/9/27 6:56:16

佛山网站建设公司3lue:5个免费工具搞定丑站痛点

佛山网站建设公司3lue:5个免费工具搞定丑站痛点 还在为模板网站太丑不够用而头疼?别急着掏钱找佛山网站建设公司3lue,先试试这几个 免费工具 。很多甲方朋友一上来就问价格,却忽略了网站上线前的视觉诊断和性能体检。…

阅读更多 →
解决matplotlib绘图中文字符显示问题 2026/9/27 6:56:16

解决matplotlib绘图中文字符显示问题

在使用Python进行数据可视化时,常常会遇到中文字符无法正常显示的问题。默认情况下,Matplotlib等常用可视化库并不支持中文字体,这导致中文字符显示为方框或者引发字体相关的警告,给数据展示和报告生成带来不便。尤其对于数据分析师而言,频繁手动调整字体配置既耗时又易出…

阅读更多 →
RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法01:基本概念【用参数化的函数来拟合π,来取代表格形式的π(表格中每个元素直接保存了某个s-a对的π概率值)】 2026/9/27 6:56:15

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法01:基本概念【用参数化的函数来拟合π,来取代表格形式的π(表格中每个元素直接保存了某个s-a对的π概率值)】

从本文开始,将从value-based methods转向到policy-based methods,从value function approximation到policy function approximation。 一、Basic idea of policy gradient 到目前,我们的policies都是用tables表示的。 如下是所有state的action probabilities,存储在一个t…

阅读更多 →
用AgentENV训练Terminal-Bench-2:搭建Agent强化学习的沙箱后端 2026/9/27 6:56:01

用AgentENV训练Terminal-Bench-2:搭建Agent强化学习的沙箱后端

用AgentENV训练Terminal-Bench-2:搭建Agent强化学习的沙箱后端 【免费下载链接】AgentENV AgentENV (AENV) is a distributed platform for running agent environments at scale. 项目地址: https://gitcode.com/gh_mirrors/age/AgentENV AgentENV&#xff…

阅读更多 →
别被建站报价忽悠 揭秘免费做调查问卷的网站真底细 2026/9/27 6:55:54

别被建站报价忽悠 揭秘免费做调查问卷的网站真底细

别被建站报价忽悠 揭秘免费做调查问卷的网站真底细 找建站公司怕被坑高价,这是很多老板心里的痛点。市面上那些号称“全网最低”的建站报价单,往往藏着无数的隐形消费。今天咱们不聊虚的,直接拆解一个看似与建站无关,实则能帮你省下一大笔营销成本的场景…

阅读更多 →
文献阅读 260926-The Origins and Control of Forest Fires in the Tropics 2026/9/27 6:55:35

文献阅读 260926-The Origins and Control of Forest Fires in the Tropics

The Origins and Control of Forest Fires in the Tropics 📌 基本信息 🛠️ 一、 引言部分简要总结 (Introduction Summary) 🔬 二、 研究方法详细介绍与分析 (Methodology Framework) 图片名:Figure 1 图例说明:Figu…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉