决策树案例以及决策树可视化

news/2024/10/31 9:29:25/

一、案例背景

泰坦尼克号沉没是历史上最臭名昭著的沉船之一。1912年4月15日,在她的处女航中,泰坦尼克号在与冰山相撞后沉没,在2224名乘客和机组人员中造成1502人死亡。在这个案例中,我们要求完成对哪些人可能存活的分析。特别是,我们要求运用机器学习工具来预测哪些乘客幸免于悲剧。

我们提取到的数据集中的特征包括票的类别,是否存活,乘坐班次,年龄,登录home.dest,房间,船和性别等。

在这里插入图片描述

经过观察数据得到:

  • 乘坐班是指乘客班(1,2,3),是社会经济阶层的代表。
  • 其中age数据缺失。

二、步骤分析

  • 导入库

    import pandas as pd
    import numpy as np
    from sklearn.model_selection import train_test_split
    from sklearn.feature_extraction import DictVectorizer
    from sklearn.tree import DecisionTreeClassifier
    
  1. 获取数据

    # 1.获取数据
    titan = pd.read_csv("https://hbiostat.org/data/repo/titanic.txt")
    
  2. 数据基本处理

    • 确定特征值,目标值

      # 2.数据基本处理
      # 2.1确定特征值,目标值
      x = titan[["pclass","age","sex"]]
      y = titan["survived"]
      
    • 缺失值处理

      # 2.2缺失值处理
      x["age"].fillna(value=titan["age"].mean(),inplace= True)
      
    • 数据集划分

      # 2.3数据集划分
      x_train, x_test, y_train, y_test = train_test_split(x,y,test_size=0.2,random_state=22)
      
  3. 特征工程(字典特征提取)

    # 3.特征工程--字典类型提取
    x_train = x_train.to_dict(orient="records")
    x_test = x_test.to_dict(orient="records")
    transfer = DictVectorizer(sparse=False)
    x_train = transfer.fit_transform(x_train)
    x_test = transfer.transform(x_test)
    
  4. 机器学习(决策树)

    # 4.机器学习(决策树)
    estimator = DecisionTreeClassifier()
    estimator.fit(x_train,y_train)
    
  5. 模型评估

    # 5.模型评估
    y_pre = estimator.predict(x_test)
    print("预测结果是:\n",y_pre)
    score = estimator.score(x_test,y_test)
    print("预测准确率为:\n",score)
    

全部代码

import pandas as pd
import numpy as np
from sklearn.model_selection import train_test_split
from sklearn.feature_extraction import DictVectorizer
from sklearn.tree import DecisionTreeClassifier# 1.获取数据
titan = pd.read_csv("https://hbiostat.org/data/repo/titanic.txt")# 2.数据基本处理
# 2.1确定特征值,目标值
x = titan[["pclass","age","sex"]]
y = titan["survived"]# 2.2缺失值处理
x["age"].fillna(value=titan["age"].mean(),inplace= True)# 2.3数据集划分
x_train, x_test, y_train, y_test = train_test_split(x,y,test_size=0.2,random_state=22)# 3.特征工程--字典类型提取
x_train = x_train.to_dict(orient="records")
x_test = x_test.to_dict(orient="records")
transfer = DictVectorizer(sparse=False)
x_train = transfer.fit_transform(x_train)
x_test = transfer.transform(x_test)# 4.机器学习(决策树)
estimator = DecisionTreeClassifier()
estimator.fit(x_train,y_train)# 5.模型评估
y_pre = estimator.predict(x_test)
print("预测结果是:\n",y_pre)
score = estimator.score(x_test,y_test)
print("预测准确率为:\n",score)

三、决策树可视化

1.保存树的结构到dot文件
  • sklearn.tree.export_graphviz():该函数能够导出DOT文件

    • tree.export_graphviz(estimator,out_file=“保存文件的地址”,feature_names=[“”,“”])
    export_graphviz(estimator,out_file="../data/tree.dot",feature_names=["age","pclass=1st","pclass=2nd","pclass=3rd","女性","男性"])
    
  • dot文件的内容如下

    在这里插入图片描述

2.显示决策树结构(通过Graphviz软件)
  • 下载Graphviz工具

  • 配置环境变量

  • 打开命令提示符,cd进入到存放.dot文件的路径

  • 通过以下命令生成决策树图片

    dot -Tpng 文件名.dot -o 生成图片的文件名.png
    
  • 该案例的决策树结构如下所示:

    在这里插入图片描述


http://www.ppmy.cn/news/92190.html

相关文章

Modern CSV:大型 CSV 文件编辑器/查看器 Crack

Modern CSV用于快速查看大型 CSV 文件 适用于 Windows、Mac 和 Linux 的复杂 CSV 编辑器/查看器 被使用 电子商务运营商。数据科学家。会计师。 IT 专业人员。学生。医学研究人员。数字营销人员。生物学家。工程师。 现代 CSV 是适用于 Windows、Mac 和 Linux 的功能强大的表格…

Java的反射机制

目录 反射的基本介绍 反射的需求 反射相关的主要类 反射优点和缺点 反射调用优化 首先我们先来看看反射的基本介绍吧 反射的基本介绍 Java的发射机制(Reflection)是指在运行时动态地获取类的信息并操作对象的能力。Java的发射机制允许程序在运行时…

C++11常用的一部分新特性

C11 统一的列表初始化{}初始化std::initializer_list 声明autodecltypenullptr STL中一些变化新容器已有容器的新接口 右值引用和移动语义左值引用和右值引用右值引用使用场景和意义右值引用引用左值及其一些更深入的使用场景分析完美转发 新的类功能默认…

数据库基础——2.MySQL的卸载安装及相关环境的配置

这篇文章我们来说一下MySQL的下载、安装、相关环境配置、可能遇见的问题及其解决方案、卸载等操作。 目录 1.查看已安装的 1.1 命令提示窗口下查看 1.2 文件目录下查看 2.Mysql的卸载 2.1卸载mysql 2.2 清理其他文件 3.MySQL的下载 3.1 介绍 3.2 软件下载 3.3 软件安…

Hbase高可用集群的搭建

高可用基于zookeeper zookeeper安装教程:集群上Zookeeper服务的搭建_EEEurekaaa!的博客-CSDN博客 1.下载安装包 推荐去国内源进行安装 Index of /apache/hbase 下载版本时,注意hbase与Hadoop的版本对应关系 2.上传服务器并解压 4.配置环…

ESP32通过 WiFi 传输视频

概述 这是ESP32 WiFi视频流的入门教程。ESP32-CAM 是一款带有ESP32-S 芯片的小型摄像头模块,除了OV2640 相机和多个用于连接外围设备的 GPIO 外,它还具有一个microSD 卡插槽,可用于存储相机拍摄的图像。 ESP32-CAM 简介 ESP32-CAM 是一款采用ESP32-S 芯片的超小型相机模组…

前端列表页+element-puls实现列表数据弹窗功能

效果图: 这是一个修改的弹窗,我们要实现的功能是,在列表,点击修改按钮时,将数据带入到弹窗里面,点击保存时关闭弹窗。 1,点击修改展开弹窗 使用 eldialog组件,v-model绑定的值为tru…

ModSecurity是一个开源的

北京集佳知识产权代理有限公司 北京北森云计算股份有限公司 网络安全系统 东软网络安全_东软集团 安全等级保护三级备案-等级评定-测评-整改-全套方案 ModSecurity是一个开源的、跨平台的Web应用防火墙(WAF),被称为WAF界的“瑞士军刀”。 linux下waf防火墙_linux waf防火墙_waf…