{ "cells": [ { "cell_type": "code", "execution_count": 98, "metadata": {}, "outputs": [], "source": [ "import os\n", "import time\n", "import datetime\n", "import pandas as pd\n", "import numpy as np\n", "import sklearn\n", "import matplotlib.pyplot as plt\n", "import seaborn as sb\n", "from sklearn.linear_model import SGDClassifier\n", "from sklearn.model_selection import train_test_split as ttsplit\n", "from sklearn.model_selection import cross_val_predict as cvpredict\n", "from sklearn.metrics import confusion_matrix, precision_score, recall_score, f1_score\n", "from sklearn.utils import shuffle" ] }, { "cell_type": "code", "execution_count": 99, "metadata": {}, "outputs": [], "source": [ "DataTrain = pd.read_csv(\"C:\\\\Users\\\\Admin\\\\Documents\\\\machine learning\\\\CleanData.csv\")" ] }, { "cell_type": "code", "execution_count": 100, "metadata": {}, "outputs": [], "source": [ "DataTrain = pd.get_dummies(DataTrain)\n", "Data = DataTrain.drop(columns='left')\n", "Target = DataTrain['left']\n", "Classifier = SGDClassifier(random_state=30)" ] }, { "cell_type": "code", "execution_count": 101, "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "Confusion Matrix: [[8453 169]\n", " [ 409 1389]]\n", "Precision: 0.8915275994865212\n", "Recall: 0.7725250278086763\n", "F1 Score: 0.8277711561382599\n" ] } ], "source": [ "D_train, D_test, T_train, T_test = ttsplit(Data, Target, test_size=0.15, stratify= Target)\n", "D_train, T_train = shuffle(D_train, T_train)\n", "T_train_pred = cvpredict(Classifier, D_train, T_train, cv=5)\n", "confusion = confusion_matrix(T_train, T_train_pred)\n", "precision = precision_score(T_train, T_train_pred)\n", "recall = recall_score(T_train, T_train_pred)\n", "f1 = f1_score(T_train, T_train_pred)\n", "\n", "print(\"Confusion Matrix: \", confusion)\n", "print(\"Precision: \", precision)\n", "print(\"Recall: \", recall)\n", "print(\"F1 Score: \", f1)" ] }, { "cell_type": "code", "execution_count": 102, "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "Confusion Matrix: [[7482 126]\n", " [ 370 1216]]\n", "Precision: 0.9061102831594635\n", "Recall: 0.7667087011349306\n", "F1 Score: 0.8306010928961749\n" ] } ], "source": [ "D_train, D_test, T_train, T_test = ttsplit(Data, Target, test_size=0.25, stratify= Target)\n", "D_train, T_train = shuffle(D_train, T_train)\n", "T_train_pred = cvpredict(Classifier, D_train, T_train, cv=5)\n", "confusion = confusion_matrix(T_train, T_train_pred)\n", "precision = precision_score(T_train, T_train_pred)\n", "recall = recall_score(T_train, T_train_pred)\n", "f1 = f1_score(T_train, T_train_pred)\n", "\n", "print(\"Confusion Matrix: \", confusion)\n", "print(\"Precision: \", precision)\n", "print(\"Recall: \", recall)\n", "print(\"F1 Score: \", f1)" ] }, { "cell_type": "code", "execution_count": 103, "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "Confusion Matrix: [[6457 136]\n", " [ 388 987]]\n", "Precision: 0.8788958147818343\n", "Recall: 0.7178181818181818\n", "F1 Score: 0.7902321857485988\n" ] } ], "source": [ "D_train, D_test, T_train, T_test = ttsplit(Data, Target, test_size=0.35, stratify= Target)\n", "D_train, T_train = shuffle(D_train, T_train)\n", "T_train_pred = cvpredict(Classifier, D_train, T_train, cv=5)\n", "confusion = confusion_matrix(T_train, T_train_pred)\n", "precision = precision_score(T_train, T_train_pred)\n", "recall = recall_score(T_train, T_train_pred)\n", "f1 = f1_score(T_train, T_train_pred)\n", "\n", "print(\"Confusion Matrix: \", confusion)\n", "print(\"Precision: \", precision)\n", "print(\"Recall: \", recall)\n", "print(\"F1 Score: \", f1)" ] } ], "metadata": { "kernelspec": { "display_name": "Python 3", "language": "python", "name": "python3" }, "language_info": { "codemirror_mode": { "name": "ipython", "version": 3 }, "file_extension": ".py", "mimetype": "text/x-python", "name": "python", "nbconvert_exporter": "python", "pygments_lexer": "ipython3", "version": "3.7.5" } }, "nbformat": 4, "nbformat_minor": 2 }