{
 "cells": [
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "aaba4068-4aae-41d6-b27b-71448e23508b",
   "metadata": {},
   "outputs": [],
   "source": [
    "import pandas as pd\n",
    "import numpy as np\n",
    "from sklearn.model_selection import train_test_split, GridSearchCV\n",
    "from sklearn.impute import SimpleImputer\n",
    "from sklearn.preprocessing import StandardScaler\n",
    "from sklearn.linear_model import LogisticRegression\n",
    "from sklearn.tree import DecisionTreeClassifier\n",
    "from sklearn.ensemble import RandomForestClassifier\n",
    "from sklearn.svm import SVC\n",
    "from sklearn.neighbors import KNeighborsClassifier\n",
    "from sklearn.naive_bayes import GaussianNB\n",
    "from sklearn.metrics import accuracy_score, classification_report\n",
    "from sklearn.feature_selection import SelectKBest, chi2, RFE\n",
    "\n",
    "\n",
    "df = pd.read_csv(\"diabetes.csv\")\n",
    "\n",
    "# Handle missing values\n",
    "# No missing data found , Data is cleaned\n",
    "imputer = SimpleImputer(strategy='mean')\n",
    "X = df.drop('Outcome', axis=1)\n",
    "X = imputer.fit_transform(X)\n",
    "y = df['Outcome']\n",
    "\n",
    "# Split data into training and testing sets\n",
    "X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)\n",
    "\n",
    "# Standardize the data\n",
    "scaler = StandardScaler()\n",
    "X_train = scaler.fit_transform(X_train)\n",
    "X_test = scaler.transform(X_test)\n",
    "\n",
    "# Define machine learning models and hyperparameters\n",
    "models = {\n",
    "    'LogisticRegression': LogisticRegression(),\n",
    "    'DecisionTree': DecisionTreeClassifier(),\n",
    "    'RandomForest': RandomForestClassifier(),\n",
    "    'SVM': SVC(),\n",
    "    'KNN': KNeighborsClassifier(),\n",
    "    'NaiveBayes': GaussianNB()\n",
    "}\n",
    "\n",
    "params = {\n",
    "    'LogisticRegression': {'C': [0.01, 0.1, 1, 10]},\n",
    "    'DecisionTree': {'max_depth': [3, 5, 7]},\n",
    "    'RandomForest': {'n_estimators': [50, 100, 150], 'max_depth': [5, 7, 10]},\n",
    "    'SVM': {'C': [0.01, 0.1, 1], 'kernel': ['linear', 'rbf']},\n",
    "    'KNN': {'n_neighbors': [3, 5, 7]},\n",
    "    'NaiveBayes': {}\n",
    "}\n",
    "\n",
    "# Apply models and GridSearchCV\n",
    "best_estimators = {}\n",
    "with open(\"output.txt\", \"w\") as f:\n",
    "    for model_name, model in models.items():\n",
    "        f.write(f\"Training {model_name}...\\n\")\n",
    "        grid = GridSearchCV(model, params[model_name], cv=5, scoring='accuracy', n_jobs=-1)\n",
    "        grid.fit(X_train, y_train)\n",
    "        best_estimators[model_name] = grid.best_estimator_\n",
    "        f.write(f\"Best parameters for {model_name}: {grid.best_params_}\\n\")\n",
    "\n",
    "    # Evaluate models\n",
    "    for model_name, model in best_estimators.items():\n",
    "        y_pred = model.predict(X_test)\n",
    "        f.write(f\"{model_name} Accuracy: {accuracy_score(y_test, y_pred):.4f}\\n\")\n",
    "        f.write(classification_report(y_test, y_pred) + \"\\n\")\n",
    "\n",
    "    # Feature Selection\n",
    "    f.write(\"\\nFeature Selection\\n\")\n",
    "    # Method 1: SelectKBest (Chi-Square)\n",
    "    k_best = SelectKBest(score_func=chi2, k=5)\n",
    "    X_new_kbest = k_best.fit_transform(X_train, y_train)\n",
    "    selected_features_kbest = k_best.get_support(indices=True)\n",
    "    f.write(\"Selected features using SelectKBest: \" + str(selected_features_kbest) + \"\\n\")\n",
    "\n",
    "    # Method 2: Recursive Feature Elimination (RFE)\n",
    "    logreg = LogisticRegression()\n",
    "    rfe = RFE(estimator=logreg, n_features_to_select=5)\n",
    "    X_new_rfe = rfe.fit_transform(X_train, y_train)\n",
    "    selected_features_rfe = rfe.get_support(indices=True)\n",
    "    f.write(\"Selected features using RFE: \" + str(selected_features_rfe) + \"\\n\")\n",
    "\n",
    "    # Reapply ML models on selected features\n",
    "    def evaluate_on_selected_features(X_selected, X_test_selected, y_train, y_test, model):\n",
    "        model.fit(X_selected, y_train)\n",
    "        y_pred = model.predict(X_test_selected)\n",
    "        return accuracy_score(y_test, y_pred)\n",
    "\n",
    "    X_test_kbest = k_best.transform(X_test)\n",
    "    X_test_rfe = rfe.transform(X_test)\n",
    "\n",
    "    for model_name, model in best_estimators.items():\n",
    "        f.write(f\"\\nEvaluating {model_name} on SelectKBest features:\\n\")\n",
    "        accuracy_kbest = evaluate_on_selected_features(X_new_kbest, X_test_kbest, y_train, y_test, model)\n",
    "        f.write(f\"Accuracy on SelectKBest features: {accuracy_kbest:.4f}\\n\")\n",
    "\n",
    "        f.write(f\"\\nEvaluating {model_name} on RFE features:\\n\")\n",
    "        accuracy_rfe = evaluate_on_selected_features(X_new_rfe, X_test_rfe, y_train, y_test, model)\n",
    "        f.write(f\"Accuracy on RFE features: {accuracy_rfe:.4f}\\n\")\n"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "56888ae9-6bb6-4c73-9074-28ece045cfa8",
   "metadata": {},
   "outputs": [],
   "source": []
  },
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "f3bb7994-559a-4e30-a3d9-432137499dab",
   "metadata": {},
   "outputs": [],
   "source": []
  }
 ],
 "metadata": {
  "kernelspec": {
   "display_name": "anaconda-panel-2023.05-py310",
   "language": "python",
   "name": "conda-env-anaconda-panel-2023.05-py310-py"
  },
  "language_info": {
   "codemirror_mode": {
    "name": "ipython",
    "version": 3
   },
   "file_extension": ".py",
   "mimetype": "text/x-python",
   "name": "python",
   "nbconvert_exporter": "python",
   "pygments_lexer": "ipython3",
   "version": "3.11.5"
  }
 },
 "nbformat": 4,
 "nbformat_minor": 5
}
