This project predicts whether a loan application will be approved or not using machine learning classification models. The dataset used is from Kaggle’s Loan Prediction problem. The goal is to build a robust model to assist banks or financial institutions in making automated loan approval decisions.
- Python 3.x
- Pandas, NumPy for data processing
- Scikit-learn for model building and evaluation
- Seaborn, Matplotlib for visualization
- Joblib for model saving
-
Data Loading & Exploration
Explored dataset shape, features, missing values, and basic statistics. -
Data Cleaning & Preprocessing
- Imputed missing values with median (numerical) and mode (categorical).
- Dropped irrelevant columns (
Loan_ID). - Encoded categorical features using Label Encoding.
- Scaled numerical features using StandardScaler.
-
Exploratory Data Analysis (EDA)
Visualized distributions, relationships between features and target, and detected outliers. -
Outlier Removal
Removed outliers inApplicantIncomeandLoanAmountusing the IQR method. -
Feature Selection
Selected relevant features based on correlation and feature importance from Random Forest. -
Model Training
Trained Logistic Regression, Random Forest, and SVM classifiers. -
Hyperparameter Tuning
Tuned Random Forest using RandomizedSearchCV for better performance. -
Model Evaluation
Evaluated models using accuracy, classification report. -
Prediction on Test Data
Processed test dataset similarly and predicted loan approval status. -
Model Saving
Saved the best model using Joblib for future inference.