AN

Ali Naderi

Lead Data Scientist & ML Architect

Clinical Decision Support System

Heart Disease Prediction
Diagnostic Modeling

A state-of-the-art machine learning pipeline designed to identify cardiovascular risk factors from the UCI Cleveland Dataset. Featuring rigorous statistical EDA, zero-leakage preprocessing, hyperparameter sweeps, and high-performance Stacking Ensembles.

# Scikit-Learn # Python # GridSearchCV # Ensemble Learning # Clinical Statistics # Feature Engineering
The Challenge

Translating Clinical Data into Predictive Intelligence

Cardiovascular diseases are the leading cause of death globally. Early identification of at-risk patients is critical for preventive intervention. However, clinical datasets are often noisy, highly skewed, and prone to methodological errors (like data leakage) during model development.

My Objective: To engineer a robust, clinically-sound classification pipeline that maximizes Recall (minimizing false negatives — missing a diseased patient) while maintaining high overall accuracy, ensuring the model is reliable enough for integration into a Clinical Decision Support System (CDSS).

303
Patients Evaluated
13
Clinical Features

Key Clinical Indicators Analyzed

  • Resting ECG & ST Depression
    Vital markers for myocardial ischemia
  • Max Heart Rate & Angina
    Exercise-induced symptoms and thresholds
  • Cholesterol & Blood Pressure
    Baseline systemic risk factors
Data Science Approach

End-to-End Analytical Workflow

1. Statistical EDA

Deep exploratory analysis utilizing robust non-parametric tests. Uncovered hidden clinical correlations.

  • Q-Q Normality Testing
  • Mann-Whitney U tests for continuous vs categorical targets
  • Chi-Square & Cramer's V for nominal associations

2. Zero-Leakage Preprocessing

Engineered a strict ColumnTransformer pipeline that separates train/test data perfectly before scaling or transformation.

  • Yeo-Johnson Power Transforms for severe skewness
  • One-Hot Encoding for multi-class nominals
  • StandardScaling & VIF Multicollinearity audits

3. Advanced Ensembling

Evaluated Decision Trees, RF, KNN, SVM, and XGBoost via GridSearchCV (Stratified 5-Fold), culminating in elite ensembles.

  • Stacking Classifier (SVM, RF, KNN base -> LR meta)
  • Soft Voting Ensembles
  • High precision and robust AUC scores achieved
Interactive Demo

Digital Twin: Diagnostic Risk Estimator

Experience the logic of our machine learning pipeline in real-time. Adjust the clinical biomarkers below to see how the underlying Logistic Regression model weights estimate the probability of Coronary Artery Disease.

45% PROBABILITY
Moderate Risk

Estimation based on clinical weights derived from our optimized Logistic Regression model.

Project Assets

Explore the Jupyter Notebooks

The complete Python source code is meticulously documented and styled in a clean, high-contrast Clinical format. Review the statistical EDA and machine learning pipelines.

1. Advanced Statistical EDA

Heart_Disease_Advanced_EDA.ipynb

Contains custom high-resolution data visualizations, rigorous Mann-Whitney U/Chi-Square testing, and distribution analysis.

2. Modeling & Ensembles

Heart_Disease_Advanced_Modeling.ipynb

Features secure ColumnTransformers, GridSearchCV tuning across 5 models, Stacking/Voting Classifiers, and ROC evaluation.