Academic & Applied Research Context
Developed throughout my Data Science curriculum at Chouaïb Doukkali University (UCD) in El Jadida, Morocco, translating raw datasets into predictive intelligence.
Real-world operational data suffers from missing values and high-dimensional colinearity. The goal was building robust, leak-free ML pipelines.
The Machine Learning Lifecycle
- Exploratory Data Analysis (EDA): Uncovering hidden correlations, outlier bounds via IQR filtering, and feature interactions using Seaborn heatmaps.
- Feature Engineering & Transformation: One-Hot encoding, Box-Cox normalization, polynomial interaction terms, and TF-IDF vectorization.
- Model Benchmark: Evaluating Random Forests, XGBoost, and SVM under stratified 10-fold cross-validation.
- Model Explainability (XAI): Extracting global and local feature importance utilizing SHAP values.
Production Pipeline Code (Scikit-Learn)
# Scikit-Learn Preprocessing & Predictive Pipeline
from sklearn.pipeline import Pipeline
from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import StandardScaler, OneHotEncoder
from sklearn.ensemble import RandomForestClassifier
numeric_features = ['age', 'session_duration', 'interaction_count']
categorical_features = ['device_type', 'region', 'subscription_tier']
preprocessor = ColumnTransformer(
transformers=[
('num', StandardScaler(), numeric_features),
('cat', OneHotEncoder(drop='first'), categorical_features)
]
)
ml_pipeline = Pipeline(steps=[
('preprocessor', preprocessor),
('classifier', RandomForestClassifier(n_estimators=200, max_depth=12, random_state=42))
])
# Fit model and evaluate test set
ml_pipeline.fit(X_train, y_train)
accuracy = ml_pipeline.score(X_test, y_test)
print(f"Test Set Accuracy: {accuracy * 100:.2f}%")
Research Impact & Competencies
This academic and practical training established strong foundations in mathematical modeling, algorithmic optimization, and statistical rigor.