This repository contains a complete, step-by-step Exploratory Data Analysis (EDA) of the Kaggle Titanic: Machine Learning from Disaster dataset.
The analysis was conducted in Python using Pandas, Matplotlib, and Seaborn within Google Colab.
- titanic_eda.ipynb — Full Jupyter Notebook with EDA steps.
- titanic_clean.csv — Cleaned dataset after preprocessing.
- figures/ — Saved visualizations from the notebook.
- Data Loading & Overview
- Missing Data Analysis & Cleaning
- Feature Engineering (Title, Family Size, IsAlone, etc.)
- Univariate Analysis — Distributions & counts for key features.
- Bivariate Analysis — Survival by Sex, Class, Embarked.
- Heatmaps — Survival rate pivot tables & correlation matrix.
- Insights & Executive Summary — Actionable findings and next steps.
- Survival rate by gender, passenger class, and port of embarkation.
- Age and Fare distributions with outlier detection.
- Correlation heatmap for numeric and engineered features.
Masum Abbas — Data Science Student at Air University, passionate about data analysis, visualization, and turning raw data into actionable insights.