Skip to content

Repository files navigation

Titanic Dataset — Exploratory Data Analysis (EDA)

This repository contains a complete, step-by-step Exploratory Data Analysis (EDA) of the Kaggle Titanic: Machine Learning from Disaster dataset.
The analysis was conducted in Python using Pandas, Matplotlib, and Seaborn within Google Colab.


📂 Contents

  • titanic_eda.ipynb — Full Jupyter Notebook with EDA steps.
  • titanic_clean.csv — Cleaned dataset after preprocessing.
  • figures/ — Saved visualizations from the notebook.

🔍 Key Analysis Steps

  1. Data Loading & Overview
  2. Missing Data Analysis & Cleaning
  3. Feature Engineering (Title, Family Size, IsAlone, etc.)
  4. Univariate Analysis — Distributions & counts for key features.
  5. Bivariate Analysis — Survival by Sex, Class, Embarked.
  6. Heatmaps — Survival rate pivot tables & correlation matrix.
  7. Insights & Executive Summary — Actionable findings and next steps.

📊 Example Visualizations

  • Survival rate by gender, passenger class, and port of embarkation.
  • Age and Fare distributions with outlier detection.
  • Correlation heatmap for numeric and engineered features.


✨ Author

Masum Abbas — Data Science Student at Air University, passionate about data analysis, visualization, and turning raw data into actionable insights.

About

Exploratory Data Analysis of the Kaggle Titanic dataset using Python, Pandas, Matplotlib, and Seaborn — includes cleaned dataset, visualizations, and survival insights.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages