Skip to content

Applied Data Science syllabus

MIT 5527 units · 59 topicsAcademic year 2083/84
Browse the units

Applied Data Science

7 units

1. Introduction to Data Science (6 LHs)

  1. Introduction to Data Science
    1. Introduction to Data Science
  2. Data-Driven Decision Making
    1. Data-Driven Decision Making
  3. Data Science Workflow
    1. Data Science Workflow: Business Problem, Data, Exploration and Analysis, Modeling, Insight, Decision
  4. Data Science life-cycle
    1. Data Science life-cycle: CRISP-DM, TDSP
  5. Key Roles
    1. Key Roles: Data Engineer, Data Analyst, Machine Learning Engineer, Data Scientist
  6. Overview of Tools
    1. Overview of Tools: Python Ecosystem, Jupyter Notebook, Common Libraries
  7. Setting up the Environement
    1. Setting up the Environement
  8. Anaconda
    1. Anaconda, Jupyter Notebook, Installing Libraries-Numpy, Pandas, Matplolib, Seaborn, Scikit-Learn

2. Data Collection and Preparation (10 LHs)

  1. Types of Data
    1. Types of Data: Structured, Semi-structured and Unstructured
  2. Commonly used Data Formats
    1. Commonly used Data Formats: CSV files, Excel, JSON, web APIs, Databases
  3. Loading and Inspecting data with Pandas (read_csv, head, info, describe)
    1. Loading and Inspecting data with Pandas (read_csv, head, info, describe)
    2. Data Quality
  4. Common Issues with Real World Data
    1. Common Issues with Real World Data
  5. Data Cleaning Techniques
    1. Data Cleaning Techniques
    2. Data Validation
  6. Data Transformation
    1. Data Transformation: Filtering, Sorting, Merging, Normalization, Standardization, Encoding Categorical Variables
  7. Feature Engineering
    1. Feature Engineering: Feature Generation, Feature Selection, Feature Extraction

3. Exploratory Data Analysis and Visualization (8 LHs)

  1. Purpose and Process of Exploratory Data Analysis (EDA), Descriptive Statistics
    1. Purpose and Process of Exploratory Data Analysis (EDA), Descriptive Statistics: Mean, Median, Mode, Variance, Standard Deviation
  2. Univariate Analysis
    1. Univariate Analysis: Histograms, Box Plots, Frequency Tables
  3. Bivariate Analysis
    1. Bivariate Analysis: Scatter Plots, Correlation, Cross-Tabulation
    2. Data Visualization
  4. Visualizing Distributions and Comparisons
    1. Visualizing Distributions and Comparisons: Bar Charts, Pie Charts, Line Plots, Histograms, Box Plots, Scatter Plots, Violin Plots, Pair plots and Interpretations
  5. Principles of Effective Data Visualization
    1. Principles of Effective Data Visualization
  6. Chart Selection, Labeling, Color
    1. Chart Selection, Labeling, Color
  7. Interpreting EDA findings for Business Insight
    1. Interpreting EDA findings for Business Insight

4. Statistics for Data Science (8 LHs)

  1. Statistics and its Importance for Data Science
    1. Statistics and its Importance for Data Science
  2. Probability Basics
    1. Probability Basics: Events, Outcomes and Probability Rules
  3. Common Distributions
    1. Common Distributions: Normal Distribution and its Properties, Skewness
  4. Sampling
    1. Sampling: Population vs Sample, Sampling Methods
  5. Confidence Intervals
    1. Confidence Intervals: Concept and Business Interpretation
  6. Hypothesis Testing
    1. Hypothesis Testing: Null and alternative Hypothesis, p-value, Significance Level
  7. Practical Tests
    1. Practical Tests: t-test and chi-square test with SciPy
  8. Interpreting Relationships between Variables
    1. Interpreting Relationships between Variables: Correlation and Simple Linear Regression

5. Machine Learning (10 LHs)

  1. Understanding Predictive analytics and Machine Learning
    1. Understanding Predictive analytics and Machine Learning
  2. Artificial Intelligence vs Machine Learning
    1. Artificial Intelligence vs Machine Learning
  3. Machine Learning Techniques
    1. Machine Learning Techniques: Supervised, Unsupervised and Reinforcement learning and their types. Regression Techniques: Linear Regression, Polynomial Regression
  4. Classification Techniques
    1. Classification Techniques: Logistic Regression, KNN, Decision Tree
  5. Model Evaluation
    1. Model Evaluation: Train/test Split
  6. Root Mean Squared Error, Mean Absolute Error, Mean Percentage Error
    1. Root Mean Squared Error, Mean Absolute Error, Mean Percentage Error
    2. Confusion Matrix
  7. Accuracy, Precision and Recall
    1. Accuracy, Precision and Recall
  8. Unsupervised Learning
    1. Unsupervised Learning: Clustering Intuition and K-Means

6. Ethical and Responsible Data Science (6 LHs)

  1. Ethics for Data Scientist
    1. Ethics for Data Scientist
  2. Real-world Cases of Algorithmic Harm
    1. Real-world Cases of Algorithmic Harm
  3. Bias in Data and Models
    1. Bias in Data and Models: Sources and Consequences
  4. Common Cognitive Biases
    1. Common Cognitive Biases
  5. Addressing Cognitive Bias
    1. Addressing Cognitive Bias
  6. Data Privacy Principles and Regulations
    1. Data Privacy Principles and Regulations: GDPR overview, Right to Privacy Responsible Data Collection: Consent, Anonymization, and Data Minimization Transparency and Explainability
  7. Ethical guidelines for AI and data science (OECD overview)
    1. Ethical guidelines for AI and data science (OECD overview)

7. Laboratory Work

  1. L1: Environment Setup and Python Review
    1. Environment setup; introduction to Jupyter Notebook and Python review for data science. Tools: Anaconda and Jupyter. Deliverable: setup verification notebook.
  2. L2: Data Loading and Inspection
    1. Loading CSV, Excel, and JSON files; initial data inspection and profiling with Pandas. Deliverable: inspection report.
  3. L3: Data Cleaning
    1. Handling missing values and duplicates; correcting data types on a business dataset using Pandas. Deliverable: cleaned dataset.
  4. L4: Data Transformation
    1. Normalization, encoding categorical variables, and feature creation with Pandas and Scikit-learn. Deliverable: transformed dataset.
  5. L5: Univariate Analysis
    1. Descriptive statistics; histograms, box plots, and frequency tables using Pandas and Matplotlib. Deliverable: summary notebook.
  6. L6: Bivariate Analysis and Correlation
    1. Scatter plots, correlation matrix, and heatmap using Seaborn and Matplotlib. Deliverable: visualization gallery.
  7. L7: Exploratory Data Analysis
    1. Full EDA on a real business dataset, deriving and presenting insights visually using Pandas and Seaborn. Deliverable: EDA report.
  8. L8: Probability and Descriptive Statistics
    1. Descriptive statistics and probability with Python; normal distribution visualization using NumPy, SciPy, and Matplotlib. Deliverable: lab notebook.
  9. L9: Hypothesis Testing
    1. t-test and chi-square test on business data, interpreting results using SciPy and Pandas. Deliverable: statistical analysis report.
  10. L10: Correlation and Regression
    1. Correlation and simple linear regression: fitting a line, interpreting slope and R² using Scikit-learn and Matplotlib. Deliverable: regression notebook.
  11. L11: Machine Learning Workflow
    1. Train/test split, fitting a Linear Regression model, evaluating MAE and R² using Scikit-learn. Deliverable: model evaluation notebook.
  12. L12: Classification
    1. Logistic Regression for predicting a business outcome; confusion matrix and accuracy using Scikit-learn. Deliverable: classification report.
  13. L13: Clustering
    1. K-Means clustering for customer segmentation, visualizing clusters using Scikit-learn and Seaborn. Deliverable: clustering notebook.
  14. L14: End-to-End Mini Project
    1. Data cleaning, EDA, a simple predictive model, and a summary report with visualizations using the full Python stack. Deliverable: project report and presentation.