Applied Data Science syllabus
Browse the units
Applied Data Science
7 units
3 Exploratory Data Analysis and Visualization (8 LHs)
5 Machine Learning (10 LHs)
7 Laboratory Work
- L1: Environment Setup and Python Review
- L2: Data Loading and Inspection
- L3: Data Cleaning
- L4: Data Transformation
- L5: Univariate Analysis
- L6: Bivariate Analysis and Correlation
- L7: Exploratory Data Analysis
- L8: Probability and Descriptive Statistics
- L9: Hypothesis Testing
- L10: Correlation and Regression
- L11: Machine Learning Workflow
- L12: Classification
- L13: Clustering
- L14: End-to-End Mini Project
1. Introduction to Data Science (6 LHs)
- Introduction to Data Science
- Introduction to Data Science
- Data-Driven Decision Making
- Data-Driven Decision Making
- Data Science Workflow
- Data Science Workflow: Business Problem, Data, Exploration and Analysis, Modeling, Insight, Decision
- Data Science life-cycle
- Data Science life-cycle: CRISP-DM, TDSP
- Key Roles
- Key Roles: Data Engineer, Data Analyst, Machine Learning Engineer, Data Scientist
- Overview of Tools
- Overview of Tools: Python Ecosystem, Jupyter Notebook, Common Libraries
- Setting up the Environement
- Setting up the Environement
- Anaconda
- Anaconda, Jupyter Notebook, Installing Libraries-Numpy, Pandas, Matplolib, Seaborn, Scikit-Learn
2. Data Collection and Preparation (10 LHs)
- Types of Data
- Types of Data: Structured, Semi-structured and Unstructured
- Commonly used Data Formats
- Commonly used Data Formats: CSV files, Excel, JSON, web APIs, Databases
- Loading and Inspecting data with Pandas (read_csv, head, info, describe)
- Loading and Inspecting data with Pandas (read_csv, head, info, describe)
- Data Quality
- Common Issues with Real World Data
- Common Issues with Real World Data
- Data Cleaning Techniques
- Data Cleaning Techniques
- Data Validation
- Data Transformation
- Data Transformation: Filtering, Sorting, Merging, Normalization, Standardization, Encoding Categorical Variables
- Feature Engineering
- Feature Engineering: Feature Generation, Feature Selection, Feature Extraction
3. Exploratory Data Analysis and Visualization (8 LHs)
- Purpose and Process of Exploratory Data Analysis (EDA), Descriptive Statistics
- Purpose and Process of Exploratory Data Analysis (EDA), Descriptive Statistics: Mean, Median, Mode, Variance, Standard Deviation
- Univariate Analysis
- Univariate Analysis: Histograms, Box Plots, Frequency Tables
- Bivariate Analysis
- Bivariate Analysis: Scatter Plots, Correlation, Cross-Tabulation
- Data Visualization
- Visualizing Distributions and Comparisons
- Visualizing Distributions and Comparisons: Bar Charts, Pie Charts, Line Plots, Histograms, Box Plots, Scatter Plots, Violin Plots, Pair plots and Interpretations
- Principles of Effective Data Visualization
- Principles of Effective Data Visualization
- Chart Selection, Labeling, Color
- Chart Selection, Labeling, Color
- Interpreting EDA findings for Business Insight
- Interpreting EDA findings for Business Insight
4. Statistics for Data Science (8 LHs)
- Statistics and its Importance for Data Science
- Statistics and its Importance for Data Science
- Probability Basics
- Probability Basics: Events, Outcomes and Probability Rules
- Common Distributions
- Common Distributions: Normal Distribution and its Properties, Skewness
- Sampling
- Sampling: Population vs Sample, Sampling Methods
- Confidence Intervals
- Confidence Intervals: Concept and Business Interpretation
- Hypothesis Testing
- Hypothesis Testing: Null and alternative Hypothesis, p-value, Significance Level
- Practical Tests
- Practical Tests: t-test and chi-square test with SciPy
- Interpreting Relationships between Variables
- Interpreting Relationships between Variables: Correlation and Simple Linear Regression
5. Machine Learning (10 LHs)
- Understanding Predictive analytics and Machine Learning
- Understanding Predictive analytics and Machine Learning
- Artificial Intelligence vs Machine Learning
- Artificial Intelligence vs Machine Learning
- Machine Learning Techniques
- Machine Learning Techniques: Supervised, Unsupervised and Reinforcement learning and their types. Regression Techniques: Linear Regression, Polynomial Regression
- Classification Techniques
- Classification Techniques: Logistic Regression, KNN, Decision Tree
- Model Evaluation
- Model Evaluation: Train/test Split
- Root Mean Squared Error, Mean Absolute Error, Mean Percentage Error
- Root Mean Squared Error, Mean Absolute Error, Mean Percentage Error
- Confusion Matrix
- Accuracy, Precision and Recall
- Accuracy, Precision and Recall
- Unsupervised Learning
- Unsupervised Learning: Clustering Intuition and K-Means
6. Ethical and Responsible Data Science (6 LHs)
- Ethics for Data Scientist
- Ethics for Data Scientist
- Real-world Cases of Algorithmic Harm
- Real-world Cases of Algorithmic Harm
- Bias in Data and Models
- Bias in Data and Models: Sources and Consequences
- Common Cognitive Biases
- Common Cognitive Biases
- Addressing Cognitive Bias
- Addressing Cognitive Bias
- Data Privacy Principles and Regulations
- Data Privacy Principles and Regulations: GDPR overview, Right to Privacy Responsible Data Collection: Consent, Anonymization, and Data Minimization Transparency and Explainability
- Ethical guidelines for AI and data science (OECD overview)
- Ethical guidelines for AI and data science (OECD overview)
7. Laboratory Work
- L1: Environment Setup and Python Review
- Environment setup; introduction to Jupyter Notebook and Python review for data science. Tools: Anaconda and Jupyter. Deliverable: setup verification notebook.
- L2: Data Loading and Inspection
- Loading CSV, Excel, and JSON files; initial data inspection and profiling with Pandas. Deliverable: inspection report.
- L3: Data Cleaning
- Handling missing values and duplicates; correcting data types on a business dataset using Pandas. Deliverable: cleaned dataset.
- L4: Data Transformation
- Normalization, encoding categorical variables, and feature creation with Pandas and Scikit-learn. Deliverable: transformed dataset.
- L5: Univariate Analysis
- Descriptive statistics; histograms, box plots, and frequency tables using Pandas and Matplotlib. Deliverable: summary notebook.
- L6: Bivariate Analysis and Correlation
- Scatter plots, correlation matrix, and heatmap using Seaborn and Matplotlib. Deliverable: visualization gallery.
- L7: Exploratory Data Analysis
- Full EDA on a real business dataset, deriving and presenting insights visually using Pandas and Seaborn. Deliverable: EDA report.
- L8: Probability and Descriptive Statistics
- Descriptive statistics and probability with Python; normal distribution visualization using NumPy, SciPy, and Matplotlib. Deliverable: lab notebook.
- L9: Hypothesis Testing
- t-test and chi-square test on business data, interpreting results using SciPy and Pandas. Deliverable: statistical analysis report.
- L10: Correlation and Regression
- Correlation and simple linear regression: fitting a line, interpreting slope and R² using Scikit-learn and Matplotlib. Deliverable: regression notebook.
- L11: Machine Learning Workflow
- Train/test split, fitting a Linear Regression model, evaluating MAE and R² using Scikit-learn. Deliverable: model evaluation notebook.
- L12: Classification
- Logistic Regression for predicting a business outcome; confusion matrix and accuracy using Scikit-learn. Deliverable: classification report.
- L13: Clustering
- K-Means clustering for customer segmentation, visualizing clusters using Scikit-learn and Seaborn. Deliverable: clustering notebook.
- L14: End-to-End Mini Project
- Data cleaning, EDA, a simple predictive model, and a summary report with visualizations using the full Python stack. Deliverable: project report and presentation.