Intro data science
Undergraduate · Data science
Syllabus focus
Topics typically covered
Standard syllabus
Data and wrangling
- Tidy data principles: observations, variables, and values
- Importing CSV/JSON and inspecting schemas
- Filtering, selecting, mutating, and aggregating tables
- Joins (inner, left) and keys; many-to-one pitfalls
- Missing data strategies and documenting decisions
- Reproducible notebooks (Jupyter or Quarto/R Markdown)
Exploration and visualization
- Univariate summaries and distribution shape
- Bivariate plots: scatter, box, and grouped bars
- Faceting and color encodings that do not mislead
- EDA checklists for data quality
- Storyboarding figures for a short report
- Choosing scales, transforms, and outlier handling
Modeling and evaluation intro
- Train/validation/test mindset and leakage
- Simple linear regression interpretation
- Classification intro: logistic or tree-based survey
- Overfitting signs and regularization intuition
- Metrics matched to goals (RMSE, accuracy, precision/recall survey)
- Communicating uncertainty and limitations
STEM / applied
Tooling practice
- pandas or tidyverse pipelines for weekly labs
- Version control for analysis projects (Git basics)
- Environment pinning (requirements.txt / renv survey)
- SQL for pulling analysis tables (intro)
- Dashboard or notebook presentation of results
- Capstone-lite: question → wrangle → model → write-up
Domain applications
- Public datasets (government, sports, or health open data)
- A/B test readout at introductory level
- Feature engineering for tabular problems
- Ethics checkpoint: privacy, consent, dual use
- Peer review of another student's analysis
- Connecting results to a stakeholder question
Notes
Language stack (Python vs R) follows the department. Statistics-heavy sections may overlap Intro Statistics under Math—tutoring aligns to the course’s primary tools.