HUNTERTUTORING

Intro data science

Undergraduate · Data science

Syllabus focus

Topics typically covered

Standard syllabus

Data and wrangling

  • Tidy data principles: observations, variables, and values
  • Importing CSV/JSON and inspecting schemas
  • Filtering, selecting, mutating, and aggregating tables
  • Joins (inner, left) and keys; many-to-one pitfalls
  • Missing data strategies and documenting decisions
  • Reproducible notebooks (Jupyter or Quarto/R Markdown)

Exploration and visualization

  • Univariate summaries and distribution shape
  • Bivariate plots: scatter, box, and grouped bars
  • Faceting and color encodings that do not mislead
  • EDA checklists for data quality
  • Storyboarding figures for a short report
  • Choosing scales, transforms, and outlier handling

Modeling and evaluation intro

  • Train/validation/test mindset and leakage
  • Simple linear regression interpretation
  • Classification intro: logistic or tree-based survey
  • Overfitting signs and regularization intuition
  • Metrics matched to goals (RMSE, accuracy, precision/recall survey)
  • Communicating uncertainty and limitations

STEM / applied

Tooling practice

  • pandas or tidyverse pipelines for weekly labs
  • Version control for analysis projects (Git basics)
  • Environment pinning (requirements.txt / renv survey)
  • SQL for pulling analysis tables (intro)
  • Dashboard or notebook presentation of results
  • Capstone-lite: question → wrangle → model → write-up

Domain applications

  • Public datasets (government, sports, or health open data)
  • A/B test readout at introductory level
  • Feature engineering for tabular problems
  • Ethics checkpoint: privacy, consent, dual use
  • Peer review of another student's analysis
  • Connecting results to a stakeholder question

Notes

Language stack (Python vs R) follows the department. Statistics-heavy sections may overlap Intro Statistics under Math—tutoring aligns to the course’s primary tools.