Data wrangling & visualization
Undergraduate · Data science
Syllabus focus
Topics typically covered
Standard syllabus
Wrangling craft
- Profiling raw files: types, encodings, and delimiters
- Schema design for analysis tables
- Deduplication, entity resolution (intro), and keys
- Outliers: detect, document, decide
- Feature construction from timestamps and categories
- Building reusable transformation checklists
Visualization design
- Choosing chart types for audience and data type
- Encoding channels: position, color, size, shape
- Small multiples vs overplotting strategies
- Uncertainty visualization (error bars, intervals survey)
- Annotation and narrative layout
- Accessibility: contrast, alt text, and colorblind-safe palettes
Quality and reproducibility
- Validation rules and assertion tests on tables
- Data dictionaries and column documentation
- Lineage: raw → cleaned → analysis extracts
- Diffing data versions between runs
- Reviewing plots for misleading scales
- Hand-off packages for collaborators
STEM / applied
Tool practice
- pandas/tidyverse/SQL mixes for cleaning labs
- Visualization libraries used by the course
- Automating refreshes of weekly data drops
- Dashboard sketches from cleaned extracts
- Performance tips for large joins (intro)
- Notebook vs script boundaries
Domain labs
- Merging messy administrative or web-scraped data
- Survey coding and Likert aggregation (intro)
- Geospatial join awareness (survey)
- Text field cleanup (regex intro)
- Before/after redesign of a misleading chart
- Capstone: wrangle + viz portfolio piece
Notes
Often paired with Intro Data Science; this course goes deeper on cleaning and visual communication than on modeling.