Databases for data science
Undergraduate · Data science
Syllabus focus
Topics typically covered
Standard syllabus
Relational foundations
- Tables, keys, foreign keys, and constraints
- Normalization intuition for analytics schemas
- SQL SELECT, WHERE, ORDER BY, and LIMIT
- Joins: inner, left, anti-join patterns
- Aggregations, GROUP BY, and HAVING
- Subqueries and common table expressions (CTEs)
Analytics SQL
- Window functions: ranking, running totals, LAG/LEAD
- Date/time dimensions and fiscal calendars (intro)
- CASE expressions and conditional aggregation
- Views and materialized views (survey)
- Query plans and basic index awareness
- Avoiding fan-out mistakes in joins
Data platforms survey
- OLTP vs OLAP / warehouse concepts
- Star schemas: facts and dimensions (intro)
- ETL/ELT into an analytics store
- Access control and least privilege for analysts
- Document vs relational stores for DS (survey)
- Connecting notebooks to databases safely
STEM / applied
Practice
- Writing graded SQL labs against sample schemas
- EXPLAIN-driven debugging of slow queries
- Parameterized queries from Python/R clients
- Building a small dimensional model for a domain
- Data quality checks expressed in SQL
- Documenting metrics definitions (single source of truth)
Product analytics patterns
- Funnel and retention query patterns (intro)
- Cohort tables and sticky metrics
- Deduplicating event streams (intro)
- Handling late-arriving data (survey)
- Privacy: PII minimization in extracts
- Capstone: analytics mart + notebook readout
Notes
Overlaps SQL under CS when present; this track emphasizes analyst workflows and warehouses over DB internals.