모듈 2: 데이터 분석 개요 및 기초통계 (24h)
학습 결과
학생은 pandas·matplotlib·seaborn을 이용하여 실제 데이터셋(11,000+ 행)에 대해 EDA를 독립적으로 수행할 수 있다.
선행 학습
- Module 1-3: Python 환경설정 (pandas, matplotlib, seaborn 라이브러리 설치)
- 왜?: EDA는 이 도구들을 실제로 사용하므로, 먼저 환경을 구축해야 함
ABCD 학습목표 & Bloom 수준
| # | ABCD 학습목표 | Bloom 수준 | 관련 sources | 평가 방법 |
|---|---|---|---|---|
| 2-1 | Audience: 데이터분석 입문자 / Behavior: EDA 8단계 프로세스를 순서대로 실행하고 / Condition: pandas/matplotlib 도구 및 실제 데이터셋 주어졌을 때 / Degree: 누락 없이 완료 | Apply | eda-exploratory-data-analysis-geeksforgeeks, eda-python-tds-prabhu | 실습 체크리스트 |
| 2-2 | Behavior: 데이터 품질 문제(결측치·중복·이상치) 3가지를 IQR 기법으로 탐지하고 / Condition: 실무 데이터셋에서 / Degree: 90% 정확도로 식별 가능 | Analyze | outlier-detection-iqr-zscore-medium, outlier-handling-velog | 정확도 평가 |
| 2-3 | Behavior: 단변량→이변량→다변량 시각화 3계층을 설계하고 / Condition: 주어진 시각화 라이브러리(matplotlib/seaborn)로 / Degree: 각 계층의 목적에 맞는 차트 선택 | Create | data-visualization-3-layer-guide | 포트폴리오 검수 |
📚 사용 Sources (권장 읽기 순서)
| 순서 | Sources | 학습목표 | 예상 학습 시간 | 비고 |
|---|---|---|---|---|
| 1️⃣ | eda-exploratory-data-analysis-geeksforgeeks | 2-1 | 1.5h | 기초: 8단계 EDA 체크리스트 |
| 2️⃣ | eda-python-tds-prabhu | 2-1 | 2h | 실습: 실제 11,914행 데이터셋 정제 사례 |
| 3️⃣ | outlier-detection-iqr-zscore-medium | 2-2 | 1.5h | 심화: IQR/Z-score 이상치 탐지 공식 |
| 4️⃣ | outlier-handling-velog | 2-2 | 1h | 선택: 이상치 처리 전략 (삭제 vs 대체) |
| 5️⃣ | data-visualization-3-layer-architecture-skala | 2-3 | 2h | 최신: 단변량→이변량→다변량 3계층 시각화 |
| 학습 시간 합계 | 2-1~2-3 | ~8h | 강의 24h 중 이론·실습 학습 부분 |
강의 자료 출처
- eda-exploratory-data-analysis-geeksforgeeks — 8단계 EDA 체크리스트 (학습목표 2-1)
- eda-python-tds-prabhu — 실제 11,914행 정제 사례 (학습목표 2-1)
- outlier-detection-iqr-zscore-medium — IQR/Z-score 이상치 탐지 공식 + 코드 (학습목표 2-2)
- outlier-handling-velog — 이상치 처리 전략 (삭제 vs 대체) (학습목표 2-2)
- data-visualization-3-layer-guide — 단변량·이변량·다변량 3계층 시각화 + 포트폴리오 가이드 (학습목표 2-3)
- exploratory-data-analysis-eda — 개념 정리
역링크
⬅️ lecture-planning-2026에서 참조