모듈 2: 데이터 분석 개요 및 기초통계 (24h)

학습 결과

학생은 pandas·matplotlib·seaborn을 이용하여 실제 데이터셋(11,000+ 행)에 대해 EDA를 독립적으로 수행할 수 있다.

선행 학습

  • Module 1-3: Python 환경설정 (pandas, matplotlib, seaborn 라이브러리 설치)
    • 왜?: EDA는 이 도구들을 실제로 사용하므로, 먼저 환경을 구축해야 함

ABCD 학습목표 & Bloom 수준

#ABCD 학습목표Bloom 수준관련 sources평가 방법
2-1Audience: 데이터분석 입문자 / Behavior: EDA 8단계 프로세스를 순서대로 실행하고 / Condition: pandas/matplotlib 도구 및 실제 데이터셋 주어졌을 때 / Degree: 누락 없이 완료Applyeda-exploratory-data-analysis-geeksforgeeks, eda-python-tds-prabhu실습 체크리스트
2-2Behavior: 데이터 품질 문제(결측치·중복·이상치) 3가지를 IQR 기법으로 탐지하고 / Condition: 실무 데이터셋에서 / Degree: 90% 정확도로 식별 가능Analyzeoutlier-detection-iqr-zscore-medium, outlier-handling-velog정확도 평가
2-3Behavior: 단변량→이변량→다변량 시각화 3계층을 설계하고 / Condition: 주어진 시각화 라이브러리(matplotlib/seaborn)로 / Degree: 각 계층의 목적에 맞는 차트 선택Createdata-visualization-3-layer-guide포트폴리오 검수

📚 사용 Sources (권장 읽기 순서)

순서Sources학습목표예상 학습 시간비고
1️⃣eda-exploratory-data-analysis-geeksforgeeks2-11.5h기초: 8단계 EDA 체크리스트
2️⃣eda-python-tds-prabhu2-12h실습: 실제 11,914행 데이터셋 정제 사례
3️⃣outlier-detection-iqr-zscore-medium2-21.5h심화: IQR/Z-score 이상치 탐지 공식
4️⃣outlier-handling-velog2-21h선택: 이상치 처리 전략 (삭제 vs 대체)
5️⃣data-visualization-3-layer-architecture-skala2-32h최신: 단변량→이변량→다변량 3계층 시각화
학습 시간 합계2-1~2-3~8h강의 24h 중 이론·실습 학습 부분

강의 자료 출처

역링크

⬅️ lecture-planning-2026에서 참조