모듈 5: 모델 개발 및 최적화 (16h)
학습 결과
학생은 scikit-learn 파이프라인으로 데이터 누수를 방지한 ML 모델을 개발하고 배포할 수 있다.
선행 학습
- Module 2: EDA 및 데이터 전처리 기초 (결측치, 스케일링 개념)
- Module 3: 기본 머신러닝 모델 (Decision Tree, Ensemble)
ABCD 학습목표 & Bloom 수준
| # | ABCD 학습목표 | Bloom 수준 | 관련 sources | 평가 방법 |
|---|---|---|---|---|
| 5-1 | Behavior: sklearn Pipeline을 이용하여 전처리·모델 훈련을 통합하고 / Condition: 혼합 자료형 데이터(수치형+범주형)에 / Degree: ColumnTransformer로 각각 다른 변환 적용 | Understand | ml-pipelines-sas-beginner-guide, sklearn-pipelines-medium-advanced | 코드 리뷰 |
| 5-2 | Behavior: 파이프라인의 모든 단계 하이퍼파라미터를 GridSearchCV로 최적화하고 / Condition: 교차검증 환경에서 / Degree: 최고 성능 조합을 자동으로 찾기 | Analyze | sklearn-pipelines-medium-advanced, ml-pipeline | 최적화 결과 검증 |
| 5-3 | Behavior: fit_transform vs transform의 차이를 이해하고 데이터 누수를 방지하여 / Condition: train-test 분할 후 파이프라인 구성 시 / Degree: 훈련/테스트 성능 격차가 5% 이내 | Analyze | data-leakage-prevention-ml | 성능 비교 분석 |
📚 사용 Sources (권장 읽기 순서)
| 순서 | Sources | 학습목표 | 예상 학습 시간 | 비고 |
|---|---|---|---|---|
| 1️⃣ | ml-pipelines-sas-beginner-guide | 5-1 | 1.5h | 기초: 파이프라인 개념·ColumnTransformer |
| 2️⃣ | sklearn-pipelines-medium-advanced | 5-2 | 2h | 심화: GridSearchCV·Feature Union·커스텀 변환자 |
| 3️⃣ | data-leakage-prevention-ml-pipeline-skala | 5-3 | 1.5h | 최신: fit_transform vs transform·데이터 누수 방지·시계열 처리 |
| 학습 시간 합계 | 5-1~5-3 | ~5h | 강의 16h 중 이론·실습 학습 부분 |
강의 자료 출처
- ml-pipelines-sas-beginner-guide — 데이터 누수 개념 (학습목표 5-1)
- sklearn-pipelines-medium-advanced — 고급 기법 (Feature Union, 커스텀 변환자) (학습목표 5-2)
- data-leakage-prevention-ml — fit_transform vs transform · 분할 순서 · 시계열 처리 · Pipeline 자동 방지 (학습목표 5-3)
- ml-pipeline — 파이프라인 설계 원칙
역링크
⬅️ lecture-planning-2026에서 참조