모듈 5: 모델 개발 및 최적화 (16h)

학습 결과

학생은 scikit-learn 파이프라인으로 데이터 누수를 방지한 ML 모델을 개발하고 배포할 수 있다.

선행 학습

  • Module 2: EDA 및 데이터 전처리 기초 (결측치, 스케일링 개념)
  • Module 3: 기본 머신러닝 모델 (Decision Tree, Ensemble)

ABCD 학습목표 & Bloom 수준

#ABCD 학습목표Bloom 수준관련 sources평가 방법
5-1Behavior: sklearn Pipeline을 이용하여 전처리·모델 훈련을 통합하고 / Condition: 혼합 자료형 데이터(수치형+범주형)에 / Degree: ColumnTransformer로 각각 다른 변환 적용Understandml-pipelines-sas-beginner-guide, sklearn-pipelines-medium-advanced코드 리뷰
5-2Behavior: 파이프라인의 모든 단계 하이퍼파라미터를 GridSearchCV로 최적화하고 / Condition: 교차검증 환경에서 / Degree: 최고 성능 조합을 자동으로 찾기Analyzesklearn-pipelines-medium-advanced, ml-pipeline최적화 결과 검증
5-3Behavior: fit_transform vs transform의 차이를 이해하고 데이터 누수를 방지하여 / Condition: train-test 분할 후 파이프라인 구성 시 / Degree: 훈련/테스트 성능 격차가 5% 이내Analyzedata-leakage-prevention-ml성능 비교 분석

📚 사용 Sources (권장 읽기 순서)

순서Sources학습목표예상 학습 시간비고
1️⃣ml-pipelines-sas-beginner-guide5-11.5h기초: 파이프라인 개념·ColumnTransformer
2️⃣sklearn-pipelines-medium-advanced5-22h심화: GridSearchCV·Feature Union·커스텀 변환자
3️⃣data-leakage-prevention-ml-pipeline-skala5-31.5h최신: fit_transform vs transform·데이터 누수 방지·시계열 처리
학습 시간 합계5-1~5-3~5h강의 16h 중 이론·실습 학습 부분

강의 자료 출처

역링크

⬅️ lecture-planning-2026에서 참조