안녕하세요.

오늘은 EDA(Exploratory Data Analysis) 학습 데이터 전처리에 대해 스터디한 내용을 쓰려고 합니다.

EDA(Exploratory Data Analysis) 학습 데이터 전처리의 기본적인 과정을 경험하고 학습 데이터 특징을 이해하고, 모델 성능 향상방안 모색에 대해 알아보도록 하겠습니다.

EDA(Exploratory Data Analysis) 학습 데이터 전처리 

 

Feature Engineering

학습 데이터를 위한 Feature Engineering 단계

학습 데이터셋 분리

- 모델이 학습할 데이터 train
- 학습모델을 검증할 데이터 val
- 최종 성능을 평가할 데이터 test

 

데이터 전처리

데이터 전처리(Data Preprocessing)는 모델이 학습할 수 있도록 원본 데이터를 적절한 형태로 변환하는 과정입니다.
범주형 변수 인코딩, 스케일링 등의 작업을 포함하고 모델의 성능과 안정성에 직접적인 영향을 미치는 중요한 단계입니다.

 

 

범주형 인코딩

수치형 스케일링

 

인코딩 + 스케일링 데이터 합치기

데이터 전처리 자동화

def 지정함수를 사용하면 쉽게 전처리를 자동화 할 수 있습니다.

모델 학습 및 테스트

Feature Importance 확인하기

  • 트리 기반 모델에서 불순도 감소량을 기준으로 계산되는 변수 중요도
  • 여러 트리의 중요도를 평균하여 산출
  • 연속형 변수나 범주 수가 많은 변수에 편향될 수 있음

 

Permutation Importance 확인하기

  • 특정 변수를 무작위로 섞었을 때 모델 성능 감소량으로 중요도 측정
  • 모델 재학습 없이 계산 가능, Feature Importance보다 신뢰도가 높은편
  • 변수 간 상관관계가 높으면 왜곡될 수 있음

 

마치며

EDA과정은 Feature Engineering을 하고 학습 데이터셋 분리한 후 데이터 전처리과정으로 범주형 인코딩, 수치형 스케일링, 

인코딩 + 스케일링 데이터 합치기가 있고 
데이터 전처리 자동차에서 모델 학습 및 테스트, Feature Importance 확인하기, Permutation Importance 확인하기
가 있다는 것을 알게 되었습니다.

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

EDA(Exploratory Data Analysis) 학습 데이터 전처리_2  (1) 2026.03.06
머신러닝 기초  (0) 2026.03.03
웹스크래핑  (0) 2026.02.25
데이터 시각화 및 분석  (0) 2026.02.24
데이터 프레임 다루기  (0) 2026.02.24

+ Recent posts