안녕하세요.

오늘은 EDA(Exploratory Data Analysis) 학습 데이터 전처리에 대해 두번째로 스터디한 내용을 쓰려고 합니다.

ML 하이퍼파라미터 튜닝 및 성능 테스트를 하고 머신러닝 하이퍼파라미터 조정, 성능평가, PCA/클러스터링 이해하는 것에 대해 알아보도록 하겠습니다.

머신러닝 하이퍼파라미터 

모델 하이퍼 파라미터 튜닝 및 테스트

의사결정나무 회귀모델(Decision TreeRegressor) 하이퍼 파라미터

데이터를 분할 기준에 따라 반복적으로 나누어 예측값을 도출하는 기본적인 트리 모델입니다.

각 분기 과정이 명확하게 드러나기 때문에 예측 근거를 설명하기 용이합니다.

  • 단순 트리구조로 성능이 불안정 할 수 있음
  • 예측 근거가 중요한 도메인(금융, 의료 등)에 적합

RandomForestRegressor 하이퍼파라미터

랜덤 포레스트는 여러 개의 의사결정나무를 무작위 샘플링한 뒤, 각 트리의 예측값을 평균하여 최종 예측을 수행하는 앙상블 모델입니다.

  • 단일트리 대비 비교적 안정적이며 무난하고 좋은 성능을 보임
  • 여러 트리를 평균하므로 예측값 근거 해석 어려움 (블랙박스)

RandomForestRegressor — scikit-learn 1.8.0 documentation

 

RandomForestRegressor

Gallery examples: Prediction Latency Comparing Random Forests and Histogram Gradient Boosting models Comparing random forests and the multi-output meta estimator Combine predictors using stacking P...

scikit-learn.org

 

 

XGBRegressor 하이퍼파라미터

이전 트리의 예측 오차(잔차)를 보완하는 방식으로 트리를 순차적으로 학습시키는 Gradient Boosting 기반 앙상블 모델입니다. 학습 과정에서 정규화(Regularization)를 포함하여 과적합을 효과적으로 제어합니다.

  • 부스팅 앙상블 기법, 이전 오차를 점차 보완하는 구조
  • 연속형 수치데이터가 많은 회귀 문제에서 좋은 성능
  • 하이퍼 파라미터가 많아 튜닝 난이도 높은편, 블랙박스 성향 있음

DT, RF, XGB 회귀모델 성능평가

각 머신러닝 모델의 하이퍼파라미터 튜닝을 통해 성능을 최대한 올려보는 실습

마치며

ML 하이퍼파라미터 튜닝 및 성능 테스트를 하고 머신러닝 하이퍼파라미터 조정, 성능평가, PCA/클러스터링 이해하는 시간이었습니다.

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

EDA(Exploratory Data Analysis) 학습 데이터 전처리_1  (0) 2026.03.04
머신러닝 기초  (0) 2026.03.03
웹스크래핑  (0) 2026.02.25
데이터 시각화 및 분석  (0) 2026.02.24
데이터 프레임 다루기  (0) 2026.02.24

+ Recent posts