안녕하세요.

오늘은 EDA(Exploratory Data Analysis) 학습 데이터 전처리에 대해 두번째로 스터디한 내용을 쓰려고 합니다.

ML 하이퍼파라미터 튜닝 및 성능 테스트를 하고 머신러닝 하이퍼파라미터 조정, 성능평가, PCA/클러스터링 이해하는 것에 대해 알아보도록 하겠습니다.

머신러닝 하이퍼파라미터 

모델 하이퍼 파라미터 튜닝 및 테스트

의사결정나무 회귀모델(Decision TreeRegressor) 하이퍼 파라미터

데이터를 분할 기준에 따라 반복적으로 나누어 예측값을 도출하는 기본적인 트리 모델입니다.

각 분기 과정이 명확하게 드러나기 때문에 예측 근거를 설명하기 용이합니다.

  • 단순 트리구조로 성능이 불안정 할 수 있음
  • 예측 근거가 중요한 도메인(금융, 의료 등)에 적합

RandomForestRegressor 하이퍼파라미터

랜덤 포레스트는 여러 개의 의사결정나무를 무작위 샘플링한 뒤, 각 트리의 예측값을 평균하여 최종 예측을 수행하는 앙상블 모델입니다.

  • 단일트리 대비 비교적 안정적이며 무난하고 좋은 성능을 보임
  • 여러 트리를 평균하므로 예측값 근거 해석 어려움 (블랙박스)

RandomForestRegressor — scikit-learn 1.8.0 documentation

 

RandomForestRegressor

Gallery examples: Prediction Latency Comparing Random Forests and Histogram Gradient Boosting models Comparing random forests and the multi-output meta estimator Combine predictors using stacking P...

scikit-learn.org

 

 

XGBRegressor 하이퍼파라미터

이전 트리의 예측 오차(잔차)를 보완하는 방식으로 트리를 순차적으로 학습시키는 Gradient Boosting 기반 앙상블 모델입니다. 학습 과정에서 정규화(Regularization)를 포함하여 과적합을 효과적으로 제어합니다.

  • 부스팅 앙상블 기법, 이전 오차를 점차 보완하는 구조
  • 연속형 수치데이터가 많은 회귀 문제에서 좋은 성능
  • 하이퍼 파라미터가 많아 튜닝 난이도 높은편, 블랙박스 성향 있음

DT, RF, XGB 회귀모델 성능평가

각 머신러닝 모델의 하이퍼파라미터 튜닝을 통해 성능을 최대한 올려보는 실습

마치며

ML 하이퍼파라미터 튜닝 및 성능 테스트를 하고 머신러닝 하이퍼파라미터 조정, 성능평가, PCA/클러스터링 이해하는 시간이었습니다.

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

EDA(Exploratory Data Analysis) 학습 데이터 전처리_1  (0) 2026.03.04
머신러닝 기초  (0) 2026.03.03
웹스크래핑  (0) 2026.02.25
데이터 시각화 및 분석  (0) 2026.02.24
데이터 프레임 다루기  (0) 2026.02.24

안녕하세요.

오늘은 EDA(Exploratory Data Analysis) 학습 데이터 전처리에 대해 스터디한 내용을 쓰려고 합니다.

EDA(Exploratory Data Analysis) 학습 데이터 전처리의 기본적인 과정을 경험하고 학습 데이터 특징을 이해하고, 모델 성능 향상방안 모색에 대해 알아보도록 하겠습니다.

EDA(Exploratory Data Analysis) 학습 데이터 전처리 

 

Feature Engineering

학습 데이터를 위한 Feature Engineering 단계

학습 데이터셋 분리

- 모델이 학습할 데이터 train
- 학습모델을 검증할 데이터 val
- 최종 성능을 평가할 데이터 test

 

데이터 전처리

데이터 전처리(Data Preprocessing)는 모델이 학습할 수 있도록 원본 데이터를 적절한 형태로 변환하는 과정입니다.
범주형 변수 인코딩, 스케일링 등의 작업을 포함하고 모델의 성능과 안정성에 직접적인 영향을 미치는 중요한 단계입니다.

 

 

범주형 인코딩

수치형 스케일링

 

인코딩 + 스케일링 데이터 합치기

데이터 전처리 자동화

def 지정함수를 사용하면 쉽게 전처리를 자동화 할 수 있습니다.

모델 학습 및 테스트

Feature Importance 확인하기

  • 트리 기반 모델에서 불순도 감소량을 기준으로 계산되는 변수 중요도
  • 여러 트리의 중요도를 평균하여 산출
  • 연속형 변수나 범주 수가 많은 변수에 편향될 수 있음

 

Permutation Importance 확인하기

  • 특정 변수를 무작위로 섞었을 때 모델 성능 감소량으로 중요도 측정
  • 모델 재학습 없이 계산 가능, Feature Importance보다 신뢰도가 높은편
  • 변수 간 상관관계가 높으면 왜곡될 수 있음

 

마치며

EDA과정은 Feature Engineering을 하고 학습 데이터셋 분리한 후 데이터 전처리과정으로 범주형 인코딩, 수치형 스케일링, 

인코딩 + 스케일링 데이터 합치기가 있고 
데이터 전처리 자동차에서 모델 학습 및 테스트, Feature Importance 확인하기, Permutation Importance 확인하기
가 있다는 것을 알게 되었습니다.

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

EDA(Exploratory Data Analysis) 학습 데이터 전처리_2  (1) 2026.03.06
머신러닝 기초  (0) 2026.03.03
웹스크래핑  (0) 2026.02.25
데이터 시각화 및 분석  (0) 2026.02.24
데이터 프레임 다루기  (0) 2026.02.24

안녕하세요.

오늘은 머신러닝 기초에 대해 스터디한 내용을 쓰려고 합니다.

AI 모델링을 위한 ML 기본 개념으로 머신러닝 학습과 데이터 전처리, 트리기반 모델 DT / RF / XGB를 알아보고 
분류 / 회귀모델 성능을 평가하고 (Appendix) 주성분 분석(PCA), K-means 클러스터링하는 법에 대해  알아보도록 하겠습니다.

학습 데이터 특징 및 주요 모델 경험과 전반적인 학습 데이터 전처리 및 모델 성능평가에 대해 공부합니다.

 

머신 러닝

 

머신러닝 학습 / 데이터 전처리

EDA 데이터 전처리와 학습 데이터셋을 분리합니다.

 

인공지능 지도 학습 vs 비지도 학습 vs 강화학습

지도학습(Supervised Learning)

정답이 있는데이터를 학습하여 분류/ 회귀문제를 예측하는 학습방식입니다.

 

• 분류 모델(Classification): 데이터의 정해진 라벨을 학습하여 어디에 해당하는지 예측하는 모델입니다.

   e.g.) 타이타닉생존여부, 붓꽃품종분류, 고객이탈여부등

 

• 회귀 모델(Regression): 정해진 라벨이 아닌 연속된 수치값을 예측하는 모델입니다.

  e.g.)상품 가격예측, 매출예상금액, 기온예측등

 

비지도 학습(Unsupervised Learning)

정답 라벨이 없는 데이터를 특정 패턴과 형태를 찾아 예상 패턴, 군집을 예측하는 학습 방식입니다.

   e.g.) PCA, K-Means Clustering, GAN 등

 

강화 학습(Reinforcement Learning)

특정 알고리즘에 따라 정답에 대한 보상, 가중치를 부여받으며 재학습하는 방식입니다.

  e.g.) Agent, AlphaGo, 자율주행

 

학습 데이터 전처리 - EDA(Exploratory Data Analysis) | 탐색적 데이터 분석

데이터 특징 파악

• 데이터의 전체적인 특징을 펼쳐보며 미리 가늠하는 단계입니다.

  e.g.) shape, info(), describe() 확인, ID/고유번호 등 식별자 유무 확인(데이터누수)

 

이상치, 결측치 탐색 및 시각화 분석

이상치와 결측치 여부등을 탐색하고 데이터 특징을 시각화하여 분석하는 단계입니다.

   e.g.) isna(), duplicated() 확인, 상관관계 및 그래프 시각화

 

Feature Engineering, 데이터 전처리

• 데이터를 모델이 학습하기 좋은 조건으로 변환/ 인코딩하는 데이터 전처리 단계입니다.

  e.g.) 이상치/결측치처리, 칼럼단위변환, 새로운칼럼생성, One-Hot 인코딩, Standard Scaling 등 ✓ Feature Selection 반복적

  모델 개선 과정

 

• 과적합 방지, 데이터 해석력 향상을 위한 주요 변수 선택(모델 학습 전, 후에 걸쳐 전반적으로 수행)합니다.

   e.g.) Feature Importance, Permutation Importance, SHAP Value 등 주요 특성 파악 및 실험

 

학습 데이터셋 분리 train / validation / test 데이터 셋

train 데이터셋

• 모델이 직접적으로 학습하는 데이터셋, 정답을 예측하는 근거 데이터셋입니다.

   e.g.) 문제집을 학습하여 지식을 쌓는 과정

 

validation 데이터 셋

• 학습된 모델의 성능을 검증하기 위한 일부 데이터셋(딥러닝에서는생략하는경우가많다.)입니다.

  e.g.) 모의고사를 통한 현재 수준 검증

 

test 데이터 셋

• 모델의 최종 성능을 평가하기 위한 데이터셋입니다.

  e.g.) 수능 시험을 통해 최종 결과 확인

 

데이터셋 분리 주요 특징

• 반드시 인코딩, 스케일링 전에 미리 분리해 줍니다. (fit_transform 함수 때문)

• 나누는 비율은8:2, 7:3 등 데이터에 따라 적용, train - test를 먼저 나누고 필요시 다시train - val 셋 분리를 합니다.

• 검증 성능이 지나치게 잘 나오는 경우 데이터 누수를 의심해 볼 수 있습니다.

• 훈련 데이터셋과 검증셋 성능을 비교하여 과적합 여부를 판단할 수 있습니다.

 

트리 기반 모델 DT / RF / XGB

의사 결정 나무(DT) Decision Tree

트리구조로 계속해서 질문을 나누는 모델

• 데이터를 특정 기준값으로 반복적 이진 분할

• 지니 불순도(Gini Impurity)를 최소화 하는 방향으로 가지 분기

• 결과값에 대한 해석 출력이 가능함

장점: 구조가 직관적이며 설명력이 높음, 설명력이 필요한 기관에 적절(금융, 의료, 법률등)

단점: 단순 트리 구조로 깊어질수록 과적합이 쉽게 발생, 작은 데이터 변화에도 구조에 영향이 크게 미칠수 있음

 

랜덤포레스트(RF) Random Forest

여러개의 의사 결정나무를 결합한 앙상블(Ensemble)모델

• 무작위 샘플링(Bootstrap Sampling)으로 여러 트리 모델 생성

• 각 트리의 예측 결과를 평균하여 예측 수행

• 단일 트리의 과적합 문제를 앙상블 구조로 완화한 모델

장점: 단일 트리 모델 대비 과적합 위험 감소 대부분의 데이터셋에서 안정적인 성능

단점: 결과값에 대한 설명력이 부족할 수 있음(블랙박스)

 

 XGBoost (Extreme Gradient Boosting)

이전 모델의 오답을 보완하며 학습하는 앙상블 모델

• 이전 트리의 오차(잔차)를 보완하며 학습 진행(Boosting)

• 점진적으로 오답을 줄여나가는 구조를 가지고 있음

• 병렬적 구조를 가진 RF와 달리 순차적인 구조를 가짐

• 기본적으로 Gradient Boosting모델을 확장한 모델

장점-- 연속형수치데이터가 많은 회귀문제에서 특히 좋은 성능을 가지며 가중치규제(L1, L2) 기능이 내장되어 안정적이며,

과적합이적음

단점-- 모델이 가지고 있는 하이퍼 파라미터가 복잡하여 튜닝이어려움

RF와 동일하게 블랙박스 성향을 가지며, 연산량이 더 증가하며 이전 트리 모델을 점진적으로 보완

 

 

분류/ 회귀 모델 성능 평가/ 분류 모델 성능 평가 지표 Confusion Matrix (혼동 행렬)

 TP, FP, FN, TN (정답유무/예측한값)

• True Postive: 실제Positive를 Positive로 ‘잘’ 예측한 경우 -- TP

• False Positive: 실제False를 Postive로 ‘잘못’ 예측한 경우 -- FP

• False Negative: 실제 Postive를 Negative로 ‘잘못’ 예측한 경우 -- FN

• True Negative: 실제 Negative를 Negative로 ‘잘’ 예측한 경우 -- TN

 

정확도, 정밀도, 재현율, f-1 score

• Accuracy(정확도): 전체 중 맞춘 비율

• Precision(정밀도): 모델이 예측한 값이 정답인 비율

• Recall(재현율): 실제값 중 모델이 제대로 예측한비율

• f1-score: Precision과 Recall의 조화 평균 Precision과 Recall은 trade-off 관계에 있다. 일반적으로 Recall 성능을 우선하여 F1-Score를 높이는 것을 기본적으로 한다.

 

회귀 모델 성능 평가 지표 MAE, RMSE, R2 Score

MAE (Mean Absolute Error): 오차 절대값 평균

• 실제값과 예측값의 오차 절대값을 평균으로 함

• 음수가 섞여 있을 경우 연산에 영향이 가지 않도록 절대값을 사용

• 맨해튼(Manhattan) 거리라고도 불리우며 계단식 접근 방식

 

RMSE (Root Mean Squared Error): 제곱 평균 오차의 제곱근

• 실제값과 예측값의오차를 제곱하여 평균을 낸 제곱근의 값

• 유클리디안(Euclidean) 거리라고도 불리우며 직선적 접근 방식

• 대부분의 회귀모델에서 MAE보다 RMSE를 채택함

 

R² Score (결정계수)

• 모델이 실제 데이터의 변동성을 얼마나 잘설정하는지 나타내 는값

• 값의 범위는0~1, 1에 가까울수록 데이터를 잘 설명하는 것이고  RMSE는 적을수록, R2는1에 가까울수록 좋은 성능 지표입니다.

 

학습 모델의 변수 중요도 : 학습 모델의 성능에 어떤 변수가 주요하게 작용했는지 확인 하는 과정

Feature Importance

• 트리 기반 모델의 불순도 감소량을 기준으로 계산되는 변수 중요도

• 여러 트리의 중요도를 평균하여 산출

• 연속형 변수나 범주 수가 많은 변수에 편향될 수 위험 있음

 

Permutation Importance

• 특정 변수를 무작위로 섞었을 때 모델 성능 감소량으로 중요도 측정

• 모델 재학습 없이 계산 가능, Feature Importance보다 신뢰도가  높은 편

• 변수간 상관 관계가 높으면 왜곡될 수 있고 변수 중요도를 확인하고 Feature Selection을 재시도하며 테스트할 수 있습니다.

변수중요도를 참고할 수는 있지만, 절대적인 신뢰는 위험합니다.

 

주성분 분석(PCA ,Principal Component Analysis) K-means 클러스터링 주성분 분석

고차원 데이터를 저차원으로 축소하는 기법

• 차원(칼럼)이 너무 많을때 차원 축소를 위한 주성분 분석

• 데이터의 정보량을 최대한 보존

• 새로운 축(주성분)을 만들어 차원을 n개로 축소

 

사용목적

• 주성분 시각화 목적 • 불필요한 노이즈 제거 • 모델 학습 속도 향상 및 변수간 상관성 완화

 

핵심개념

• PC1 가장 많은 분산을 설명하는 축, PC2, PC3 … 순 • 정보 손실을 최소화하면서 차원을 줄이는 방법, 차원이 지나치게 많을때(약100개가량이상) 사용할 수 있습니다.

 

K-means 클러스터링/ 비지도 학습 기반 군집화 기법

작동 원리

• k개의 중심점 초기화

• 각 데이터를 가장 가까운 중심에 배정

• 중심점 재계산 및 수렴할 때까지 반복

 

특징

• 단순하고 빠르게 군집화 분석 가능

• 거리 기반 알고리즘을 사용

 

핵심 개념

• 거리 기반으로 데이터를 군집화하는 기법

 

마치며

Exploratory Data Analysis(탐색적 데이터 분석)데이터를 본격적으로 모델링하기 전에 데이터의 구조, 분포, 이상치, 변수 간 관계 등을 탐색하는 과정입니다.

데이터의 특성을 이해하고, 분석 방향을 설정하기 위한 사전 단계라고 보면 됩니다.

AI 모델링을 위한 ML 기본 개념으로 머신러닝 학습과 데이터 전처리, 트리기반 모델 DT / RF / XGB를 알아보고 분류 / 회귀모델 성능을 평가하고 (Appendix) 주성분 분석(PCA), K-means 클러스터링하는 법에 대해 알아보는 시간이었습니다.

 

안녕하세요.

오늘은 웹스크래핑에 대해 스터디한 내용을 쓰려고 합니다.

기본적인 웹 스크래핑으로 데이터를 수집해보고 분석하는 과정을 파악하고, 
웹 스크래핑 기초, selenium / BeautifulSoup, 키워드 분석, wordcluod살펴보겠습니다.

 

웹스크래핑 기초

 

데이터 가져오기

selenium

-> 직접 웹 페이지를 방문하여 요소 수집, 동적 웹 스크래핑 가능합니다.
BeautifulSoup
-> HTML 파싱만으로 간단하고 빠른 수집, 정적 웹 스크래핑에 적합합니다.

 

selenium, BeautifulSoup 결합 웹 스크래핑

selenium으로 동적 웹 요소 조회, BeautifulSoup으로 조회된 요소 빠르게 데이터화합니다.

 

예시 사이트 리뷰, 댓글, 좋아요, 아이디 등 데이터 특징별 요소 추출하여 df 생성하고, 생성된 df로 워드 클라우드 생성, 불용어 설정 후 워드 클라우드 키워드 분석 및 인사이트 도출 실습합니다.

페이지소스 가져와서 분석해보기

코랩에 맞는 linux 버전 크롬 드라이버를 설치합니다.

Selenium 옵션을 설정하고 service 객체로 크롬드라이버로 경로 지정한 후 스트리밍 순위 페이지를 가져와서 Selenium으로 웹페이지 열면 cookie_accept를 클릭하고 더보기를 클릭한 수 페이지소스를 가져옵니다.
영화제목과 개봉일을 추출하고 평론가와 관객점수를 추출하고 df변환 후 csv를 저장하고 영화포스터를 저장합니다.

 

 

 

영화 콘텐츠의 순위를 확인한 후 리뷰 더보기를 클릭합니다.
리뷰 작성자와 날짜, 평점, 리뷰 내용을 추출하고 평균 평점과 평점 중앙값을 추출합니다.

 

 

긍, 부정 리뷰를 분석하고 4~5점 평균 글자수와 1~2점 평균글자수를 분석합니다. 리뷰 길이별 분포와 별점 별 리뷰 글자수를 분석합니다.
긍,부정 분류를 한 후 리뷰키워드 분석을 하고 기본 불용어를 지정합니다. 상위빈도 20개 키워드를 확인한 후 주요키워드를 수집합니다.
그룹을 정의한 후 함수로 지정하여 다양하게 분석합니다. 
그룹을 정의하고 불용어를 설정하여 그룹별로 분석합니다. 전처리, 평균 길이, 단어 분리, 빈도 계산하여 막대그래프로 표시해 봅니다.

 

 

 

실습과제

  1. 스크래핑 하고싶은 콘텐츠의 리뷰 정보를 최대한 수집
  2. 가장 많이 등장한 키워드 추출
  3. 콘텐츠의 스토리, 장르가 어떤 키워드 중심인지 파악
  4. 감성어, 인물, 단어 등 특징별로 키워드 분류
  5. OTT 홍보 전략 목적으로 데이터 분석
  6. 데이터 분석 결과 기반 전략 수립 (e.g.) 긍정 키워드를 조합한 홍보전략, 부정 키워드 감지 시스템 등

 

마치며 

처음 웹스크래핑을 해보면서 데이터 리터러시에 대해 더 실무적으로 알아볼 수 있었고 스크래핑하고 싶은 콘텐츠를 정보를 수집한 후 키워드 도출을 통해서 사업의 페인포인트를 파악해 볼 수 있는 시간이었습니다.

하지만 단어를 가지고 단순하게 판단해서는 안된다는 사실도 알 수 있었습니다.

안녕하세요.

오늘은 데이터 시각화 및 분석에 대해 스터디한 내용을 쓰려고 합니다.

서울시 자전거 대여 정보를 통해 데이터 분석하는 방법을 살펴보겠습니다.

 

서울시 자전거(따릉이) 대여 데이터 

 

데이터 불러오기

url로 데이터를 불러오고, 데이터 구조 및 정보, 수치정보를 확인해 봅니다.

데이터 정제 및 시각화 준비

 

데이터 시각화 및 분석

다양한 방식으로 데이터를 분석할 수 있고 그래프 시각화에서는 대부분 plt, seaborn을 쓰게 되는데, seaborn은 통계적 시각화와 색감, 그룹 비교에 유리하며 plt는 단조롭지만, 복잡한 커스터마이징에는 좀 더 유리한 편이다.

 

마치며

실제적인 공공데이터를 가지고 데이터를 시각화해 볼 수 있는 시간이었습니다.

여기에서 나오는 인사이트로 제품에 어떻게 반영할지 고민해볼 수 있었습니다.

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

머신러닝 기초  (0) 2026.03.03
웹스크래핑  (0) 2026.02.25
데이터 프레임 다루기  (0) 2026.02.24
데이터 구조의 이해와 분석 및 활용  (0) 2026.02.19
개발협업  (0) 2026.02.18

안녕하세요.

오늘은 데이터 프레임 다루기에 대해 스터디한 내용을 쓰려고 합니다.

데이터프레임에 대한 기본적인 구조를 경험해보고 데이터를 확인 및 점검하는 법에 대해서 알아보도록 하겠습니다.

데이터 정보 확인 shape, info(), describe()로 결측치, 중복값 확인 isnull, duplicated로 기본 인덱싱, 슬라이싱, 불리언 인덱싱로

구분해서 살펴보겠습니다.

타이타닉 데이터 프레임

 

데이터 가져오기

url로 데이터를 불러오고, 데이터 구조 및 정보, 수치정보를 확인해 봅니다.

pandas 기본 기능으로 df 살펴보기

데이터 조회, 확인 및 선택 방법

-기본 조회 메서드 head, tail, sample
-데이터 프레임의 인덱싱: 라벨 인뎅싱 loc & 정수 인덱싱 iloc

 

인덱싱과 슬라이싱, 데이터 선택

파이썬의 인덱스는 기본적으로 0부터 시작합니다.


예를 들어, a = ['x', 'y', 'z']의 첫번째 인덱스인 x를 호출하기 위해 0번 인덱스를 조회한다면
a[0] = 'x', a[1] = 'y', a[2] = 'z' (0번, 1번, 2번 Index 호출)

 

라벨 인덱싱 loc, 정수 인덱싱 iloc

라벨 인덱싱: loc[행시작:행끝, 열시작:열끝]을 이용한 인덱싱 (시작: 끝) -> 문자열로 인식하여 인덱싱하는 방식
정수 인덱싱: iloc[행시작:행끝 -1, 열시작:열끝 -1]을 이용한 인덱싱 (시작:끝 -1) -> 가장 기본적으로 사용되는 방식

 

 

불리언(boolean) 인덱싱

불리언 연산자에 따라 True, False 값으로 분류하여 조회하는 방식입니다.
데이터 프레임 형식으로는 df[df['칼럼'] 불리언 연산자]를 사용합니다.

많이 쓰이는 불리언 연산자: <, >, ==, !=, |, &

 

데이터 조회 및 분석 준비

원하는 데이터를 조회하고, 용도에 맞게 재구성하며 분석을 준비합니다.
데이터 조건부 조회: 불리언 인덱싱, contains(), (dtype + astype())
데이터 정렬 및 결측치 처리

 

특정 값 조회

불리언 인덱싱, contains()를 통해 원하는 값만 조회합니다.

 

새로운 Feature 생성

결측치가 있던 행들은 분석시 혼선을 줄 수 있으므로, 새로운 결측치 여부 Feature로 만들어 구분할 수 있습니다.
또한, 기존의 Feature를 기반으로 다양한 Feature Engineering을 수행 할 수 있습니다.

 

데이터 정제 및 분석 점검

몇 가지 핵심적인 정제를 마친 df_3로 어떤 분석을 할 수 있는지 연습 해봅니닫.

 

마치며

데이터프레임에 대한 기본적인 구조를 경험해보고 데이터를 확인 및 점검하는 법에 대해 알아보앗습니다.

결측치, 중복값 확인, 기본 인덱싱, 슬라이싱, 불리언 인덱싱에 대해 알아볼 수 있었습니다.

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

웹스크래핑  (0) 2026.02.25
데이터 시각화 및 분석  (0) 2026.02.24
데이터 구조의 이해와 분석 및 활용  (0) 2026.02.19
개발협업  (0) 2026.02.18
데이터 기반 사고 방식  (0) 2026.02.18

안녕하세요.

오늘은 피그마로 그리는 화면설계서에 대해 스터디한 내용을 쓰려고 합니다.

Figma로 화면 설계를 하면서 컴포넌트 & 인스턴스의 개념과 컴포넌트 프로퍼티 활용하여 화면 그리기에 대해 알아보도록 하겠습니다.

 

피그마로 기획서 그리기

 

컴포넌트 & 인스턴스

1. 컴포넌트(Component)개념과 활용 방법

Figma의 컴포넌트(Component)는 디자인에서 재사용 가능한 요소입니다.

버튼, 카드, 네비게이션 바 같은 UI 요소를 한 번 만들어놓고 여러 곳에서 동일한 스타일과 동작을 유지할 수 있도록 합니다.

 

2. 인스턴스(Instance)

인스턴스(Instance)는 컴포넌트의 복제본(클론)입니다. 컴포넌트와 연결된 상태이며, 원본(컴포넌트)이 수정되면 모든 인스턴스도 자동으로 업데이트됩니다.

• 컴포넌트의 복제본이며, 원본이 수정되면 함께 변경됨

• 특정 속성을 변경하여 오버라이드(Override) 가능

• 원본과 연결을 유지하면서도 일부 요소만 커스터마이징 가능

 

3. 인스턴스 오버라이드(Override)

인스턴스에서는 원본 컴포넌트와 연결을 유지하면서도 특정 속성을 변경할 수 있습니다.

이를 오버라이드(Override)라고 합니다.

연결을 유지하면 인스턴스를 수정하더라도, 원본 컴포넌트를 업데이트하면 변경 사항이 반영됩니다.

 

• 텍스트(Text) 변경 → 버튼의 “확인”을 “취소”로 변경

• 색상(Color) 변경 → 기본 버튼을 파란색에서 빨간색으로 변경

• Boolean 속성 → 아이콘 보이기/숨기기 토글

• Instance Swap → 특정 아이콘을 다른 아이콘으로 변경

 

4. 컴포넌트와 인스턴스 활용 예시

 

• 버튼 컴포넌트 & 인스턴스

컴포넌트 : 기본 버튼 디자인 (파란색, “확인” 텍스트)

인스턴스:  “확인” → “취소” 변경 (텍스트 오버라이드) 

색상을 파란색 → 빨간색 변경 (스타일 오버라이드)

 

• 아이콘 버튼 컴포넌트

컴포넌트 : 기본 아이콘 버튼 (Boolean 속성으로 아이콘 ON/OFF)

인스턴스   아이콘을 변경 (Instance Swap)   아이콘 숨김 (Boolean 속성 False)

 

컴포넌트 프로퍼티 활용

1. 컴포넌트 프로퍼티(Component Properties)

컴포넌트 프로퍼티는 컴포넌트 내부 요소를 변경할 수 있는 설정 값입니다. 이를 통해 컴포넌트의 다양한 변형을 오버라이드(Override) 없이도 쉽게 조절할 수 있습니다.

• 다양한 변형(Variants) 없이도 인스턴스 조정 가능

• 디자인 시스템을 유지하면서도 유연한 사용 가능

• 디자이너와 개발자 간의 협업이 쉬워짐

 

1) Boolean 프로퍼티 (True/False)

특정 요소(예: 아이콘, 텍스트, 배경)를 보이거나 숨기도록 설정하는 기능입니다.

• 사용 예시

  버튼에서 아이콘 ON/OFF ✓ 배지(Badge) ON/OFF ✓ 카드의 서브텍스트 표시 여부

• 적용 방법

① 컴포넌트를 선택하고, 오른쪽 패널의 Properties에서 + Add Property 클릭

② Boolean을 선택하고 이름 설정 (예: Radio)

③ Boolean 프로퍼티를 조절할 요소를 선택

④ Appearance 섹션에서 Radio Property 선택

• 결과

  True이면 요소가 보임

  False이면 요소가 숨겨짐

 

2) Text 프로퍼티 (텍스트 변경)

인스턴스에서 특정 텍스트 내용을 쉽게 변경할 수 있는 기능입니다.

• 사용 예시

✓ 버튼의 텍스트 변경 (확인 → 취소)

✓ 카드의 제목 변경 (Welcome → Hello!)

✓ 네비게이션 메뉴의 항목 수정

 

• 적용 방법

a. 컴포넌트를 선택하고, Properties에서 + Add Property 클릭

b. Text를 선택하고 이름 설정 (예: Button Label)

c. 변경할 텍스트 요소를 선택

d. Layer 섹션에서 텍스트 옆의 "∗" 버튼을 클릭하고 방금 만든 프로퍼티 연결

 

• 결과

인스턴스에서 텍스트 내용을 쉽게 변경 가능

디자인 시스템을 유지하면서도 유연한 사용 가능

 

3) Instance Swap 프로퍼티 (컴포넌트 교체)

특정 요소(아이콘, 이미지 등)를 다른 요소로 교체할 수 있습니다.

• 사용 특징

✓ 인스턴스는 마스터 컴포넌트에 없는 요소를 추가 할 수 없음

✓ 바꾸어 줄 아이콘 이미지는 모두 컴포넌트로 만들어 놓아야 함

예 : 로고 변경 (회사 로고 → 파트너사 로고)

예 : 프로필 아바타 변경

 

• 적용 방법

① 교체를 적용할 이미지는 미리 컴포넌트로 지정 필요

② Instance Swap을 선택

③ 변경할 요소(아바타)를 선택

④ 오브젝트 복사 후 아바타 변경 (Avatars1 → Avatars3)

 

• 결과

인스턴스에서 내부 요소를 쉽게 변경 가능

디자인 시스템을 유지하면서도 유연한 사용 가능

 

 

4) Variant 프로퍼티 (상태 관리)

하나의 컴포넌트에서 여러 상태(Variants)를 관리할 수 있습니다.

• 사용 예시

버튼의 상태 변경 (기본 / 호버 / 클릭)

토글 스위치 ON/OFF 상태 변경

알림 배지의 스타일 변경 (기본 / 강조)

 

• 적용 방법

① 전체 컴포넌트를 선택한 후, 오른쪽 패널에서 Combine as variants클릭

② Properties에서 Variant 프로퍼티를 설정하여 상태를 관리

 

• 결과

인스턴스에서 Variant를 쉽게 변경 가능

하나의 컴포넌트로 다양한 변형을 관리 가능

 

5) Variant 다중 프로퍼티 설정

• 적용 방법

① Red색상의 컴포턴트를 선택 후 Property=Color, Value=red로 설정

② 추가적으로 blue, yellow도 추가

③ Radius Property 추가하여 Value = 0, 25, 65 추가 설정

④ 인스턴스에 Property 적용

 

• 결과

인스턴스에서 Variant를 쉽게 변경 가능

하나의 컴포넌트로 다양한 변형을 관리 가능

 

무료 이미지 plugin 사용하기 _unsplash

https://www.figma.com/ko-kr/community/plugin/738454987945972471/unsplash

 

무료 아이콘 plugin 사용하기 _Iconify

https://www.figma.com/ko-kr/community/plugin/735098390272716381/iconify

마치며

피그마로 기획서를 그리기 위해서 컴포넌트와 인스턴스의 개념, 컴포넌트 프라퍼티 개념인 Boolean 프로퍼티, Text 프로퍼티 (텍스트 변경), Instance Swap 프로퍼티 (컴포넌트 교체), Variant 프로퍼티 (상태 관리), Variant 다중 프로퍼티 설정에 대해 알아볼 수 있고 실습하는 시간이었습니다.

'AI PM 부트캠프 > UX기획' 카테고리의 다른 글

화면 설계 개념과 작성 원칙  (0) 2026.02.18
서비스 정책서 작성  (0) 2026.02.17
기능정의 및 IA설계  (0) 2026.02.17
PRD 작성하기  (0) 2026.02.16
요구사항 정의서  (1) 2026.02.15

안녕하세요.

오늘은 데이터의 구조 및 활용에 대해 스터디한 내용을 쓰려고 합니다.

AI PM이 데이터를 알아야 하는 이유는 어떤 데이터를 수집할지 알기 위해서입니다.

이를 위해 데이터의 종류별 특징과 데이터 분석 기초, 공공 API 활용에 대해 알아보도록 하겠습니다.

 

데이터의 특징

 

 

 

비즈니스· AI 모델 보다 먼저 결정되는 데이터 특징

• 설문데이터예시: 이름, 성별, 연령 등

• “이 데이터로 이런 기능추가해주실수있으세요?” 애매하고 추상적인 요구 사항

 

데이터의 대표적 구조 3가지

정형데이터 

행과 열의 구조를 가진 데이터 테이블, 데이터 분석과 모델 학습을 할 때 필요한 형태의 데이터입니다.

 

반정형데이터 

일정한 구조는 가지고 있지만 가공이 필요한 데이터, 개별적으로 불러올 수 있고, 분석이나 학습을 위해서는 가공이 필요합니다.

 

비정형데이터 

데이터 그대로의 분석이 어려운 원천데이터, 크기와 특징이 불규칙하며 딥러닝, 생성형AI 학습에서 주로 쓰입니다.

 

Titanic 데이터셋 실습

pandas 기본익히기

• df = pd.read_csv(): 괄호안의 csv정보를 읽어오는 함수를 df라는변수로 지정

• df: csv를 읽어온 데이터 프레임을 지정한 변수(다른 이름으로도 가능)

• df.head(): 해당 데이터의 가장 앞 5개행(기본값)을 불러옴, 괄호 안에 불러올 숫자 지정 가능

df.tail(): head와 동일, 하지만 가장 뒤의 행부터 불러옴

 

 

  df.shape: 데이터의 구조 (해당데이터는(행개수, 열개수))

  df.columns: 데이터의 각 칼럼 명

  df.info(): 데이터셋의 기본 정보(칼럼 명, 데이터개수, 데이터타입)

  df.describe(): 데이터셋의 수치형 칼럼 정보(수치형 칼럼만 조회가능, count=개수 std=표준편차) 데이터 프레임을 불러오면shape, info(), describe()는 필수적으로 찍어보고 시작한다고 봐도 됩니다.

 

  df.isnull().sum(): 결측치를 전부 조회 isnull()한 뒤, 총 합 sum()을 조회하는 함수의 조합

   df.duplicated().sum(): 중복된 행을 조회하는 함수, 만약 중복된 행이 있다면 drop_duplites()로 중복행들을 제거합니다.

   df.nunique(): 각 칼럼이 가지고 있는 고유값의 수, 칼럼 자체가 고유한 특징을 가지고 있다면 학습 데이터에서는 삭제 시킵니다.    df.value_counts(): 각 칼럼이 가지고 있는 값들의 개수를 나타내고 전부 고유값인 칼럼의 경우 모든 행이 나타나게 됩니다.

 

matplotlib 맛보기- 박스 플롯(이상치탐지)

탐지된 이상치는 제거 대상일까?

 

컬럼별 상관관계 시각화

 

 

GROUP BY 시각화

 

Groupby는 실제 분석 툴에서도 기본이 되는 기능입니다. 칼럼이 될 그룹을 정하고, 해당하는 행의 값들을 불러옵니다.

개수, 평균, 합계등 다양한 집계 함수를 활용하여 다각적 분석이 가능합니다.

 

마치며

데이터의 종류와 데이터셋 실습을 해보면서 데이터의 기초에 대해 알아볼 수 있는 시간이었습니다.

 

 

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

데이터 시각화 및 분석  (0) 2026.02.24
데이터 프레임 다루기  (0) 2026.02.24
개발협업  (0) 2026.02.18
데이터 기반 사고 방식  (0) 2026.02.18
No-code 데이터 분석,SQL  (0) 2026.02.17

+ Recent posts