안녕하세요.

오늘은 데이터의 구조 및 활용에 대해 스터디한 내용을 쓰려고 합니다.

AI PM이 데이터를 알아야 하는 이유는 어떤 데이터를 수집할지 알기 위해서입니다.

이를 위해 데이터의 종류별 특징과 데이터 분석 기초, 공공 API 활용에 대해 알아보도록 하겠습니다.

 

데이터의 특징

 

 

 

비즈니스· AI 모델 보다 먼저 결정되는 데이터 특징

• 설문데이터예시: 이름, 성별, 연령 등

• “이 데이터로 이런 기능추가해주실수있으세요?” 애매하고 추상적인 요구 사항

 

데이터의 대표적 구조 3가지

정형데이터 

행과 열의 구조를 가진 데이터 테이블, 데이터 분석과 모델 학습을 할 때 필요한 형태의 데이터입니다.

 

반정형데이터 

일정한 구조는 가지고 있지만 가공이 필요한 데이터, 개별적으로 불러올 수 있고, 분석이나 학습을 위해서는 가공이 필요합니다.

 

비정형데이터 

데이터 그대로의 분석이 어려운 원천데이터, 크기와 특징이 불규칙하며 딥러닝, 생성형AI 학습에서 주로 쓰입니다.

 

Titanic 데이터셋 실습

pandas 기본익히기

• df = pd.read_csv(): 괄호안의 csv정보를 읽어오는 함수를 df라는변수로 지정

• df: csv를 읽어온 데이터 프레임을 지정한 변수(다른 이름으로도 가능)

• df.head(): 해당 데이터의 가장 앞 5개행(기본값)을 불러옴, 괄호 안에 불러올 숫자 지정 가능

df.tail(): head와 동일, 하지만 가장 뒤의 행부터 불러옴

 

 

  df.shape: 데이터의 구조 (해당데이터는(행개수, 열개수))

  df.columns: 데이터의 각 칼럼 명

  df.info(): 데이터셋의 기본 정보(칼럼 명, 데이터개수, 데이터타입)

  df.describe(): 데이터셋의 수치형 칼럼 정보(수치형 칼럼만 조회가능, count=개수 std=표준편차) 데이터 프레임을 불러오면shape, info(), describe()는 필수적으로 찍어보고 시작한다고 봐도 됩니다.

 

  df.isnull().sum(): 결측치를 전부 조회 isnull()한 뒤, 총 합 sum()을 조회하는 함수의 조합

   df.duplicated().sum(): 중복된 행을 조회하는 함수, 만약 중복된 행이 있다면 drop_duplites()로 중복행들을 제거합니다.

   df.nunique(): 각 칼럼이 가지고 있는 고유값의 수, 칼럼 자체가 고유한 특징을 가지고 있다면 학습 데이터에서는 삭제 시킵니다.    df.value_counts(): 각 칼럼이 가지고 있는 값들의 개수를 나타내고 전부 고유값인 칼럼의 경우 모든 행이 나타나게 됩니다.

 

matplotlib 맛보기- 박스 플롯(이상치탐지)

탐지된 이상치는 제거 대상일까?

 

컬럼별 상관관계 시각화

 

 

GROUP BY 시각화

 

Groupby는 실제 분석 툴에서도 기본이 되는 기능입니다. 칼럼이 될 그룹을 정하고, 해당하는 행의 값들을 불러옵니다.

개수, 평균, 합계등 다양한 집계 함수를 활용하여 다각적 분석이 가능합니다.

 

마치며

데이터의 종류와 데이터셋 실습을 해보면서 데이터의 기초에 대해 알아볼 수 있는 시간이었습니다.

 

 

'AI PM 부트캠프 > 데이터' 카테고리의 다른 글

데이터 시각화 및 분석  (0) 2026.02.24
데이터 프레임 다루기  (0) 2026.02.24
개발협업  (0) 2026.02.18
데이터 기반 사고 방식  (0) 2026.02.18
No-code 데이터 분석,SQL  (0) 2026.02.17

+ Recent posts