안녕하세요.
오늘은 데이터 프레임 다루기에 대해 스터디한 내용을 쓰려고 합니다.
데이터프레임에 대한 기본적인 구조를 경험해보고 데이터를 확인 및 점검하는 법에 대해서 알아보도록 하겠습니다.
데이터 정보 확인 shape, info(), describe()로 결측치, 중복값 확인 isnull, duplicated로 기본 인덱싱, 슬라이싱, 불리언 인덱싱로
구분해서 살펴보겠습니다.
타이타닉 데이터 프레임

데이터 가져오기
url로 데이터를 불러오고, 데이터 구조 및 정보, 수치정보를 확인해 봅니다.

pandas 기본 기능으로 df 살펴보기
데이터 조회, 확인 및 선택 방법
-기본 조회 메서드 head, tail, sample
-데이터 프레임의 인덱싱: 라벨 인뎅싱 loc & 정수 인덱싱 iloc
인덱싱과 슬라이싱, 데이터 선택
파이썬의 인덱스는 기본적으로 0부터 시작합니다.
예를 들어, a = ['x', 'y', 'z']의 첫번째 인덱스인 x를 호출하기 위해 0번 인덱스를 조회한다면
a[0] = 'x', a[1] = 'y', a[2] = 'z' (0번, 1번, 2번 Index 호출)
라벨 인덱싱 loc, 정수 인덱싱 iloc
라벨 인덱싱: loc[행시작:행끝, 열시작:열끝]을 이용한 인덱싱 (시작: 끝) -> 문자열로 인식하여 인덱싱하는 방식
정수 인덱싱: iloc[행시작:행끝 -1, 열시작:열끝 -1]을 이용한 인덱싱 (시작:끝 -1) -> 가장 기본적으로 사용되는 방식
불리언(boolean) 인덱싱
불리언 연산자에 따라 True, False 값으로 분류하여 조회하는 방식입니다.
데이터 프레임 형식으로는 df[df['칼럼'] 불리언 연산자]를 사용합니다.
많이 쓰이는 불리언 연산자: <, >, ==, !=, |, &
데이터 조회 및 분석 준비
원하는 데이터를 조회하고, 용도에 맞게 재구성하며 분석을 준비합니다.
데이터 조건부 조회: 불리언 인덱싱, contains(), (dtype + astype())
데이터 정렬 및 결측치 처리
특정 값 조회
불리언 인덱싱, contains()를 통해 원하는 값만 조회합니다.
새로운 Feature 생성
결측치가 있던 행들은 분석시 혼선을 줄 수 있으므로, 새로운 결측치 여부 Feature로 만들어 구분할 수 있습니다.
또한, 기존의 Feature를 기반으로 다양한 Feature Engineering을 수행 할 수 있습니다.
데이터 정제 및 분석 점검
몇 가지 핵심적인 정제를 마친 df_3로 어떤 분석을 할 수 있는지 연습 해봅니닫.
마치며
데이터프레임에 대한 기본적인 구조를 경험해보고 데이터를 확인 및 점검하는 법에 대해 알아보앗습니다.
결측치, 중복값 확인, 기본 인덱싱, 슬라이싱, 불리언 인덱싱에 대해 알아볼 수 있었습니다.
'AI PM 부트캠프 > 데이터' 카테고리의 다른 글
| 웹스크래핑 (0) | 2026.02.25 |
|---|---|
| 데이터 시각화 및 분석 (0) | 2026.02.24 |
| 데이터 구조의 이해와 분석 및 활용 (0) | 2026.02.19 |
| 개발협업 (0) | 2026.02.18 |
| 데이터 기반 사고 방식 (0) | 2026.02.18 |