pandas 개요
pandas 개요
pandas는 표 형태의 데이터를 다루는 Python 라이브러리예요. DataFrame과 Series라는 자료구조로 정형 데이터를 읽고, 정제하고, 변환하고, 집계하는 전 과정을 코드 몇 줄로 처리할 수 있어요. 데이터 분석과 ETL에서 사실상 표준으로 쓰여요.
DataFrame과 Series
pandas의 핵심 자료구조는 두 가지예요. Series는 1차원 배열(한 컬럼)이고, DataFrame은 행과 열로 이뤄진 2차원 표예요. DataFrame은 여러 Series가 컬럼으로 모인 구조예요.
DataFrame 만들기
딕셔너리나 리스트로 DataFrame을 만들어요. 딕셔너리의 키는 컬럼명이 되고, 값이 컬럼 데이터가 돼요.
import pandas as pd
df = pd.DataFrame({
"name": ["Alice", "Bob", "Carol"],
"age": [25, 30, 35],
"city": ["Seoul", "Busan", "Incheon"]
})
print(df)
여러 파일·타입의 데이터를 읽어 DataFrame으로 만드는 게 일반적인 시작점이에요.
데이터 다루기
DataFrame은 열 선택, 행 필터, 정렬, 집계 같은 작업을 직관적인 문법으로 제공해요.
df["age"] # 열 선택 (Series)
df[df["age"] > 28] # 조건 필터
df.sort_values("age", ascending=False)
왜 pandas인가
Excel나 CSV를 코드로 다루는 것보다 재현 가능하고, 대용량 데이터도 메모리 기반으로 빠르게 처리할 수 있어요. 또한 NumPy, scikit-learn, 시각화 라이브러리와 자연스럽게 이어져 데이터 파이프라인의 중간 허브 역할을 해요.