pandas 데이터 읽고 쓰기
pandas 데이터 읽고 쓰기
pandas는 CSV, Excel, JSON, Parquet 등 다양한 포맷을 읽고 쓸 수 있어요. 파일을 DataFrame으로 읽어 분석하고, 결과를 다시 원하는 포맷으로 저장하는 것까지 pandas 하나로 처리할 수 있어요.
CSV 읽기
가장 자주 쓰는 게 CSV예요. read_csv()에 파일 경로를 넘기면 돼요.
import pandas as pd
df = pd.read_csv("sales.csv")
옵션으로 구분자가 다른 경우 sep, 인코딩이 필요한 경우 encoding을 지정할 수 있어요.
df = pd.read_csv("sales.tsv", sep="\t")
CSV 저장
DataFrame을 CSV로 저장할 때는 to_csv()를 써요. index=False로 인덱스를 빼면 깔끔하게 저장돼요.
df.to_csv("report.csv", index=False)
Excel과 JSON
Excel은 read_excel()/to_excel()로, JSON은 read_json()/to_json()으로 다뤄요. Excel은 sheet_name으로 시트를, header, dtype 같은 옵션으로 읽는 방식을 제어해요.
df_excel = pd.read_excel("data.xlsx", sheet_name="Sheet1")
df.to_json("data.json", orient="records")
Parquet 등 이진 포맷
Parquet은 대용량 데이터를 효율적으로 저장하는 이진 포맷이에요. read_parquet()/to_parquet()로 다루고, 분산 처리 도구와도 잘 맞아요.