Data Studio

Data Studio

각 데이터셋 페이지에는 데이터셋 내용을 담은 테이블이 있고, 100행씩 페이지로 나뉘어 있어요. 테이블 하단 버튼으로 페이지 사이를 이동할 수 있어요.

출처: 문서

본문

데이터 분포 살펴보기

컬럼 상단에는 데이터 분포를 나타내는 그래프가 보여요. 클래스가 얼마나 균형 있는지, 수치 데이터와 텍스트 길이의 범위·분포가 어떤지, 컬럼 데이터의 몇 퍼센트가 누락됐는지 빠르게 파악할 수 있어요.

값으로 필터링하기

수치 컬럼의 히스토그램 막대를 클릭하면 데이터셋 뷰어가 데이터를 필터링해 선택한 범위의 값이 있는 행만 보여줘요. 마찬가지로 범주형 컬럼에서 한 클래스를 선택하면 선택한 카테고리의 행만 보여줘요.

데이터셋에서 단어 검색하기

테이블 상단의 검색창에 단어를 입력해 데이터셋에서 검색할 수 있어요. 대소문자를 구분하지 않으며, 단어를 포함한 모든 행을 매칭해요. string 컬럼에서 검색되며, 값이 딕셔너리나 리스트에 중첩되어 있어도 검색해요.

데이터셋에 SQL 쿼리 실행하기

SQL Console로 브라우저에서 데이터셋에 SQL 쿼리를 실행할 수 있어요. 이 기능은 Parquet 자동 변환을 활용해요.

자세한 내용은 SQL Console 가이드를 참고하세요. 같은 DuckDB SQL 쿼리를 hf datasets sql로 커맨드 라인에서, 또는 DuckDB로 직접 실행할 수 있어요.

특정 행 공유하기

행을 클릭한 뒤 브라우저 주소창의 URL을 복사해 특정 행을 공유할 수 있어요. 예를 들어 https://huggingface.co/datasets/nyu-mll/glue/viewer/mrpc/test?p=2&row=241 은 MRPC 데이터셋의 test 스플릿 241번째 행에서 데이터셋 스튜디오를 열어요.

에이전트 트레이스

Claude Code, Codex, Pi 같은 도구의 원시 JSONL 트레이스를 데이터셋으로 푸시해 Data Studio에서 탐색하거나, Storage Bucket에 동기화해 개별 .jsonl 파일을 열 수 있어요. 두 경로 모두 같은 트레이스 뷰어를 사용해 세션, 턴, 도구 호출, 모델 응답을 단계별로 살펴봐요. 지원되는 에이전트와 트레이스 보기는 Agent Traces를 참고하세요.

대규모 데이터셋

Dataset Viewer는 대규모 데이터셋을 지원하지만, 데이터 형식에 따라 데이터셋의 첫 5GB만 보여줄 수 있어요:

  • Parquet 데이터셋: Dataset Viewer가 전체 데이터셋을 보여주지만, 정렬·필터링·검색은 첫 5GB에서만 활성화돼요.
  • 5GB 초과의 다른 형식(예: WebDataset 또는 JSON Lines): Dataset Viewer가 첫 5GB만 보여주고, 정렬·필터링·검색이 이 첫 5GB에서 활성화돼요.

이 경우 뷰어가 부분적이라는 정보 메시지가 표시돼요. 전체 데이터셋을 정확히 나타내기엔 충분히 큰 샘플이어야 하며, 더 큰 샘플이 필요하면 알려 주세요.

Parquet 파일 접근하기

데이터셋 뷰어를 구동하기 위해 모든 데이터셋의 첫 5GB가 Parquet 형식으로 자동 변환돼요(이미 Parquet 데이터셋이 아니라면). 데이터셋 뷰어에서(예: GLUE) "Auto-converted to Parquet" 를 클릭해 Parquet 파일에 접근할 수 있어요. Polars, Pandas, DuckDB 같은 라이브러리로 데이터셋 Parquet 파일을 쿼리하는 방법은 데이터셋 뷰어 문서를 참고하세요.

[!TIP] Parquet은 대규모 데이터셋의 쿼리·처리에 최적화된 컬럼 기반 저장 형식이에요. 빅데이터 처리와 분석에 널리 쓰이며 데이터 처리와 머신러닝에도 많이 사용돼요.

변환 봇

새 데이터셋을 만들면 parquet-converter이 데이터셋을 Parquet으로 변환하면 알려줘요. 저장소에서 여는 토론이 Parquet 형식에 대한 세부 정보와 Parquet 파일 링크를 제공해요.

프로그래밍 방식 접근

Hub API로 Parquet 파일 목록에 프로그래밍 방식으로 접근할 수 있어요. 예를 들어 엔드포인트 https://huggingface.co/api/datasets/nyu-mll/glue/parquetnyu-mll/glue 데이터셋의 Parquet 파일을 나열해요. hf CLI는 hf datasets parquet로 같은 목록을, hf datasets sql로 SQL 쿼리를 제공해요.

직접 호출할 수 있는 Dataset Viewer API 문서도 있어요. 이 API는 모든 Hugging Face Hub 데이터셋의 내용, 메타데이터, 기본 통계에 접근하게 해주며 Dataset Viewer 프론트엔드를 구동해요.

데이터셋 미리보기

가장 큰 데이터셋은 풀 기능 뷰어 대신 첫 100행의 미리보기를 보여줘요. 이 제한은 5GB를 넘으면서 기본 Parquet 형식이 아니거나 Parquet으로 자동 변환되지 않은 데이터셋에만 적용돼요.

웹페이지에 Dataset Viewer 임베드하기

iframe으로 Dataset Viewer를 자신의 웹페이지에 임베드할 수 있어요. 사용할 URL은 https://huggingface.co/datasets/<namespace>/<dataset-name>/embed/viewer 이고, 여기서 <namespace>는 데이터셋 소유자, <dataset-name>은 데이터셋 이름이에요. 서브셋, 스플릿, 필터, 검색, 선택 행 같은 다른 파라미터도 전달할 수 있어요.

자세한 내용은 웹페이지에 Dataset Viewer 임베드하기 가이드를 참고하세요.

Dataset Viewer 구성하기

데이터셋의 Dataset Viewer가 제대로 동작하게 하려면 지원 형식과 구조인지 확인하세요. YAML로 데이터셋을 구성할 수도 있어요.

데이터셋 README.md 파일 상단에 YAML 구성 블록을 추가해 Dataset Viewer에 표시할 파일을 지정할 수 있어요. 예를 들어 어떤 파일이 어느 스플릿으로 갈지 선택하려면:

---
configs:
- config_name: default
  data_files:
  - split: train
    path: "data.csv"
  - split: test
    path: "holdout.csv"
---

스플릿당 여러 파일을 선택하거나 glob 패턴을 쓸 수도 있어요:

---
configs:
- config_name: default
  data_files:
  - split: train
    path:
    - "data/train_part1.csv"
    - "data/train_part2.csv"
  - split: test
    path: "data/*.csv"
---

프라이빗 데이터셋의 경우 Dataset Viewer는 PRO 사용자Team 또는 Enterprise 조직에 대해 활성화돼요.

자세한 내용은 Dataset Viewer 구성 방법 가이드를 참고하세요.

더 알아보기 (Learn more)