Hugging Face Hub 문서
Hugging Face Hub 문서
Hugging Face Hub는 오픈 ML을 위한 레퍼런스 AI 플랫폼이에요. 200만 개가 넘는 모델, 150만 개의 데이터셋, 150만 개의 AI 앱(Spaces)을 호스팅하며, 모두 공개·공개 접근 가능해요. 공개 AI를 넘어 Hub는 내부·비공개 팀을 위한 훌륭한 협업 플랫폼이기도 해요. 탐색하고, 실험하고, 협업하고, 빌드하세요 — 모두 한곳에서! 🤗
출처: 문서
본문
Hugging Face Hub가 뭔가요?
우리는 커뮤니티가 함께 협력해 머신러닝 발전이라는 목표를 향해 나아가도록 돕고 있어요 🔥.
어떤 단일 회사도 — Tech Titans를 포함해 — 혼자서 "AI를 해결"할 수 없어요. 이를 달성하는 유일한 방법은 커뮤니티 중심 접근으로 지식과 자원을 공유하는 거예요. 우리는 Hugging Face Hub에서 가장 큰 오픈소스 모델·데이터셋·데모 컬렉션을 구축해 모두를 위한 ML을 민주화하고 발전시키고 있어요 🚀.
Code of Conduct와 Content Guidelines를 읽고 커뮤니티 구성원이 지켜주길 기대하는 가치를 익히는 걸 권장해요 🤗.
Hub에서 무엇을 찾을 수 있나요?
Hugging Face Hub는 Git 기반 저장소를 호스팅해요. 버전 관리되는 폴더로 모든 파일을 담을 수 있죠. 비버전 관리·가변 객체 스토리지에는 Hub가 Storage Buckets도 제공해요.
그 위에서 업로드하고 발견할 수 있는 것들:
- Models: LLM, 텍스트, 비전, 오디오 task를 위한 최첨단 모델 호스팅
- Datasets: 다양한 도메인과 모달리티의 방대한 데이터 제공
- Spaces: 브라우저에서 바로 ML 모델을 시연하는 대화형 앱
Hub는 버전 관리, 커밋 히스토리, diff, 브랜치, 12개 이상의 라이브러리 통합을 제공해요! 모든 저장소는 Xet 위에 구축돼요. Xet은 Git 안에 대용량 파일을 효율적으로 저장하는 신기술로, 파일을 고유한 청크로 지능적으로 분할해 업로드·다운로드를 가속화해요.
모든 저장소가 공유하는 기능은 Repositories 문서에서 자세히 배울 수 있어요.
Models
커뮤니티가 공유한 수만 개의 오픈소스 ML 모델을 발견하고 사용할 수 있어요. 책임 있는 모델 사용과 개발을 촉진하기 위해 모델 저장소에는 각 모델의 한계와 편향을 알려주는 Model Cards가 장착돼 있어요. task, 언어, 평가 결과 같은 정보에 대한 추가 메타데이터도 포함할 수 있고, 저장소에 TensorBoard 트레이스가 있으면 학습 지표 차트까지 추가할 수 있어요. 모델에 추론 widget을 추가하는 것도 쉬워서, 누구나 브라우저에서 직접 모델을 조작할 수 있어요! 프로그램적 접근을 위해 Inference Providers가 서버리스 API를 제공해요.
Hub에 모델을 업로드하거나 모델을 다운로드해 작업에 통합하려면 Models 문서를 살펴보세요. Hub를 지원하는 🤗 Transformers, Asteroid, ESPnet 같은 12개 이상의 라이브러리 중에서도 선택할 수 있어요.
Datasets
Hub는 NLP, Computer Vision, Audio 전반의 광범위한 task에 사용할 수 있는, 8천 개 이상 언어로 된 50만 개 이상의 공개 데이터셋의 본거지예요. Hub는 데이터셋을 찾고·다운로드하고·업로드하기 쉽게 만들어요. 데이터셋에는 Dataset Cards 형태의 광범위한 문서와 브라우저에서 직접 데이터를 탐색할 수 있게 하는 Data Studio가 함께 제공돼요. 많은 데이터셋이 공개지만 조직과 개인은 라이선스나 개인정보 문제를 준수하기 위해 비공개 데이터셋을 만들 수 있어요. Datasets에 대해 자세히 알아보세요.
🤗 datasets 라이브러리로 데이터셋을 프로그래밍 방식으로 상호작용할 수 있어서, Hub의 데이터셋을 프로젝트에서 쉽게 사용할 수 있어요. 한 줄의 코드로 데이터셋에 접근할 수 있고, 컴퓨터에 맞지 않을 만큼 커도 스트리밍으로 데이터를 효율적으로 접근할 수 있어요.
Spaces
Spaces는 Hub에 ML 데모 앱을 호스팅하는 간단한 방법이에요. ML 포트폴리오를 만들고, 컨퍼런스나 이해관계자에게 프로젝트를 선보이고, ML 생태계의 다른 사람들과 협력할 수 있게 해줘요.
우리는 두 가지 훌륭한 Python SDK(Gradio 와 Streamlit)를 지원하며, 몇 분 만에 멋진 앱을 만들 수 있어요. 사용자는 간단한 HTML/CSS/JavaScript 페이지인 static Space를 만들거나 어떤 Docker 기반 애플리케이션도 배포할 수 있어요.
데모에 GPU 파워가 필요하다면 ZeroGPU를 시도해 보세요. 필요한 때에만 실시간으로 NVIDIA RTX Pro 6000 Blackwell GPU를 동적으로 제공해요.
몇몇 Spaces를 탐색한 뒤(우리의 Space of the Week!를 확인해 보세요) Spaces 문서로 들어가 자신만의 Space를 만드는 방법을 모두 배워보세요. Space를 GPU나 다른 가속 하드웨어에서 실행하도록 업그레이드할 수도 있어요. ⚡️
Storage Buckets
Storage Buckets는 Xet 스토리지 백엔드로 구동되는, Hugging Face의 S3와 유사한 객체 스토리지를 제공해요. 저장소(파일 히스토리를 추적하는 git 기반)와 달리 버킷은 콘텐츠 주소형 중복 제거가 있는 대용량 파일용 원격 객체 스토리지 컨테이너예요. 학습 체크포인트, 로그, 중간 산출물, 또는 버전 관리가 필요 없는 대용량 파일 모음을 저장하는 것처럼 간단하고 빠르며 가변적인 스토리지가 필요한 사용 사례를 위해 설계됐어요.
Organizations
기업, 대학, 비영리 단체는 Hugging Face 커뮤니티의 필수적인 부분이에요! Hub는 계정을 그룹화하고 데이터셋·모델·Spaces를 관리하는 데 사용할 수 있는 Organizations를 제공해요. 교육자는 Hugging Face for Classrooms로 학생용 협업 조직을 만들 수도 있어요. 조직의 저장소는 조직 페이지에 표시되고, 조직의 모든 구성원이 저장소에 기여할 수 있어요. 조직의 모든 작업을 편리하게 그룹화하는 것 외에도, Hub는 관리자가 역할을 설정해 저장소 접근을 제어하고, 조직의 결제 방법과 청구 정보를 관리하게 해줘요. 머신러닝은 협업할 때 더 재미있어요! 🔥
기존 조직 탐색, 여기에서 새 조직 생성, 그리고 Organizations 문서를 방문해 더 알아보세요.
Security
Hugging Face Hub는 코드·모델·데이터가 안전하다는 안심을 주는 보안 및 접근 제어 기능을 지원해요. 이 문서의 Security 섹션을 방문해 다음을 알아보세요.
- User Access Tokens
- Organizations를 위한 Access Control
- GPG로 커밋 서명
- 멀웨어 스캐닝
더 알아보기 (Learn more)
Hub는 200만+ 모델, 150만+ 데이터셋, 150만+ Spaces를 호스팅하는 오픈 AI 플랫폼이에요. Git 기반 저장소에서 버전 관리·브랜치·12개 이상 라이브러리 통합을 제공하고, 대용량 파일은 Xet 기술로 효율적으로 저장해요. 시작하려면 Models·Datasets·Spaces·Organizations·Security 문서 섹션을 각각 살펴보는 걸 권장해요.