AI 모델을 로컬에서 사용하기
AI 모델을 로컬에서 사용하기
Hub의 AI 모델을 내 컴퓨터에서 직접 실행할 수 있어요. 이렇게 하면 개인정보 보호(데이터를 원격 서버로 보내지 않음), 속도(서버·연결 속도가 아니라 내 하드웨어가 한계), 제어(모델을 마음대로 구성), 비용(API 프로바이더 비용 없이 실행) 같은 이점을 누릴 수 있답니다.
출처: 문서
본문
Hub의 AI 모델을 로컬에서 직접 실행할 수 있어요. 이는 다음과 같은 이점을 주죠:
- 개인정보 (Privacy): 데이터를 원격 서버로 보내지 않아요.
- 속도 (Speed): 서버나 연결 속도가 아니라 내 하드웨어가 한계예요.
- 제어 (Control): 모델을 원하는 대로 구성할 수 있어요.
- 비용 (Cost): API 프로바이더 비용을 지불하지 않고 로컬에서 모델을 실행할 수 있어요.
로컬 앱 사용법
로컬 앱(Local apps)은 Hugging Face 모델을 내 컴퓨터에서 직접 실행하는 애플리케이션이에요. 시작 방법:
- Local Apps 설정에서 로컬 앱 활성화해요.

- Hub에서 검색해 지원되는 모델을 선택해요. 탐색 바의
Other섹션에서app으로 필터링할 수 있어요:

- 모델 페이지의 "Use this model" 드롭다운에서 로컬 앱을 선택해요.

- 제공된 명령어를 복사해 터미널에서 실행해요.

지원되는 로컬 앱
로컬 앱이 지원되는지 확인하는 가장 좋은 방법은 Local Apps 설정에 가서 앱이 목록에 있는지 보는 거예요. 인기 있는 로컬 앱 몇 가지를 간단히 살펴볼게요:
[!TIP] 👨💻 이 로컬 앱들을 사용하려면 위처럼 모델 카드에서 스니펫을 복사해요.
👷 로컬 앱을 직접 만든다면 이 가이드에서 Hub와 통합하는 법을 배울 수 있어요.
Llama.cpp
Llama.cpp는 CPU, CUDA, Metal을 포함한 다양한 하드웨어에서 최적화된 추론으로 LLM을 로컬에서 실행하는 고성능 C/C++ 라이브러리예요.
장점:
- 여러 CPU 제품군에서 CPU 기반 모델에 매우 빠른 성능
- 낮은 리소스 사용량
- 여러 인터페이스 옵션 (CLI, 서버, Python 라이브러리)
- CPU와 GPU에 하드웨어 최적화
Llama.cpp를 사용하려면 모델 카드로 이동해 "Use this model"을 클릭하고 명령어를 복사해요.
# 모델을 로드하고 실행:
./llama-server -hf unsloth/gpt-oss-20b-GGUF:Q4_K_M
전용 llama.cpp + HF 문서 페이지를 읽어보세요.
Ollama
Ollama는 간단한 커맨드라인 인터페이스로 대규모 언어 모델을 로컬에서 실행하게 해주는 애플리케이션이에요.
장점:
- 쉬운 설치와 설정
- Hugging Face Hub와 직접 통합
Ollama를 사용하려면 모델 카드로 이동해 "Use this model"을 클릭하고 명령어를 복사해요.
ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_M
Jan
Jan은 사용자 친화적인 인터페이스로 완전히 오프라인에서 실행되는 오픈소스 ChatGPT 대안이에요.
장점:
- 사용자 친화적인 GUI
- 문서와 파일로 채팅
- OpenAI 호환 API 서버 — 모델을 실행하고 다른 앱에서 사용 가능
Jan을 사용하려면 모델 카드로 이동해 "Use this model"을 클릭해요. Jan이 열리면 인터페이스를 통해 채팅을 시작할 수 있어요.
LM Studio
[!NOTE] 전용 LM Studio 문서 페이지를 읽어보세요.
LM Studio는 로컬 LLM을 다운로드, 실행, 실험하기 쉬운 방법을 제공하는 데스크톱 애플리케이션이에요.
장점:
- 직관적인 그래픽 인터페이스
- 내장 모델 브라우저
- 개발자 도구와 API
- 개인·상업용 무료
모델 카드로 이동해 "Use this model"을 클릭해요. LM Studio가 열리면 인터페이스를 통해 채팅을 시작할 수 있어요.
더 알아보기 (Learn more)
- 로컬 앱을 쓰면 개인정보·속도·제어·비용 네 가지 이점을 모두 누릴 수 있어요.
- Llama.cpp, Ollama, Jan, LM Studio가 대표적인 지원 로컬 앱이에요.