WebLLM — 브라우저에서 LLM을 로컬로 실행하기
WebLLM — 브라우저에서 LLM을 로컬로 실행하기
MLC LLM의 매력은 같은 엔진을 브라우저로도 가져갈 수 있다는 점이에요. WebLLM 은 JavaScript/WASM 기반 배포로, 사용자 브라우저 안에서 LLM 추론이 실제로 돌아가게 해 줘요.
WebLLM은 서버 호출 없이 브라우저에서 직접 모델을 로드하고 대화를 실행해요. 프라이버시가 중요한 데이터를 기기에 두고 추론할 수 있고, 오프라인에서도 동작하는 구조예요.
실행은 크게 두 단계예요:
- 모델 컴파일 — MLC LLM 컴파일러로 모델을 WebGPU/WASM 타깃에 맞게 컴파일해요.
- JS SDK 로드 — 컴파일된 모듈을 웹 앱에서 로드해 채팅 API를 호출해요.
브라우저에서는 WebGPU 를 활용해 GPU 추론을 시도하고, 지원되지 않는 환경은 CPU(WASM) 경로로 폴백돼요. 같은 messages/stream 형태의 OpenAI 호환 API를 써서 서버 SDK와 거의 같은 코드로 브라우저 배포를 만들 수 있어요.
이런 구조 덕분에 서버 비용 없이, 지연 없이, 기기 안에서 LLM을 쓰는 특수한 제품(프라이버시 민감 앱, 오프라인 도구 등)을 만들기 좋아요. 정확한 설치는 공식 WebLLM 문서의 모델 컴파일과 npm 패키지 안내를 따라가면 돼요.