llmware 개요 — 지식 기반 로컬 앱을 위한 통합 프레임워크

llmware 개요 — 지식 기반 로컬 앱을 위한 통합 프레임워크

llmware는 지식 기반의 로컬·프라이빗·시큐어 LLM 애플리케이션을 만드는 통합 프레임워크예요. Windows, Mac, Linux 전반의 AI PC와 랩톱, 엣지·셀프호스팅 배포에 최적화돼 있어요. GGUF, OpenVINO, ONNXRuntime, ONNXRuntime-QNN(Qualcomm), WindowsLocalFoundry, Pytorch를 지원해서 대상 플랫폼에 맞는 추론 기술을 골라 쓸 수 있는 게 특징이에요.

출처: https://github.com/llmware-ai/llmware

llmware는 크게 두 컴포넌트로 구성돼요.

  1. 모델 카탈로그(Model Catalog) — 300개 이상의 모델을 양자화·최적화된 형태로 미리 패키징했어요. 기기 GPU·NPU를 활용할 수 있고, 엔터프라이즈 프로세스 자동화에 특화된 50개 이상의 llmware 파인튜닝 SLIM, Bling, Dragon, Industry-Bert 모델도 포함돼요. OpenAI, Anthropic, Google 같은 클라우드 모델도 지원해요.
  2. RAG 파이프라인 — 지식 소스를 생성형 AI 모델에 연결하는 전 과정을 다뤄요. 문서 파싱, 텍스트 청킹, 임베딩, 스케일러블 지식 베이스 생성까지 통합돼 있어요.

핵심 개념은 모델 카탈로그 접근, 라이브러리 생성·쿼리, 프롬프트·소스 결합으로 정리할 수 있어요.

  • Model Catalog: 모든 모델을 동일한 방식으로 조회하고 로드해요.
from llmware.models import ModelCatalog

# 전체 모델 목록 조회
models = ModelCatalog().list_all_models()

# 모델 로드 후 inference
my_model = ModelCatalog().load_model("llmware/bling-phi-3-gguf")
output = my_model.inference("what is the future of AI?", add_context="Here is the article to read")
  • Library: 지식 컬렉션을 파싱·청킹·임베딩해서 인덱싱해요. 라이브러리는 '지식 베이스 컨테이너' 개념으로, 같은 데이터에 여러 벡터 DB·임베딩 모델을 섞어 붙일 수도 있어요.
from llmware.library import Library

lib = Library().create_new_library("my_library")
lib.add_files("/folder/path/to/my/files")
lib.install_new_embedding(embedding_model_name="mini-lm-sbert", vector_db="milvus", batch_size=500)

llmware의 비전은 가능한 한 작은 컴퓨팅으로 정확하고 비용 효율적인 AI를 만드는 거예요. 그래서 대부분의 예제와 모델을 랩톱에서 바로 실행할 수 있어요.

더 알아보기