사용법 (transformers로 실행)

사용법 (transformers로 실행)

Falcon 모델은 Hugging Face Transformers에 통합되어 있어요. 파이프라인이나 AutoModelForCausalLM으로 로드할 수 있어요.

Falcon-40B 예제

from transformers import AutoTokenizer, AutoModelForCausalLM
import transformers
import torch

model = "tiiuae/falcon-40b"

tokenizer = AutoTokenizer.from_pretrained(model)
pipeline = transformers.pipeline(
    "text-generation",
    model=model,
    tokenizer=tokenizer,
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
    device_map="auto",
)
sequences = pipeline(
   "Girafatron is",
   max_length=200,
   do_sample=True,
   top_k=10,
   num_return_sequences=1,
   eos_token_id=tokenizer.eos_token_id,
)
for seq in sequences:
    print(f"Result: {seq['generated_text']}")

Falcon-180B 예제

전체 bfloat16으로 실행하려면 약 8x A100 80GB 또는 동급 장비가 필요해요.

from transformers import AutoTokenizer, AutoModelForCausalLM
import transformers
import torch

model = "tiiuae/falcon-180b"

tokenizer = AutoTokenizer.from_pretrained(model)
pipeline = transformers.pipeline(
    "text-generation",
    model=model,
    tokenizer=tokenizer,
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
    device_map="auto",
)
sequences = pipeline(
   "Girafatron is",
   max_length=200,
   do_sample=True,
   top_k=10,
   num_return_sequences=1,
   eos_token_id=tokenizer.eos_token_id,
)
for seq in sequences:
    print(f"Result: {seq['generated_text']}")

주의점

  • PyTorch 2.0 필요 — Falcon LLM은 transformers와 함께 쓸 때 PyTorch 2.0이 필요해요
  • 빠른 추론 — 빠른 추론을 원하면 **Text Generation Inference(TGI)**를 쓰는 걸 권장해요
  • raw 모델 주의 — 40B/7B 등은 raw 프리트레인 모델이라 채팅 용도엔 Instruct 변형을 쓰세요

더 알아보기