사용법 (transformers로 실행)
사용법 (transformers로 실행)
Falcon 모델은 Hugging Face Transformers에 통합되어 있어요. 파이프라인이나 AutoModelForCausalLM으로 로드할 수 있어요.
Falcon-40B 예제
from transformers import AutoTokenizer, AutoModelForCausalLM
import transformers
import torch
model = "tiiuae/falcon-40b"
tokenizer = AutoTokenizer.from_pretrained(model)
pipeline = transformers.pipeline(
"text-generation",
model=model,
tokenizer=tokenizer,
torch_dtype=torch.bfloat16,
trust_remote_code=True,
device_map="auto",
)
sequences = pipeline(
"Girafatron is",
max_length=200,
do_sample=True,
top_k=10,
num_return_sequences=1,
eos_token_id=tokenizer.eos_token_id,
)
for seq in sequences:
print(f"Result: {seq['generated_text']}")
Falcon-180B 예제
전체 bfloat16으로 실행하려면 약 8x A100 80GB 또는 동급 장비가 필요해요.
from transformers import AutoTokenizer, AutoModelForCausalLM
import transformers
import torch
model = "tiiuae/falcon-180b"
tokenizer = AutoTokenizer.from_pretrained(model)
pipeline = transformers.pipeline(
"text-generation",
model=model,
tokenizer=tokenizer,
torch_dtype=torch.bfloat16,
trust_remote_code=True,
device_map="auto",
)
sequences = pipeline(
"Girafatron is",
max_length=200,
do_sample=True,
top_k=10,
num_return_sequences=1,
eos_token_id=tokenizer.eos_token_id,
)
for seq in sequences:
print(f"Result: {seq['generated_text']}")
주의점
- PyTorch 2.0 필요 — Falcon LLM은 transformers와 함께 쓸 때 PyTorch 2.0이 필요해요
- 빠른 추론 — 빠른 추론을 원하면 **Text Generation Inference(TGI)**를 쓰는 걸 권장해요
- raw 모델 주의 — 40B/7B 등은 raw 프리트레인 모델이라 채팅 용도엔 Instruct 변형을 쓰세요