tiktoken 시작하기 — 설치와 첫 토크나이징

tiktoken 시작하기

텍스트를 그대로 모델에 넣기 전에, 실제로는 토큰 단위로 잘라서 넣어야 해요. tiktoken은 OpenAI 모델용 BPE 토크나이저로, 이 잘라내기(인코딩)와 되살리기(디코딩)를 매우 빠르게 처리해 줘요. 여기에 원문에 있던 예제를 그대로 보여드릴게요.

import tiktoken
enc = tiktoken.get_encoding("o200k_base")
assert enc.decode(enc.encode("hello world")) == "hello world"

# To get the tokeniser corresponding to a specific model in the OpenAI API:
enc = tiktoken.encoding_for_model("gpt-4o")

tiktoken.get_encoding으로 인코딩 이름을 직접 지정할 수도 있고, tiktoken.encoding_for_model로 모델 이름을 주면 그 모델에 맞는 토크나이저를 골라 줘요. 토크나이저 API의 정확한 스펙은 tiktoken/core.py에 문서화돼 있어요.

설치

오픈소스 버전은 PyPI에서 받을 수 있어요.

pip install tiktoken

성능

공식 README에 따르면 tiktoken은 비슷한 오픈소스 토크나이저보다 3~6배 빠르다고 해요. GPT-2 토크나이저로 1GB 텍스트를 기준으로 측정한 수치고, GPT2TokenizerFast(tokenizers==0.13.2, transformers==4.24.0)와 tiktoken==0.2.0을 비교했어요.

더 알아보기