핵심 개념

핵심 개념 (Key concepts)

OpenAI API를 이해하는 데 필요한 핵심 개념들 — 텍스트 생성 모델, 임베딩, 토큰 — 을 소개해요. 모델이 텍스트를 어떻게 처리하는지 기본기를 배워요.

출처: 문서

본문

OpenAI에서 사용자 데이터 보호는 우리 사명의 근본이에요. 우리는 API를 통한 입력과 출력으로 모델을 학습시키지 않아요. 자세한 내용은 API data privacy page에서 확인하세요.

텍스트 생성 모델 (Text generation models)

OpenAI의 텍스트 생성 모델(종종 생성형 사전 학습 트랜스포머, 줄여서 "GPT" 모델이라고 불려요), 예를 들어 gpt-6-astra와 gpt-5.6-terra는 자연어와 형식 언어(formal language)를 이해하도록 학습되었어요. 이 모델들은 입력에 대한 응답으로 텍스트 출력을 만들어 내요. 이 모델들의 입력은 "프롬프트(prompt)"라고도 불려요. 프롬프트를 설계하는 것이 기본적으로 모델을 "프로그래밍"하는 방법이에요. 보통 작업을 성공적으로 완료하는 방법을 설명하는 지침이나 몇 가지 예시를 제공하는 방식으로요. GPT 모델은 콘텐츠 또는 코드 생성, 요약, 대화, 창작 글쓰기 등 매우 다양한 작업에 사용될 수 있어요. 자세한 내용은 입문용 text generation guide와 prompt engineering guide에서 확인하세요.

임베딩 (Embeddings)

임베딩(embedding)은 데이터 조각(예: 어떤 텍스트)의 벡터 표현으로, 그 콘텐츠 및/또는 의미의 측면을 보존하도록 설계된 것이에요. 어떤 면에서 유사한 데이터 청크들은 관련 없는 데이터보다 서로 더 가까운 임베딩을 갖는 경향이 있어요. OpenAI는 텍스트 문자열을 입력받아 임베딩 벡터를 출력으로 생성하는 텍스트 임베딩 모델을 제공해요. 임베딩은 검색, 클러스터링, 추천, 이상 탐지, 분류 등에 유용해요. 임베딩에 대해 더 자세히 알아보려면 embeddings guide를 참고하세요.

토큰 (Tokens)

텍스트 생성 및 임베딩 모델은 토큰(token)이라는 청크 단위로 텍스트를 처리해요. 토큰은 흔히 나타나는 문자 시퀀스를 나타내요. 예를 들어 " tokenization" 문자열은 " token"과 "ization"으로 분해되는 반면, " the"처럼 짧고 흔한 단어는 단일 토큰으로 표현돼요. 문장에서는 각 단어의 첫 번째 토큰이 일반적으로 공백 문자로 시작한다는 점을 유의하세요. 특정 문자열이 어떻게 토큰으로 변환되는지 테스트하려면 tokenizer tool를 확인해 보세요. 대략적인 경험칙으로, 영어 텍스트의 경우 1 토큰은 약 4자, 또는 0.75 단어에 해당해요.

유의할 한 가지 제한은 텍스트 생성 모델의 경우 프롬프트와 생성된 출력을 합친 것이 모델의 최대 컨텍스트 길이를 넘지 않아야 한다는 점이에요. 임베딩 모델(토큰을 출력하지 않음)의 경우 입력이 모델의 최대 컨텍스트 길이보다 짧아야 해요. 각 텍스트 생성 및 임베딩 모델의 최대 컨텍스트 길이는 model index에서 확인할 수 있어요.

더 알아보기 (Learn more)

관련 문서: 텍스트 생성 가이드와 프롬프트 엔지니어링 가이드를 참고하세요.