Datasets 시작하기
Datasets 시작하기
Evaluations(흔히 evals라고 함)는 모델 출력을 테스트하여 지정한 스타일과 콘텐츠 기준을 충족하는지 확인합니다. evals 작성은 안정적인 애플리케이션을 만드는 데 필수적인 부분입니다. OpenAI 플랫폼의 기능인 Datasets는 evals와 프롬프트 테스트를 빠르게 시작할 수 있는 방법을 제공합니다.
OpenAI는 Evals 플랫폼을 폐지하고 있습니다. 기존 evals 콘텐츠는 전환 기간 동안 계속 사용할 수 있습니다. Evals는 2026년 10월 31일부터 기존 사용자에게 읽기 전용이 되며, 플랫폼은 2026년 11월 30일에 종료될 예정입니다. 현재 일정은 폐지 안내 페이지에서 확인하세요.
외부 모델에 대한 평가 같은 고급 기능이 필요하거나, API로 eval 실행과 상호작용하거나, 더 큰 규모로 평가를 실행하고 싶다면 Evals 사용을 고려하세요.
출처: 문서
본문
데이터셋 만들기
먼저 대시보드에서 데이터셋을 만드세요.
- evaluation 페이지에서 Datasets 탭으로 이동하세요.
- 오른쪽 상단의 Create 버튼을 클릭해 시작하세요.
- 입력 필드에 데이터셋 이름을 추가하세요. 이 가이드에서는 데이터셋 이름을 "Investment memo generation."으로 정하겠습니다.
- 데이터를 추가하세요. 처음부터 데이터셋을 만들려면 Create를 클릭하고 시각적 인터페이스를 통해 데이터를 추가하세요. 저장된 프롬프트나 데이터가 있는 CSV가 이미 있다면 업로드하세요.
데이터셋을 동적 공간으로 사용하여 시간이 지나면서 평가 데이터 세트를 확장하는 것을 권장합니다. 모니터링이 필요한 엣지 케이스나 사각지대를 발견하면 대시보드 인터페이스로 추가하세요.
CSV 업로드
과거 분기의 회사 이름과 실제 매출 값을 담은 CSV가 있다고 가정하겠습니다.
CSV의 열은 프롬프트와 그레이더(graders) 모두가 접근할 수 있습니다. 예를 들어 CSV에 입력 열(company)과 그레이더가 참조로 사용할 정답 열(correct_revenue, correct_income)이 포함될 수 있습니다.
시각적 데이터 인터페이스 사용
데이터셋을 연 뒤 Data 탭에서 데이터를 조작할 수 있습니다. 셀을 클릭해 내용을 편집하세요. 행을 추가해 데이터를 더 추가할 수 있습니다. 각 행의 오른쪽 끝에 있는 오버플로 메뉴에서 행을 삭제하거나 복제할 수도 있습니다.
변경 사항을 저장하려면 오른쪽 상단의 Save 버튼을 클릭하세요.
프롬프트 만들기
datasets 대시보드의 탭을 통해 여러 프롬프트가 동일한 데이터와 상호작용할 수 있습니다.
-
새 프롬프트를 추가하려면 Add prompt를 클릭하세요.
Datasets는 OpenAI 프롬프트와 함께 사용하도록 설계되었습니다. OpenAI 플랫폼에 프롬프트를 저장했다면 드롭다운에서 선택해 이 인터페이스에서 변경할 수 있습니다. 프롬프트 변경 사항을 저장하려면 Save를 클릭하세요.
프롬프트는 버전 관리 시스템을 사용하므로 안전하게 업데이트할 수 있습니다. Save를 클릭하면 프롬프트의 새 버전이 생성되며, OpenAI 플랫폼 어디에서나 참조하거나 사용할 수 있습니다.
-
프롬프트 패널에서 제공되는 필드와 설정을 사용해 추론 호출을 제어하세요:
- 오른쪽 상단의 슬라이더 아이콘을 클릭해 모델
temperature와top_p를 제어하세요. - 도구를 추가해 추론 호출이 웹에 접근하거나, MCP를 사용하거나, 다른 도구 호출 작업을 완료할 수 있게 하세요.
- 변수를 추가하세요. 프롬프트와 그레이더 모두 이 변수를 참조할 수 있습니다.
- 시스템 메시지를 직접 입력하거나, 연필 아이콘을 클릭해 제공한 기본 지침에 따라 모델이 프롬프트 생성을 도와주게 하세요.
이 예시에서는 웹 검색 도구를 추가해 모델 호출이 인터넷에서 재무 데이터를 가져올 수 있게 하겠습니다. 변수 목록에는 데이터셋의 회사 열을 참조할 수 있도록 company를 추가합니다. 프롬프트는 모델에게 "generate a financial report"라고 지시해 생성합니다.
출력 생성 및 어노테이션
데이터와 프롬프트를 설정했으면 출력을 생성할 준비가 되었습니다. 모델의 출력은 제공한 프롬프트와 도구로 모델이 작업을 어떻게 수행하는지 보여줍니다. 그다음 출력에 어노테이션을 달아 모델이 시간이 지나면서 성능을 개선하게 합니다.
-
오른쪽 상단에서 Generate output을 클릭하세요.
데이터셋에 새 output 특수 열이 결과로 채워지기 시작합니다. 이 열에는 데이터셋의 각 행에 프롬프트를 실행한 결과가 포함됩니다.
-
생성된 출력이 준비되면 어노테이션을 다세요. output, rating, 또는
output_feedback열을 클릭해 어노테이션 보기를 여세요.원하는 만큼 적게 또는 많이 어노테이션을 다세요. Datasets는 어떤 정도와 유형의 어노테이션에서도 작동하도록 설계되었지만, 더 높은 품질의 정보를 제공할수록 더 나은 결과를 얻을 수 있습니다.
어노테이션의 역할
어노테이션은 모델 출력을 평가하고 개선하는 데 핵심적인 부분입니다. 좋은 어노테이션은:
- 스타일과 톤 같은 주관적 요소를 포함해 매우 특정한 경우에도 원하는 모델 동작에 대한 정답(ground truth) 역할을 합니다.
- 자동 프롬프트 개선(프롬프트 최적화 도구를 통한)을 가능하게 하는 정보 밀도 높은 컨텍스트를 제공합니다.
- 특히 미묘하거나 드문 경우에서 프롬프트의 문제점 진단을 가능하게 합니다.
- 그레이더가 사용자 의도와 일치하도록 돕습니다.
원하는 만큼 적게 또는 많이 어노테이션을 선택할 수 있습니다. Datasets는 어떤 정도와 유형의 어노테이션에서도 작동하도록 설계되었지만, 더 높은 품질의 정보를 제공할수록 더 나은 결과를 얻을 수 있습니다. 또한 데이터셋 내용에 대한 전문가가 아니라면, 주제 전문가(subject matter expert)가 어노테이션을 수행하도록 권장합니다. 이는 그들의 전문성이 최적화 프로세스에 반영되는 가장 가치 있는 방법입니다. evals로 프롬프트 회복력을 개선하는 데 가장 효과적이었다고 우리가 발견한 내용에 대해 더 알아보려면 쿡북을 살펴보세요.
어노테이션 시작 지점
시작할 수 있는 어노테이션 유형 몇 가지는 다음과 같습니다:
- 출력에 대한 판단을 나타내는 Good/Bad 등급
output_feedback섹션의 텍스트 비평- 오른쪽 상단의 Columns 드롭다운에서 추가한 커스텀 어노테이션 범주
전문가 어노테이션 반영
데이터셋 내용에 대한 전문가가 아니라면 주제 전문가가 어노테이션을 수행하게 하세요. 이는 최적화 프로세스에 전문성을 반영하는 가장 좋은 방법입니다. 쿡북에서 더 자세히 알아보세요.
그레이더 추가
어노테이션이 평가 프로세스에 인간 피드백을 반영하는 가장 효과적인 방법이지만, 그레이더는 평가를 대규모로 실행할 수 있게 합니다. 그레이더는 유형에 따라 다양한 입력을 생성할 수 있는 자동화된 평가입니다.
| Type | 세부 사항 | 사용 사례 |
|---|---|---|
| String check | 정확한 문자열 매칭으로 모델 출력을 참조와 비교 | 응답이 정답 열과 정확히 일치하는지 확인 |
| Text similarity | embeddings를 사용해 모델 출력과 참조 간 의미적 유사도 계산 | 정확한 매칭이 필요 없을 때 응답이 정답 참조와 얼마나 가까운지 확인 |
| Score model grader | LLM을 사용해 숫자 점수 부여 | 친근함 같은 주관적 속성을 숫자 척도로 측정 |
| Label model grader | LLM을 사용해 범주형 라벨 선택 | "concise"나 "verbose" 같은 고정 라벨을 기준으로 응답 분류 |
| Python code execution | 커스텀 Python 코드를 실행해 프로그래밍 방식으로 결과 계산 | 출력에 50단어 미만이 포함되어 있는지 확인 |
- 오른쪽 상단에서 Grade > New grader로 이동하세요.
- 드롭다운에서 그레이더 유형을 선택하고 양식을 작성해 그레이더를 구성하세요.
- 데이터셋의 열을 참조해 정답 값과 대조하세요.
- 그레이더를 만드세요.
- 그레이더를 하나 이상 추가한 뒤 Grade 드롭다운 메뉴로 특정 그레이더나 모든 그레이더를 데이터셋에 실행하세요. 실행이 완료되면 각 그레이더 전용 열에서 데이터셋의 통과/실패 등급을 볼 수 있습니다.
데이터셋을 저장하면 데이터셋과 프롬프트를 변경해도 그레이더는 유지되므로, 프롬프트나 모델 매개변수 변경이 개선으로 이어지는지, 엣지 케이스 추가가 프롬프트의 문제점을 드러내는지 빠르게 평가하는 좋은 방법입니다. datasets 대시보드는 프롬프트의 여러 변형에 걸쳐 자동화된 그레이더의 결과를 동시에 추적하기 위한 여러 탭을 지원합니다.
그레이더에 대해 자세히 알아보세요.
다음 단계
Datasets는 빠른 반복에 적합합니다. 시간이 지나면서 성능을 추적하거나 대규모로 실행할 준비가 되면 데이터셋을 Eval로 내보내세요. Evals는 비동기로 실행되고, 더 큰 데이터 볼륨을 지원하며, 버전 간 성능을 모니터링할 수 있게 합니다.
더 많은 아이디어는 예제 코드와 서드파티 리소스 링크가 있는 OpenAI Cookbook을 방문하거나, 평가 도구에 대해 자세히 알아보세요:
- Cookbook: evals로 회복력 있는 프롬프트 만들기 — 평가를 사용해 지속적인 개선의 플라이휠을 운영합니다.
- evals 작업하기 — 외부 모델에 대해 평가하고, API로 evals와 상호작용하는 등 다양한 기능을 제공합니다.
- 프롬프트 최적화 도구 — 데이터셋을 사용해 프롬프트를 자동으로 개선합니다.
- 그레이더 — 정교한 그레이더를 만들어 evals의 효과를 개선합니다.