Vision fine-tuning
Vision fine-tuning (비전 파인튜닝)
비전 파인튜닝은 지도 파인튜닝에 이미지 입력을 사용해 모델의 이미지 입력 이해를 개선해요. 이 가이드는 SFT의 이 부분집합을 안내하고, 이미지 입력으로 파인튜닝할 때 중요한 고려 사항을 설명해요.
OpenAI는 파인튜닝 플랫폼을 단계적으로 종료하고 있어요. 새 사용자는 더 이상 플랫폼에 접근할 수 없지만, 기존 파인튜닝 플랫폼 사용자는 향후 몇 달 동안 훈련 작업을 만들 수 있을 거예요.
모든 파인튜닝 모델은 기본 모델이 폐기될 때까지 추론에 계속 사용할 수 있어요. 전체 타임라인은 여기에 있어요.
| 동작 방식 | 가장 좋은 용도 | 함께 사용 |
|---|---|---|
| 지도 파인튜닝을 위해 이미지 입력을 제공해서 모델의 이미지 입력 이해를 개선해요. | - 이미지 분류 - 복잡한 프롬프트에 대한 지시 따르기 실패 수정 | `gpt-4o-2024-08-06` |
출처: 문서
본문
데이터 형식
하나 또는 여러 이미지 입력을 보내고 그것을 기반으로 모델 응답을 만들 수 있는 것처럼, 같은 메시지 타입을 JSONL 훈련 데이터 파일에 포함할 수 있어요. 이미지는 HTTP URL 또는 Base64 인코딩 이미지를 담은 data URL로 제공할 수 있어요.
다음은 JSONL 파일의 한 줄에 있는 이미지 메시지의 예시예요. 아래에서 가독성을 위해 JSON 객체를 펼쳐 보여주지만, 일반적으로 이 JSON은 데이터 파일에서 한 줄로 나타나요.
{
"messages": [
{
"role": "system",
"content": "You are an assistant that identifies and describes artworks."
},
{
"role": "user",
"content": "Describe this artwork."
},
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://api.nga.gov/iiif/a2e6da57-3cd1-4235-b20e-95dcaefed6c8/full/!800,800/0/default.jpg"
}
}
]
},
{
"role": "assistant",
"content": "This appears to be a traditional painted artwork with a central human subject."
}
]
}
비전 파인튜닝을 위한 훈련 데이터 업로드는 여기 설명된 것과 같은 과정을 따르요.
이미지 데이터 요구 사항
크기
- 훈련 파일은 이미지를 포함하는 예시를 최대 50,000개 포함할 수 있어요 (텍스트 예시 제외).
- 각 예시는 최대 10개의 이미지를 가질 수 있어요.
- 각 이미지는 최대 10 MB일 수 있어요.
형식
- 이미지는 JPEG, PNG, 또는 WEBP 형식이어야 해요.
- 이미지는 RGB 또는 RGBA 이미지 모드여야 해요.
assistant역할 메시지의 출력으로 이미지를 포함할 수 없어요.
콘텐츠 심사 정책
훈련 전에 이미지를 스캔해서 사용 정책을 준수하는지 확인해요. 이로 인해 파인튜닝 시작 전 파일 검증에 지연이 생길 수 있어요.
다음을 포함하는 이미지는 데이터셋에서 제외되고 훈련에 사용되지 않아요.
- 사람 (People)
- 얼굴 (Faces)
- 어린이 (Children)
- CAPTCHA
이미지가 건너뛰어지면 어떻게 해야 하나
다음 이유로 훈련 중 이미지가 건너뛰어질 수 있어요.
- CAPTCHA 포함, 사람 포함, 얼굴 포함, 어린이 포함
- 이미지를 제거하세요. 현재는 이런 엔티티를 포함한 이미지로 모델을 파인튜닝할 수 없어요.
- 접근 불가 URL
- 이미지 URL이 공개적으로 접근 가능한지 확인하세요.
- 이미지가 너무 큼
- 이미지가 데이터셋 크기 한도 안에 들도록 하세요.
- 유효하지 않은 이미지 형식
- 이미지가 데이터셋 형식 안에 들도록 하세요.
모범 사례
훈련 비용 줄이기
이미지의 detail 파라미터를 low로 설정하면 이미지가 512×512 픽셀로 리사이즈되고 크기에 관계없이 85 토큰으로만 표현돼요. 이는 훈련 비용을 줄여줘요. 자세한 내용은 여기를 참고하세요.
{
"type": "image_url",
"image_url": {
"url": "https://api.nga.gov/iiif/a2e6da57-3cd1-4235-b20e-95dcaefed6c8/full/!800,800/0/default.jpg",
"detail": "low"
}
}
이미지 품질 제어
이미지 이해의 충실도를 제어하려면 각 이미지에 대해 image_url의 detail 파라미터를 low, high, 또는 auto로 설정하세요. 이것은 훈련 중 모델이 보는 이미지당 토큰 수에도 영향을 주고 훈련 비용에도 영향을 줘요. 자세한 내용은 여기를 참고하세요.
안전 검사
프로덕션에 배포하기 전에 다음 안전 정보를 검토하고 따르세요.
안전을 어떻게 평가하는가
파인튜닝 작업이 완료되면 결과 모델의 동작을 13개의 고유한 안전 카테고리에 걸쳐 평가해요. 각 카테고리는 제대로 통제되지 않으면 AI 출력이 잠재적으로 해를 끼칠 수 있는 중요한 영역을 나타내요.
| 이름 | 설명 |
|---|---|
| advice | 당사 정책을 위반하는 조언 또는 지도. |
| harassment/threatening | 어떤 대상에 대한 폭력이나 심각한 해를 포함하는 괴롭힘 콘텐츠. |
| hate | 인종, 성별, 민족, 종교, 국적, 성적 취향, 장애 상태, 카스트에 기반한 혐오를 표현·선동·조장하는 콘텐츠. 보호되지 않는 집단을 겨냥한 혐오 콘텐츠(예: 체스 선수)는 괴롭힘입니다. |
| hate/threatening | 인종, 성별, 민족, 종교, 국적, 성적 취향, 장애 상태, 카스트에 기반해 대상 집단을 겨냥한 폭력이나 심각한 해를 포함하는 혐오 콘텐츠. |
| highly-sensitive | 당사 정책을 위반하는 고도로 민감한 데이터. |
| illicit | 불법 행위를 저지르는 방법에 대한 조언 또는 지시를 주는 콘텐츠. "how to shoplift" 같은 문구가 이 카테고리에 해당해요. |
| propaganda | 당사 정책을 위반하는 이념에 대한 칭송 또는 지원. |
| self-harm/instructions | 자살, 자해, 섭식 장애 같은 자해 행위를 수행하도록 조장하거나, 그러한 행위를 저지르는 방법에 대한 지시·조언을 주는 콘텐츠. |
| self-harm/intent | 화자가 자살, 자해, 섭식 장애 같은 자해 행위에 관여하고 있거나 관여할 의도가 있다고 표현하는 콘텐츠. |
| sensitive | 당사 정책을 위반하는 민감한 데이터. |
| sexual/minors | 18세 미만 개인을 포함하는 성적 콘텐츠. |
| sexual | 성적 흥분을 유발하려는 콘텐츠(예: 성행위 설명) 또는 성 서비스를 홍보하는 콘텐츠(성 교육과 웰니스 제외). |
| violence | 죽음, 폭력, 또는 신체적 부상을 묘사하는 콘텐츠. |
각 카테고리에는 미리 정의된 통과 임계값이 있어요. 주어진 카테고리에서 너무 많은 평가 예시가 실패하면 OpenAI는 파인튜닝 모델의 배포를 차단해요. 파인튜닝 모델이 안전 검사를 통과하지 못하면 OpenAI는 파인튜닝 작업에서 어떤 카테고리가 요구 임계값을 충족하지 못하는지 설명하는 메시지를 보내요. 결과는 파인튜닝 작업의 심사(moderation) 검사 섹션에서 볼 수 있어요.
안전 검사를 통과하는 방법
파인튜닝 작업 객체에서 실패한 안전 검사를 검토하는 것 외에도, 파인튜닝 API 이벤트 엔드포인트를 질의해 어떤 카테고리가 실패했는지 세부 사항을 검색할 수 있어요. 카테고리 결과와 집행에 대한 세부 사항을 위해 moderation_checks 타입의 이벤트를 찾으세요. 이 정보는 재훈련과 개선을 위해 어떤 카테고리를 타겟으로 삼을지 좁히는 데 도움이 돼요. 모델 스펙에는 추가 훈련 데이터를 위한 영역을 식별하는 데 도움이 되는 규칙과 예시가 있어요.
이 평가가 광범위한 안전 카테고리를 다루지만, 파인튜닝 모델이 사용 사례에 적합한지 확인하기 위해 직접 평가도 수행하세요.
다음 단계
이제 비전 파인튜닝의 기초를 알았으니, 이 다른 방법들도 살펴보세요.
- 지도 파인튜닝 — 샘플 입력에 대한 올바른 출력을 제공해 모델을 파인튜닝합니다.
- 직접 선호 최적화 — DPO를 사용해 모델을 파인튜닝합니다.
- 강화 파인튜닝 — 출력을 채점해 추론 모델을 파인튜닝합니다.
더 알아보기 (Learn more)
- 이미지·비전 가이드에서 이미지 입력과 detail 제어를 확인하세요.
- Supervised fine-tuning 가이드를 참고하세요.