주석이 달린 모델 카드 템플릿
주석이 달린 모델 카드 템플릿 (Annotated Model Card Template)
모델 카드를 완성할 때 각 섹션의 역할(개발자, 사회기술 전문가, 프로젝트 조직자)을 안내하는 주석 템플릿이에요. 각 섹션에 무엇을 적어야 하는지 이탤릭체 설명으로 함께 제공됩니다.
출처: 문서
본문
[!TIP] 게시할 준비가 되셨나요? 간결하고 유익하며 사용자 친화적인 모델 릴리스의 필수 단계는 Model Release Checklist를 참고하세요.
템플릿 (Template)
작성 지침 (Directions)
모델 카드를 완전히 채우려면 몇 가지 다른 역할의 입력이 필요합니다. (한 사람이 여러 역할을 맡을 수도 있어요.) 이 역할들을 코드 작성과 학습 실행을 담당하는 개발자(developer), 기술과 사회의 장기적 상호작용 분석에 능숙한 사회기술 전문가(sociotechnic)(변호사, 윤리학자, 사회학자, 권리 옹호자 포함), 그리고 모델의 전체적인 범위와 영향력을 이해하고 카드의 각 부분을 대략적으로 채울 수 있으며 모델 카드 업데이트의 연락 담당 역할을 하는 **프로젝트 조직자(project organizer)**라고 부를게요.
-
개발자는 Training Procedure와 Technical Specifications을 채우는 데 필요합니다. 또한 Bias, Risks, and Limitations의 "Limitations" 섹션에 특히 유용해요. Evaluation에 대한 Results를 제공할 책임이 있으며, 이상적으로는 Evaluation의 나머지(Testing Data, Factors & Metrics)를 정의할 때 다른 역할과 협력합니다.
-
사회기술 전문가는 Bias, Risks, and Limitations 안의 "Bias"와 "Risks"를 채우는 데 필요하며, Uses 안의 "Out of Scope Use"에 특히 유용합니다.
-
프로젝트 조직자는 Model Details와 Uses를 채우는 데 필요해요. Training Data도 채울 수 있습니다. 프로젝트 조직자는 또한 Citation, Glossary, Model Card Contact, Model Card Authors, More Information을 담당할 수도 있어요.
지침은 아래에 이탤릭체로 제공됩니다.
템플릿 변수 이름은 monospace로 표시됩니다.
Model Name
섹션 개요 (Section Overview): 모델 이름과 모델이 무엇인지에 대한 1-2문장 요약을 제공하세요.
model_id
model_summary
Table of Contents
섹션 개요 (Section Overview): 각 섹션으로의 링크와 함께 제공해, 사람들이 파일을 쉽게 이동하거나 TOC를 보존한 채 다른 위치에서 사용/인쇄할 수 있게 합니다.
Model Details
섹션 개요 (Section Overview): 이 섹션은 모델이 무엇인지, 현재 상태, 어디서 왔는지에 대한 기본 정보를 제공합니다. 모델을 참조하려는 누구에게나 유용해야 합니다.
Model Description
model_description
모델에 대한 기본 세부 정보를 제공하세요. 여기에는 아키텍처, 버전, 논문에 소개되었는지, 원본 구현이 가능한지, 창작자가 포함됩니다. 저작권은 여기에 명시해야 합니다. 학습 절차, 파라미터, 중요한 면책 조항에 대한 일반 정보도 이 섹션에서 언급할 수 있습니다.
- Developed by (개발자):
developers
모델을 만든 사람을 나열하세요(가능하면 링크).
- Funded by (자금 제공자):
funded_by
이 모델을 재정적, 컴퓨팅 또는 기타 방식으로 지원·가능하게 한 자금 출처를 나열하세요(가능하면 링크).
- Shared by [선택]:
shared_by
모델을 온라인으로 제공하는 사람/조직을 나열하세요(가능하면 링크).
- Model type (모델 유형):
model_type
"유형"은 다음과 같이 이름 붙일 수 있습니다: 1. 지도/학습 방법 (Supervision/Learning Method) 2. 머신러닝 유형 (Machine Learning Type) 3. 모달리티 (Modality)
- Language(s) [NLP]:
language
시스템이 자연(인간) 언어를 사용하거나 처리할 때 이 필드를 사용하세요.
- License (라이선스):
license
사용 중인 라이선스를 명명하고 링크하세요.
- Finetuned From Model [선택]:
base_model
이 모델이 다른 모델을 기반으로 한다면, 여기에서 그 모델로 링크하세요.
Model Sources [선택]
- Repository:
repo - Paper [선택]:
paper - Demo [선택]:
demo
사용자가 모델과 그 세부 정보를 직접 볼 수 있는 소스를 제공하세요. 학습 로그, 교훈 등 추가적인 종류의 리소스는 More Information 섹션에 속합니다. 이 섹션에 하나만 포함한다면 저장소로 링크하세요.
Uses
섹션 개요 (Section Overview): 이 섹션은 모델이 다양한 적용 컨텍스트에서 어떻게 사용되도록 의도되었는지에 대한 질문을 다루고, 모델의 예측 가능한 사용자(모델의 영향을 받는 사람 포함)를 논의하며, 범위 밖으로 간주되거나 모델 오용으로 간주되는 사용을 설명합니다. 이 섹션은 라이선스 사용 세부 정보를 포함하기 위한 것이 아님을 유의하세요. 그것은 라이선스로 직접 링크하세요.
Direct Use
direct_use
미세 조정, 후처리 또는 파이프라인 연결 없이 모델을 어떻게 사용할 수 있는지 설명하세요. 예시 코드 스니펫을 권장합니다.
Downstream Use [선택]
downstream_use
이 모델이 태스크에 대해 미세 조정되거나 더 큰 생태계·앱에 연결될 때 어떻게 사용될 수 있는지 설명하세요. 예시 코드 스니펫을 권장합니다.
Out-of-Scope Use
out_of_scope_use
모델이 예측 가능하게 오용될 수 있는 방법(동작하지 않을 방식으로 사용되는 경우)을 나열하고 사용자가 모델로 해서는 안 되는 일을 다루세요.
Bias, Risks, and Limitations
섹션 개요 (Section Overview): 이 섹션은 예측 가능한 해악, 오해, 기술·사회기술적 한계를 식별합니다. 또한 경고와 잠재적 완화에 대한 정보를 제공합니다. Bias, risk, limitation은 때로 분리할 수 없거나 같은 문제를 가리킬 수 있습니다. 일반적으로 bias와 risk는 사회기술적이고, limitation은 기술적입니다:
- **Bias(편향)**는 일부 하위 집단에 대한 고정관념 또는 비례하지 않는 성능(편중)입니다.
- **Risk(위험)**은 모델이 유발할 수 있는 사회적으로 관련 있는 문제입니다.
- **Limitation(한계)**은 나열된 권장 사항을 따라 해결할 수 있는 예측 가능한 실패 모드입니다.
bias_risks_limitations
이 모델에서 비롯된 알려졌거나 예측 가능한 문제는 무엇인가요?
Recommendations
bias_recommendations
예측 가능한 문제와 관련한 권장 사항은 무엇인가요? 이것은 "이미지를 다운샘플링하세요"부터 명시적 콘텐츠 필터링까지 모든 것을 포함할 수 있습니다.
Training Details
섹션 개요 (Section Overview): 이 섹션은 학습 데이터, 학습 요소의 속도·크기, 학습의 환경 영향 등 학습을 설명하고 복제하는 데 필요한 정보를 제공합니다. Technical Specifications과도 밀접하게 관련되어 있으며, 여기의 콘텐츠는 학습 절차와 관련될 때 그 섹션으로 링크해야 합니다. 모델 입력과 학습 발자취에 대해 더 알고 싶은 사람들에게 유용합니다. 모델이 무엇을 학습하는지의 기초를 알고 싶은 누구에게나 관련이 있어요.
Training Data
training_data
학습 데이터가 무엇인지 1-2문장으로 쓰세요. 이상적으로는 추가 정보를 위해 Dataset Card로 링크합니다. 데이터 전처리나 추가 필터링과 관련된 문서 링크는 여기뿐 아니라 More Information에도 넣을 수 있습니다.
Training Procedure [선택]
Preprocessing
preprocessing
토큰화, 크기 조정/재작성(모달리티에 따라) 등을 자세히 설명하세요.
Speeds, Sizes, Times
speeds_sizes_times
처리량, 시작/종료 시간, 체크포인트 크기 등을 자세히 설명하세요.
Evaluation
섹션 개요 (Section Overview): 이 섹션은 평가 프로토콜, 평가에서 측정되는 것, 결과를 설명합니다. 평가는 이상적으로 최소 두 부분으로, 하나는 일반 성능의 정량적 측정(Testing Data, Factors & Metrics, 벤치마킹으로 할 수 있음)을, 다른 하나는 특정 사회 안전 문제에 대한 성능(Societal Impact Assessment, red-teaming으로 할 수 있음)을 봅니다. 모델 카드 메타데이터에서 모델의 평가 결과를 구조화된 방식으로 지정할 수도 있어요. 결과는 Hub가 파싱해 모델 페이지의 위젯에 표시됩니다. https://huggingface.co/docs/hub/model-cards#evaluation-results 를 참고하세요.
Testing Data, Factors & Metrics
평가는 이상적으로 태스크, 도메인, 인구 하위 그룹 같은 다른 요인에 대해 **분리(disaggregated)**되어야 하며, 예측 가능한 사용 컨텍스트에 가장 의미 있는 메트릭으로 계산되어야 합니다. 다른 하위 그룹에서의 동일한 평가 성능은 그 하위 그룹에 대해 "공정"하다고 합니다. 목표 공정성 메트릭은 모델 사용을 고려할 때 어떤 오류가 더 문제가 될 가능성이 있는지에 따라 결정해야 합니다. 그러나 이 섹션은 가장 흔히 다양한 태스크 벤치마크에 대한 종합적인 평가 성능을 보고하는 데 사용됩니다.
Testing Data
testing_data
테스트 데이터를 설명하거나 그 Dataset Card로 링크하세요.
Factors
testing_factors
모델 동작에 영향을 미칠 예측 가능한 특성은 무엇인가요? 성능 격차를 발견하기 위해 평가는 이상적으로 이러한 요인들에 걸쳐 분리되어야 합니다.
Metrics
testing_metrics
평가에 어떤 메트릭이 사용될 것인가요?
Results
results
결과는 위에서 정의한 Factors와 Metrics에 기반해야 합니다.
Summary
results_summary
결과가 무엇을 말하나요? 일반 청중을 위한 일종의 tl;dr 역할을 할 수 있습니다.
Societal Impact Assessment [선택]
이 자유 텍스트 섹션을 사용해 이 모델이 아동 안전, NCII, 프라이버시, 폭력 같은 사회적 해악 위험에 대해 어떻게 평가되었는지 설명하세요. 다음 질문에 대한 답변 형태일 수 있습니다:
- 이 모델은 어린이가 사용하기에 안전한가요? 그 이유는?
- 이 모델은 비자발적 친밀 이미지(CSEM 포함)와 관련된 위험을 평가하도록 테스트되었나요?
- 이 모델은 폭력 활동 또는 폭력 묘사와 관련된 위험을 평가하도록 테스트되었나요? 결과는? 각 문제에 대한 정량적 수치도 제공할 수 있습니다.
Model Examination [선택]
섹션 개요 (Section Overview): 일부 개발자들이 추가하기 시작한 실험적 섹션으로, 설명 가능성/해석 가능성에 대한 작업이 들어갈 수 있습니다.
model_examination
Environmental Impact
섹션 개요 (Section Overview): 전기 사용량과 탄소 배출 같은 환경 영향 계산에 필요한 정보를 요약합니다.
- Hardware Type:
hardware_type - Hours used:
hours_used - Cloud Provider:
cloud_provider - Compute Region:
cloud_region - Carbon Emitted:
co2_emitted
탄소 배출은 Lacoste et al. (2019)에 제시된 Machine Learning Impact 계산기로 추정할 수 있습니다.
Technical Specifications [선택]
섹션 개요 (Section Overview): 이 섹션은 모델 목적과 아키텍처, 컴퓨트 인프라에 대한 세부 정보를 포함합니다. 모델 개발에 관심 있는 사람들에게 유용해요. 이 섹션을 작성하려면 보통 모델 개발자가 직접 참여해야 합니다.
Model Architecture and Objective
model_specs
Compute Infrastructure
compute_infrastructure
Hardware
hardware_requirements
최소 하드웨어 요구 사항(예: 처리, 저장, 메모리 요구 사항)은 무엇인가요?
Software
software
Citation [선택]
섹션 개요 (Section Overview): 개발자가 선호하는 이 모델에 대한 인용 방식입니다. 종종 논문입니다.
BibTeX
citation_bibtex
APA
citation_apa
Glossary [선택]
섹션 개요 (Section Overview): 이 섹션은 공통 용어와 메트릭 계산 방식을 정의합니다.
glossary
다양한 청중이 접근 가능하도록 용어를 명확히 정의하세요.
More Information [선택]
섹션 개요 (Section Overview): 이 섹션은 데이터셋 생성, 기술 사양, 교훈, 초기 결과에 대한 글 링크를 제공합니다.
more_information
Model Card Authors [선택]
섹션 개요 (Section Overview): 이 섹션은 모델 카드를 만든 사람들을 나열해, 그 구성에 들어간 상세한 작업에 대한 인정과 책임을 제공합니다.
model_card_authors
Model Card Contact
섹션 개요 (Section Overview): Model Card에 대한 업데이트, 제안 또는 질문이 있는 사람들이 Model Card 작성자에게 연락할 수 있는 방법을 제공합니다.
model_card_contact
How to Get Started with the Model
섹션 개요 (Section Overview): 모델을 사용하는 방법을 보여주는 코드 스니펫을 제공합니다.
get_started_code
다음과 같이 인용하세요: Ozoani, Ezi and Gerchick, Marissa and Mitchell, Margaret. Model Card Guidebook. Hugging Face, 2022. https://huggingface.co/docs/hub/en/model-card-guidebook
더 알아보기 (Learn more)
Annotated Model Card는 개발자·사회기술 전문가·프로젝트 조직자의 역할별로 각 섹션 작성 지침을 이탤릭체 주석으로 제공하는 템플릿이에요. template 변수(model_description, bias_risks_limitations 등)를 실제 값으로 채우고, huggingface_hub의 modelcard_template.md 파일을 템플릿으로 사용하세요. 게시 전에는 Model Release Checklist를 확인하는 것이 좋아요.