커뮤니티
커뮤니티 (Community)
이 페이지는 🤗 Transformers를 중심으로 커뮤니티가 개발한 리소스를 모아 둔 곳이에요. 모델 파인튜닝부터 평가, 배포까지 다양한 예제를 찾아볼 수 있지요.
출처: 문서
본문
커뮤니티 리소스 (Community resources)
| 리소스 | 설명 | 작성자 |
|---|---|---|
| Hugging Face Transformers Glossary Flashcards | Transformers Docs Glossary를 바탕으로 만든 플래시카드 세트로, 장기 지식 보존을 위해 설계된 오픈소스·크로스플랫폼 앱인 Anki로 쉽게 학습/복습할 수 있는 형태로 만들었어요. 플래시카드 사용법에 대한 이 소개 영상을 참고해 주세요. | Darigov Research |
커뮤니티 노트북 (Community notebooks)
| 노트북 | 설명 | 작성자 | |
|---|---|---|---|
| 사전 학습된 Transformer를 파인튜닝해 가사 생성하기 | GPT-2 모델을 파인튜닝해서 좋아하는 아티스트 스타일의 가사를 생성하는 방법 | Aleksey Korshuk | |
| TPU에서 T5 학습하기 | Transformers와 Nlp로 SQUAD에서 T5를 학습하는 방법 | Suraj Patil | |
| 분류·객관식용 T5 파인튜닝 | text-to-text 형식과 PyTorch Lightning을 사용해 분류·객관식 태스크용으로 T5를 파인튜닝하는 방법 | Suraj Patil | |
| 새 데이터셋·언어로 DialoGPT 파인튜닝 | 오픈 다이얼로그 대화형 챗봇을 위해 새 데이터셋에서 DialoGPT 모델을 파인튜닝하는 방법 | Nathan Cooper | |
| Reformer로 긴 시퀀스 모델링 | Reformer로 최대 500,000 토큰의 시퀀스에서 학습하는 방법 | Patrick von Platen | |
| 요약용 BART 파인튜닝 | blurr를 사용해 fastai로 요약용 BART를 파인튜닝하는 방법 | Wayde Gilliam | |
| 누구의 트윗이든 사전 학습된 Transformer 파인튜닝 | GPT-2 모델을 파인튜닝해서 좋아하는 Twitter 계정 스타일의 트윗을 생성하는 방법 | Boris Dayma | |
| Weights & Biases로 🤗 Hugging Face 모델 최적화 | Hugging Face와 W&B 통합을 보여주는 완전한 튜토리얼 | Boris Dayma | |
| Longformer 사전 학습 | 기존 사전 학습 모델의 "long" 버전을 만드는 방법 | Iz Beltagy | |
| QA용 Longformer 파인튜닝 | QA 태스크를 위해 longformer 모델을 파인튜닝하는 방법 | Suraj Patil | |
| 🤗nlp로 모델 평가 | nlp로 TriviaQA에서 longformer를 평가하는 방법 |
Patrick von Platen | |
| 감성 구간 추출용 T5 파인튜닝 | text-to-text 형식과 PyTorch Lightning으로 감성 구간 추출용 T5를 파인튜닝하는 방법 | Lorenzo Ampil | |
| 다중 클래스 분류용 DistilBert 파인튜닝 | PyTorch로 다중 클래스 분류를 위해 DistilBert를 파인튜닝하는 방법 | Abhishek Kumar Mishra | |
| 다중 라벨 분류용 BERT 파인튜닝 | PyTorch로 다중 라벨 분류를 위해 BERT를 파인튜닝하는 방법 | Abhishek Kumar Mishra | |
| 요약용 T5 파인튜닝 | PyTorch로 요약을 위해 T5를 파인튜닝하고 WandB로 실험을 추적하는 방법 | Abhishek Kumar Mishra | |
| 동적 패딩/버케팅으로 Transformers 파인튜닝 가속화 | 동적 패딩/버케팅으로 파인튜닝을 2배 이상 가속하는 방법 | Michael Benesty | |
| Masked Language Modeling용 Reformer 사전 학습 | 양방향 self-attention 레이어로 Reformer 모델을 학습하는 방법 | Patrick von Platen | |
| Sci-BERT 확장·파인튜닝 | AllenAI의 사전 학습 SciBERT 모델의 어휘를 CORD 데이터셋 위에서 늘리고 파이프라인으로 연결하는 방법 | Tanmay Thakur | |
| Trainer API로 요약용 BlenderBotSmall 파인튜닝 | Trainer API를 사용해 커스텀 데이터셋에서 요약용 BlenderBotSmall을 파인튜닝하는 방법 | Tanmay Thakur | |
| Electra 파인튜닝과 Integrated Gradients로 해석 | 감성 분석을 위해 Electra를 파인튜닝하고 Captum Integrated Gradients로 예측을 해석하는 방법 | Eliza Szczechla | |
| Trainer 클래스로 비영어 GPT-2 모델 파인튜닝 | Trainer 클래스로 비영어 GPT-2 모델을 파인튜닝하는 방법 | Philipp Schmid | |
| 다중 라벨 분류 태스크용 DistilBERT 파인튜닝 | 다중 라벨 분류 태스크를 위해 DistilBERT 모델을 파인튜닝하는 방법 | Dhaval Taunk | |
| 문장 쌍 분류용 ALBERT 파인튜닝 | 문장 쌍 분류 태스크를 위해 ALBERT 모델이나 다른 BERT 기반 모델을 파인튜닝하는 방법 | Nadir El Manouzi | |
| 감성 분석용 Roberta 파인튜닝 | 감성 분석을 위해 Roberta 모델을 파인튜닝하는 방법 | Dhaval Taunk | |
| 질문 생성 모델 평가 | 여러분의 seq2seq transformer 모델이 생성한 질문에 대한 답은 얼마나 정확한가? | Pascal Zoleko | |
| CNN/Dailymail 요약에 BERT 활용 | CNN/Dailymail 요약을 위해 EncoderDecoderModel을 google-bert/bert-base-uncased checkpoint로 warm-start 하는 방법 | Patrick von Platen | |
| BBC XSum 요약에 RoBERTa 활용 | BBC/XSum 요약을 위해 공유 EncoderDecoderModel을 FacebookAI/roberta-base checkpoint로 warm-start 하는 방법 | Patrick von Platen | |
| 순차 질의응답(SQA)용 TAPAS 파인튜닝 | Sequential Question Answering(SQA) 데이터셋에서 tapas-base checkpoint로 TapasForQuestionAnswering을 파인튜닝하는 방법 | Niels Rogge | |
| 표 사실 확인(TabFact)에서 TAPAS 평가 | 🤗 datasets와 🤗 transformers 라이브러리를 조합해 tapas-base-finetuned-tabfact checkpoint로 파인튜닝된 TapasForSequenceClassification을 평가하는 방법 | Niels Rogge | |
| 번역용 mBART 파인튜닝 | Seq2SeqTrainer로 힌디어→영어 번역을 위해 mBART를 파인튜닝하는 방법 | Vasudev Gupta | |
| FUNSD(양식 이해 데이터셋)에서 LayoutLM 파인튜닝 | 스캔 문서에서 정보 추출을 위해 FUNSD 데이터셋에서 LayoutLMForTokenClassification을 파인튜닝하는 방법 | Niels Rogge | |
| DistilGPT2 파인튜닝·텍스트 생성 | DistilGPT2를 파인튜닝하고 텍스트를 생성하는 방법 | Aakash Tripathi | |
| 최대 8K 토큰에서 LED 파인튜닝 | 장거리 요약을 위해 pubmed에서 LED를 파인튜닝하는 방법 | Patrick von Platen | |
| Arxiv에서 LED 평가 | 장거리 요약에서 LED를 효과적으로 평가하는 방법 | Patrick von Platen | |
| RVL-CDIP(문서 이미지 분류 데이터셋)에서 LayoutLM 파인튜닝 | 스캔 문서 분류를 위해 RVL-CDIP 데이터셋에서 LayoutLMForSequenceClassification을 파인튜닝하는 방법 | Niels Rogge | |
| GPT2 조정을 이용한 Wav2Vec2 CTC 디코딩 | 언어 모델 조정으로 CTC 시퀀스를 디코딩하는 방법 | Eric Lam | |
| Trainer 클래스로 두 언어에서 요약용 BART 파인튜닝 | Trainer 클래스로 두 언어에서 요약용 BART를 파인튜닝하는 방법 | Eliza Szczechla | |
| Trivia QA에서 Big Bird 평가 | Trivia QA에서 긴 문서 질의응답에 BigBird를 평가하는 방법 | Patrick von Platen | |
| Wav2Vec2로 비디오 자막 만들기 | Wav2Vec으로 오디오를 전사해 어떤 비디오로든 YouTube 자막을 만드는 방법 | Niklas Muennighoff | |
| PyTorch Lightning으로 CIFAR-10에서 Vision Transformer 파인튜닝 | HuggingFace Transformers, Datasets, PyTorch Lightning으로 CIFAR-10에서 Vision Transformer(ViT)를 파인튜닝하는 방법 | Niels Rogge | |
| 🤗 Trainer로 CIFAR-10에서 Vision Transformer 파인튜닝 | HuggingFace Transformers, Datasets, 🤗 Trainer로 CIFAR-10에서 Vision Transformer(ViT)를 파인튜닝하는 방법 | Niels Rogge | |
| 엔티티 타입 데이터셋 Open Entity에서 LUKE 평가 | Open Entity 데이터셋에서 LukeForEntityClassification을 평가하는 방법 | Ikuya Yamada | |
| 관계 추출 데이터셋 TACRED에서 LUKE 평가 | TACRED 데이터셋에서 LukeForEntityPairClassification을 평가하는 방법 | Ikuya Yamada | |
| 중요 NER 벤치마크 CoNLL-2003에서 LUKE 평가 | CoNLL-2003 데이터셋에서 LukeForEntitySpanClassification을 평가하는 방법 | Ikuya Yamada | |
| PubMed 데이터셋에서 BigBird-Pegasus 평가 | PubMed 데이터셋에서 BigBirdPegasusForConditionalGeneration을 평가하는 방법 | Vasudev Gupta | |
| Wav2Vec2로 음성 감정 분류 | MEGA 데이터셋에서 감정 분류를 위해 사전 학습된 Wav2Vec2 모델을 활용하는 방법 | Mehrdad Farahani | |
| DETR로 이미지에서 객체 감지 | 학습된 DetrForObjectDetection 모델로 이미지에서 객체를 감지하고 attention을 시각화하는 방법 | Niels Rogge | |
| 커스텀 객체 감지 데이터셋에서 DETR 파인튜닝 | 커스텀 객체 감지 데이터셋에서 DetrForObjectDetection을 파인튜닝하는 방법 | Niels Rogge | |
| Named Entity Recognition용 T5 파인튜닝 | Named Entity Recognition 태스크에서 T5를 파인튜닝하는 방법 | Ogundepo Odunayo | |
| MLflow과 PEFT로 QLoRA를 사용해 오픈소스 LLM 파인튜닝 | QLoRA와 PEFT를 사용해 메모리 효율적으로 LLM을 파인튜닝하면서 MLflow로 실험 추적을 관리하는 방법 | Yuki Watanabe |