Converters

Converters

검색 시스템에 넣을 파일은 PDF, 이미지, 워드 문서 등 형식이 제각각이에요. Converters는 이런 다양한 형식의 파일에서 데이터를 추출해서 Haystack이 다루는 통일된 문서(Document) 형식으로 바꿔주는 컴포넌트 묶음입니다.

출처: 공식문서

어떤 변환기가 있나

Converter 설명
AmazonTextractConverter AWS Textract로 이미지와 단일 페이지 PDF를 문서로 변환하며, 표·양식·서명·레이아웃의 구조 분석과 자연어 질의를 선택적으로 지원합니다.
AzureDocumentIntelligenceConverter Azure Document Intelligence 서비스로 PDF, JPEG, PNG, BMP, TIFF, DOCX, XLSX, PPTX, HTML을 GitHub Flavored Markdown 출력으로 변환합니다.
AzureOCRDocumentConverter PDF(검색 가능·이미지 전용 모두), JPEG, PNG, BMP, TIFF, DOCX, XLSX, PPTX, HTML을 문서로 변환합니다.
CSVToDocument CSV 파일을 문서로 변환합니다.
DoclingConverter PDF, DOCX, HTML 및 기타 문서 형식을 레이아웃 인식 청킹, Markdown, JSON 내보내기와 함께 문서로 변환합니다.
DoclingServeConverter 원격 DoclingServe HTTP 서버를 사용해 PDF, DOCX, HTML 및 기타 문서 형식을 문서로 변환하며, 로컬 ML 의존성이 없습니다.
DocumentToImageContent 이미지 또는 PDF 파일 기반 문서에서 시각 데이터를 추출해 ImageContent 객체로 변환합니다.
DOCXToDocument DOCX 파일을 문서로 변환합니다.
FileToFileContent 파일을 읽어 FileContent 객체로 변환합니다.
HTMLToDocument HTML 파일을 문서로 변환합니다.
ImageFileToDocument 이미지 파일 참조를 연관 메타데이터가 있는 빈 Document 객체로 변환합니다.
ImageFileToImageContent 로컬 이미지 파일을 읽어 ImageContent 객체로 변환합니다.
JSONConverter JSON 파일을 텍스트 문서로 변환합니다.
KreuzbergConverter Kreuzberg의 Rust 코어 엔진으로 91개 이상의 파일 형식을 로컬에서 문서로 변환합니다.
LibreOfficeFileConverter LibreOffice의 커맨드라인 인터페이스로 오피스 파일(문서, 스프레드시트, 프레젠테이션)을 형식 간 변환합니다.
MarkdownToDocument 마크다운 파일을 문서로 변환합니다.
MarkItDownConverter Microsoft의 MarkItDown 라이브러리로 PDF, Word, PowerPoint, Excel, HTML, 이미지 등을 문서로 변환합니다.
MistralOCRDocumentConverter Mistral의 OCR API로 문서에서 텍스트를 추출하며, 선택적으로 구조 주석을 제공합니다.
MSGToDocument Microsoft Outlook .msg 파일을 문서로 변환합니다.
MultiFileConverter CSV, DOCX, HTML, JSON, MD, PPTX, PDF, TXT, XSLX 파일을 문서로 변환합니다.
OpenAPIServiceToFunctions OpenAPI 서비스 명세를 OpenAI 함수 호출 메커니즘과 호환되는 형식으로 변환합니다.
OpenDataLoaderConverter OpenDataLoader PDF를 사용해 PDF 파일을 로컬에서 문서로 변환하며, Markdown·텍스트·HTML·JSON 출력을 지원합니다.
OutputAdapter 한 컴포넌트의 출력이 다른 컴포넌트의 입력에 맞게 들어가도록 도와줍니다.
PaddleOCRVLDocumentConverter PaddleOCR의 대형 모델 문서 파싱 API로 문서에서 텍스트를 추출합니다.
PDFMinerToDocument pdfminer 인자를 사용해 복잡한 PDF 파일을 문서로 변환합니다.
PDFToImageContent 로컬 PDF 파일을 읽어 ImageContent 객체로 변환합니다.
PPTXToDocument PPTX 파일을 문서로 변환합니다.
PyPDFToDocument PDF 파일을 문서로 변환합니다.
TikaDocumentConverter Apache Tika로 다양한 파일 형식을 문서로 변환합니다.
TextFileToDocument 텍스트 파일을 문서로 변환합니다.
TwelveLabsVideoConverter TwelveLabs Pegasus 비디오-언어 모델로 비디오를 문서로 변환합니다.
UnstructuredFileConverter 텍스트 파일과 디렉토리를 하나의 문서로 변환합니다.
XLSXToDocument Excel 파일을 문서로 변환합니다.

실제로는 어떻게 쓰나

변환기는 보통 인덱싱 파이프라인의 가장 앞부분에 놓여요. 예를 들어 DOCX 파일을 색인한다면 DOCXToDocument로 문서로 만든 뒤, 이어지는 전처리기(PreProcessor) 단계에서 정리하고 분할합니다. 변환할 파일 종류가 미리 정해져 있지 않다면 MultiFileConverterUnstructuredFileConverter처럼 여러 형식을 한 번에 다루는 변환기를 고르면 돼요.

PDF·이미지처럼 텍스트가 아닌 콘텐츠는 OCR·레이아웃 분석이 필요한 경우가 많아요. AmazonTextractConverter, MistralOCRDocumentConverter처럼 모델 기반 변환기는 텍스트 추출만으로는 놓치기 쉬운 표·서명·구조까지 잡아내고 싶을 때 유용합니다.