Crawl4AI 개요 — LLM을 위한 크롤러

Crawl4AI 개요

웹을 크롤링해서 LLM에 바로 넣을 수 있는 깨끗한 텍스트를 뽑고 싶은데, 매번 DOM 정리와 렌더링 대기를 일일이 다루기엔 힘들죠. Crawl4AI는 그 '지루한 웹 수집'을 전부 대신해 주는 오픈소스 라이브러리예요. GitHub에서 가장 빠르게 오르는 저장소 중 하나일 만큼, LLM 데이터 파이프라인 쪽에서 빠르게 표준처럼 자리 잡고 있어요.

핵심 기능

  • AsyncWebCrawler — 비동기 크롤러 (Playwright 기반)
  • BrowserConfig / CrawlerRunConfig — 브라우저·실행 설정
  • DefaultMarkdownGenerator — HTML을 Markdown으로 자동 변환 (콘텐츠 필터 지원)
  • 추출 전략 — CSS/XPath 기반(무료, 빠름)과 LLM 기반(구조화)을 모두 지원
  • 동적 콘텐츠 — JavaScript 실행, 대기 조건, "Load More" 클릭 처리
  • 멀티 URL 병렬arun_many()로 동시 크롤

어디에 쓰나요

  • RAG 말뭉치 수집 — 문서·블로그·지식베이스를 크롤 → Markdown → 벡터 저장소
  • 에이전트 웹 검색 — MCP 서버로 붙여 에이전트가 실시간 웹 조사
  • 가격 모니터링 — 스키마 추출로 가격 변화 감지
  • 콘텐츠 모니터링 — 딥 크롤 + LLM 변경 감지

라이선스와 배포

Apache 2.0 오픈소스로, 셀프호스팅이 자유로워요. pip이나 Docker로 설치할 수 있어요.

더 알아보기