Crawl4AI 개요 — LLM을 위한 크롤러
Crawl4AI 개요
웹을 크롤링해서 LLM에 바로 넣을 수 있는 깨끗한 텍스트를 뽑고 싶은데, 매번 DOM 정리와 렌더링 대기를 일일이 다루기엔 힘들죠. Crawl4AI는 그 '지루한 웹 수집'을 전부 대신해 주는 오픈소스 라이브러리예요. GitHub에서 가장 빠르게 오르는 저장소 중 하나일 만큼, LLM 데이터 파이프라인 쪽에서 빠르게 표준처럼 자리 잡고 있어요.
핵심 기능
- AsyncWebCrawler — 비동기 크롤러 (Playwright 기반)
BrowserConfig/CrawlerRunConfig— 브라우저·실행 설정DefaultMarkdownGenerator— HTML을 Markdown으로 자동 변환 (콘텐츠 필터 지원)- 추출 전략 — CSS/XPath 기반(무료, 빠름)과 LLM 기반(구조화)을 모두 지원
- 동적 콘텐츠 — JavaScript 실행, 대기 조건, "Load More" 클릭 처리
- 멀티 URL 병렬 —
arun_many()로 동시 크롤
어디에 쓰나요
- RAG 말뭉치 수집 — 문서·블로그·지식베이스를 크롤 → Markdown → 벡터 저장소
- 에이전트 웹 검색 — MCP 서버로 붙여 에이전트가 실시간 웹 조사
- 가격 모니터링 — 스키마 추출로 가격 변화 감지
- 콘텐츠 모니터링 — 딥 크롤 + LLM 변경 감지
라이선스와 배포
Apache 2.0 오픈소스로, 셀프호스팅이 자유로워요. pip이나 Docker로 설치할 수 있어요.