Firecrawl Crawl Website 도구

Firecrawl Crawl Website 도구 (FirecrawlCrawlWebsiteTool)

CrewAI의 FirecrawlCrawlWebsiteTool은 Firecrawl 플랫폼을 사용해 웹사이트를 크롤링하고 깨끗한 markdown이나 구조화된 데이터로 변환하는 도구예요. 웹사이트 전체를 체계적으로 크롤링해야 할 때 유용합니다.

출처: 문서

본문

Firecrawl은 어떤 웹사이트든 깨끗한 markdown이나 구조화된 데이터로 크롤링·변환하는 플랫폼입니다.

설치 (Installation)

  • firecrawl.dev에서 API 키를 받아 환경변수(FIRECRAWL_API_KEY)로 설정하세요.
  • crewai[tools] 패키지와 함께 Firecrawl SDK를 설치하세요.
pip install firecrawl-py 'crewai[tools]'

예시 (Example)

에이전트가 웹사이트를 로드할 수 있게 하려면 FirecrawlCrawlWebsiteTool을 다음과 같이 사용하세요.

from crewai_tools import FirecrawlCrawlWebsiteTool

tool = FirecrawlCrawlWebsiteTool(url='firecrawl.dev')

인자 (Arguments)

  • api_key: 선택. Firecrawl API 키 지정. 기본값은 FIRECRAWL_API_KEY 환경변수.
  • url: 크롤링을 시작할 기본 URL.
  • page_options: 선택.
    • onlyMainContent: 선택. 헤더, 내비게이션, 푸터 등을 제외한 페이지의 주요 콘텐츠만 반환.
    • includeHtml: 선택. 페이지의 raw HTML 콘텐츠 포함. 응답에 html 키를 출력.
  • crawler_options: 선택. 크롤링 동작을 제어하는 옵션.
    • includes: 선택. 크롤링에 포함할 URL 패턴.
    • exclude: 선택. 크롤링에서 제외할 URL 패턴.
    • generateImgAltText: 선택. LLM으로 이미지 alt 텍스트 생성 (유료 요금제 필요).
    • returnOnlyUrls: 선택. true이면 크롤링 상태에서 URL 목록만 반환. 참고: 응답은 문서 목록이 아니라 데이터 안의 URL 목록입니다.
    • maxDepth: 선택. 크롤링할 최대 깊이. 깊이 1은 기본 URL, 깊이 2는 기본 URL과 직접 하위 항목 등을 포함.
    • mode: 선택. 사용할 크롤링 모드. Fast 모드는 sitemap이 없는 웹사이트에서 4배 빠르지만 정확도가 떨어질 수 있고, JavaScript로 많이 렌더링되는 웹사이트에서는 사용하면 안 됩니다.
    • limit: 선택. 크롤링할 최대 페이지 수.
    • timeout: 선택. 크롤링 작업의 타임아웃(밀리초).

더 알아보기 (Learn more)