Firecrawl Scrape Website 도구

Firecrawl Scrape Website 도구 (FirecrawlScrapeWebsiteTool)

CrewAI의 FirecrawlScrapeWebsiteTool은 Firecrawl 플랫폼을 사용해 웹사이트를 스크래핑하고 깨끗한 markdown이나 구조화된 데이터로 변환하는 도구예요. 고성능 웹 스크래핑이 필요할 때 유용합니다.

출처: 문서

본문

Firecrawl은 어떤 웹사이트든 깨끗한 markdown이나 구조화된 데이터로 크롤링·변환하는 플랫폼입니다.

설치 (Installation)

  • firecrawl.dev에서 API 키를 받아 환경변수(FIRECRAWL_API_KEY)로 설정하세요.
  • crewai[tools] 패키지와 함께 Firecrawl SDK를 설치하세요.
pip install firecrawl-py 'crewai[tools]'

예시 (Example)

에이전트가 웹사이트를 로드할 수 있게 하려면 FirecrawlScrapeWebsiteTool을 다음과 같이 사용하세요.

from crewai_tools import FirecrawlScrapeWebsiteTool

tool = FirecrawlScrapeWebsiteTool(url='firecrawl.dev')

인자 (Arguments)

  • api_key: 선택. Firecrawl API 키 지정. 기본값은 FIRECRAWL_API_KEY 환경변수.
  • url: 스크래핑할 URL.
  • page_options: 선택.
    • onlyMainContent: 선택. 헤더, 내비게이션, 푸터 등을 제외한 페이지의 주요 콘텐츠만 반환.
    • includeHtml: 선택. 페이지의 raw HTML 콘텐츠 포함. 응답에 html 키를 출력.
  • extractor_options: 선택. 페이지 콘텐츠에서 구조화된 정보를 LLM 기반으로 추출하는 옵션.
    • mode: 사용할 추출 모드. 현재는 'llm-extraction'을 지원.
    • extractionPrompt: 선택. 페이지에서 무엇을 추출할지 설명하는 프롬프트.
    • extractionSchema: 선택. 추출할 데이터의 스키마.
  • timeout: 선택. 요청의 타임아웃(밀리초).

더 알아보기 (Learn more)