Firecrawl Scrape Website 도구
Firecrawl Scrape Website 도구 (FirecrawlScrapeWebsiteTool)
CrewAI의 FirecrawlScrapeWebsiteTool은 Firecrawl 플랫폼을 사용해 웹사이트를 스크래핑하고 깨끗한 markdown이나 구조화된 데이터로 변환하는 도구예요. 고성능 웹 스크래핑이 필요할 때 유용합니다.
출처: 문서
본문
Firecrawl은 어떤 웹사이트든 깨끗한 markdown이나 구조화된 데이터로 크롤링·변환하는 플랫폼입니다.
설치 (Installation)
- firecrawl.dev에서 API 키를 받아 환경변수(
FIRECRAWL_API_KEY)로 설정하세요. crewai[tools]패키지와 함께 Firecrawl SDK를 설치하세요.
pip install firecrawl-py 'crewai[tools]'
예시 (Example)
에이전트가 웹사이트를 로드할 수 있게 하려면 FirecrawlScrapeWebsiteTool을 다음과 같이 사용하세요.
from crewai_tools import FirecrawlScrapeWebsiteTool
tool = FirecrawlScrapeWebsiteTool(url='firecrawl.dev')
인자 (Arguments)
api_key: 선택. Firecrawl API 키 지정. 기본값은FIRECRAWL_API_KEY환경변수.url: 스크래핑할 URL.page_options: 선택.onlyMainContent: 선택. 헤더, 내비게이션, 푸터 등을 제외한 페이지의 주요 콘텐츠만 반환.includeHtml: 선택. 페이지의 raw HTML 콘텐츠 포함. 응답에 html 키를 출력.
extractor_options: 선택. 페이지 콘텐츠에서 구조화된 정보를 LLM 기반으로 추출하는 옵션.mode: 사용할 추출 모드. 현재는 'llm-extraction'을 지원.extractionPrompt: 선택. 페이지에서 무엇을 추출할지 설명하는 프롬프트.extractionSchema: 선택. 추출할 데이터의 스키마.
timeout: 선택. 요청의 타임아웃(밀리초).