웹사이트 스크래핑 도구(ScrapeWebsiteTool)

웹사이트 스크래핑 도구(ScrapeWebsiteTool)

에이전트가 특정 웹페이지의 내용을 읽어야 할 때, 텍스트만 깔끔하게 추출해 주는 도구가 있으면 편합니다. ScrapeWebsiteTool은 지정된 웹사이트의 내용을 추출·읽어 주는 도구입니다. 특히 CrewAI는 이 도구의 요청이 SSRF 안전 헬퍼를 거치도록 해 두었어요.

출처: 공식문서

본문

아직 도구 개선 작업이 진행 중이라, 예상치 못한 동작이나 향후 변경이 있을 수 있습니다.

설명

지정된 웹사이트의 내용을 추출하고 읽어 주는 도구입니다. HTTP 요청을 만들고 받은 HTML 콘텐츠를 파싱해 다양한 유형의 웹페이지를 처리할 수 있어요. 웹 스크래핑 작업, 데이터 수집, 웹사이트에서 특정 정보 추출에 특히 유용합니다.

가져오기는 CrewAI의 SSRF 안전 HTTP 헬퍼를 거칩니다: 요청된 URL과 모든 리다이렉트 단계(hop)가 비공개·예약 범위(클라우드 메타데이터 포함)에 대해 검사되고, TCP 연결은 그 검사를 통과한 IP에 고정됩니다.

설치

crewai_tools 패키지를 설치합니다.

pip install 'crewai[tools]'

예제

from crewai_tools import ScrapeWebsiteTool

# To enable scrapping any website it finds during it's execution
tool = ScrapeWebsiteTool()

# Initialize the tool with the website URL, 
# so the agent can only scrap the content of the specified website
tool = ScrapeWebsiteTool(website_url='https://www.example.com')

# Extract the text from the site
text = tool.run()
print(text)

인자

인자 타입 설명
website_url string 필수 웹사이트 URL. 도구의 주요 입력으로, 어떤 웹사이트의 콘텐츠를 스크래핑·읽을지 지정합니다.

더 알아보기