웹사이트 스크래핑 도구(ScrapeWebsiteTool)
웹사이트 스크래핑 도구(ScrapeWebsiteTool)
에이전트가 특정 웹페이지의 내용을 읽어야 할 때, 텍스트만 깔끔하게 추출해 주는 도구가 있으면 편합니다. ScrapeWebsiteTool은 지정된 웹사이트의 내용을 추출·읽어 주는 도구입니다. 특히 CrewAI는 이 도구의 요청이 SSRF 안전 헬퍼를 거치도록 해 두었어요.
출처: 공식문서
본문
아직 도구 개선 작업이 진행 중이라, 예상치 못한 동작이나 향후 변경이 있을 수 있습니다.
설명
지정된 웹사이트의 내용을 추출하고 읽어 주는 도구입니다. HTTP 요청을 만들고 받은 HTML 콘텐츠를 파싱해 다양한 유형의 웹페이지를 처리할 수 있어요. 웹 스크래핑 작업, 데이터 수집, 웹사이트에서 특정 정보 추출에 특히 유용합니다.
가져오기는 CrewAI의 SSRF 안전 HTTP 헬퍼를 거칩니다: 요청된 URL과 모든 리다이렉트 단계(hop)가 비공개·예약 범위(클라우드 메타데이터 포함)에 대해 검사되고, TCP 연결은 그 검사를 통과한 IP에 고정됩니다.
설치
crewai_tools 패키지를 설치합니다.
pip install 'crewai[tools]'
예제
from crewai_tools import ScrapeWebsiteTool
# To enable scrapping any website it finds during it's execution
tool = ScrapeWebsiteTool()
# Initialize the tool with the website URL,
# so the agent can only scrap the content of the specified website
tool = ScrapeWebsiteTool(website_url='https://www.example.com')
# Extract the text from the site
text = tool.run()
print(text)
인자
| 인자 | 타입 | 설명 |
|---|---|---|
| website_url | string |
필수 웹사이트 URL. 도구의 주요 입력으로, 어떤 웹사이트의 콘텐츠를 스크래핑·읽을지 지정합니다. |