Vision Tool

Vision Tool

VisionTool은 이미지에서 텍스트를 추출하도록 설계된 도구예요.

출처: 문서

본문

VisionTool

설명 (Description)

이 도구는 이미지에서 텍스트를 추출하는 데 사용됩니다. 에이전트에 전달되면 이미지에서 텍스트를 추출하고, 이를 사용해 응답·리포트 또는 다른 출력을 생성합니다. 이미지의 URL 또는 PATH를 에이전트에 전달하면 됩니다.

또한 이미지에 대한 커스텀 query를 물어보고, 요청에 가장 잘 맞는 모델을 자동으로 선택하는 complexity_level을 고를 수도 있어요:

복잡도 레벨 모델
easy gpt-5.6-luna
medium (기본값) gpt-5.6-terra
hard gpt-5.6-sol

도구에 명시적인 llm 또는 model을 제공하면, 복잡도 기반 모델 선택보다 우선합니다.

설치 (Installation)

crewai_tools 패키지를 설치하세요:

pip install 'crewai[tools]'

사용법 (Usage)

VisionTool을 사용하려면 OPENAI_API_KEY 환경 변수에 OpenAI API 키를 설정해야 합니다.

from crewai_tools import VisionTool

vision_tool = VisionTool()

@agent
def researcher(self) -> Agent:
    '''
    This agent uses the VisionTool to extract text from images.
    '''
    return Agent(
        config=self.agents_config["researcher"],
        allow_delegation=False,
        tools=[vision_tool]
    )

인자 (Arguments)

VisionTool은 다음 인자를 받습니다:

인자 타입 설명
image_path_url string 필수. 텍스트를 추출할 이미지 파일(또는 URL)의 경로.
query string 선택. 이미지에 대해 모델에게 물어볼 질문 또는 지시. 기본값: "What's in this image?".
complexity_level string 선택. 모델을 선택하는 요청의 복잡도: easy, medium, 또는 hard. 기본값: medium.

더 알아보기 (Learn more)