Vision Tool
Vision Tool
VisionTool은 이미지에서 텍스트를 추출하도록 설계된 도구예요.
출처: 문서
본문
VisionTool
설명 (Description)
이 도구는 이미지에서 텍스트를 추출하는 데 사용됩니다. 에이전트에 전달되면 이미지에서 텍스트를 추출하고, 이를 사용해 응답·리포트 또는 다른 출력을 생성합니다. 이미지의 URL 또는 PATH를 에이전트에 전달하면 됩니다.
또한 이미지에 대한 커스텀 query를 물어보고, 요청에 가장 잘 맞는 모델을 자동으로 선택하는 complexity_level을 고를 수도 있어요:
| 복잡도 레벨 | 모델 |
|---|---|
easy |
gpt-5.6-luna |
medium (기본값) |
gpt-5.6-terra |
hard |
gpt-5.6-sol |
도구에 명시적인 llm 또는 model을 제공하면, 복잡도 기반 모델 선택보다 우선합니다.
설치 (Installation)
crewai_tools 패키지를 설치하세요:
pip install 'crewai[tools]'
사용법 (Usage)
VisionTool을 사용하려면 OPENAI_API_KEY 환경 변수에 OpenAI API 키를 설정해야 합니다.
from crewai_tools import VisionTool
vision_tool = VisionTool()
@agent
def researcher(self) -> Agent:
'''
This agent uses the VisionTool to extract text from images.
'''
return Agent(
config=self.agents_config["researcher"],
allow_delegation=False,
tools=[vision_tool]
)
인자 (Arguments)
VisionTool은 다음 인자를 받습니다:
| 인자 | 타입 | 설명 |
|---|---|---|
| image_path_url | string |
필수. 텍스트를 추출할 이미지 파일(또는 URL)의 경로. |
| query | string |
선택. 이미지에 대해 모델에게 물어볼 질문 또는 지시. 기본값: "What's in this image?". |
| complexity_level | string |
선택. 모델을 선택하는 요청의 복잡도: easy, medium, 또는 hard. 기본값: medium. |
더 알아보기 (Learn more)
- DALL-E Tool — AI 이미지 생성 도구 알아보기
- AI & ML Tools 개요 — AI/ML 관련 도구 전체 살펴보기