Skip to main content
비전 모델은 텍스트 프롬프트와 함께 이미지를 분석할 수 있습니다. 이미지 이해, 정보 추출, 분류, 시각적 질의응답, 멀티모달 추론에 사용하세요. Venice는 OpenAI 호환 멀티모달 채팅 메시지를 지원합니다. 동일한 사용자 메시지 안에 텍스트 블록과 이미지 블록을 함께 넣어 비전 지원 모델로 요청을 보내세요.

기본 사용법

Base64 이미지 사용하기

이미지가 로컬에 있거나 비공개인 경우 base64 데이터 URL을 전달할 수도 있습니다:

여러 이미지 전송

content는 블록 배열이므로 하나의 사용자 메시지에 텍스트와 함께 여러 개의 image_url 블록을 포함할 수 있습니다. 이미지를 비교하거나 여러 이미지에 걸친 질문을 할 때 사용하세요:
각 이미지는 컨텍스트 토큰을 소비합니다. 여러 이미지가 포함된 요청이 TOO_MANY_TOKENS(HTTP 400)를 반환하면 이미지 수를 줄이거나, 지시문을 짧게 하거나, 더 큰 컨텍스트 윈도우를 가진 모델로 전환하세요.

비전 모델 선택

비전을 지원하는 모델을 찾으려면 텍스트 모델 페이지나 Models API를 이용하세요. 비전 지원 여부는 모델 기능 목록에 표시됩니다.
문서와 같은 입력이라면, Venice가 파일에서 텍스트를 추출하기 원할 때 파일 입력을 사용하세요. 시각적 레이아웃이나 이미지 콘텐츠 자체가 중요할 때는 비전을 사용하세요.

프롬프트 팁

  • 모델이 무엇에 집중해야 하는지 알려주세요: 객체, 텍스트, 레이아웃, 안전성, 결함 또는 차이점 등.
  • 애플리케이션에서 파싱할 필드가 필요하다면 구조화된 출력을 요청하세요.
  • 이미지 URL은 API가 접근 가능해야 하며, 비공개 이미지에는 base64 데이터 URL을 사용하세요.
  • 이미지와 긴 지시문을 함께 사용한다면 충분한 컨텍스트를 지원하는 모델을 사용하세요.

관련 리소스