Skip to main content
Los modelos de visión pueden analizar imágenes junto con prompts de texto. Úsalos para comprensión de imágenes, extracción, clasificación, respuesta a preguntas visuales y razonamiento multimodal. Venice admite mensajes de chat multimodales compatibles con OpenAI. Coloca bloques de texto e imagen en el mismo mensaje de usuario y envía la solicitud a un modelo con capacidad de visión.

Uso básico

Usar imágenes en base64

También puedes pasar una URL de datos en base64 cuando la imagen sea local o privada:

Enviar varias imágenes

content es un arreglo de bloques, así que un solo mensaje de usuario puede incluir varios bloques image_url junto con texto. Úsalo para comparar imágenes o hacer preguntas que abarquen más de una imagen:
Cada imagen consume tokens de contexto. Si una solicitud con varias imágenes devuelve TOO_MANY_TOKENS (HTTP 400), reduce el número de imágenes, acorta tus instrucciones o cambia a un modelo con una ventana de contexto más grande.

Elige un modelo de visión

Usa la página de Modelos de Texto o la API de Modelos para encontrar modelos que admitan visión. El soporte para visión se indica en las capacidades del modelo.
Para entradas de tipo documento, usa Entradas de archivo cuando quieras que Venice extraiga texto de un archivo. Usa visión cuando importe el propio diseño visual o contenido de la imagen.

Consejos para prompts

  • Indícale al modelo en qué debe enfocarse: objetos, texto, diseño, seguridad, defectos o diferencias.
  • Solicita salida estructurada cuando tu aplicación necesite campos que puedas analizar.
  • Mantén las URLs de imágenes accesibles para la API o usa URLs de datos base64 para imágenes privadas.
  • Usa un modelo con suficiente contexto si combinas imágenes con instrucciones largas.

Recursos relacionados