Qué es la visión por computador
Durante años se basó en modelos especializados para cada tarea. Hoy convive con los modelos multimodales, que pueden describir una foto, leer un gráfico o detectar un problema en una imagen a partir de una simple pregunta.
Tareas principales
- Clasificación: qué hay en la imagen.
- Detección: dónde está cada objeto.
- Segmentación: qué píxeles pertenecen a cada objeto.
- Reconocimiento de texto (OCR).
- Análisis de vídeo: seguimiento de movimientos y eventos.
Ejemplo real
Un almacén usa cámaras con visión por computador para verificar que cada paquete lleva la etiqueta correcta y no tiene daños antes de salir. Los errores de envío bajan y las reclamaciones también.
Para qué te sirve en tu negocio
- Control de calidad en producción.
- Etiquetado automático de fotos de producto.
- Búsqueda por imagen en ecommerce.
- Análisis de afluencia en tiendas físicas.
- Lectura automática de documentos.
Errores comunes
- Entrenar con imágenes que no se parecen a las condiciones reales (luz, ángulo).
- Ignorar la privacidad al grabar a personas.
- Esperar precisión perfecta en casos poco habituales.
Preguntas frecuentes
¿ChatGPT tiene visión por computador?
Sí, los modelos multimodales entienden imágenes.
¿Qué diferencia hay con el OCR?
El OCR es una tarea concreta de la visión por computador: leer texto.
¿Es caro implantarla?
Con modelos multimodales vía API, se puede empezar con poco coste.
