user@devops:~$ cat README.md
CLIP Multimodal
# Descripción
Proyecto multimodal con OpenAI CLIP (Contrastive Language-Image Pre-training) que conecta imágenes y texto en un mismo espacio vectorial de 512 dimensiones. El pipeline carga 20 imágenes reales desde picsum.photos, las codifica con el Vision Transformer (ViT-B/32) de CLIP, y realiza clasificación zero-shot sobre 74 categorías definidas por texto. También incluye búsqueda semántica de imágenes por texto (10 consultas sobre 20 imágenes con top-5 resultados), una matriz de similitud texto-imagen, y visualización del espacio multimodal con t-SNE. CLIP logra clasificar imágenes sin haberlas visto durante entrenamiento, simplemente comparando embeddings de imagen con descripciones textuales.
# Características principales
$ Clasificación zero-shot sobre 74 categorías con OpenAI CLIP (ViT-B/32)
$ Búsqueda semántica de imágenes mediante consultas en lenguaje natural con similitud coseno
$ Embeddings multimodales de 512 dimensiones: imágenes y texto en el mismo espacio vectorial
$ Matrix de similitud texto-imagen con heatmap para 10 consultas semánticas × 20 imágenes
$ Proyección t-SNE del espacio multimodal mostrando imágenes y referencias textuales
$ 7 visualizaciones: t-SNE, heatmap, búsqueda semántica grid, confianza, distribución, ejemplos
$ Dataset real: 20 imágenes diversas de picsum.photos (naturaleza, objetos, personas, animales)
# Galería
# Tecnologías utilizadas