user@devops:~$ cat README.md
CLIP Multimodal
# Descrição
Projeto multimodal com OpenAI CLIP (Contrastive Language-Image Pre-training) que conecta imagens e texto no mesmo espaço vetorial de 512 dimensões. O pipeline carrega 20 imagens reais do picsum.photos, as codifica com o Vision Transformer (ViT-B/32) do CLIP e realiza classificação zero-shot em 74 categorias definidas por texto. Também inclui pesquisa semântica de imagens por texto (10 consultas em 20 imagens com top-5 resultados), uma matriz de similaridade texto-imagem e visualização do espaço multimodal com t-SNE. O CLIP classifica imagens sem tê-las visto durante o treinamento, simplesmente comparando embeddings de imagem com descrições textuais.
# Características principais
$ Classificação zero-shot em 74 categorias com OpenAI CLIP (ViT-B/32)
$ Pesquisa semântica de imagens via consultas em linguagem natural com similaridade de cosseno
$ Embeddings multimodais de 512 dimensões: imagens e texto no mesmo espaço vetorial
$ Matriz de similaridade texto-imagem com heatmap para 10 consultas semânticas × 20 imagens
$ Projeção t-SNE do espaço multimodal mostrando imagens e referências textuais
$ 7 visualizações: t-SNE, heatmap, grade de pesquisa semântica, confiança, distribuição, exemplos
$ Dataset real: 20 imagens diversas do picsum.photos (natureza, objetos, pessoas, animais)
# Galeria
# Tecnologias utilizadas