$ cd ../
CLIP Multimodal — bash

user@devops:~$ cat README.md

CLIP Multimodal

# Descrição

Projeto multimodal com OpenAI CLIP (Contrastive Language-Image Pre-training) que conecta imagens e texto no mesmo espaço vetorial de 512 dimensões. O pipeline carrega 20 imagens reais do picsum.photos, as codifica com o Vision Transformer (ViT-B/32) do CLIP e realiza classificação zero-shot em 74 categorias definidas por texto. Também inclui pesquisa semântica de imagens por texto (10 consultas em 20 imagens com top-5 resultados), uma matriz de similaridade texto-imagem e visualização do espaço multimodal com t-SNE. O CLIP classifica imagens sem tê-las visto durante o treinamento, simplesmente comparando embeddings de imagem com descrições textuais.

# Características principais

$ Classificação zero-shot em 74 categorias com OpenAI CLIP (ViT-B/32)

$ Pesquisa semântica de imagens via consultas em linguagem natural com similaridade de cosseno

$ Embeddings multimodais de 512 dimensões: imagens e texto no mesmo espaço vetorial

$ Matriz de similaridade texto-imagem com heatmap para 10 consultas semânticas × 20 imagens

$ Projeção t-SNE do espaço multimodal mostrando imagens e referências textuais

$ 7 visualizações: t-SNE, heatmap, grade de pesquisa semântica, confiança, distribuição, exemplos

$ Dataset real: 20 imagens diversas do picsum.photos (natureza, objetos, pessoas, animais)

# Galeria

Vista desktop
CLIP Multimodal - Vista desktop
Vista mobile
CLIP Multimodal - Vista mobile

# Tecnologias utilizadas

Python PyTorch Transformers scikit-learn matplotlib
Hermes Agent