SimCLR: Aprender por Contraste e Pagar pelos Negativos

por Frank de Alcantara em 28/07/2026

SimCLR: Aprender por Contraste e Pagar pelos Negativos

Vamos mostrar à rede duas fotografias do mesmo cão: uma recortada, outra desfocada e com as cores alteradas. Depois vamos mostrar a fotografia de outro cão. Se a representação aproximar as duas primeiras e afastar a terceira, talvez tenha aprendido algo sobre identidade visual. Talvez tenha aprendido apenas nossa escolha de recortes e cores. O SimCLR é interessante justamente porque transforma essa ambiguidade em uma tarefa precisa.

O autoencoder organiza um latente para reconstrução. A difusão latente organiza um espaço para geração. O SimCLR abandona ambos os contratos. Em vez de perguntar “consigo refazer a entrada?”, pergunta “duas transformações da mesma imagem chegam ao mesmo lugar, e imagens diferentes permanecem separadas?”. Não há decoder de pixels. Há geometria, temperatura e um lote cheio de adversários involuntários.

1. Duas views definem o positivo

Para cada imagem x k , sorteamos duas transformações t e t ′ de uma família T :

x ~ 2 k = t ( x k ) , x ~ 2 k + 1 = t ′ ( x k ) .

Essas duas views formam um par positivo. As views de outras imagens no lote funcionam como negativos. Com B imagens, o modelo processa 2 B entradas.

O encoder f produz uma representação h i = f ( x ~ i ) . Um pequeno projection head g produz

z i = g ( h i ) .

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )