BYOL: Aprender sem Negativos sem Entregar Tudo ao Colapso

por Frank de Alcantara em 28/07/2026

BYOL: Aprender sem Negativos sem Entregar Tudo ao Colapso

No SimCLR, cada imagem encontra uma companheira positiva e uma multidão de negativas. Vamos retirar a multidão. Se pedirmos apenas que duas views da mesma imagem produzam a mesma representação, a rede pode resolver o problema atribuindo o mesmo vetor a tudo. Cães, pontes e torradeiras finalmente unidos, embora por uma geometria inútil.

O BYOL, de Bootstrap Your Own Latent (algo como construir a própria representação por autoalimentação), aceita o risco e remove todos os pares negativos. Duas views da mesma imagem devem concordar, mas nenhuma imagem diferente entra no denominador. O método funciona apesar da solução constante, apoiado em uma arquitetura assimétrica e em uma dinâmica em duas escalas. A distinção importa: observamos resistência ao colapso; não recebemos uma prova universal de que a função constante seja impossível.

1. Duas redes, três cabeçalhos

Uma view v = t ( x ) percorre a rede online, cujos parâmetros são θ . Chamaremos de y θ a representação do encoder, de z θ a saída do projector e de q θ ( z θ ) a previsão final:

y θ = f θ ( v ) , z θ = g θ ( y θ ) , q θ ( z θ ) .

O encoder f θ produz a representação, o projector g θ leva essa representação ao espaço da tarefa pretexto e o predictor q θ tenta alcançar o alvo.

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )