DINO: Autodestilação e Objetos que Emergem da Atenção

por Frank de Alcantara em 28/07/2026

DINO: Autodestilação e Objetos que Emergem da Atenção

Um professor treinado antes do aluno pode transmitir classes conhecidas. Um professor que é apenas uma cópia atrasada do próprio aluno não dispõe desse luxo: precisa produzir um alvo útil sem rótulos, sem nomes de classes e sem saber mais do que o estudante sabia há pouco. Parece uma organização escolar desenhada pelo setor financeiro. No DINO, ela aprende representações surpreendentemente boas.

O BYOL ensina uma rede online a prever o vetor de um alvo lento. O DINO, de self-DIstillation with NO labels (autodestilação sem rótulos), mantém a família student-teacher, a EMA e o stop-gradient, mas muda o objeto previsto: o student aprende uma distribuição produzida pelo teacher.

Quando o backbone é um ViT, de Vision Transformer, uma segunda descoberta aparece. Os mapas de autoatenção do token de classe delimitam objetos sem que o treinamento receba máscaras de segmentação. Isso é uma propriedade empírica emergente, não uma prova de que cada cabeça aprendeu uma explicação causal da cena.

1. O professor não vem pronto

O student possui parâmetros θ s . O teacher possui parâmetros θ t atualizados por EMA, com λ ∈ [ 0 , 1 ) representando o momento que preserva seu estado anterior:

θ t ← λ θ t + ( 1 − λ ) θ s .

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )