DINO: Autodestilação e Objetos que Emergem da Atenção
por Frank de Alcantara em 28/07/2026
- 1. Representações e Modelos de Mundo: o Mapa da Série
- 2. Autoencoders: o Gargalo, a Reconstrução e o Latente
- 4. Difusão Latente: Comprimir Antes de Gerar
- 5. SimCLR: Aprender por Contraste e Pagar pelos Negativos
- 6. BYOL: Aprender sem Negativos sem Entregar Tudo ao Colapso
- 7. DINO: Autodestilação e Objetos que Emergem da Atenção
- 8. MAE: Mascarar 75% da Imagem e Reconstruir o que Falta
- 9. Prever, não gerar: o template JEPA e o problema do colapso
Um professor treinado antes do aluno pode transmitir classes conhecidas. Um professor que é apenas uma cópia atrasada do próprio aluno não dispõe desse luxo: precisa produzir um alvo útil sem rótulos, sem nomes de classes e sem saber mais do que o estudante sabia há pouco. Parece uma organização escolar desenhada pelo setor financeiro. No DINO, ela aprende representações surpreendentemente boas.
O BYOL ensina uma rede online a prever o vetor de um alvo lento. O DINO, de self-DIstillation with NO labels (autodestilação sem rótulos), mantém a família student-teacher, a EMA e o stop-gradient, mas muda o objeto previsto: o student aprende uma distribuição produzida pelo teacher.
Quando o backbone é um ViT, de Vision Transformer, uma segunda descoberta aparece. Os mapas de autoatenção do token de classe delimitam objetos sem que o treinamento receba máscaras de segmentação. Isso é uma propriedade empírica emergente, não uma prova de que cada cabeça aprendeu uma explicação causal da cena.
1. O professor não vem pronto
O student possui parâmetros
Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.
Continuar com Google Acesso gratuito e instantâneo com sua conta Google(Updated: )