Representações e Modelos de Mundo: o Mapa da Série
por Frank de Alcantara em 29/07/2026
- 1. Representações e Modelos de Mundo: o Mapa da Série
- 2. Autoencoders: o Gargalo, a Reconstrução e o Latente
- 4. Difusão Latente: Comprimir Antes de Gerar
- 5. SimCLR: Aprender por Contraste e Pagar pelos Negativos
- 6. BYOL: Aprender sem Negativos sem Entregar Tudo ao Colapso
- 7. DINO: Autodestilação e Objetos que Emergem da Atenção
- 8. MAE: Mascarar 75% da Imagem e Reconstruir o que Falta
- 9. Prever, não gerar: o template JEPA e o problema do colapso
Uma câmera entrega pixels. Um microfone entrega amostras de pressão. Um robô recebe posições articulares, forças, imagens e comandos. Nenhuma dessas medições vem acompanhada de uma etiqueta informando o que é permanente, o que é ruído, o que pode mudar e qual mudança depende de uma ação. Antes de prever o mundo, uma máquina precisa decidir o que conta como estado do mundo.
Essa decisão é o objeto desta série.
Começaremos por representações. Veremos como um encoder transforma observações em vetores, quais tarefas obrigam esses vetores a conservar informação e por que uma perda pequena pode esconder uma representação inútil. Depois chegaremos às JEPA, de Joint-Embedding Predictive Architectures (arquiteturas preditivas de embeddings conjuntos), que aprendem prevendo alvos no espaço de representação. Finalmente, usaremos essas representações como estados de modelos que renderizam observações, simulam dinâmica, imaginam futuros e sustentam planejamento.
Neste ponto da leitura a atenta leitora deve saber que eu, este pobre escriba, não sei qual é a melhor representação de mundo, nem sequer imagino onde essa pesquisa vai nos levar. Hoje, no começo da série, escolhi parar em JEPA. Mas, não escrevi isso em uma pedra.
O percurso contém vinte artigos, mas não é uma coleção de vinte respostas independentes. Cada artigo remove uma ambiguidade necessária para o seguinte. Este primeiro texto apresenta a arquitetura inteira, fixa o vocabulário e oferece um mapa vivo do que já pode ser lido.
1. Duas perguntas, uma série
A série será governada por duas perguntas encadeadas:
Que tarefa de pré-treinamento força uma rede a conservar a informação que será útil depois?
Que futuro o modelo precisa prever, sob quais ações e incertezas, para melhorar uma decisão?
A primeira pergunta pertence ao aprendizado de representação e pode ser facilmente definida:
Seja
na qual
Modelar é sempre difícil.
Se o objetivo pedir reconstrução de pixels, detalhes locais serão valiosos. Se pedir concordância entre duas views da mesma cena, a representação será pressionada a ignorar transformações como aumentos da área de um objeto na cena. Se pedir previsão de uma região ausente, o contexto terá de carregar informação suficiente para antecipar o alvo.
A segunda pergunta requer mais atenção. O problema começa quando
Vamos denotar por
na qual
Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.
Continuar com Google Acesso gratuito e instantâneo com sua conta Google(Updated: )