Representações e Modelos de Mundo: o Mapa da Série

por Frank de Alcantara em 29/07/2026

Representações e Modelos de Mundo: o Mapa da Série

Uma câmera entrega pixels. Um microfone entrega amostras de pressão. Um robô recebe posições articulares, forças, imagens e comandos. Nenhuma dessas medições vem acompanhada de uma etiqueta informando o que é permanente, o que é ruído, o que pode mudar e qual mudança depende de uma ação. Antes de prever o mundo, uma máquina precisa decidir o que conta como estado do mundo.

Essa decisão é o objeto desta série.

Começaremos por representações. Veremos como um encoder transforma observações em vetores, quais tarefas obrigam esses vetores a conservar informação e por que uma perda pequena pode esconder uma representação inútil. Depois chegaremos às JEPA, de Joint-Embedding Predictive Architectures (arquiteturas preditivas de embeddings conjuntos), que aprendem prevendo alvos no espaço de representação. Finalmente, usaremos essas representações como estados de modelos que renderizam observações, simulam dinâmica, imaginam futuros e sustentam planejamento.

Neste ponto da leitura a atenta leitora deve saber que eu, este pobre escriba, não sei qual é a melhor representação de mundo, nem sequer imagino onde essa pesquisa vai nos levar. Hoje, no começo da série, escolhi parar em JEPA. Mas, não escrevi isso em uma pedra.

O percurso contém vinte artigos, mas não é uma coleção de vinte respostas independentes. Cada artigo remove uma ambiguidade necessária para o seguinte. Este primeiro texto apresenta a arquitetura inteira, fixa o vocabulário e oferece um mapa vivo do que já pode ser lido.

1. Duas perguntas, uma série

A série será governada por duas perguntas encadeadas:

Que tarefa de pré-treinamento força uma rede a conservar a informação que será útil depois?

Que futuro o modelo precisa prever, sob quais ações e incertezas, para melhorar uma decisão?

A primeira pergunta pertence ao aprendizado de representação e pode ser facilmente definida:

Seja x uma observação, como uma imagem, e seja f θ um encoder com parâmetros θ . Chamaremos de z o vetor ou tensor que resume essa observação. A representação será

z = f θ ( x ) ,

na qual z é um vetor ou tensor que resume x . A fórmula é curta porque esconde a escolha difícil. A leitora engenheira terá que escolher quais propriedades de x devem permanecer acessíveis em z .

Modelar é sempre difícil.

Se o objetivo pedir reconstrução de pixels, detalhes locais serão valiosos. Se pedir concordância entre duas views da mesma cena, a representação será pressionada a ignorar transformações como aumentos da área de um objeto na cena. Se pedir previsão de uma região ausente, o contexto terá de carregar informação suficiente para antecipar o alvo.

A segunda pergunta requer mais atenção. O problema começa quando z passa a representar um estado que evolui.

Vamos denotar por z t a representação no instante t , por a t a ação executada, por F ϕ um modelo de dinâmica com parâmetros ϕ e por z ^ t + 1 a representação prevista para o próximo instante. Uma previsão mínima assumirá a forma

z ^ t + 1 = F ϕ ( z t , a t ) ,

na qual z ^ t + 1 é o estado previsto para o próximo instante. Agora a qualidade de z t não pode ser medida apenas por reconstrução ou classificação. O estado precisa distinguir futuros que exigem ações diferentes. Se duas situações visualmente semelhantes levam a consequências incompatíveis, comprimi-las no mesmo ponto economiza memória enquanto destrói o planejamento. Há economias que custam caro. Esta, destrói o modelo.

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )