Difusão Latente: Comprimir Antes de Gerar

por Frank de Alcantara em 28/07/2026

Difusão Latente: Comprimir Antes de Gerar

Remover ruído de uma imagem de alta resolução é caro por uma razão pouco misteriosa: há muitos pixels, e o modelo precisa visitar o tensor repetidas vezes. Uma imagem de 1024 × 1024 possui dezesseis vezes a área de uma imagem de 256 × 256 . Se a rede trabalhar diretamente nos pixels durante dezenas de passos, a conta cresce antes que qualquer amostra tenha a oportunidade de nos impressionar.

A difusão latente começa com uma pergunta de engenharia: precisamos executar todo o processo generativo no espaço em que a imagem será exibida? Nos dois artigos anteriores, construímos essa passagem em etapas. Primeiro, o autoencoder linear treinável tornou observável o contrato de reconstrução com um vetor global. Depois, Autoencoders Espaciais: da Projeção Linear ao Latente Gerativo substituiu esse vetor por um tensor que conserva vizinhanças e pode ser processado por uma rede gerativa. Em ambos, o encoder E transforma a imagem x no latente z , e o decoder D transforma esse latente na reconstrução x ^ :

z = E ( x ) , x ^ = D ( z ) .

O encoder comprime a imagem; o decoder tenta reconstruí-la. A difusão latente acrescenta um segundo modelo entre essas duas operações. Em vez de aprender a remover ruído diretamente de x , aprende no latente z :

x → z 0 → z t → z ^ 0 → x ^ .

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )