MAE: Mascarar 75% da Imagem e Reconstruir o que Falta

por Frank de Alcantara em 28/07/2026

MAE: Mascarar 75% da Imagem e Reconstruir o que Falta

Esconder 15 % dos tokens já basta para dar trabalho ao BERT. em uma imagem natural, esconder 15 % dos patches pode deixar informação demais: textura, cor e contornos vizinhos denunciam facilmente o que falta. O MAE, de Masked Autoencoder (autoencoder mascarado), responde com uma medida pouco tímida. Esconde 75 % da imagem e entrega ao encoder apenas o quarto restante.

Antes de atravessar a ponte entre modalidades, vale ler Masked Language Modeling: Esconder Tokens para Aprender Contexto e BERT: O Encoder que Lê dos Dois Lados. Eles separam o objetivo MLM da arquitetura BERT. Aqui faremos a mesma distinção entre mascaramento e modelo. Palavras são símbolos discretos e densos em significado; pixels vizinhos carregam muita redundância. A taxa de 75 % não é uma excentricidade decorativa. É o que impede a tarefa visual de virar preenchimento local com diploma de pós-graduação.

1. Da imagem para 196 patches

Considere uma imagem de 224 × 224 pixels dividida em patches de 16 × 16 . Cada lado contém

224 16 = 14

posições. Chamaremos de N o número total de patches:

N = 14 2 = 196

patches. Com taxa de máscara r = 0 , 75 , chamaremos de N m o número de patches ocultos e de N v o número dos visíveis. Sorteamos

N m = 0 , 75 ⋅ 196 = 147

patches ocultos. Restam

N v = 196 − 147 = 49

visíveis.

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )