Prestando Atenção

por Frank de Alcantara em 10/02/2025

Prestando Atenção

Superando Limitações Locais: Construindo a Ponte para a Atenção

Em outro porto, navegamos pelos modelos probabilísticos clássicos para vetorização de sequências, como as Cadeias de Markov e os Modelos N-gram. Vimos como estes modelos são capazes de capturar a dependência local estimando a probabilidade de uma palavra, w t , com base em suas N − 1 vizinhas imediatas, P ( w t | w t − N + 1 , . . . , w t − 1 ) . As técnicas que estudamos fornecem representações como a razão de probabilidades de transição, que compara padrões locais de um documento com os padrões gerais do corpus. Mas, como uma luneta danificada, não permitem uma visão completa.

A própria natureza desses modelos, encapsulada na Propriedade de Markov, impõe uma limitação significativa: a dificuldade em capturar dependências de longo alcance. Esta limitação é precisamente o que os modelos baseados em mecanismos de atenção, como os Transformers, procuram superar, permitindo que cada palavra na sequência preste atenção a qualquer outra palavra, independentemente da distância entre elas. A esforçada leitora deveria ler este parágrafo novamente, com atenção, e refletir sobre o que ele significa. A ideia de que cada palavra pode prestar atenção a qualquer outra palavra, independentemente da distância entre elas, é a bússola que a guiará no entendimento dos Transformers.

A Propriedade de Markov é um conceito fundamental em processos estocásticos e modelagem de sequências. Esta propriedade estabelece que a probabilidade de um estado futuro depende apenas do estado presente, e não de estados anteriores da sequência.

Em termos mais formais, para uma sequência de variáveis aleatórias, como palavras em um texto, X 1 , X 2 , . . . , X n , a Propriedade de Markov afirma que:

P ( X n + 1 = x | X 1 = x 1 , X 2 = x 2 , . . . , X n = x n ) = P ( X n + 1 = x | X n = x n )

Para ir além das informações obtidas com a Propriedade de Markov e entender o significado completo, ou prever a próxima palavra, em situações da linguagem real, precisaremos relacionar palavras que estão muito distantes entre si em uma determinada sequência de texto.

A dedicada leitora deve considerar que, a solução inocente, aumentar a ordem N nos modelos N-gram para tentar alcançar contextos mais longos, será impraticável devido à esparsidade dos dados que resultará desta solução. Afinal, não deve ser difícil de entender que as combinações de N palavras ficam cada vez mais raras e que o número de estados possíveis, crescerá quase exponencialmente, a maldição da dimensionalidade. Sendo assim, a pergunta que fica é:

Como podemos capturar dependências de longo alcance sem aumentar a ordem dos N-grams?

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )