A Vetorização Básica
por Frank de Alcantara em 09/02/2025
- 1. Você Pensa Como Fala
- 2. A Temida Matemática
- 3. A Probabilidade da Linguagem
- 4. A Vetorização Básica
- 5. Redes Neurais Artificiais para Word Embedding
- 6. Embeddings Distribuídos e CBoW
- 7. SkipGram e Otimizações do Word2Vec
- 8. Word2Vec, a Ponte para o Contexto
- 9. Desvendando a Modelagem de Sequências
- 10. Prestando Atenção
- 11. Do Código à Geração
- 12. Masked Language Modeling: Esconder Tokens para Aprender Contexto
- 13. BERT: O Encoder que Lê dos Dois Lados
- 14. O Cisma e a Batalha da Eficiência
- 15. GEMM o Coração Matemático
- 16. Do Cosseno à Borda: Busca Semântica em Produção
Neste artigo aprenderemos as técnicas de vetorização mais básicas, como a frequência de termos e o modelo Bag of Words (BoW). Vamos discutir como essas técnicas são usadas para representar textos como vetores numéricos, permitindo que os computadores processem e analisem linguagem natural.
Técnicas Básicas de Vetorização
Existem diversas técnicas para transformar textos em números, nessa viagem, os primeiros portos que visitaremos estão fortemente construídos sobre as técnicas primitivas de representação matemática de elementos linguísticos. Eu vou fazer o máximo de esforço para seguir um fluxo crescente de dificuldade. A atenta leitora não deve se assustar se achar que eu perdi o rumo. Se eu parecer perdido é porque lembrei de algo que precisa ser visto antes que possamos deixar um porto em direção a outro. As passagens serão compradas sempre que eu achar que ficou claro.
Frequência de Termos
Uma das formas mais básicas, quase intuitiva. de representar texto numericamente é através da frequência de termos. A ideia é contar quantas vezes cada palavra aparece em um documento ou conjunto de documentos e criar um vocabulário1.
Antes de prosseguirmos com a vetorização de textos, precisamos formalizar o conceito de corpus. Em linguística computacional e processamento de linguagem natural, um corpus (plural corpora) é uma coleção estruturada de textos. Formalmente, definiremos:
Nesta definição, cada
Cada documento
Em processamento de linguagem natural, um token é a menor unidade de análise em um texto. Um token pode ser uma palavra, um número, um sinal de pontuação ou qualquer outra unidade significativa. Por exemplo, na frase “O gato preto.”, temos 4 tokens: “O”, “gato”, “preto” e “.”. O processo de dividir um texto em tokens é chamado de tokenização. A escolha de como definir e separar tokens é uma decisão importante que afeta todo o processamento subsequente. Considere, para ilustrar, a palavra composta “guarda-chuva” pode ser considerada como um único token ou como três tokens (“guarda”, “-“, “chuva”), dependendo das regras de tokenização adotadas. Em modelos modernos de processamento de linguagem natural, como o GPT e BERT, os tokens podem ser ainda mais granulares, incluindo partes de palavras, chamadas de subpalavras (subwords).
Neste caso,
O vocabulário global
Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.
Continuar com Google Acesso gratuito e instantâneo com sua conta Google(Updated: )