Entendendo Markov Decision Process

por Frank de Alcantara em 04/02/2025

Entendendo Markov Decision Process

Cheating is not in the nature of a gambler but in the nature of a loser. John Scarne

Reinforcement Learning, do ponto de vista da matemática, começa com a Lei dos Grandes Números.

A Lei dos Grandes Números - LGN, um teorema fundamental da teoria das probabilidades que descreve o resultado de realizar o mesmo experimento um grande número de vezes. De acordo com esta lei, a média dos resultados obtidos de um grande número de tentativas se aproxima do valor esperado e tenderá a se tornar mais próximo sempre que o número de tentativas aumentar. Isso quer dizer que: se você repetir um experimento aleatório muitas vezes, de forma independente e sob as mesmas condições, a média dos resultados observados convergirá para o valor teórico esperado (a média populacional).

Considere o exemplo menos criativo possível: lançar uma moeda. Neste caso, teremos que considerar o:

Valor esperado: Uma moeda justa tem duas faces (cara e coroa), cada uma com probabilidade de 0 , 5 (ou 50 % ). O valor esperado de um lançamento é, portanto, 0 , 5 .

E, providenciar um conjunto de tentativas:

Resultados experimentais:

  1. Lançando a moeda 10 vezes, obtive 3 caras e 7 coroas (média de 0 , 3 );

  2. Lançando a moeda 100 vezes, obtive 61 caras e 39 coroas (média de 0 , 61 );

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )