Entendendo Markov Decision Process
por Frank de Alcantara em 04/02/2025
- 1. Reinforcement Learning: História
- 2. Entendendo Markov Decision Process
- 3. Um Mundo Inteiro em uma Grade
- 4. Resolvendo o Grid World Com MDP
- 5. MDP: Casos Reais - Manutenção de Turbinas Eólicas
Cheating is not in the nature of a gambler but in the nature of a loser. John Scarne
Reinforcement Learning, do ponto de vista da matemática, começa com a Lei dos Grandes Números.
A Lei dos Grandes Números - LGN, um teorema fundamental da teoria das probabilidades que descreve o resultado de realizar o mesmo experimento um grande número de vezes. De acordo com esta lei, a média dos resultados obtidos de um grande número de tentativas se aproxima do valor esperado e tenderá a se tornar mais próximo sempre que o número de tentativas aumentar. Isso quer dizer que: se você repetir um experimento aleatório muitas vezes, de forma independente e sob as mesmas condições, a média dos resultados observados convergirá para o valor teórico esperado (a média populacional).
Considere o exemplo menos criativo possível: lançar uma moeda. Neste caso, teremos que considerar o:
Valor esperado: Uma moeda justa tem duas faces (cara e coroa), cada uma com probabilidade de
E, providenciar um conjunto de tentativas:
Resultados experimentais:
-
Lançando a moeda 10 vezes, obtive
caras e coroas (média de ); -
Lançando a moeda 100 vezes, obtive
caras e coroas (média de );
Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.
Continuar com Google Acesso gratuito e instantâneo com sua conta Google(Updated: )