Resolvendo o Grid World Com MDP
por Frank de Alcantara em 10/02/2025
- 1. Reinforcement Learning: História
- 2. Entendendo Markov Decision Process
- 3. Um Mundo Inteiro em uma Grade
- 4. Resolvendo o Grid World Com MDP
- 5. MDP: Casos Reais - Manutenção de Turbinas Eólicas
Agora que formalizamos o Grid World como um Processo de Decisão de Markov (MDP), podemos aplicar algoritmos de Reinforcement Learning para encontrar a política ótima
Para encontrar a política ótima, vamos dissecar a estrutura do MDP como ferramenta para resolver o Grid World.
Formulação MDP do Grid World
Vamos dedicar um minuto, ou dez, para lembrar em que porto desta jornada estamos. Até agora definimos o seguinte:
-
Estados
: O conjunto de todas as células da grade. Cada célula representa um estado. -
Ações
: O conjunto de ações possíveis: . -
Função de Transição
: define a probabilidade de transitar para o estado ao executar a ação no estado . No Grid World estocástico que estamos estudando, teremos: -
de probabilidade de se mover na direção pretendida. -
de probabilidade de se mover para cada um dos lados perpendiculares. - Se a ação levar a uma colisão com a parede, o agente permanece no estado
.
Eu havia usado
e . Se a atenta leitora não entendeu a mudança, este não é um artigo para você. -
Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.
Continuar com Google Acesso gratuito e instantâneo com sua conta Google(Updated: )